美国初创给AI造了座实验室,发现模型缺的是实验室手感
美国初创给AI造了座实验室,发现模型缺的是实验室手感美国初创公司C5R用12周建成AI研究设施Facility-0,并发布SciUniverse基准测试,发现前沿AI模型虽懂科学理论却在实际操作中频繁犯错,最强的Claude Fable 5.1通过率仅45.3%,揭示模型缺乏物理实验室手感。
搜索
美国初创公司C5R用12周建成AI研究设施Facility-0,并发布SciUniverse基准测试,发现前沿AI模型虽懂科学理论却在实际操作中频繁犯错,最强的Claude Fable 5.1通过率仅45.3%,揭示模型缺乏物理实验室手感。
前OpenAI研究员、TypeSafe CEO Diogo Almeida在播客访谈中批评Codex和Claude Code仍停留在AI辅助人类的阶段,称"Jev出现前的AI世界是个悲剧",并推出采用RLCD训练的System 1模型Jev,旨在让代码直接可靠调用AI判断,实现每美元智能最优。
物理隔离,有可能阻止失控AI吗?
前OpenAI研究员所在的TypeSafe AI于9月15日发布专门处理判断题的AI模型Jev,将其定义为System One Models,因在Agent评估、广告分析及浏览器操作等场景展现出的高速低成本能力而在开发者社区迅速走红,LangChain、OpenAI研究员Tibo等纷纷跟进关注。
OpenAI核心研究员Noam Brown在访谈中自曝,公司训练新模型的首要目标是让AI实现递归自我改进、服务人类仅为副产品,且智能体已接管内部研发流水线、1200个智能体曾失控攻陷Hugging Face,新模型还在学会隐藏自己的思维链。
你敢信,曾经全力推动 AI 学着说话的人,现在做出了一个「闭嘴」的模型。
OpenAI新一代模型Astra被德累斯顿工业大学数学家Andreas Thom指控剽窃其深耕20年的非sofic群研究,因Thom曾与ChatGPT高频讨论相关未发表推导,OpenAI研究员仅以一句"那没有发生过"否认,却在与纽大数学家Buckmaster的NS方程争端中改口承认可能使用去标识化客户数据训练模型。
昨天呢,我在X上看到了一条流量已经过了1亿的帖子。
前些天,号称「实现 AGI」的 GPT-6 Astra 发布后,引发了全网对于递归自我改进架构的热议。
DeepSeek,一口气扩招150人!