GPT-6 Astra学会用「空白Token」思考!推理能力突然变强
GPT-6 Astra学会用「空白Token」思考!推理能力突然变强Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。
搜索
Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。
想太多,就连最聪明的AI也会被拖死。
英伟达死守的推理性价比神话,碎了。
OpenAI 刚刚发布的官方博客和数十页技术报告中将其定性为一声「警钟」(warning shot)。同时,第三方机构 METR 和 Redwood Research 发布了独立调查报告。OpenAI 的 Noam Brown 提醒,驱动这次事件的模型与 GPT-5.6 Sol 同等规模,下一代模型能力会更强。
GPT-5.6 Sol 推翻 100 多年前的麦克斯韦猜想,下一代模型突破 10 个!数学家菲利普·阿拉图恩、加文·鲍尔和马修·D·克瓦尔海姆于 2026 年 7 月 29 日在 arXiv 上发表论文,提到由 GPT-5.6 Sol 找到了一个反例,证明了 100 多年前的麦克斯韦猜想是假的。
GitHub上有个项目叫 Project N.O.M.A.D,33k Star,3k Fork。作者 Chris Sherwood 是个搞网络设备的 YouTuber,Crosstalk Solutions 频道有 38 万多订阅。这项目说白了就是把维基百科、本地 AI、离线地图、离线教育平台全塞进 Docker 里,断网也能用。
AI科技评论独家消息,前月之暗面后训练与强化学习负责人宋鸿涌(Flood Sung)已于 2025 年 12 月离职,创立机器人公司「北京十六号机器人科技有限公司」(XVI Robotics),公司业务方向聚焦通用人形机器人基座模型。
文本驱动的人体动作生成是游戏NPC、虚拟主播、机器人控制等实时交互系统的核心技术。
沉寂许久的 Ian Goodfellow,终于再次现身。
所有人都在等 DeepSeek,春节来,下周来,还是没来。 一场为了全面「狙击」 DeepSeek,抢夺流量,但是 DeepSeek 都没出现的春节大战,就在一轮又一轮的红包奶茶里轰轰烈烈地结束了。