GPT-6 Astra学会用「空白Token」思考!推理能力突然变强
GPT-6 Astra学会用「空白Token」思考!推理能力突然变强Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。
搜索
Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。
近日,IQuest Research 同北京航空航天大学、曼彻斯特大学等合作伙伴发布 ModularRSI,尝试让 Agent 根据自身执行经验,持续修改模型外围的运行机制——Harness。
搜索结果里但凡出现 AI 摘要,用户点开普通网页的几率就几乎腰斩。Pew Research Center 对美国用户在 Google 上大规模浏览行为的分析发现:有 AI 摘要时,用户点击传统搜索结果的比例从 15%直接暴跌至 8%。
网友将HHMI Janelia和Google Research发布的果蝇大脑神经图谱MaleCNS接入AI,让虚拟苍蝇玩《超级马里奥64》《反恐精英2》《艾尔登法环》等游戏、在Coinbase炒币、识别日文平假名、参加虚拟MMA格斗,甚至操控多足机器人。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。
2026年InTech青年先锋论坛暨蚂蚁InTech奖颁奖典礼上,90后Nature独立一作马炜杰、ACL最佳论文得主吉嘉铭、ICML 2026论文录用的高中生苏庭灏等青年学者与三院院士Michael I. Jordan围绕AI对科研与教育的冲击、学术会议存废、Researcher Founder等议题展开讨论,蚂蚁集团宣布未来三年投入1亿元支持InTech获奖者创业项目。
阿里旗下阿里云正在内测AI投研工具"Qovest",定位为面向专业个人投资者的AI金融投研助手,首批验证A股条件检索、Deep Research、持续跟踪等功能,瞄准独立研究习惯的个人投资者,补齐国内投研工具市场结构性缺口,卡位AI金融赛道。
Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。
Oriscen由前Google Research科学家崔皓与TikTok原内容生态负责人王率丁等人创办,主张让AI在社交协调与人生经历保存中扮演配角,在完成任务后主动退场,将生活的主角留给人。
EvoMap团队推出自进化智能体EvoX,采用无中心调度的蜂群模式让大量Agent平级协作、自主组队,在563道逻辑、数学、物理题上将Claude Haiku 4.5的正确率从单Agent的26.29%提升至70%以上,并开源AutoResearch项目构建Agent经验基础设施。