面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26
面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。
搜索
埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。
GPT-6 Astra联合三位人类研究员首次攻克FrontierMath基准测试中一道自2017年悬而未决的「重大进展」级数学难题,证明批准式委员会选举中「核」永远不为空,并创造性地提出基于「调和熵」的新型投票规则及多项式时间算法。
谷歌最新数学推理模型Mathematica(基于未发布的DeepThink V3)因内部评测截图泄露而曝光,其在推导丢番图方程时展现出带有强烈情绪化表达的原始思维链,输出上限达65536 Tokens且采用Temperature=1的高温度推理模式,目前仍处于UNSTABLE_EXPERIMENTAL不稳定实验阶段。
OpenAI的GPT-6 Astra攻破了FrontierMath Tier 4最后一道难题,使该研究级数学测试被Epoch AI正式宣布饱和,所有题目均已至少被AI成功解出过一次。
硅谷独角兽Axiom Math宣布其6人团队在约两周的秘密实验中,借助AI驱动的搜索、计算与Lean形式化验证,将有界素数间隔上界从246进一步推进到212,打破了保持十余年的纪录。
在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
新智元报道 人类证出来的最难素数定理,AI刚从头验了一遍。 结论是:证明成立,逻辑无误。 8月17日,由一位25岁广州女孩创立的AI公司Axiom Math宣布,自家系统AxiomProver完成了「
北大团队雪梦未来(SnowOrigin)获龚虹嘉、陆奇及海外机构投资。公司以神经腕带、全景头环等可穿戴设备为入口,结合自研NMH(Neural Math Hybrid)AI 解码模型,试图将人类真实操作过程中的意图、姿态、发力趋势、微控制及环境上下文,转化为可用于机器人、世界模型和具身智能训练的结构化数据。
被一道数学竞赛题卡住很久时,高手往往能准确地判断:现在缺的是一个技术细节,还是整个思路从一开始就走错了?
硬氪获悉,雪梦未来(SnowOrigin)团队获得龚虹嘉、陆奇及海外机构投资。这支北大背景团队以sEMG(表面肌电)运动神经信号解码技术为切入点,通过神经腕带、第一视角采集设备以及自研NMH(Neural Math Hybrid)AI解码模型,构建新一代面向具身智能的人类操控数据采集方案。