告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答
告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
搜索
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
根据IT桔子数据,截至2026年7月17日, 32家“商汤系”公司在上半年共完成28笔融资,累计融资额超过470亿元人民币,在中国AI融资市场取得了耀眼的成绩。其中,既有商汤科技自身通过“1+X”战略拆分出的子公司——曦望Sunrise、大晓机器人、商汤医疗等;也有大批从商汤离职创业的前高管所创立的公司
刚刚,Anthropic和OpenAI同时放出了语音模式大升级!Claude这边,从只能跑Haiku升级到Opus 4.8和Sonnet 5全系列,不仅能在对话里调Gmail、日历、Slack,还扩增到11种语言,但没有中文。
Mark Gurman 披露了一份苹果直到 2028 年的 Mac 路线图。
又来???GPT-5.6最近这是捅了数学反例窝了……
在此之前,梁文锋曾提出“不融资、不上市、不商业化”的原则。此次大规模融资标志着DeepSeek正式走向资本市场,也引发了业界对其商业化路径与技术愿景的广泛关注。在近期的一场投资者交流会上,梁文锋详细阐述了DeepSeek的组织文化、开源逻辑、技术路线图以及对行业竞争格局的看法。
商业地图可以告诉机器人「前方右转」,却无法直接告诉它眼前应该从哪里转、沿哪一侧通过;即使已经生成路线,控制误差、地面变化和动态障碍,也可能让机器人在行进过程中逐渐偏离。
这家初创公司已与Georgia Power 签订合同,为位于Effingham County的这一数据中心综合体锁定了3.2GW的电力供应,这一规模可能使该设施跻身OpenAI迄今为止最大的数据中心之列。预计从2028年起将有数百兆瓦电力投入使用,其余开发工作将持续到2032年。1GW的电力足以在任意时刻为约75万户美国家庭供电。
刚刚,字节也坐不住了,推出了 Trae Work 官方知识库教程。我让 Agent 查了下,这个知识库目前大约有 46w 字,85 篇文档。 不得不说,不愧是字节,写文档还是很有一手的!
一觉醒来,Hermes Agent用户圈子直接炸了锅,官方放出了最新的版本:水银。恰如其名,最新版本主打一个“快”,丝滑流畅如水银泻地,冷启动速度提高了80%,但这次更新,“快”仅仅是开胃菜。