Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
搜索
SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。
最近,DeepSeek 接连上了几次热搜。先是因为一张实习 offer 引发围观。一位清华学生在社交媒体晒出录用信息,岗位是 DeepSeek 实习生,税前日薪 5500 元。按每月 22 个工作日计算,月薪超过 12 万元。
今年 6 月,Google DeepMind 宣布与电影公司 A24 建立长期研究合作,并向其投资约 7500 万美元。成立于 2012 年的 A24,以开发独具文艺气息的小众电影见长。它的代表作包括奥斯卡最佳影片《月光男孩》和《瞬息全宇宙》、全球票房大卖的《至尊马蒂》,以及今年热映的恐怖片《后室》。14 年间,A24 早已把片厂名字做成品牌:A24 三个字,本身就是人气的保证。
7月16日,Nature刊出消息:科学家用AI造出了自然界里从来没有过的CRISPR酶,切基因比「天然版本」更利索。论文同日发表在Science。带队的人,是2020年因为CRISPR拿下诺贝尔化学奖的Jennifer Doudna。
2023 年他在深圳创立听象科技,推出自有品牌昂听 ELEHEAR(下文统一简称 ELEHEAR)。前期发布 Alpha 系列产品试水助听器市场,2024 年 10 月推出旗舰产品 Beyond,凭借全栈自研的 AI 助听器+远程实时验配的新模式,用 1 年时间做到了美国亚马逊助听器类目 Top1,年销超 1500 万美元,市场份额从 1% 迅速增长至 18%。
近日,专注于第二代人工智能制药技术的元示科技有限公司完成近亿元最新一轮融资。公司由北京大学前沿交叉学科研究院2017级博士吴佳奇创立,核心研发方向为人工智能虚拟细胞与通用细胞大模型,是国内较早布局细胞级AI药物研发的初创团队。
两年前,Patrick Coughlin 的母亲接到了一通电话,来电显示是女儿的号码,电话里也出现了女儿的声音。随后,一名男子声称绑架了她,要求立即支付 1200 美元,否则就会在当地一家沃尔玛的停车场伤害她。
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
就在刚刚,Anthropic正式发布了Opus 5。这款定位是「深思熟虑且积极主动」的模型,不仅成本只要Fable 5的一半,而且在大多数跑分上直接碾压。在最近的IMO 2026中,它不靠任何外部工具和Agent框架,就拿下了42/42的满分!