DeepSeek mHC多流残差坍塌失效了?
DeepSeek mHC多流残差坍塌失效了?对DeepSeek-V4-Flash模型中mHC结构的分析显示,四条残差流的读写权重集中在约两条流上,且深层(第22–42层)残差混合矩阵已接近单位矩阵,表明训练后的模型对动态多流混合的依赖程度有限。
搜索
对DeepSeek-V4-Flash模型中mHC结构的分析显示,四条残差流的读写权重集中在约两条流上,且深层(第22–42层)残差混合矩阵已接近单位矩阵,表明训练后的模型对动态多流混合的依赖程度有限。
AI互动内容公司Flam完成4000万美元B轮融资,由QED Investors领投、宝莱坞巨星沙鲁克·汗跟投,Google已为其企业客户,资金将用于AI模型研发、产品矩阵扩展及海外销售团队建设。
阶跃星辰发布开源旗舰基础模型Step 5 Preview,在Artificial Analysis Intelligence Index中以44分跻身全球开源模型前三,并依托全模态模型矩阵和在手机、汽车等终端的超4200万台规模化落地,重新跻身国产基础模型公司第一梯队。
在JDDiscovery-2026京东全球科技探索者大会上,智元、智平方、鹿明机器人、逆矩阵科技与京东探索研究院围绕"具身智能走出Demo"展开圆桌讨论,指出机器人从Demo走向真实落地的核心瓶颈已从单点模型能力转向数据、反馈闭环与系统能力,并认为GPT-6 Astra代表的语言模型上限及物理AI基座模型的构建将推动具身范式发生重大变化。
大约20年前,马斯克通过Tesla推动“汽车电动化”革命,以高度垂直整合的方式,重塑全球汽车产业。与此同时,中国车企依托成熟供应链优势,走出“开放整合”的道路,以极高效率完成产业追赶。如今,两者成为全球电动车市场最重要的两股力量。
智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied,该模型在具身智能评测平台RoboColiseum扰动适应子榜单中以0.692分登顶榜首,标志着智象原生全模态世界模型矩阵的进一步完善。
浙江大学AI博士生、无界AI联合创始人马千里借助GPT-5.6、Fable 5、DeepSeek等AI模型组成的科研Agent团队,在北大董彬教授发起的ICMConjectures项目中用48小时产出约2万行Lean形式化代码,攻破了数学家Colombo于1928年提出的百年矩阵行列式难题。
2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
AlphaEvolve再次刷新记录!
前不久用Fable 5推翻雅可比猜想的Anthropic研究员,又吭哧吭哧和两个人类伙伴带着Claude,做出了668阶哈达玛矩阵!(好数学家不挑AI模型,doge)不过这人每次有成果都不明说,发一堆只有内行才看得懂的东西。