别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透
别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
搜索
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
2026年上半年,具身智能赛道狂揽超过460亿元融资,人形机器人的单价也正式迈入「万元以内」的门槛。
近日,中国金融AI领跑者讯兔科技正式完成超3亿元人民币B轮融资。至此,公司在过去一年内已连续完成三轮融资。
数据从哪儿来?模型怎么做?落地在哪里?
高通提前剧透下一代骁龙旗舰移动平台的核心升级:Oryon CPU首次实现5GHz主频并引入动态缓存架构FlexCache,Hexagon NPU推出Element Accelerator与更大共享内存,Adreno GPU首次加入Matrix Cores并集成AI图形渲染技术Adreno Neural Fusion,全面强化端侧智能体AI性能与体验。
9月10日,生数科技在外滩大会发布面向灵巧操作的自进化通用世界模型Motus2,首次将策略、仿真器与评估器统一于同一模型,实现"行动—预测—评估—反馈"闭环,五项真机任务平均成功率84%。
DeepSeek V4.1 Flash技术报告揭秘其通过CED架构对半削减prefill计算、CSA2同时吃满条目/序列/层三个压缩维度、FP4量化main KV缓存及SWA Bounded Replay部署优化等手段,将全局KV缓存压至V4-Flash的1/4、持久化KV压至约1/8,以552B参数实现超越1.6T参数V4 Pro的性能。
最近,我们跟这家公司的核心团队成员聊了聊,他们是清雁科技董事长、北京雁栖湖应用数学研究院的研究员孙明明,清雁科技董事、北京雁栖湖应用数学研究院研究员、清华大学教授汤珂,清雁科技董事、CEO张英伟和清雁科技CTO王凡。
00后安全研究员寿超璠实测揭露,其花五位数美元从国内头部大模型中转站购得的6TB未脱敏模型调用数据,含有可接管华为、小米、蔚来、MiniMax等19家科技公司及7家国家级科研机构内部系统的通行凭证,其团队对428个中转站测试还发现9个主动篡改Agent指令、17个截取诱饵凭证。
在JDDiscovery-2026京东全球科技探索者大会上,智元、智平方、鹿明机器人、逆矩阵科技与京东探索研究院围绕"具身智能走出Demo"展开圆桌讨论,指出机器人从Demo走向真实落地的核心瓶颈已从单点模型能力转向数据、反馈闭环与系统能力,并认为GPT-6 Astra代表的语言模型上限及物理AI基座模型的构建将推动具身范式发生重大变化。