分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
搜索
刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
国内AI设计智能体扎堆冒出来,而且很多操盘手都来自同一批地方,字节剪映系和腾讯系尤其密集。最近注意到了一个产品叫OJO Design,官网的定位是全球首个设计Agent团队工作台,并且已经上线2个月了。
2026 年春天,AI 中转站这门略显灰色的生意,突然迎来了一位最不缺流量的玩家。4 月,孙宇晨开始为 B.AI 站台,把「一个 Key 调用所有大模型」的生意,称作「AI Agent 的底层金融基础设施」。
现在的 Agent 将所有的工程线索和垃圾噪音都一股脑扔进 Chat Context 里,缺乏一层独立、结构化的 Engineering State 来做隔离与控制。为了打破这个瓶颈,Valkor 联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了 loom。
我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。
你有没有想过,写代码这件事的对象正在悄悄换人?上周一晚上,我在旧金山Market Street上WorkOS的办公室里待了将近两个小时,看了二十几个现场demo。进门之前我以为这只是一场普通的创业展示夜,但看完之后我意识到,这群人在展示的根本不是产品,而是他们对"写代码、用代码、读代码"这件事本身的理解,已经发生了多深的变化。
“包括Physical Intelligence在内,如今的北美头部具身智能公司离成熟都还有不短的距离。整个领域,也还没出现真正的奠基性工作。”“中国真正领先的,恰恰是机器人硬件。美国同样没有成熟答案,中国公司又何必急着把自己称为‘中国版XX’?”
Agent 执行任务的时候,会反复踩坑、不断试错,最后积累一些正确的经验。但这些经验通常只能停留在当前会话,或者当前 Agent 的记忆里,很难传给其他 AI。一个 Agent 调用某个 API,花了半个小时查文档、改参数,连续失败好几次,最后终于找到正确方法。
多模型Agent系统显然是未来的趋势。cursor 的一篇很不错的文章。他们的最新研究表明,将前沿模型作为规划者和协调者,与一个更廉价的“主力”模型搭配,可以大幅降低项目中总token的成本,从而实现 15 倍的成本改进。
语核科技创始人翟星吉说,AI项目一定是高层驱动的,但真正主导的是业务部门。他的逻辑很值得琢磨:大部分公司买一个Agent产品,本质上不是买软件,是在做生产投资——就像制造业企业投资一条产线,买的是高级人力服务。 所以决策链路变成了:业务部门真的算出ROI,跑去跟老板说"这东西能帮我们提升产值或者降低成本",老板说"赶紧买"。