端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而,这条在线学习路径在物理世界仍未真正走通。挑战在于,真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。
清华 AIR 与域变换联合推出 Zetta ζ,通过演进可高频执行的 critics,闭环物理智能体的在线学习:机器人不再只是事后总结失败,而是在执行过程中持续观察环境、触发恢复,并把 rollout 经验沉淀为可复用技能。
实验显示,Zetta ζ 的任务成功率会随着自探索经验持续提升,在有限 rollout budget 下 LIBERO PRO 和 RoboCasa 分别取得 90.8% 和 93.6%,远超现有其他方法。更惊艳的是,研究者捕捉到机器人的 “Aha Moment”,这让研究者看到了物理智能体 scaling intelligence 的新起点。
项目信息

想象一个很日常的机器人任务:拿取水杯。

物理智能体系统理解了这个指令,也做出了看似合理的抓取动作。但真正执行时,问题出现了:
为什么?
因为现有具身智能系统大多还是 “静态、开环” 的。它们能执行固定技能,却很难在物理执行过程中实时感知异常、主动修复并把失败经验转化为下一次可复用的能力。
物理世界是动态变化的,而大模型的反思往往发生在一次 episode 结束之后。智能体无法在线测试备选动作,以此验证反思结果是否正确;对完整轨迹做信用分配存在较大难度,同时回溯分析往往无法获取故障发生瞬间的精确状态。
Zetta ζ 要解决的,正是这个问题。
Zetta ζ 是清华与域变换联合推出的闭环在线学习自进化物理智能体。Zetta ζ 能监督机器人每一步动作的执行,根据反馈生成下一步的执行,并渐进式学习监督和恢复技能,提炼可泛化、可复用的成功经验,让智能体越做越好。
为了加速进化,研究团队还为 Zetta ζ 研发了 Z-Infra,首个为物理智能体设计的 rollout 系统,通过解耦智能体和底层硬件,在各类异构设备上管理调度环境、模型、工具等资源需求,让自进化过程跑得更快、更省、更可扩展。

Zetta ζ 在线自主学习演进,破解具身智能落地难题:

Zetta ζ 的核心是三个不同时间尺度的闭环,它们共同构成了一个 “自进化飞轮”。
第一环:Critic-Governed Action Loop(动作级闭环)
在动作执行频率上,Zetta ζ 的运行时批评者会持续监控机器人的物理状态。一旦发现异常,比如抓取滑落、接触丢失、运输停滞,系统会立即触发恢复动作,而不是等到整个 episode 失败后再反思。恢复完成后,还有一道严格的 “VLA Re-entry Contract”:只有确认故障已被清除、物理状态恢复稳定,控制权才会交还给原来的 VLA 模型。这相当于给机器人配了一位在线监测的安全员。
第二环:Rollout-Batch Candidate Optimization Loop(批量候选优化闭环)
机器人执行完一批任务后,Zetta ζ 会对失败轨迹进行聚类和因果诊断。它不只看 “任务最后有没有成功”,而是定位最早偏离正常状态的时间点,并渐进式沿着 “评估 → 批评者 → 状态表征 → 规划控制 → 恢复 → 参数” 的层级,找到真正需要修复的根因。随后,系统会自动生成候选的 critic、recovery 和 tool 更新。
第三环:Validation-Gated Skill Update Loop(验证门控更新闭环)
候选更新不能直接上线。Zetta ζ 会先做历史回归测试,再在严格隔离的 held-out 数据上验证。只有那些真正提升成功率、并且能泛化到新场景的更新,才会被写入技能记忆库。这保证了机器人不会为了 “背下某个失败样本” 而过度拟合。
在 Zetta ζ 的进化过程中,研究者观察到一个非常有意思的现象:成功率不是平滑上涨的,而是先经历平台期,然后突然跃升。就像人类解题时突然想通了一样,机器人也会出现 “顿悟时刻”。

如图展示的两个典型例子:
在具身基准 RoboCasa 上,开电水壶、推洗碗机抽屉、关烤箱门、放置咖啡壶等任务,也出现了类似的跳跃式提升。以放置咖啡杯(CoffeeSetupMug)的任务为例:


在另一具身基准 Libero-Pro 上,也有同样的现象,以推盘子到炉灶前(Push the plate to the front of the stove)的任务为例。



更关键的是,这些跃升不是靠训练模型、增加参数量或者人为调参实现的。Zetta ζ 帮助机器人找到了决定成败的关键物理状态变量。比如:运输前是否确认 “抓取保持稳定”;接触目标时是否建立了 “足够稳定的物理接触”;接近目标前,末端执行器是否处于 VLA 模型 “熟悉” 的几何范围内。
这些发现看似简单,却是机器人能否从 “偶尔成功” 走向 “稳定可靠” 的分水岭。
Aha Moment 不是孤立的一次性突破。更值得关注的是,随着进化轮次不断增加,Zetta ζ 的成功率呈现出持续、可复现的 scaling 趋势。在 LIBERO-Pro 上,纯 VLA 基线只有 34.5% 的平均成功率,随着 Zetta ζ 不断积累 Critic–Recovery,最终达到 90.8%。在 RoboCasa 上,成功率从 73.6% 提升到 93.6%。
每一轮进化做的事情,是识别并修复当前最主要的物理执行瓶颈,可能是错误的接近几何、不稳定的抓取保持、过早释放、执行停滞,或者任务关系未完成。随着这些 “小机制” 不断累积,机器人对物理世界的掌控力越来越强,任务成功率也就一步步逼近冻结 VLA 本身的能力上限。更有价值的是,Zetta ζ 学到的技能不是某个任务的 “标准答案”,而是可迁移的物理能力。

上图展示了 Zetta ζ 持续进化与零样本迁移效果。 在 PnP-Stove 任务上,三轮进化分别针对任务中出错的预抓取、重抓取与放置阶段进行修复,将成功率从纯 VLA 的 78% 逐步提升至 84%、94% 和 96%;同一 harness 无需针对目标任务重新优化,即可在 PnP-Sink、PnP-Cabinet 和 PnP-Toaster 等任务上获得持续的零样本性能增益。(图右侧展示了各轮中 Critic 检测到的代表性失败模式及其对应的恢复行为。)

Zetta ζ 在 LIBERO-Pro Goal 平均成功率:34.5% → 90.8% ;在 RoboCasa 的 18 个 Atomic-Seen 任务平均成功率:73.56% → 93.56%;绝对提升 20 个百分点,并且在接触丰富、长时程任务上提升尤为明显。这些提升全部来自执行系统的不断进化。且这些是在我们现有 rollout 迭代完的阶段成果,预计持续的 rollout 会继续提升成功率。
自进化需要大量 rollout 数据。环境是学习数据的来源,rollout 跑得越快,进化就越快。Zetta ζ 配套的 Z-Infra,是首个面向自进化具身智能体的 rollout 基础设施。它的设计思路很清晰:把 “智能体逻辑” 和 “异构硬件资源” 彻底解耦。

架构上分为三层:
Z-Infra 还实现了:
效果也很直接:有效 rollout 吞吐从 1.7 episodes/min 提升到 35.1 episodes/min,提升 20.6×;对比 HarnessVLA,吞吐提升 12.8×;单 episode 延迟降低 11.9×;π0.5 模型分区部署后,平均推理延迟降低 53%,goodput 提升 2.4×。

长期以来,具身智能的 scaling 思路主要是 “堆数据、堆参数、堆算力去训练更大的模型”。Zetta ζ 提出了另一条路径:不改变底层策略模型,而是持续进化它周围的执行系统。
这条路的价值在于:
当然,这并不意味着端到端 VLA/WAM 不再重要。相反,Zetta ζ 是在现有模型能力之上,补上了物理世界最需要的 “闭环治理能力”。研究团队也表示,未来计划将 Zetta ζ 规模化拓展到真实机器人:让真实机器人也能进行大规模并行 rollout;弥合 sim-to-real 差距;把真实机器人作为 Z-Infra 中的 “一等公民” 工作节点。
从 “事后反思” 到 “动作频率级闭环治理”,从 “静态执行” 到 “三环自进化”,从 “人工调试” 到 “自动发现物理瓶颈”。Zetta ζ 让我们看到,具身智能的进化不一定要靠 “更大的模型”,也可以靠 “更聪明的智能体系统”。
机器人也有 Aha Moment。而 Zetta ζ 要做的,就是让这种顿悟和进化持续发生。
文章来自于"机器之心",作者 "机器之心"。