对话清华赵昊:物理AI,胜负关键在4D可控的世界模型基模
对话清华赵昊:物理AI,胜负关键在4D可控的世界模型基模今天,世界模型几乎成为 AI 领域最受关注的话题之一,但对于“什么才是真正的世界模型”却依然存在巨大分歧。有人认为它只是视频生成的延伸,也有人认为只有能够理解物理规律、支持机器人行动的系统才是真正的世界模型。
搜索
今天,世界模型几乎成为 AI 领域最受关注的话题之一,但对于“什么才是真正的世界模型”却依然存在巨大分歧。有人认为它只是视频生成的延伸,也有人认为只有能够理解物理规律、支持机器人行动的系统才是真正的世界模型。
迁移学习里的“源数据”,未必非得是图像、文本或音频。
7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。 入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智
交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。
苏度科技联合创始人、董事长苏昊是ImageNet的核心作者之一,师从李飞飞。这家公司走了一条与硅谷主流“纯大脑黑盒大模型”不太一样的路:软硬件协同设计,上下分层架构,上层负责任务规划与环境理解,下层负责具体物体操作;Sim-to-Real作为核心训练范式,让机器人在虚拟世界里经历几百万年的进化,再迁移到现实。
最近硅谷有点魔幻。一边被中国开源模型吓得不轻,专门造了个词叫「Kimi panic」;另一边,美国最大的模型托管平台刚被自家模型攻击,救场的偏偏又是一个中国开源模型。就在这个节骨眼上,老黄又整活了。
“AI教母”李飞飞创办的World Labs正式宣布收购美国机器人仿真初创公司SceniX。这笔交易是World Labs成立以来的首笔公开收购,也标志着这家以“空间智能”为旗帜的明星创企,正式将业务边界从3D世界生成推进到物理机器人训练领域。
这家公司是Fireworks AI,按现在流行的话说,Fireworks AI是一家Token工厂。既不训练前沿大模型,也不做面向消费者的AI应用,只做推理,帮企业把开源模型微调好、托管好,然后按调用量收钱。今年GTC大会上,黄仁勋和Lin Qiao有场对谈,老黄直言,“In a lot of ways, you're the TSMC of AI factories.”
袁博地的答案是否定的。从清华大学接触计算机视觉,到 UC Berkeley 攻读 AI 博士,再到 Google X 负责机器人的视觉系统,袁博地过去十多年的研究几乎始终围绕 Pixel 展开:从图像识别,到 GAN、Diffusion,再到图像和视频生成,技术范式不断变化,研究对象却始终指向同一件事——如何让机器理解和生成视觉世界。