机器人需要「看到三维未来」!RynnWorld-4D重塑4D具身世界模型
机器人需要「看到三维未来」!RynnWorld-4D重塑4D具身世界模型近两年,视频生成模型在具身智能领域受到持续关注。从 UniPi、SuSIE 到各类 action-conditioned video generation 变体,其核心思路一致:先由模型生成一段未来视频,再从中提取动作信号供机器人执行。
搜索
近两年,视频生成模型在具身智能领域受到持续关注。从 UniPi、SuSIE 到各类 action-conditioned video generation 变体,其核心思路一致:先由模型生成一段未来视频,再从中提取动作信号供机器人执行。
如果想开发一个视频理解应用,你会怎么做?
来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。
General Intuition 做的事听起来有点绕:用游戏数据训练现实世界里的 AI Agent。换成更直白的话说,General Intuition 做的是让 AI 先在游戏里学会“怎么行动”,再把这种能力迁移到机器人、无人机、自动驾驶、仿真环境里。
AI 时代,面临传统电网和可再生能源的压力,科技巨头们争夺的资源已不仅仅是 GPU,而是稳定、低价、全天候不断电的清洁能源。现在,解决方案或许又多了一个新的选择。近日,美国核能初创公司 Ampera 称,已基于 3D 打印完成全球首个全尺寸核反应堆模块,旨在为 AI 数据中心、国防应用、工业设施和偏远地区等提供清洁电力。
看《堡垒之夜》的游戏录像,也能训练AI?没错,一家靠着海量游戏录像训练AI的公司General Intuition,刚刚完成3.2亿美元(约合人民币21.77亿元)融资。General Intuition公开披露的融资总额已达4.54亿美元,估值23亿美元。
过去十年,推荐系统最核心的动作可以概括成一个字:找。
全球最强超算,易主了!
解决非常底层、 非常硬核问题的时代来了。
如今,CameraSquad 的出现,让这种多视角一致的视频生成与 3D 世界状态构建成为现实。近日,中国科学院大学高林研究员团队联合卡迪夫大学、香港科技大学和快手可灵团队,提出了一种面向多轨迹并行生成的相机可控视频生成方法 CameraSquad [1],相关论文已被 ACM SIGGRAPH 2026 录用。