视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
搜索
交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
这家初创公司已与Georgia Power 签订合同,为位于Effingham County的这一数据中心综合体锁定了3.2GW的电力供应,这一规模可能使该设施跻身OpenAI迄今为止最大的数据中心之列。预计从2028年起将有数百兆瓦电力投入使用,其余开发工作将持续到2032年。1GW的电力足以在任意时刻为约75万户美国家庭供电。
现在,你可以通过录屏 + 语音讲解的方式,彻底把自己蒸馏成 Skill 了。7 月 21 日,Anthropic 在 Claude 桌面端 Cowork 的 + 菜单里加了一项「Record a Skill」:录屏,一边操作一边用语音讲解,录完后 Claude 自动把演示转化成一个可复用的 Skill。
2026年7月,38度的上海。西岸,张江,世博——三地四馆,盛况空前。一千一百家企业。三百多台真机。九位图灵奖得主到场。很多人把这届WAIC大会定为“史上最火的一届”。不是因为它推动了哪个划时代的突破,而是因为它恰好站在一个奇妙的节点上:我们截取了二十八个瞬间。拼在一起,是一幅赛博浮世绘。
这是今天 AI 圈最大的瓜。 OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。闭源模型一举攻破开源社区,社区用开源模型自救,这离谱的剧情听起来都能拍一部电影了。
最近手头在测一个新模型,叫 Macaron-V1。说实话一开始没抱太大期待,打着「个人智能体」旗号的产品这两年太多了,大多数打开之后还是那套老配方:一个聊天机器人,外面挂几个插件。但测了三四天下来,发现这个模型的思路跟我预想的不太一样,值得认真写一篇。
近日,围绕搜索、推荐、广告等核心业务中的大规模向量检索成本与性能问题,小红书引擎架构团队在 OSDI 2026 会议上发表了论文《The Clustering Strikes Back: Building Cost-Effective and High-Performance ANNS at Scale with HELMSMAN》。
2026年WAIC的展厅里,人潮涌动。大模型厂商在秀参数,算力厂商在秀集群规模。
上海世博展览馆,WAIC 2026,H1-A530展位前围了三层人。
2026年10月1日,IROS 2026 Workshop——Physical World Models for Scaling Embodied AI将在美国匹兹堡举行。论文征集现已开放,8月10日截止;WorldArena 2.0 Challenge三大赛道已于7月10日开赛,总奖金$7500。