ICML 2026|两张图换个顺序,VLM就「不会了」:EgoTSR让机器人判断任务是否真的在推进
ICML 2026|两张图换个顺序,VLM就「不会了」:EgoTSR让机器人判断任务是否真的在推进浙江大学等五所高校的研究团队提出 EgoTSR。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。
搜索
浙江大学等五所高校的研究团队提出 EgoTSR。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。
AI 创业公司「MobAI」已完成数百万元天使轮融资,由港股上市公司赤子城科技独家投资。目前,由MobAI开发的AI互动叙事应用Lunaverse Stories 已进入邀请制测试阶段。 熟悉AI互动类产品的人应该对MobAI并不陌生。
Github热榜持续屠榜,短短几天一路狂揽15.4k stars,甚至一度冲到了Top 1的位置。不是啥大厂项目,也不是啥新模型。而是一个叫OpenMontage的开源「视频制作」系统~(剪辑人狂喜.jpg)
或许是知道大家这周末都要奋战狂战 Fable 5,Anthropic 的 Claude Code 开发者 Thariq 放出了一篇长文,分享他使用 Fable 5 模型的方法论。Thariq 在文中表示:Fable 5 的能力上限,取决于你能发现多少自己还不知道的东西。
就在前几天,一家名为 Oasis Devices 的迈阿密初创公司,发布了一款专门适用于不方便打字也不方便大声说话的新 AI 录音听写硬件,OASIS 1 智能戒指。这枚售价 289 美元的钛合金戒指,最大的卖点,就是把 Wispr Flow 的 AI 听写技术,从一个放在手机上的 App 里,转到了一个离我们嘴巴更近的载体里。
“Opus是好模型,但Fable 5比它好十倍。”Alex说。他建议开发者把过去两周Fable下架期间写的所有代码,全部丢给Fable 5进行重新审查,目的是看看有没有安全漏洞、性能不够的地方、或者写得太粗糙但可以修改好的逻辑。
就在昨晚,Anthropic扔出了经济指数系列的第六份报告——第一次把几百万次Claude对话的采样精度从每周拉到逐小时!你几点焦虑、几点嘴馋、几点睡不着,全在数据里。AI比你的伴侣还懂你的作息。
「不如直接数字人」 私以为,世界模型这个概念的发展经过了三个非常幽默的阶段。 第一阶段:硅谷真懂行的老登如杨立昆、李飞飞,觉得大语言模型在讲故事上没啥空间了,所以从学术圈拽了个新概念过来尝试弯道超车。
LinStereo 对应地做了三件事:PALA 换掉 ConvGRU 解决传播问题,HSCV 保留多尺度特征,DPI 用单目深度给一个靠谱的起点。PALA 做的事情说起来很直观,就是把 ConvGRU 的局部更新换成全局注意力,让每个像素每次迭代都能看到整张图。难点在于 softmax attention 是 O (N²) 的,直接用在高分辨率视差图上跑不动。
三星大模型团队联合北京大学、香港城市大学、香港科技大学等科研机构,共同发布了面向 AI Agent 的基准测试 LiveClawBench。它关注的并不是「谁的 Agent 更强」,而是一个更基础、也更关键的问题:为什么同一个 AI Agent,在一些任务中已经接近可用,而在另一些任务中却会突然失稳?