从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用
从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用近年来,大语言模型(LLMs)在长篇视觉叙事中展现出卓越潜力,生产方式正迅速从单一模型生成转向面向生产的智能体系统。但长视频剪辑仍然是一个极难控制的长期任务。模型有时会在缺乏素材依据的情况下强行生成,甚至在面对明显断档的转场或人物不一致时依然“盲目拼接”。
搜索
近年来,大语言模型(LLMs)在长篇视觉叙事中展现出卓越潜力,生产方式正迅速从单一模型生成转向面向生产的智能体系统。但长视频剪辑仍然是一个极难控制的长期任务。模型有时会在缺乏素材依据的情况下强行生成,甚至在面对明显断档的转场或人物不一致时依然“盲目拼接”。
据最新独家爆料,谷歌目前正在紧锣密鼓地对即将发布的重磅大语言模型Gemini 3.5 Pro进行高强度的激进迭代,在正式揭晓之前,内部预计还会测试更多的版本。
2026 年 6 月 19 日,John Jumper 在 X 上宣布,自己将离开工作近九年的 Google DeepMind,在短暂休整后加入 Anthropic。随后,DeepMind CEO Demis Hassabis 也公开回复,感谢 Jumper 对 AlphaFold 和 AI for Science 的贡献。
我们相信,常驻型 (always-on) AI 助理的下一次飞跃,不在于把某一个模型单点调得更聪明,而在于扩展智能体的上下文 (Scaling Agent Context)—— 不断拓宽助理能够持续 "感知 — 推理 — 执行" 的范围,作为生活连接器连接用户的信息孤岛,直到它能接管用户的整个数字世界。
最近,谷歌连失两员大将。短短三天内,先是 Transformer 论文共同作者 Noam Shazeer 离开谷歌加入 OpenAI;紧接着诺贝尔奖得主、AlphaFold 负责人 John Jumper 转投 Anthropic 麾下。
来自西湖大学和香港中文大学(深圳)的团队沿着这一思路提出 Drifting Preference Optimization(DrPO),把漂移场用于单步文生图模型的偏好后训练。在 DrPO 中,奖励只负责对候选图像排序,不参与反向传播。具体而言,针对同一个文本提示词,当前模型生成一组候选图像。高分样本在特征空间中产生吸引,低分样本产生排斥,并结合参考模型约束给出模型的更新方向。
如今,CameraSquad 的出现,让这种多视角一致的视频生成与 3D 世界状态构建成为现实。近日,中国科学院大学高林研究员团队联合卡迪夫大学、香港科技大学和快手可灵团队,提出了一种面向多轨迹并行生成的相机可控视频生成方法 CameraSquad [1],相关论文已被 ACM SIGGRAPH 2026 录用。
对于 AI 生成图像中可能存在的不自然伪影,我们是否不仅能够将其定位和解释,还能进一步对其进行修复,使图像恢复为更加真实、自然的视觉外观?围绕这一问题,来自北京大学等机构的研究者提出了 GenShield:一个统一的自回归框架,将 AI 生成图像检测 与 图像伪影修复 结合到同一个闭环中,实现从 “诊断” 到 “修复” 的一体化建模。
在常规的对话外,Claude Code(也可以是 Codex)其实还提供了一些别样的控制(或者说:上下文注入)方法,比如:CLAUDE.md、Rules、Skills、Subagents、Hooks、Output Styles、以及 System Prompt Append
一觉醒来,AI的新潮流变成了养猫???火速围观一下,刚刚全球流式音视频模型赛道闯进了一匹黑马,能力SOTA级,模型名字就叫缅因猫(MaineCoon)。养过缅因猫的朋友都知道,这个品种有个外号叫「猫狗」,意思是几乎你走到哪儿,它就跟到哪儿,相当粘人,互动感MAX。
美国政府出口管制令刚落,坊间以为Anthropic最强模型Mythos要彻底消失。结果彭博社一锤炸响:仍有200多家银行和科技巨头,通过「玻璃之翼计划」继续使用Mythos预览版挖网络漏洞!
机器之心编辑部 AI 读论文这件事,正在进入下一个阶段。 最近,alphaXiv 推出了一个面向 arXiv 论文的 autoresearch 功能。 它的使用方式非常直接:当用户看到一篇论文时,只需要把论文 URL 里的「arxiv」改成「autoarxiv」,系统就会:
有人声称用 Claude Code 破译了 Linear A,一种来自克里特岛、已经沉默了 3500 年的古老文字。Claude Code 之父 Boris Cherny,也发文宣告了这个酷炫玩法:它是青铜时代米诺斯文明使用的书写系统,大约从公元前 1800 年开始出现,一直用到公元前 1450 年迈锡尼希腊人征服克里特岛为止。
刚刚,Anthropic重磅产品曝光了:永久在线智能体Conway来袭,AI开始主动打工,告别对话框!同时,GPT-5.6也在悄悄内测了。巨头激战,谁将颠覆你的工作流?
2011 年,Judea Pearl 凭借在因果推理领域的奠基性贡献获得图灵奖。他提出AI必须跨越三层:关联、干预、反事实。2018 年,他在面向大众的著作《The Book of Why》中将这一框架系统化为“因果之梯”。
近日,皮特·弗洛伦斯创办的具身智能公司Generalist AI完成了一轮新融资,总规模为4亿美元(约合人民币27亿元),估值为20亿美元(约合人民币135.5亿元)。本轮投资方包括英伟达旗下的NVentures、知名天使投资人纳特·弗里德曼(Nat Friedman)和丹尼尔·格罗斯(Daniel Gross)共同管理的NFDG
为什么推开源工具?在vibecoder到高级程序员都懂的原因,你能自己魔改成自家用的黑科技有什么不好?而且还不用订阅不花钱。为此,我们搞了这个游戏开发者的实用选型指南。每一个工具,都会告诉你:它适合做什么、不适合做什么、以及如何与AI工作流结合。
Waniwani宣布完成了800万美元的种子轮融资,由Seedcamp领投,Redstone、Zone II Ventures、Plug & Play、OPRTRs Club、Kima Ventures以及一批知名天使投资人跟投。
今天,流形空间宣布完成新一轮数亿元融资。本轮投资方包括中国国新旗下国新基金,淡马锡旗下毅峰资本,产业资本北汽产投、芯能创投等。流形空间成立于2025年5月,一年以来已经累计完成6轮融资,Pre-A轮累计近10亿元,
从v0.7开始,我先给 Humanize PPT 划了一条边界。把渲染PPT页面外包给下游的Skill。Humanize PPT负责把大纲,逐页意图,视频和图片素材的坑位和演讲稿,整理成结构化的 JSON 与 Markdown,再交给下游 Skill 原生渲染。
早在3月20日,纽约时报的凯文·罗斯就发现了在硅谷开发者中,出现了一种叫做 Tokenmaxxing的现象。这个现象最早出现在OpenAI、Anthropic等前沿模型开发公司。OpenAI 的工程师一周用了 2100 亿个token,大概是 33 个维基百科的量;Claude Code 的工程师则一个月单人可以烧15万美元token。
过去两年,关于 AI 的讨论几乎都绕着同一个词打转——失业。哪些岗位会消失,多少程序员会被取代,下一个被端掉饭碗的白领是谁。这个叙事好懂,也足够让人焦虑,所有人都能对号入座。
在今天这个时间点,一个色情漫画网站的浏览量能到 1 亿次,背后大概率有 AI 的参与。于是我顺着央视记者查到的那个网站名字搜了一圈,果然,这类色情漫画网站里,很大一部分内容都是 AI 做出来的。
银河通用团队用史上最大、整整 20 亿帧的动捕数据,训练出了全球首个人形机器人全身实时运控基座大模型,该模型零样本泛化全新动作,成功率从 MLP 架构的 76.89% 跃至 92.58%,推理延迟仅 0.39ms,效果超越英伟达 SONIC,甚至比目前业内主流 TWIST 系统速度提升至五倍。
小米正式发布并开源了Xiaomi Miloco 2.0,一套面向未来的全屋智能AI开源方案。直观来看,小米给Agent时代的智能家居装上了新的“AI大脑”,把超级AI管家带进了智能家居生态中。
属实给我整精神了,AI啥时候会干的这事??不卖关子了,这是HappyOyster 1.0(快乐生蚝)实现的,阿里ATH推出的可实时构建和交互的开放式世界模型产品。看到世界模型四个字,可能有朋友好奇:这和我之前玩的Sora那些有啥区别?不都是AI生成画面嘛?
真正把灵动岛推上风口的,是 6 月以来接连发生的几件事。6 月 8 日的 WWDC 2026,苹果发布了全新的 Siri AI。Federighi 在台上的原话是,苹果要「带来下一代 Apple Intelligence,并推出 Siri AI,一个明显更聪明、更博学、也更能干的 Siri」。
来自博世中央研究院与清华大学的研究人员提出 FunctionEvolve 框架,在两大基准测试上大幅刷新了这项任务的结果。在 LLM-SRBench 的 129 个合成科学方程任务上,FunctionEvolve 最终给出的公式在 55.8% 的任务上与真实公式等价(SA@1 = 72/129),是此前最好结果的 3.6 倍;
香港大学李弘扬团队联合华为、上海创智学院及清华大学李升波教授团队,发表的最新论文World Engine: Towards the Era of Post-Training for Autonomous Driving给出了系统回答。