AI资讯新闻榜单内容搜索-自回归

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 自回归
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。

来自主题: AI技术研报
9854 点击    2026-07-23 10:39
首次,统一建模视角下的扩散语言模型后门威胁

首次,统一建模视角下的扩散语言模型后门威胁

首次,统一建模视角下的扩散语言模型后门威胁

扩散语言模型(DLM)正逐渐成为自回归(Autoregressive, AR)语言模型之外一种新兴的建模范式。

来自主题: AI技术研报
8843 点击    2026-07-15 14:35
无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

过去几年,扩散模型几乎定义了高质量图像生成:从随机噪声出发,经过多轮迭代,逐步 “雕刻” 出一张图像。但随着大语言模型席卷人工智能领域,另一条路线正迅速走到舞台中央 —— 图像,能否也像语言一样,通过自回归方式逐步生成?

来自主题: AI技术研报
7681 点击    2026-07-14 11:07
世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

以 LeWorldModel(LeWM)为例,它在规划时有一个重要瓶颈:每评估一条候选动作序列,模型都要一步步自回归 rollout。也就是说,LeWM 先预测下一步 latent,再把预测出的 latent 输入 dynamics model,继续预测下一步:

来自主题: AI技术研报
8249 点击    2026-07-07 14:57
ICML 2026|从「鉴伪」到「修复」,AI图像取证进入闭环时代

ICML 2026|从「鉴伪」到「修复」,AI图像取证进入闭环时代

ICML 2026|从「鉴伪」到「修复」,AI图像取证进入闭环时代

对于 AI 生成图像中可能存在的不自然伪影,我们是否不仅能够将其定位和解释,还能进一步对其进行修复,使图像恢复为更加真实、自然的视觉外观?围绕这一问题,来自北京大学等机构的研究者提出了 GenShield:一个统一的自回归框架,将 AI 生成图像检测 与 图像伪影修复 结合到同一个闭环中,实现从 “诊断” 到 “修复” 的一体化建模。

来自主题: AI技术研报
8264 点击    2026-06-21 10:31
Mythos阴影里谷歌悄悄发模型DiffusionGemma,速度暴涨4倍

Mythos阴影里谷歌悄悄发模型DiffusionGemma,速度暴涨4倍

Mythos阴影里谷歌悄悄发模型DiffusionGemma,速度暴涨4倍

就在刚刚,谷歌闷头干了件大事:把生成图片的扩散模型,拿来写文字了,而且一出手就是4倍加速。 新模型名为DiffusionGemma,它直接抛弃了传统自回归那套“逐Token生成”的打字机模式,而是像“印刷机”一样工作——

来自主题: AI资讯
12215 点击    2026-06-11 15:27
RSS 2026|蚂蚁灵波提出首个自回归因果世界模型,50条数据解锁通用机器人操控

RSS 2026|蚂蚁灵波提出首个自回归因果世界模型,50条数据解锁通用机器人操控

RSS 2026|蚂蚁灵波提出首个自回归因果世界模型,50条数据解锁通用机器人操控

赋予机器人物理理解和预测能力是通用操作的关键。蚂蚁灵波等机构提出的 LingBot-VA 试图将视频帧预测与动作推理统一起来,让机器人通过自回归扩散框架学会“一边思考一边行动”。

来自主题: AI技术研报
10881 点击    2026-06-04 09:13
22.9倍加速!FlashAR:仅用0.05%数据,让预训练好的自回归图像模型飞起来

22.9倍加速!FlashAR:仅用0.05%数据,让预训练好的自回归图像模型飞起来

22.9倍加速!FlashAR:仅用0.05%数据,让预训练好的自回归图像模型飞起来

来自浙江大学和阿德莱德大学的研究团队提出了 FlashAR—— 一个轻量级的后训练加速框架。不需要从头训练,在 Emu3.5-Image-34B 模型上,仅用原始训练数据的 0.05%(约 8 万张图片),就能将预训练好的自回归模型改造成高度并行的生成器 Emu3.5-34B-Flash,实现最高 22.9 倍的端到端加速。

来自主题: AI技术研报
9361 点击    2026-05-24 10:07
首个三模式大语言模型:4倍token吞吐量,长文本秒级时代要来了?

首个三模式大语言模型:4倍token吞吐量,长文本秒级时代要来了?

首个三模式大语言模型:4倍token吞吐量,长文本秒级时代要来了?

英伟达提出了全球首个三模式的大语言模型系列,只需简单更改注意力模式 / 掩码,即可在自回归、扩散和自推测解码之间切换。一个模型,三种解码模式,没有额外的草稿模型,没有架构变更。最快的模式 token 吞吐量能提升 4 倍。

来自主题: AI技术研报
10978 点击    2026-05-22 15:33