AI资讯新闻榜单内容搜索-ROLL

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: ROLL
ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。

来自主题: AI技术研报
8186 点击    2026-08-01 10:44
ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。

来自主题: AI技术研报
8575 点击    2026-07-11 11:16
世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

以 LeWorldModel(LeWM)为例,它在规划时有一个重要瓶颈:每评估一条候选动作序列,模型都要一步步自回归 rollout。也就是说,LeWM 先预测下一步 latent,再把预测出的 latent 输入 dynamics model,继续预测下一步:

来自主题: AI技术研报
8248 点击    2026-07-07 14:57
OpenAI 和 Anthropic 共同看好的 FDE:AI 时代的新岗位出现,旧分工松动|对谈 Rolling AI

OpenAI 和 Anthropic 共同看好的 FDE:AI 时代的新岗位出现,旧分工松动|对谈 Rolling AI

OpenAI 和 Anthropic 共同看好的 FDE:AI 时代的新岗位出现,旧分工松动|对谈 Rolling AI

本周「十字路口」,我们聊 FDE 这个正在被重新定义的岗位与分工:它究竟是在把“售前/交付”换个名字,还是代表 ToB AI 时代新的组织结构与商业边界?当模型越来越强,最后一公里为什么依然最难?企业真正缺的,到底是更强的模型,还是能把 AI 带进流程、接入系统、治理知识、持续迭代并对结果负责的人?

来自主题: AI资讯
9899 点击    2026-06-13 10:19
自学成才,3000 元成本,Yoroll 合作创作者做出"全球最佳 AI 短片",好莱坞大佬全网寻人!

自学成才,3000 元成本,Yoroll 合作创作者做出"全球最佳 AI 短片",好莱坞大佬全网寻人!

自学成才,3000 元成本,Yoroll 合作创作者做出"全球最佳 AI 短片",好莱坞大佬全网寻人!

这几天,一部叫《丧尸清道夫》的 AI 短片,把国内外互联网都刷了一遍。没有大牌导演,没有传统动画公司的工业体系,也没有烧钱级别的制作预算。一个中国独立创作者,用十天时间、约 3000 元成本,做出了一部被网友称为"国产爱死机"的 AI 短片。

来自主题: AI资讯
10622 点击    2026-05-16 11:01
ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索

ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索

ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索

I²B-LPO 是一个面向 RLVR 后训练的探索增强框架,通过改进 rollout 策略引导模型生成更多样化的推理轨迹,将探索行为从 “重复采样” 推进到 “在关键节点生成更具区分度的推理轨迹”,在多个数学基准上同时提升准确率与语义多样性,最高分别达 5.3% 和 7.4%。该工作接收于 ACL 2026 Main,来自阿里达摩院 - 智能决策团队。

来自主题: AI技术研报
9962 点击    2026-05-14 14:24
训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限

当强化学习后训练的大规模 rollout 已经被证明能够提升图像生成模型的偏好对齐能力,推理负担就成了制约训练速度的核心瓶颈。来自 NVIDIA、港大和 MIT 的团队提出的 Sol-RL,通过「FP4 先探索、BF16 再训练」的后训练框架,将达到等效 reward 水平的收敛速度最高提升到 4.64x,在训练速度与对齐效果之间给出了一条更具工程可行性的解法。

来自主题: AI技术研报
9681 点击    2026-04-16 16:07