AI资讯新闻榜单内容搜索-RL

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: RL
世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。

来自主题: AI技术研报
9479 点击    2026-07-16 10:10
AI打工大排行:Claude Fable 5自动赚钱的能力,是GPT-5.5的2.5倍

AI打工大排行:Claude Fable 5自动赚钱的能力,是GPT-5.5的2.5倍

AI打工大排行:Claude Fable 5自动赚钱的能力,是GPT-5.5的2.5倍

Fable 5 在远程劳动力指数(Remote Labor Index,RLI)上拿到了 16.1% 的自动化率,几乎是第二名 Opus 4.8(8.3%)的两倍,更是第三名 GPT-5.5(6.3%)的 2.5 倍。

来自主题: AI资讯
8786 点击    2026-07-12 16:38
98年哈工大教授带队,破晓智能要把触觉写进机器人基础模型

98年哈工大教授带队,破晓智能要把触觉写进机器人基础模型

98年哈工大教授带队,破晓智能要把触觉写进机器人基础模型

瞄准这类 “看起来做对了,物理上却没完成” 的失败。破晓智能(PHANES AI)创始人、哈工大(深圳)长聘教授杨朔及其团队发布了最新论文 TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation。

来自主题: AI资讯
10628 点击    2026-07-12 16:37
老黄RTX Spark真机现身Bilibili World!CPU和GPU直接焊在一起,笔记本跑120B大模型

老黄RTX Spark真机现身Bilibili World!CPU和GPU直接焊在一起,笔记本跑120B大模型

老黄RTX Spark真机现身Bilibili World!CPU和GPU直接焊在一起,笔记本跑120B大模型

就在这届Bilibili World上,英伟达首次面向大众玩家展示了搭载RTX Spark超级芯片的笔记本电脑。这款芯片专为个人智能体打造,不仅搭载了Blackwell RTX GPU,连CPU也是出自英伟达的Grace CPU。

来自主题: AI资讯
9567 点击    2026-07-12 10:52
北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

来自主题: AI技术研报
8228 点击    2026-07-12 10:44
ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。

来自主题: AI技术研报
8577 点击    2026-07-11 11:16
你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。

来自主题: AI技术研报
8335 点击    2026-07-10 10:41
蚂蚁灵波发布最新世界模型 LingBot-World 2.0,无限时长、随机变化的世界,终于来了?

蚂蚁灵波发布最新世界模型 LingBot-World 2.0,无限时长、随机变化的世界,终于来了?

蚂蚁灵波发布最新世界模型 LingBot-World 2.0,无限时长、随机变化的世界,终于来了?

最新世界模型 LingBot-World 2.0 正在试图实现的事情。「一个世界只需要几秒钟就能造出来」不再仅限于预制的世界,而是让每一次生成,都是一次全新的创造。这是一个秒级生成、支持实时交互的开源世界模型。

来自主题: AI资讯
9390 点击    2026-07-10 10:24