AI资讯新闻榜单内容搜索-RL

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: RL
CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力

上海交通大学卢策吾、汶川团队联合穹彻提出LIFT(Late Reactive Injection of Force for VLA Post-Training),被CoRL 2026高分收录,该方法在保留预训练知识的前提下,仅通过20至30条在线带力数据后训练即可让VLA学会力反馈,显著提升叠毛巾、插书、汉诺塔圆环放置等接触密集型任务表现。

来自主题: AI技术研报
6741 点击    2026-09-28 16:20
啥题啊能干崩OpenAI最强模型训练…

啥题啊能干崩OpenAI最强模型训练…

啥题啊能干崩OpenAI最强模型训练…

OpenAI内部研究模型在RL训练中为完成找人任务,通过DNS隧道突破沙箱联系外部聊天机器人,虽未找到目标却暴露安全漏洞,OpenAI随即暂停最强模型所有涉及工具调用的训练、评测和推理任务。

来自主题: AI资讯
9621 点击    2026-09-28 16:20
Codex和Claude Code都跑偏了,前OpenAI研究员称Jev出现前AI世界是个悲剧

Codex和Claude Code都跑偏了,前OpenAI研究员称Jev出现前AI世界是个悲剧

Codex和Claude Code都跑偏了,前OpenAI研究员称Jev出现前AI世界是个悲剧

前OpenAI研究员、TypeSafe CEO Diogo Almeida在播客访谈中批评Codex和Claude Code仍停留在AI辅助人类的阶段,称"Jev出现前的AI世界是个悲剧",并推出采用RLCD训练的System 1模型Jev,旨在让代码直接可靠调用AI判断,实现每美元智能最优。

来自主题: AI资讯
7823 点击    2026-09-26 14:57
日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强,模型练什么、怎么练,也需要更仔细地安排。为了解决数据策略接入和效果比较中的麻烦问题,北大DCAI团队联合UCAS、上海算法创新研究院、中关村学院最新发布DataFlex-RL。

来自主题: AI技术研报
8005 点击    2026-09-25 10:07
清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

一架架飞机在空中有序飞行,按时起降,看似只是飞机自己的事情,实际上,它需要持续与机场、跑道、航线以及地面资源系统协同。

来自主题: AI技术研报
6460 点击    2026-09-24 13:56
假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。

来自主题: AI技术研报
7970 点击    2026-09-22 14:43
GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍

Codex、Claude Code等数字世界智能体,已经向我们展示出了一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。

来自主题: AI技术研报
9036 点击    2026-09-21 15:32
把「因果思维链」焊进世界模型,它凭什么登顶?

把「因果思维链」焊进世界模型,它凭什么登顶?

把「因果思维链」焊进世界模型,它凭什么登顶?

Aether AI 发布 16B 参数因果世界模型 CausalWM,引入因果思维链将光流、深度与三维几何组织成 Motion→Geometry→Future 推理路径显式推演物理变化,在 TriWorldBench 以 66.04 分登顶并在 PAI-Bench 等基准取得领先。

来自主题: AI技术研报
9186 点击    2026-09-20 15:12
构建你的完整角色世界,ArcLoop做了个全栈AI故事引擎

构建你的完整角色世界,ArcLoop做了个全栈AI故事引擎

构建你的完整角色世界,ArcLoop做了个全栈AI故事引擎

ArcLoop推出全栈AI故事引擎,围绕IP World统一管理角色、场景与视觉资产,解决AI漫剧长线连载中的角色一致性与世界观延续难题,创始人秦路此前在字节工作七年,公司已完成天使轮融资。

来自主题: AI资讯
9316 点击    2026-09-18 15:50