AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview

预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview

预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview

自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?

来自主题: AI技术研报
7639 点击    2026-09-22 11:18
ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。

来自主题: AI技术研报
9524 点击    2026-09-22 09:51
工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明

工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明

工具、技能、记忆连成网,北大等提出自进化程序图PG,越用越聪明

当Agent已经能够调用工具、使用技能并保存记忆,一个更进一步的问题是:这些能力怎样在任务中配合,又怎样从过去的执行中积累可复用的经验?

来自主题: AI技术研报
9627 点击    2026-09-22 09:50
迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述

让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。

来自主题: AI技术研报
10435 点击    2026-09-22 09:50
EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据

EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据

EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据

工具调用使大语言模型能够通过外部 API 获取信息、执行操作。训练这类能力,需要建立用户请求与具体函数调用之间的对应关系。一条合格的训练样本,不仅要符合函数定义,还要保证工具选择、调用次数和参数取值与用户意图一致。

来自主题: AI技术研报
7256 点击    2026-09-21 15:31
复旦上线音视频模型新裁判:一万组数据对齐人类审美

复旦上线音视频模型新裁判:一万组数据对齐人类审美

复旦上线音视频模型新裁判:一万组数据对齐人类审美

现有的音视频奖励模型,能通过局部指标捕捉到画质或同步上的优势,却往往忽略声音失真、台词与提示不符,以及动作和语音配合不自然等问题。

来自主题: AI技术研报
9022 点击    2026-09-21 15:30
荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 “人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作” 与 “重建真实交互” 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。视觉上成立,并不意味着物理交互上成立。

来自主题: AI技术研报
5844 点击    2026-09-21 10:10
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。

来自主题: AI技术研报
7307 点击    2026-09-20 15:08
肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中

来自主题: AI技术研报
9208 点击    2026-09-20 15:07