AI资讯新闻榜单内容搜索-多模态

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 多模态
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。

来自主题: AI技术研报
7287 点击    2026-09-28 09:48
华为大模型双子星联手创业,息壤开物要找物理世界的Scaling Law

华为大模型双子星联手创业,息壤开物要找物理世界的Scaling Law

华为大模型双子星联手创业,息壤开物要找物理世界的Scaling Law

前华为云盘古大模型CTO李寅与多模态首席科学家张含望联合创立的息壤开物宣布完成数亿元种子轮及天使轮融资(估值5亿美金),旨在训练面向物理世界的大物理模型(LPM),寻找物理世界的Scaling Law。

来自主题: AI资讯
8398 点击    2026-09-26 14:57
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。

来自主题: AI技术研报
7313 点击    2026-09-20 15:08
肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA

新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中

来自主题: AI技术研报
9216 点击    2026-09-20 15:07
实时交互模型:一个还没形成共识的赛道,怎么就成了热门?

实时交互模型:一个还没形成共识的赛道,怎么就成了热门?

实时交互模型:一个还没形成共识的赛道,怎么就成了热门?

实时交互模型尚未形成统一定义却已成为热门赛道,SigmaZ AI、Loopit、Reverie AI、Runway和Vidu等公司从原生音视频生成、Coding驱动等不同技术路线出发,探索AI在聊天框之外实时响应用户多模态输入的能力,行业正围绕定义权和稀缺交互数据展开竞争。

来自主题: AI资讯
8946 点击    2026-09-19 10:59
豆包大模型再更新,发力多模态编程,一手实测来了

豆包大模型再更新,发力多模态编程,一手实测来了

豆包大模型再更新,发力多模态编程,一手实测来了

字节跳动发布新版豆包2.1 Pro(0915版本),重点升级多模态编程与视觉理解能力,可依据设计图、图纸和操作录屏生成代码,编辑团队通过山西3D旅行导览、小王子微缩星球等场景实测,验证其在Agent任务交付与Token效率方面的提升。

来自主题: AI资讯
8265 点击    2026-09-18 15:48
和「豆包爱学」一起长大的孩子,会少走多少弯路?

和「豆包爱学」一起长大的孩子,会少走多少弯路?

和「豆包爱学」一起长大的孩子,会少走多少弯路?

豆包爱学2.0依托豆包多模态大模型与Seedance系列模型,将AI嵌入语数英等学科的问答、板书讲解、定制课程、听写和错题整理等学习全流程,同一对话入口即可围绕知识点不断生成完整学习内容,展现字节在AI教育场景的工程化能力。

来自主题: AI资讯
7903 点击    2026-09-18 15:46