AI资讯新闻榜单内容搜索-CV

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: CV
ECCV 2026|当RGB变成不可靠变量:InfraNet用非对称学习重构RGB-IR检测

ECCV 2026|当RGB变成不可靠变量:InfraNet用非对称学习重构RGB-IR检测

ECCV 2026|当RGB变成不可靠变量:InfraNet用非对称学习重构RGB-IR检测

在讨论 RGB-IR 目标检测时,「两种模态互补」几乎是默认前提。RGB 擅长保留纹理和颜色,红外图像在弱光条件下更稳定,于是最直接的路线是搭建双分支网络,让它们在中间层不断交换信息。InfraNet 的出发点却来自一个不太符合这一直觉的现象。

来自主题: AI技术研报
8812 点击    2026-07-19 10:13
ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。

来自主题: AI技术研报
10013 点击    2026-07-18 10:09
ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据

ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据

ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据

PhyMAGIC通过让物体动起来,从视频中提取物理证据,帮助准确推断材料属性。它结合图生视频与视觉语言模型,生成针对性运动探针,并不断修正物理参数,最终构建出可微分的3D动态模型,实现更符合现实的视频生成。

来自主题: AI技术研报
5813 点击    2026-07-17 10:09
ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream

ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream

ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream

为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是

来自主题: AI技术研报
6808 点击    2026-07-12 10:47
ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

视频虚拟试衣(VVT)作为电商展示与数字内容创作中的核心技术,已在动态人物换装、服装纹理保持和视频时序连贯性方面取得显著进展。然而,现有方法大多仍受限于固定相机视角,生成结果被动依赖源视频的原始相机轨

来自主题: AI技术研报
7076 点击    2026-07-07 14:58
谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

近期, ECCV 2026 结果公布,Realsee 团队的成果 Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes 成功入选。它面向室内全景图像,能够从稀疏、无序的全景照片中,直接预测相机位姿、度量深度和点云重建结果,可以为 3DGS 提供更稳定、更精准的几何约束。

来自主题: AI技术研报
8857 点击    2026-07-07 09:55
世界模型评测的最大盲区,被新基准MemoBench捅破了

世界模型评测的最大盲区,被新基准MemoBench捅破了

世界模型评测的最大盲区,被新基准MemoBench捅破了

来自哈佛大学、MIT、IBM、波士顿大学、谷歌、JHU、CMU 和 Kempner Institute 的研究者提出了一个新的诊断性基准:MemoBench。这是首个面向动态环境的「消失-重现」世界建模评测基准,并已被计算机视觉顶会 ECCV 2026 接收。其一作 Haoyu Chen 为哈佛大学计算科学与工程专业一年级硕士生,师从哈佛大学计算机科学助理教授 Yilun Du。

来自主题: AI技术研报
8143 点击    2026-07-06 12:24
上海交大提出ICRDrag:首个上下文区域拖拽模型,实现精准可控图像编辑

上海交大提出ICRDrag:首个上下文区域拖拽模型,实现精准可控图像编辑

上海交大提出ICRDrag:首个上下文区域拖拽模型,实现精准可控图像编辑

还在用 DragGAN、DragDiffusion 拖拽修图?点选拖拽容易变形、边界割裂、细节丢失的时代落幕了!ECCV 2026 ICRDrag 首创上下文区域拖拽模型,用掩码精准定位局部区域,移动、缩放、变形全都丝滑自然,兼顾精准度与画面真实感。

来自主题: AI技术研报
8345 点击    2026-07-05 09:47
OmicOS Science 正式发布|国产大模型与AI4S的时代来临

OmicOS Science 正式发布|国产大模型与AI4S的时代来临

OmicOS Science 正式发布|国产大模型与AI4S的时代来临

今天,我们将面向任何用户推出OmicOS Science正式版(https://omicos.cn/),无论您处于世界上的任何区域,无论您使用的是任何模型,都可以享受AI时代的红利!我们深知,科学研究最关键的一环是可审计与可复现性。在OmicOS Science中,点击生成的每一张图,你都能看见这张图绘制的代码

来自主题: AI资讯
9559 点击    2026-07-04 21:08
ECCV 2026 | 悉尼大学提出Linstereo, 打通立体匹配「最后一公里」

ECCV 2026 | 悉尼大学提出Linstereo, 打通立体匹配「最后一公里」

ECCV 2026 | 悉尼大学提出Linstereo, 打通立体匹配「最后一公里」

LinStereo 对应地做了三件事:PALA 换掉 ConvGRU 解决传播问题,HSCV 保留多尺度特征,DPI 用单目深度给一个靠谱的起点。PALA 做的事情说起来很直观,就是把 ConvGRU 的局部更新换成全局注意力,让每个像素每次迭代都能看到整张图。难点在于 softmax attention 是 O (N²) 的,直接用在高分辨率视差图上跑不动。

来自主题: AI技术研报
8741 点击    2026-07-04 10:50