AI倒查论文100年!99.2%的顶刊都有问题...
AI倒查论文100年!99.2%的顶刊都有问题...7月22日,美国某研究审查公司用AI Agent对ICML 2026全部168篇口头报告论文进行了系统性的结果复现审计。168篇论文中有92篇拥有至少5条可供验证的结论性声明。最终的结果是:AI Agent能够成功复现超过四成结论的,只有34篇;而能复现八成以上结论的,仅有8篇。
搜索
7月22日,美国某研究审查公司用AI Agent对ICML 2026全部168篇口头报告论文进行了系统性的结果复现审计。168篇论文中有92篇拥有至少5条可供验证的结论性声明。最终的结果是:AI Agent能够成功复现超过四成结论的,只有34篇;而能复现八成以上结论的,仅有8篇。
今年,由倪赞林担任第一作者,王慎执、乐洋共同参与的《The Flexibility Trap》获得 ICML 2026 Outstanding Paper Award。ICML 2026 投稿量达到创纪录的 24,000+ 篇,仅评出 2 篇 Outstanding Paper,该论文成为ICML历史上首篇完全由国内单位学者完成的获奖成果,为更好地理解和设计扩散语言模型做出了重要贡献。
想象一个刚上岗的实习生。教他做A任务,他学得很好;接着教他做B任务,他又学会了——但回过头再让他做A,他却忘得七七八八。
过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。
迁移学习里的“源数据”,未必非得是图像、文本或音频。
多智能体系统(Multi-Agent Systems,MAS)展示了令人印象深刻的能力:一个模型负责提出方案,另一个模型进行批评,还有模型承担投票、规划或执行。通过角色分工和多轮协作,系统能够解决单个模型难以稳定完成的数学推理、代码生成和知识问答任务。
来自港科大的研究团队提出了RepetitionCurse,这是一种针对MoE大模型服务的黑盒压力测试方法。它不需要模型权重,不需要梯度,也不需要知道后端专家如何部署,只利用高度重复的输入模式,就能诱导专家路由把大量token路由到同一小批专家上。
这场越来越快、越来越贵、越来越拥挤的竞赛里,我们还能做什么?
ICML 2026落幕了。
这年头,提示词工程也能发ICML了???