平均6天一个新旗舰!大模型更新快到人类跟不上了
平均6天一个新旗舰!大模型更新快到人类跟不上了OpenAI、Anthropic及国内十家主要大模型厂商平均每6天推出一款新旗舰模型,AI已大规模参与下一代模型研发,导致模型迭代速度首次超过人类适应速度,开发者调好的提示词和参数频繁面临报废。
搜索
OpenAI、Anthropic及国内十家主要大模型厂商平均每6天推出一款新旗舰模型,AI已大规模参与下一代模型研发,导致模型迭代速度首次超过人类适应速度,开发者调好的提示词和参数频繁面临报废。
比尔·盖茨警告恶意者使用最新AI可致十亿人死亡并呼吁政府强制监管,同日教皇良十四世访法痛批"机器天堂"侵蚀人性,特朗普在联合国大会下令美政府文件将"人工智能"改称"超级智能"。
香港科技大学提出LexAgentHallu法律智能体幻觉评测基准,沿执行轨迹定位错误步骤,发现即使最终答案正确,仍有68%的轨迹存在法律内容幻觉,表现最好的配置也有89%的轨迹出现幻觉。
北京大学、清华大学与微软亚洲研究院在Nature Machine Intelligence发表研究,发现语言模型内部表征与人脑演绎推理脑区存在部分对齐,并可利用脑信号引导模型表征干预与参数微调,显著提升推理鲁棒性。
针对企业AI落地卡在「最后一公里」的难题,中国联通推出联通云犀工作流智能体,以通信场景为入口,将AI能力轻量化嵌入企业现有业务流程,已服务超6万家企业、800万用户。
南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。
单点智能撑不起物理世界,华为报告指向系统进化。 作者 | 王涵 编辑 | 漠影 2026年,资本正在为AI走进物理世界疯狂下注。 IT桔子数据显示,截至5月11日,国内具身智能领域今年已披露投资218
匿名模型Space Bunny突然杀上OpenRouter与OpenCode双榜调用日榜第一,经多个Coding任务实测,其速度快、输出效果良好,首轮细节虽偶有小bug但经一轮交互即可修复,厂商身份尚未公开,网友们纷纷猜测可能来自OpenAI、Grok、Kimi、GLM或Meta等公司。
谷歌DeepMind掌门人首次确认Gemini 4 Pro已进入后训练早期阶段,开发者在实测中发现其新检查点在3D物理模拟、代码生成等任务上表现碾压Opus 5.5,且泄露参数显示其具备1000万Token上下文窗口和极具攻击性的定价,谷歌力争在年底前正式发布。
作者用 Qoder 搭配 Qwen3.8-Flash 模型调用开源工具 capcut-cli,在剪映 5.9 中自动完成口播视频的字幕识别、贴字和音效添加,生成可继续手动修改的分轨草稿。