模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案
模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”
搜索
向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”
问小白 5 Pro 呈现出一种很接近真实项目成员的工作方式:先确认 Brief,主动拆解任务,持续汇报进度,在文档中留下修改痕迹,最终完成交付。不同路线决定了不同能力上限:对话路线的上限是上下文窗口,资料路线的上限是权限管理粒度,研究流程路线的上限是自动化程度,而项目工作台路线的上限是系统架构的复杂度
又来???GPT-5.6最近这是捅了数学反例窝了……
热热热热热!今年 WAIC 现场,大家对 AI 的热情,像上海的气温一样持续攀升。
这是今天 AI 圈最大的瓜。 OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。闭源模型一举攻破开源社区,社区用开源模型自救,这离谱的剧情听起来都能拍一部电影了。
GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!
上海世博展览馆,WAIC 2026,H1-A530展位前围了三层人。
简直细思极恐!
2026 年的 WAIC,人形机器人依然是展馆里最密集的品类。后空翻、跳舞、格斗,各类单机演示轮番上阵,技术完成度一年高过一年。
发布之前,我在 X 上看到有人说,测 K3 的感觉就像在测 Fable 5。虽然离 Fable 5 还差一点点 🤏,但超过 Opus 4.8 和 GPT 5.5 基本没有问题。在前端能力,K3 的提升非常明显,我已经用它复刻了前段时间爆火的独立工作室 Abeto 推出的一款 3D 网页游戏 《 Messenger》(ps. 音乐手动配的,主角模型是 K3 自己判断、自主去游戏官网找的)