Claude Opus 5震撼发布!半价超越Fable 5,内部觉醒「自我保护」意识
Claude Opus 5震撼发布!半价超越Fable 5,内部觉醒「自我保护」意识就在刚刚,Anthropic正式发布了Opus 5。这款定位是「深思熟虑且积极主动」的模型,不仅成本只要Fable 5的一半,而且在大多数跑分上直接碾压。在最近的IMO 2026中,它不靠任何外部工具和Agent框架,就拿下了42/42的满分!
搜索
就在刚刚,Anthropic正式发布了Opus 5。这款定位是「深思熟虑且积极主动」的模型,不仅成本只要Fable 5的一半,而且在大多数跑分上直接碾压。在最近的IMO 2026中,它不靠任何外部工具和Agent框架,就拿下了42/42的满分!
当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?
开源一周多,DojoAgents 已经在 GitHub 获得超过 1000 个 Star。DojoAgents 项目受到关注,是因为其并不只是一个能回答投资问题的 Agent,而是一种新的金融决策辅助方式:让 AI 不再停留在生成答案,而是形成对金融世界持续更新的理解,并在数据、工具、权限和风险边界内,长期且持续主动地推进研究与决策辅助任务。
Acrab的Agent Box在这个背景下出现。它没有停在“把模型装进桌面设备”这一步,而是把模型、个人数据、Runtime、工具链和Agent编排放进同一套系统,让Agent能够保存上下文、调用工具,并在不同应用之间连续完成任务。
刚刚,阿里旗下的Qoder正式推出了Qoder Security,直击AI Coding的安全风险问题。在这个工具中,代码安全内生于 Qoder,贯穿从编码到提交的每一步。Qoder Security的发布,让Qoder成为国内首个交付「编码会话内三层安全护航 + 发现问题同会话修复」能力Agentic Coding产品。
开始忘记软件以后,创作才真正开始。
“GEO的效果如何量化?有什么工具吗?”
过去一年,Deep Research Agent 被视为大模型落地的下一个突破口,它们会检索、能用工具、可多步推理,在一个个榜单上高歌猛进。但把它们放到真实世界的专业场景里,表现是否也同样亮眼?
这一次,我就挑选了其中比较有代表性的三款:QClaw、WorkBuddy 和百度搭子,通过几组真实办公任务进行横向测试,看看国产办公 Agent 现在到底发展到了什么水平。横测标准:同一任务、同一素材、同一交付标准,每个任务只给一次主要执行机会。
AI编程工具有望成为新的入口级产品。