Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡
8685点击    2026-09-28 16:24

你让AI Agent连夜迁移一个代码库。


第二天一早,满怀期待地打开终端,没想到只看到这样一条消息:


已完成3个接口迁移,接下来我将处理剩余两个端点,并补上测试。


然后,就没有下文了。想让它干完剩下的活,你还得再敲两个字:继续。


本以为它会一口气干到底,结果它只给你画了张「下一步」的饼,程序就替它打卡下班了。


这不是某一个人的倒霉经历。


Opus 5.5一发布,跑Agent的开发者就发现,模型能力是强了,可干着干着就爱停下来,你不催它就不动。


Anthropic自己也看到了。发布没几天,配套的提示词指南已经挂了出来,专门给这类毛病打补丁。


Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡


在开篇的排查清单里,官方直接点名了这种「半路溜号」:


无人值守的Agent汇报完进度,直接停在了半路。


背后的原因,你可能想不到:Opus 5.5太爱汇报了。


干长活时,它会主动向你同步进度。问题是,有些汇报发完,它就不再动手了,API给出的信号是end_turn,意思是「这一轮我说完了」。


可不少沿用旧逻辑的Agent程序只认一条死规矩:模型不再调用工具,就算活干完了。


一份进度汇报,就这样被当成了交差。


Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡


这一点,官方指南说得也很清楚:


纯文本的回合结束,应该看作一份汇报,绝不能当作任务完成的凭证。


所以,真正的问题是,AI压根没想偷懒,是你的程序先替它打了下班卡。


害人的优等生习惯


官方把这种半路停工归结成了四种情况,只要你经常跑Agent,大概率都遇到过。


第一种,纸上谈兵。


写了一大长篇总结,结尾宣布下一步要做什么,却压根没调用任何工具,下一步永远停在口头上。


第二种,过分礼貌。


干着干着,突然停下来问一句「如果您不介意,我接下来继续处理某某」,然后原地挂机,等你这个根本不在电脑前的人去回复它。


第三种,假装请示。


列出一大串需要你拍板的决策项,但实际上按它自己的说法,这些决策根本不影响它继续干剩下的活。


第四种,汇报强迫症。


模型觉得当前回合字数够多了,或者刚好做完一个小阶段,非得停下来向你做个总结。


有点讽刺的是,在Opus 5.5的官方宣传里,「沟通更主动、总结更清楚」恰恰是它的核心卖点。


谁能想到,这些优等生的好习惯,一放进旧的无人值守程序里,反倒成了停工的诱因。


Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡


官方三招:


把验收权从AI手里拿回来


怎么让它接着干,又不至于陷入无限死循环?


官方给出了三招。


第一招,任务清单。


把大任务拆成细项,交给待办工具或文本去维护,让模型边做边勾选。


回合结束时,如果清单上还有没做完的任务,模型也没解释被什么卡住了,你的应用就得自动发条消息,点名让它接着干。


Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡


官方给出的续跑示例:「你的任务清单还有未完成项:迁移剩下两个端点,并更新它们的测试。继续做。如果哪项被卡住,说明卡在哪里。」


第二招,铁面验收员。


事先定好完成的标准。每次回合结束,甩给一个更小的模型去对照检查。没达标?把没达标的原因当成下一条消息再塞给它,让它返工。


第三招,硬刹车。


同一个任务如果自动续跑两三次还卡在原地,必须强制停下来交给人复查。真卡死的任务,千万别让它把你的API额度空转烧光。


除此之外,提示词也得跟上。


官方给了一段可以直接抄的系统提示词,说白了就是两头堵:


既要明说绝对不想要上述四种停法,也要说清楚什么时候才准停,比如离了用户真推不下去,或者碰到了被刻意保护的核心资源。


旧代码为什么突然报400错误?


如果说干一半停工只是磨洋工,那下面这些迁移陷阱就是直接让程序崩溃了。


从Opus 5切换到Opus 5.5,有四处API改动。原来给Opus 5写的请求,不改就发给新模型,会被直接拒绝,返回400错误。


1.thinking参数不能再关了。


如果你把thinking设为disabled,或者手工指定了budget_tokens,系统会直接拒绝请求。要么别传thinking字段,要么设为adaptive,让effort参数来控制思考深度。


2.tool_choice不能再强制调用工具。


把tool_choice设为any或者指定某一个tool,都会报400。官方建议用auto,配合严格工具调用或结构化输出,再在提示词里说清什么时候用哪个工具。


3.thinking块绑定了模型和上下文。


2026年8月31日之后创建的账户,中途改了系统提示词、工具或历史消息,再回放旧的thinking块,默认会直接报错。只追加、不改写的用法不受影响。


4.旧版电脑操作工具下线。


在Claude API和Google Cloud上,要换成computer_toolset_20260801。Amazon Bedrock上,旧的computer_20251124照样能用。


还有那些不报错的暗坑。


第一个,看不见干活过程。


在Opus 5上,模型在两次工具调用之间写的进度文字,是普通的正文(text块)。


到了Opus 5.5,这些文字被挪进了思考块(thinking块),而思考块默认不显示内容(display为omitted),返回时是空的。


如果你的界面只显示正文,长任务跑起来就是一片安静。请求一个都没失败,用户却以为它卡死了。


解法是把display设为updates(beta),只拿进度摘要;或者设为summarized,进度和推理摘要一起返回。


第二个,回答被截断。


max_tokens管的是思考加正文的总量。过去关掉思考时定的上限,现在可能不够用,回答写到一半就断了。


第三个,看不见推理,照样烧token。


思考内容就算不返回给你,也照样按输出token计费。


处理返回结果的代码里,还有两个地方容易忘了改。


一是读结果时要分清类型。模型返回的内容里,思考和正文是分开的,别想当然地把第一段当成回答。


二是来回调用工具时,模型的思考记录要原封不动地传回去。删掉一段、改几个字、调换一下顺序,都会被拒。


这份清单针对的是自己调用Messages API写代码的开发者。


用Claude Managed Agents的,只需要改个模型名。


同样的medium档


已经不是当年的味道


既然思考关不掉,effort就成了调控成本唯一的旋钮。


Opus 5.5支持从low到max五档。


官方说,现在开medium档,就能追平甚至超越以前Opus 5的high档,如果是low档处理简单任务,成本更是低得惊人。


听着像白捡的便宜,但官方立刻补了一句:在同一个档位下,Opus 5.5每回合的思考量比Opus 5大得多,尤其是高档位。


也就是说,如果你把旧项目的high档原封不动搬过来,不仅回合变长,输出的token数也会狂飙。


同样叫high,它想的东西已经完全不一样了。


一个接地气的建议是:从medium起步,用你自己的数据跑跑看,确实需要提智商的地方再往上调。


如果想让它少琢磨点,直接降档,这比你在提示词里苦口婆心地喊「别想太多」要管用得多。


消除AI味


全靠拉黑名单


最后,指南里还有个做前端页面的绝招。


如果你不给明确的设计方向,让模型自己发挥,它多半会搞出那种千篇一律的AI风界面。


这时候你如果在提示词里写「请避免通用的AI感」,它只会从一套AI模板换到另一套AI模板。


真正有效的办法,是直接拉黑名单。


官方示范里直接列出:不要奶油色或灰白背景,不要标题里的斜体强调词,不要01/02这种章节编号,不要等宽字体标签,不要胶囊形按钮。


Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡


Opus 5.5官方指南中的前端示例提示词,点名五种要避开的样式。


模型能听懂具体的「我不要什么」,但听不懂抽象的「我要好看一点」。


翻完这份官方指南,最大的感触是:


模型一路狂奔,很多应用的脚手架却还停在上一代。


过去怕它不动脑,逼着它把推理一步步写出来,现在反倒得劝它少想点;过去费尽心思让它按时汇报,现在它汇报得太勤快,活儿反倒停在了半路。


一个Agent能不能把活干完,模型能力只占一半。另一半,看你怎么定义「完成」,怎么保存上下文,怎么分配推理预算。


下次你的Agent再干到一半就溜,别急着骂它偷懒,先回头翻翻你自己写的那段循环。


参考资料:


https://platform.claude.com/docs/en/models/opus-5-5/migration-guide#text-between-tool-calls%20


https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5-5#unattended-agentic-runs


文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0