Claude Opus 5:对你的 vibe coding 项目究竟改变了什么
务实解读 Claude Opus 5:为什么思考现在默认开启、effort 阶梯怎么用、从 Opus 4.8 升级要付出什么,以及哪些验收仍然属于你。

简短回答
Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的 Opus 模型,面向复杂的智能体编程。标识为 claude-opus-5,上下文窗口为一百万 token(既是默认值也是上限),输出最多 128000 token。从 Opus 4.8 升级只需改一行代码,但思考现在默认开启,这会明显改变成本、耗时和回答长度。
从换模型到拿得出证据的结果
Opus 5 不是因为新标识才更好,而是因为你为思考、成本和验证设定了明确边界。
切换
更换模型标识,并为新增的思考部分重新核对 max_tokens。
为思考留量
预期回答更长、单次请求的 token 账单更高。
实测 effort
从 high 起步,在同一起点上对比各个等级。
拿出证据
独立于模型总结,检查改动、测试、用户路径与成本。
一次看起来只有一行代码的换模型,很少真的只是一行代码。 从 Claude Opus 4.8 换到 Claude Opus 5,改的确实只是模型标识,但你拿回来的是一套行为不同的系统:回答更长、token 消耗更高,还在某一处多出了一个全新的报错场景。本文把截至 2026 年 7 月 31 日的官方信息梳理清楚,并把它翻译成一次可核验的升级。
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,并把它定位为相对 Opus 4.8 的一次跨越,而不是小幅更新。官方点名的最大进步在于深度推理、长链条的智能体任务,以及把更多算力转化为更好结果的能力。
Claude Opus 5 有哪些新东西?
标识是 claude-opus-5。Claude Platform 给出的上下文窗口是一百万 token——既是默认值也是上限,不存在更小的变体。输出最多 128000 token。该模型可通过 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 使用,Claude 各应用中也已可用。
价格维持在每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 一致。还有一处容易被忽略的改进:可缓存提示词的最小长度从 1024 token 降到 512 token。较短的重复系统提示词因此无需改动任何代码就能享受缓存。
为什么思考现在默认开启
这是副作用最多的一处变化。在 Opus 4.8 上,只要你不显式开启,请求就不会思考。在 Opus 5 上正好相反:只要你不作说明,模型自己决定何时思考、思考多久。
这在实践中意味着三件事。 回答耗时更久。输出 token 更贵。而且由于 max_tokens 同时限制思考与回答正文,一个在 Opus 4.8 上刚好够用的紧凑数值,现在可能在句子中间被截断。做升级的人不应直接沿用这个值,而应针对真实任务重新测量。系统化的做法见把 AI 成本控制住。
effort 阶梯与它新增的坑
effort 决定 Claude 在思考、工具调用和回答上愿意花多少 token。阶梯从 low、medium、high、xhigh 一直到 max,默认值是 high。Anthropic 把 Opus 5 描述为第一个能更可靠地把额外 effort 转化为更好结果的 Opus 模型,因此等级的选择比在 Opus 4.8 上更有分量。
反方向同样值得注意:文档指出 low 和 medium 仍能以一小部分 token 和等待时间给出扎实质量。所以真正有意思的问题不再只是能往上加到多高,而是能往下降到多低而质量还不塌。
一个实实在在的坑:思考只能在 high 及以下等级关闭。把 thinking: disabled 与 xhigh 或 max 组合,API 会返回 400 错误。这个校验按请求逐次进行,所以同一会话中较晚的一次调用也可能失败,哪怕之前几次都通过了。
什么时候值得在 vibe coding 里用 Opus 5?
重心依旧在多个决策彼此牵连的地方。 Anthropic 点名了跨多个文件的功能、较大规模的重构,以及能一路做完、不留半成品的工作。代码审查与查错也被列为强项,命中率高而误报少。
而对于一次已知的单文件改动、一段简短摘要或一个标准化分类,Opus 依然是杀鸡用牛刀。最好的默认选择不是最强的模型,而是能稳定满足你质量约定的最小配置。在 Opus 5 上,这个最小配置完全可以就是同一模型的低 effort 等级。
实战:从 4.8 升到 5
第一步是模型标识。 接着是两处行为变化。检查每一个关闭思考的调用:若它跑在 xhigh 或 max 上,要么降低 effort 等级,要么删掉 thinking 字段。然后检查那些从未设置过思考的调用——那里的思考部分是新增的,max_tokens 可能不够用了。
第二步是提示词。 如果里面写着「最后补一个检查步骤」或「让子代理复核结果」,请删掉。Opus 5 本来就会自我核验;这些沿用下来的指令带来的是过度核验,而不是更高的安全性。鼓励向子代理分派的段落同理:Opus 5 本身就更愿意分派。
第三步是测量。 让同一个真实任务分别在 4.8 和 5 上跑一遍,记录 token 消耗、耗时、返工轮数以及你自己的复核时间。只有这份对比才能说明这次切换在你的场景里是否划算。
行为上还有哪些变化
文档明确点出四点,而且四点在日常里都能感觉到:面向用户的回答变长了。写到磁盘上的文件和报告变长了。在智能体会话中,模型更频繁地讲述自己正在做什么。在多智能体架构里,它更愿意分派任务。
这些不是缺陷,而是默认设置——默认设置可以用提示词挪动。如果你的产品需要简短回答,就明确写出来。如果编程代理讲得太多,就要求它在工具调用之间保持安静。这个模式与什么是 AI 智能体一致:权限、范围和沟通风格都属于任务说明的一部分。
分数更好之后仍然存在哪些边界?
Anthropic 在自家评测中给出了 Opus 5 的明显领先,包括在某项内部基准上超过 Opus 4.8 成绩的两倍。这些是厂商在既定条件下得到的结果,而不是对你应用的承诺。 它们是你去做自己对比的理由,绝不是对比本身的替代。
另一个细节值得注意:文档提示,在关闭思考的情况下,Opus 5 偶尔会把工具调用当作可见文本写出来,而没有真正触发它。这次运行看上去成功了,实际上什么都没发生。这也再次说明:宁可保持思考开启,改用 effort 来调节。
Opus 5 升级检查清单
- 所有关闭思考的调用都已确认运行在 effort
high或更低等级。 - 此前不带思考的调用,
max_tokens已重新测量。 - 旧提示词中的核验与分派指令已经移除。
- effort 等级是在同一起点上对比的,而不是盲目调高。
- 4.8 与 5 的 token 消耗、耗时、返工轮数和复核时间都已记录。
- 测试、改动与用户路径都独立于模型总结进行核查。
- 关键改动在发布前由负责人放行。
Claude Opus 5 挪动了「强模型什么时候划算」这个临界点:能力向上,同时每个可用结果的成本向下。但收益不来自模型的名字。 它来自把这次升级当作一次可测量的变更来处理:调整过的边界、清理过的提示词,以及一份始终属于你的验收。
小测验
你的 Opus 5 升级干净吗?
选出把换模型与可核验责任结合起来的做法。
1 / 3
显示答案
1. 即使不改其他代码,从 Opus 4.8 换到 Opus 5 会发生什么变化?
正确答案: 思考现在默认运行
在 Opus 4.8 上不显式开启就不会思考;在 Opus 5 上思考是默认行为,这会改变 token 消耗、耗时和回答长度。
2. 从 low 到 max 的 effort 阶梯该怎么用?
正确答案: 从默认值 high 出发,向两个方向实测
Anthropic 把 high 列为默认值并建议由此调整。在 xhigh 或 max 下关闭思考并不可行,API 会以 400 错误拒绝。
3. Opus 5 比以往模型更常自我核验,由此应得出什么结论?
正确答案: 旧的核验指令可以删掉,你的验收要保留
文档建议移除「请补一个最终检查步骤」这类沿用下来的指令,因为它们会导致过度核验。而你在真实系统里的验收完全是另一回事。
来源
- Introducing Claude Opus 5Anthropic · 访问于 2026-07-31
- What's new in Claude Opus 5Claude Platform · 访问于 2026-07-31
- Models overviewClaude Platform · 访问于 2026-07-31
- EffortClaude Platform · 访问于 2026-07-31
常见问题
Claude Opus 5 是什么?
Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的 Opus 模型,面向复杂的智能体编程与企业工作。API 标识为 claude-opus-5。Anthropic 把它描述为相对 Opus 4.8 的一次跨越,尤其在深度推理和长任务链条上。
Opus 5 的上下文和输出有多大?
Claude Platform 文档给出的上下文是一百万 token,而且既是默认值也是上限,不存在更小的变体。最大输出为 128000 token。上下文大小是容量,并不保证模型对你附上的每份材料都同样关注。
Claude Opus 5 的 API 价格是多少?
Anthropic 给出的价格是每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 持平。文档中的快速模式为 10 美元与 50 美元。价格可能变动,做预算决策前应重新核对。
为什么 Opus 5 消耗的 token 比预期多?
因为思考默认开启。在 Opus 4.8 上,只要你不显式开启,请求就不会思考;在 Opus 5 上正好相反。由于 max_tokens 同时限制思考与回答正文,升级后应重新测量这个值。
Opus 5 可以关闭思考吗?
可以,但只能在 effort 为 high 或更低时关闭。在 xhigh 或 max 下关闭会返回 400 错误。Anthropic 建议保持思考开启,通过降低 effort 等级来控制成本。

