前言¶
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并把它设为 Claude Code 的默认模型。官方定位很直白:这不是公司最强的模型——顶层的 Claude Fable 5 仍负责极限任务——但 Opus 5 在编程与知识工作场景里,能力已接近 Fable 5,价格却只有后者的一半。
同一天,GitHub Copilot 也宣布接入 Opus 5。编程代理赛道上,Anthropic 用「更强、更省、更落地」的组合,把日常开发工具链的默认水位又抬高了一档。
发布要点:谁该用、花多少钱¶
Opus 5 面向的是长时程、多步骤的 agentic 编程——改 bug、跨文件重构、在工具链里连续调用,而不是单次补全。官方定价与 Opus 4.8 相同:
- 输入:$5 / 百万 token
- 输出:$25 / 百万 token
API 模型 ID 为 claude-opus-5。主要规格如下:
| 项目 | 说明 |
|---|---|
| 上下文窗口 | 100 万 token(默认即上限) |
| 最大输出 | 128K token(Batches API 可达 300K) |
| 默认接入 | Claude Max 默认模型;Claude Pro 最强模型;Claude Code 默认 |
| Fast 模式 | 约 2.5 倍速度,价格为基准的 2 倍 |
如果你已经在用 Claude Max / Pro 或 Claude Code,多数情况下无需额外配置即可获得 Opus 5。Claude Code 里也可显式指定:
claude --model claude-opus-5
或在 shell 配置中写入:
export ANTHROPIC_MODEL="claude-opus-5"
评测表现:Frontier-Bench 与 SWE-bench¶
Anthropic 在公告中重点引用了几组面向真实软件工程的评测,而非只看单次函数补全。
Frontier-Bench v0.1(74 项任务,可视为 Terminal-Bench 2.1 的后续版本)是本次最受关注的指标之一。据官方与公开解读:
- Opus 4.8:约 18.7%
- Opus 5(max effort):约 43.3%
- Opus 5(xhigh effort):约 44.4%(官方内部跑分中,xhigh 甚至略高于 max)
- 对比参考:Fable 5 约 33.7%,GPT-5.6 Sol 约 37.5%
也就是说,Opus 5 在 Frontier-Bench 上超过同期其他模型,相对前代 Opus 4.8 则是翻倍以上,且官方强调单任务成本更低。
在 SWE-bench 系列上:
| 基准 | Opus 5 | 备注 |
|---|---|---|
| SWE-bench Verified | 96.0% | 修复已验证 GitHub Issue |
| SWE-bench Pro | 79.2% | Fable 5 约 80.0%,仍略高 |
| SWE-bench Multimodal | 59.4% | Opus 4.8 为 38.4% |
此外,在 GDPval-AA、CursorBench 3.2 等知识工作与 IDE 向评测中,Anthropic 称 Opus 5 达到新的 SOTA;CursorBench 3.2 在 max effort 下与 Fable 5 峰值相差 0.5% 以内,成本约为一半。网络安全方向仍由 Mythos 5 领先,Opus 5 未覆盖该上限场景。
自适应思考与 effort 参数¶
Opus 5 相对 4.8 最大的 API 行为变化,是自适应思考(adaptive thinking)默认开启。
在 Opus 4.8 上,请求默认不思考,需显式设置 thinking: {"type": "adaptive"} 才会启用。Opus 5 则反过来:同样请求会自动进入思考模式,模型自行决定每轮推理深度;开发者用 effort 参数控制「想多深」。
可用档位:low、medium、high(默认)、xhigh、max。
high:API 与 Claude Code 的默认值,兼顾质量与成本。xhigh:面向 30 分钟以上的长时程 agent 任务;Frontier-Bench 上有时比max更优。max:追求极限质量,token 与延迟也最高。
官方建议:日常开发优先用 effort 调成本,而不是直接关掉思考——多数任务下,thinking 开启 + low effort 往往优于 thinking 关闭。
迁移时需注意的破坏性变更¶
若仍要关闭思考,只能把 effort 设在 high 及以下:
{
"model": "claude-opus-5",
"thinking": {"type": "disabled"},
"output_config": {"effort": "high"}
}
在 xhigh 或 max 下搭配 thinking: {"type": "disabled"},API 会返回 400 错误。另外,max_tokens 同时限制思考 token 与回复 token,从 4.8 迁移时需重新评估预算。
GitHub Copilot 接入¶
GitHub 于 7 月 24 日同步宣布:Claude Opus 5 已在 GitHub Copilot 中可用,面向需要复杂推理、工具调用与多步执行的编码任务。
覆盖范围包括:
- Visual Studio Code、Visual Studio、JetBrains、Xcode、Eclipse
- Copilot CLI、Copilot cloud agent、Copilot app
- github.com 与 GitHub Mobile
订阅方面,Copilot Pro+、Max、Business、Enterprise 用户可在模型选择器里选用 Opus 5;Business / Enterprise 管理员需在 Copilot 策略中开启对应模型权限。 rollout 为渐进式,部分账号可能稍晚看到入口。
对团队而言,这意味着 Copilot 与 Claude Code 可以共享同一套 Opus 5 能力基线,便于在 IDE 插件与终端 agent 之间做 A/B 对比。
怎么选:Opus 5 还是 Fable 5¶
Anthropic 自己的分层很清晰:
- 日常编程、企业知识工作、可预期的 agent 流水线 → Opus 5。性价比高,Frontier-Bench / SWE-bench 数据支持「接近顶层、成本减半」的叙事。
- 最高风险、最长自主运行、必须榨干能力的任务 → 仍选 Fable 5。SWE-bench Pro 等个别项 Fable 5 仍有微弱优势。
- 网络安全红队与漏洞利用链 → Mythos 5 专属赛道,Opus 5 不在此列。
落地建议:
- 先把 Claude Code / Copilot 默认切到 Opus 5,用自有仓库跑一轮回归(构建、测试、典型 Issue)。
- 用
effort做成本扫描:从medium或high起,逐步下调直到质量跌破阈值。 - 对超长任务(>30 分钟)试
xhigh,不必默认max——Frontier-Bench 数据表明「最高档 ≠ 永远最优」。 - 从 Opus 4.8 迁移时,检查所有关闭 thinking 的调用路径,避免与
xhigh/max冲突。
小结¶
Claude Opus 5 的发布,核心不是又刷了一个榜单分数,而是把接近 Fable 5 的 agentic 编程能力压进 Opus 价位,并同步推到 Claude Code 与 GitHub Copilot 两条主航道。自适应思考默认开启、effort 五档可调、Frontier-Bench 与 SWE-bench 的大幅跃升,共同指向同一件事:编程代理正在从「尝鲜功能」变成 IDE 里的默认工作方式。
如果你已经在用 Claude Code 或 Copilot Pro+,现在值得做的只有一件——打开一个真实项目,让 Opus 5 跑完一整条多文件任务链,再用 effort 量一下账单。比任何 benchmark 数字都更能说明它是否该成为你们团队的新默认。