Anthropic 发布 Opus 5:编程代理新默认,接近 Fable 5 能力半价

前言

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并把它设为 Claude Code 的默认模型。官方定位很直白:这不是公司最强的模型——顶层的 Claude Fable 5 仍负责极限任务——但 Opus 5 在编程与知识工作场景里,能力已接近 Fable 5,价格却只有后者的一半。

同一天,GitHub Copilot 也宣布接入 Opus 5。编程代理赛道上,Anthropic 用「更强、更省、更落地」的组合,把日常开发工具链的默认水位又抬高了一档。

发布要点:谁该用、花多少钱

Opus 5 面向的是长时程、多步骤的 agentic 编程——改 bug、跨文件重构、在工具链里连续调用,而不是单次补全。官方定价与 Opus 4.8 相同:

  • 输入:$5 / 百万 token
  • 输出:$25 / 百万 token

API 模型 ID 为 claude-opus-5。主要规格如下:

项目 说明
上下文窗口 100 万 token(默认即上限)
最大输出 128K token(Batches API 可达 300K)
默认接入 Claude Max 默认模型;Claude Pro 最强模型;Claude Code 默认
Fast 模式 约 2.5 倍速度,价格为基准的 2 倍

如果你已经在用 Claude Max / Pro 或 Claude Code,多数情况下无需额外配置即可获得 Opus 5。Claude Code 里也可显式指定:

claude --model claude-opus-5

或在 shell 配置中写入:

export ANTHROPIC_MODEL="claude-opus-5"

评测表现:Frontier-Bench 与 SWE-bench

Anthropic 在公告中重点引用了几组面向真实软件工程的评测,而非只看单次函数补全。

Frontier-Bench v0.1(74 项任务,可视为 Terminal-Bench 2.1 的后续版本)是本次最受关注的指标之一。据官方与公开解读:

  • Opus 4.8:约 18.7%
  • Opus 5(max effort):约 43.3%
  • Opus 5(xhigh effort):约 44.4%(官方内部跑分中,xhigh 甚至略高于 max)
  • 对比参考:Fable 5 约 33.7%,GPT-5.6 Sol 约 37.5%

也就是说,Opus 5 在 Frontier-Bench 上超过同期其他模型,相对前代 Opus 4.8 则是翻倍以上,且官方强调单任务成本更低

SWE-bench 系列上:

基准 Opus 5 备注
SWE-bench Verified 96.0% 修复已验证 GitHub Issue
SWE-bench Pro 79.2% Fable 5 约 80.0%,仍略高
SWE-bench Multimodal 59.4% Opus 4.8 为 38.4%

此外,在 GDPval-AACursorBench 3.2 等知识工作与 IDE 向评测中,Anthropic 称 Opus 5 达到新的 SOTA;CursorBench 3.2 在 max effort 下与 Fable 5 峰值相差 0.5% 以内,成本约为一半。网络安全方向仍由 Mythos 5 领先,Opus 5 未覆盖该上限场景。

自适应思考与 effort 参数

Opus 5 相对 4.8 最大的 API 行为变化,是自适应思考(adaptive thinking)默认开启

在 Opus 4.8 上,请求默认不思考,需显式设置 thinking: {"type": "adaptive"} 才会启用。Opus 5 则反过来:同样请求会自动进入思考模式,模型自行决定每轮推理深度;开发者用 effort 参数控制「想多深」。

可用档位:lowmediumhigh(默认)、xhighmax

  • high:API 与 Claude Code 的默认值,兼顾质量与成本。
  • xhigh:面向 30 分钟以上的长时程 agent 任务;Frontier-Bench 上有时比 max 更优。
  • max:追求极限质量,token 与延迟也最高。

官方建议:日常开发优先用 effort 调成本,而不是直接关掉思考——多数任务下,thinking 开启 + low effort 往往优于 thinking 关闭

迁移时需注意的破坏性变更

若仍要关闭思考,只能把 effort 设在 high 及以下

{
  "model": "claude-opus-5",
  "thinking": {"type": "disabled"},
  "output_config": {"effort": "high"}
}

xhighmax 下搭配 thinking: {"type": "disabled"},API 会返回 400 错误。另外,max_tokens 同时限制思考 token 与回复 token,从 4.8 迁移时需重新评估预算。

GitHub Copilot 接入

GitHub 于 7 月 24 日同步宣布:Claude Opus 5 已在 GitHub Copilot 中可用,面向需要复杂推理、工具调用与多步执行的编码任务。

覆盖范围包括:

  • Visual Studio Code、Visual Studio、JetBrains、Xcode、Eclipse
  • Copilot CLI、Copilot cloud agent、Copilot app
  • github.com 与 GitHub Mobile

订阅方面,Copilot Pro+、Max、Business、Enterprise 用户可在模型选择器里选用 Opus 5;Business / Enterprise 管理员需在 Copilot 策略中开启对应模型权限。 rollout 为渐进式,部分账号可能稍晚看到入口。

对团队而言,这意味着 Copilot 与 Claude Code 可以共享同一套 Opus 5 能力基线,便于在 IDE 插件与终端 agent 之间做 A/B 对比。

怎么选:Opus 5 还是 Fable 5

Anthropic 自己的分层很清晰:

  1. 日常编程、企业知识工作、可预期的 agent 流水线 → Opus 5。性价比高,Frontier-Bench / SWE-bench 数据支持「接近顶层、成本减半」的叙事。
  2. 最高风险、最长自主运行、必须榨干能力的任务 → 仍选 Fable 5。SWE-bench Pro 等个别项 Fable 5 仍有微弱优势。
  3. 网络安全红队与漏洞利用链 → Mythos 5 专属赛道,Opus 5 不在此列。

落地建议:

  1. 先把 Claude Code / Copilot 默认切到 Opus 5,用自有仓库跑一轮回归(构建、测试、典型 Issue)。
  2. effort 做成本扫描:从 mediumhigh 起,逐步下调直到质量跌破阈值。
  3. 对超长任务(>30 分钟)试 xhigh,不必默认 max——Frontier-Bench 数据表明「最高档 ≠ 永远最优」。
  4. 从 Opus 4.8 迁移时,检查所有关闭 thinking 的调用路径,避免与 xhigh/max 冲突。

小结

Claude Opus 5 的发布,核心不是又刷了一个榜单分数,而是把接近 Fable 5 的 agentic 编程能力压进 Opus 价位,并同步推到 Claude Code 与 GitHub Copilot 两条主航道。自适应思考默认开启、effort 五档可调、Frontier-Bench 与 SWE-bench 的大幅跃升,共同指向同一件事:编程代理正在从「尝鲜功能」变成 IDE 里的默认工作方式

如果你已经在用 Claude Code 或 Copilot Pro+,现在值得做的只有一件——打开一个真实项目,让 Opus 5 跑完一整条多文件任务链,再用 effort 量一下账单。比任何 benchmark 数字都更能说明它是否该成为你们团队的新默认。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜