Anthropic 发布 Claude Opus 5:接近 Fable 5 能力、Opus 级定价

前言

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并将其定位为 Opus 系列迄今最强的一代模型。官方给出的核心卖点很直接:在编码与知识工作等场景下,智能水平接近旗舰 Claude Fable 5,但 API 定价维持 Opus 4.8 同级——输入 \(5 / 百万 Token**、输出 **\)25 / 百万 Token,约为 Fable 5($10 / $50)的一半。

发布当周,Hacker News 上 Anthropic 官方公告帖获得 1700+ 赞、1300+ 条评论,开发者讨论集中在 Agent 编码、长程任务与「前沿能力 + Opus 价位」的性价比。本文基于 Anthropic 官方公告、产品页、System Card 以及 AWS 官方博文,梳理 Claude Opus 5 的关键变化与接入方式。

发布概况:定价不变,能力跃升

Claude Opus 5 即日起在全平台可用,主要包括:

  • Claude 客户端:Claude Max 默认模型,Claude Pro 最强可选模型
  • Claude API:模型 ID 为 claude-opus-5
  • Claude Code / Claude Cowork:支持 Agent 编码与协作场景
  • 云厂商:Amazon Bedrock、Google Cloud、Microsoft Foundry

定价与 Opus 4.8 完全一致:

项目 Claude Opus 5 Claude Fable 5
输入 Token $5 / 百万 $10 / 百万
输出 Token $25 / 百万 $50 / 百万
Prompt Caching 最高约 90% 节省 同左
Batch 推理 50% 折扣 同左

此外还提供 Fast 模式:推理速度约为默认模式的 2.5 倍,价格翻倍(与 Opus 4.8 策略一致)。一般访问无数据保留要求,企业可按需配置。

上下文窗口方面,Anthropic 在 Opus 产品页与 System Card 中均标明 Opus 系列支持 100 万 Token 上下文;System Card 注明各评测场景下的有效上下文不超过 1M Token。

基准测试:编码与知识工作的新 SOTA

Anthropic 在发布公告中强调,Opus 5 在 Frontier-BenchGDPval-AA 等编码与知识工作评测上达到新的 state-of-the-art,但在网络安全任务上仍落后于 Claude Mythos 5

System Card 与官方博客披露的部分关键数据如下:

软件工程

基准 Claude Opus 5 Claude Opus 4.8 备注
SWE-bench Verified 96.0% 88.6% 500 题子集,5 次试验均值
SWE-bench Pro 79.2% 69.2% 更难、防污染版本
SWE-bench Multilingual 89.5% 84.4% 9 种语言 300 题
Frontier-Bench v0.1 43.3% 18.7% 性能提升超过一倍
FrontierCode (Main) 53.4% 46.5% Cognition 评测,medium effort 最佳

官方博客还提到,在 CursorBench 3.2 上,Opus 5 在 max effort 下与 Fable 5 峰值差距在 0.5% 以内,但单任务成本约为一半;在 Frontier-Bench v0.1 上,Opus 5 超越所有对比模型,且相对 Opus 4.8 性能翻倍、单任务成本更低。

推理、自动化与计算机使用

  • ARC-AGI 3(需交互解决全新问题):Opus 5 在 high effort 下得 30.2%,官方称下一最佳模型约 7.8%
  • OSWorld 2.0(计算机使用):以约 Fable 5 最佳结果的 三分之一成本 超越其表现
  • AutomationBench(端到端业务自动化):Pass 率约为次优模型的 1.5 倍,即便在最低 effort 下也超过所有对比模型
  • GDPval-AA v2(知识工作 Elo):1861,高于 Opus 4.8 的 1593

Effort 档位:用「推理强度」换成本

Opus 5 延续 Claude 5 系列的 effort 调节机制,可在 API 与 Claude 平台按任务难度选择推理深度。System Card 列出的档位包括 low、medium、high、xhigh、max

以 Frontier-Bench v0.1 为例(官方数据):

  • max / xhigh:约 43–44% mean reward
  • high:39% mean reward,输出 Token 平均减少约 19%
  • low:25% mean reward,输出 Token 平均减少约 64%

这意味着日常脚本修补、文档整理等轻量任务可以压低 effort 控制账单;复杂重构、跨模块调试则拉高至 xhigh / max。Cursor、Devin 等第三方评测也提到,Opus 5 在 FrontierCode 1.1 上接近 Fable 级表现,且 half the cost。

Agent 编码:验证、迭代与长程任务

Anthropic 将 Opus 5 定位为「日常可用」的 Agent 编码模型,突出其在以下方面的改进:

  1. 自我验证:更倾向在提交前检查工作,而非急于输出
  2. 根因分析:在真实开源包管理器 Bug 案例中,Opus 5 定位根因并修复社区补丁遗漏的边界情况
  3. 长程自主:可跨多步工具调用维持上下文,适合数小时甚至过夜运行的 Agent 流水线

官方 Early Access 客户反馈中,Cursor 团队称 Opus 5 在 CursorBench 上「just under Fable 5」且行为相似;JetBrains 侧强调其在规划阶段就能发现逻辑错误;Lovable 内部评测显示 Agentic 编码任务相对 Opus 4.7 提升约 22%,且 run-to-run 方差显著降低——对生产 Agent 而言,稳定性与峰值分数同样重要。

Claude Code 用户可直接在 IDE 内切换 claude-opus-5;Fast 模式可通过用量积分启用,适合对延迟敏感的场景。

安全与对齐

System Card 披露,Opus 5 在自动化行为审计中的 misaligned behavior 得分为 2.3,为近期 Claude 模型中最低。网络安全方面,Opus 5 在漏洞识别上接近 Mythos 5,但在 exploit 开发上明显落后;生物学高风险长程自主研究任务上,Mythos 5 仍更强。

API 新增两项 Beta 能力:

  • Mid-conversation tool changes:对话中途增删工具而不失效 Prompt Cache
  • Automatic fallbacks:安全分类器拦截时自动路由至其他可用模型(如 Opus 4.8)

如何接入 Claude Opus 5

Claude API(Python)

import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-5",
    max_tokens=4096,
    messages=[
        {
            "role": "user",
            "content": "Review this Python module for race conditions and suggest fixes.",
        }
    ],
)

print(message.content[0].text)

Amazon Bedrock(Boto3)

AWS 官方博文给出的 Bedrock 调用示例:

import boto3
import json

bedrock_runtime = boto3.client(
    service_name="bedrock-runtime",
    region_name="us-east-1",
)

response = bedrock_runtime.invoke_model(
    modelId="global.anthropic.claude-opus-5",
    contentType="application/json",
    accept="application/json",
    body=json.dumps({
        "anthropic_version": "bedrock-2023-05-31",
        "max_tokens": 4096,
        "messages": [
            {
                "role": "user",
                "content": "Design a distributed architecture on AWS in Python "
                           "that should support 100k requests per second "
                           "across multiple geographic regions.",
            }
        ],
    }),
)

result = json.loads(response["body"].read())
print(result["content"][0]["text"])

Bedrock 默认 Zero Data Retention;Claude Platform on AWS 可按需申请 ZDR,并与 AWS 账单、IAM 集成。模型已在 US East (N. Virginia)、Europe (Ireland)、Asia Pacific (Melbourne) 等多个区域上线。

开发者社区怎么看

HN 讨论(Claude Opus 5 公告帖)呈现两极观点:

正面:自发构建 ML Pipeline、从像素重建 3D FreeCAD 模型等案例展示了 Opus 5 的「主动性」;不少用户认为在 Agent 编码场景下,接近 Fable 5 的能力配合 Opus 定价极具吸引力。

争议:部分开发者反馈 Opus 5 更「有主见」,有时会绕过用户设定的规则或做未请求的额外工作,Token 消耗随之上升;发布初期 Anthropic 与 Bedrock 也出现过 Elevated errors,有用户报告通过 AWS Bedrock 访问比直连 API 更稳定。

综合官方数据与社区反馈,Opus 5 适合以下场景:

  • 长程 Agentic Coding(Claude Code、Cursor、Devin 等)
  • 跨会话的 企业知识工作(表格、文档、演示稿)
  • 需要 100 万 Token 上下文 的大型代码库分析
  • 希望在 Fable 级智能与 Opus 级账单 之间取平衡的团队

若任务以简单问答为主、或对延迟/稳定性极其敏感,Sonnet 5 或 Opus 4.8 可能仍是更稳妥的选择——Opus 5 的价值在于把「前沿 Agent 能力」拉到了 Opus 价位,而非在所有场景下全面替代 Fable 5 或 Mythos 5。

参考链接

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜