前言¶
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并将其定位为 Opus 系列迄今最强的一代模型。官方给出的核心卖点很直接:在编码与知识工作等场景下,智能水平接近旗舰 Claude Fable 5,但 API 定价维持 Opus 4.8 同级——输入 \(5 / 百万 Token**、输出 **\)25 / 百万 Token,约为 Fable 5($10 / $50)的一半。
发布当周,Hacker News 上 Anthropic 官方公告帖获得 1700+ 赞、1300+ 条评论,开发者讨论集中在 Agent 编码、长程任务与「前沿能力 + Opus 价位」的性价比。本文基于 Anthropic 官方公告、产品页、System Card 以及 AWS 官方博文,梳理 Claude Opus 5 的关键变化与接入方式。
发布概况:定价不变,能力跃升¶
Claude Opus 5 即日起在全平台可用,主要包括:
- Claude 客户端:Claude Max 默认模型,Claude Pro 最强可选模型
- Claude API:模型 ID 为
claude-opus-5 - Claude Code / Claude Cowork:支持 Agent 编码与协作场景
- 云厂商:Amazon Bedrock、Google Cloud、Microsoft Foundry
定价与 Opus 4.8 完全一致:
| 项目 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 输入 Token | $5 / 百万 | $10 / 百万 |
| 输出 Token | $25 / 百万 | $50 / 百万 |
| Prompt Caching | 最高约 90% 节省 | 同左 |
| Batch 推理 | 50% 折扣 | 同左 |
此外还提供 Fast 模式:推理速度约为默认模式的 2.5 倍,价格翻倍(与 Opus 4.8 策略一致)。一般访问无数据保留要求,企业可按需配置。
上下文窗口方面,Anthropic 在 Opus 产品页与 System Card 中均标明 Opus 系列支持 100 万 Token 上下文;System Card 注明各评测场景下的有效上下文不超过 1M Token。
基准测试:编码与知识工作的新 SOTA¶
Anthropic 在发布公告中强调,Opus 5 在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到新的 state-of-the-art,但在网络安全任务上仍落后于 Claude Mythos 5。
System Card 与官方博客披露的部分关键数据如下:
软件工程¶
| 基准 | Claude Opus 5 | Claude Opus 4.8 | 备注 |
|---|---|---|---|
| SWE-bench Verified | 96.0% | 88.6% | 500 题子集,5 次试验均值 |
| SWE-bench Pro | 79.2% | 69.2% | 更难、防污染版本 |
| SWE-bench Multilingual | 89.5% | 84.4% | 9 种语言 300 题 |
| Frontier-Bench v0.1 | 43.3% | 18.7% | 性能提升超过一倍 |
| FrontierCode (Main) | 53.4% | 46.5% | Cognition 评测,medium effort 最佳 |
官方博客还提到,在 CursorBench 3.2 上,Opus 5 在 max effort 下与 Fable 5 峰值差距在 0.5% 以内,但单任务成本约为一半;在 Frontier-Bench v0.1 上,Opus 5 超越所有对比模型,且相对 Opus 4.8 性能翻倍、单任务成本更低。
推理、自动化与计算机使用¶
- ARC-AGI 3(需交互解决全新问题):Opus 5 在 high effort 下得 30.2%,官方称下一最佳模型约 7.8%
- OSWorld 2.0(计算机使用):以约 Fable 5 最佳结果的 三分之一成本 超越其表现
- AutomationBench(端到端业务自动化):Pass 率约为次优模型的 1.5 倍,即便在最低 effort 下也超过所有对比模型
- GDPval-AA v2(知识工作 Elo):1861,高于 Opus 4.8 的 1593
Effort 档位:用「推理强度」换成本¶
Opus 5 延续 Claude 5 系列的 effort 调节机制,可在 API 与 Claude 平台按任务难度选择推理深度。System Card 列出的档位包括 low、medium、high、xhigh、max。
以 Frontier-Bench v0.1 为例(官方数据):
- max / xhigh:约 43–44% mean reward
- high:39% mean reward,输出 Token 平均减少约 19%
- low:25% mean reward,输出 Token 平均减少约 64%
这意味着日常脚本修补、文档整理等轻量任务可以压低 effort 控制账单;复杂重构、跨模块调试则拉高至 xhigh / max。Cursor、Devin 等第三方评测也提到,Opus 5 在 FrontierCode 1.1 上接近 Fable 级表现,且 half the cost。
Agent 编码:验证、迭代与长程任务¶
Anthropic 将 Opus 5 定位为「日常可用」的 Agent 编码模型,突出其在以下方面的改进:
- 自我验证:更倾向在提交前检查工作,而非急于输出
- 根因分析:在真实开源包管理器 Bug 案例中,Opus 5 定位根因并修复社区补丁遗漏的边界情况
- 长程自主:可跨多步工具调用维持上下文,适合数小时甚至过夜运行的 Agent 流水线
官方 Early Access 客户反馈中,Cursor 团队称 Opus 5 在 CursorBench 上「just under Fable 5」且行为相似;JetBrains 侧强调其在规划阶段就能发现逻辑错误;Lovable 内部评测显示 Agentic 编码任务相对 Opus 4.7 提升约 22%,且 run-to-run 方差显著降低——对生产 Agent 而言,稳定性与峰值分数同样重要。
Claude Code 用户可直接在 IDE 内切换 claude-opus-5;Fast 模式可通过用量积分启用,适合对延迟敏感的场景。
安全与对齐¶
System Card 披露,Opus 5 在自动化行为审计中的 misaligned behavior 得分为 2.3,为近期 Claude 模型中最低。网络安全方面,Opus 5 在漏洞识别上接近 Mythos 5,但在 exploit 开发上明显落后;生物学高风险长程自主研究任务上,Mythos 5 仍更强。
API 新增两项 Beta 能力:
- Mid-conversation tool changes:对话中途增删工具而不失效 Prompt Cache
- Automatic fallbacks:安全分类器拦截时自动路由至其他可用模型(如 Opus 4.8)
如何接入 Claude Opus 5¶
Claude API(Python)¶
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Review this Python module for race conditions and suggest fixes.",
}
],
)
print(message.content[0].text)
Amazon Bedrock(Boto3)¶
AWS 官方博文给出的 Bedrock 调用示例:
import boto3
import json
bedrock_runtime = boto3.client(
service_name="bedrock-runtime",
region_name="us-east-1",
)
response = bedrock_runtime.invoke_model(
modelId="global.anthropic.claude-opus-5",
contentType="application/json",
accept="application/json",
body=json.dumps({
"anthropic_version": "bedrock-2023-05-31",
"max_tokens": 4096,
"messages": [
{
"role": "user",
"content": "Design a distributed architecture on AWS in Python "
"that should support 100k requests per second "
"across multiple geographic regions.",
}
],
}),
)
result = json.loads(response["body"].read())
print(result["content"][0]["text"])
Bedrock 默认 Zero Data Retention;Claude Platform on AWS 可按需申请 ZDR,并与 AWS 账单、IAM 集成。模型已在 US East (N. Virginia)、Europe (Ireland)、Asia Pacific (Melbourne) 等多个区域上线。
开发者社区怎么看¶
HN 讨论(Claude Opus 5 公告帖)呈现两极观点:
正面:自发构建 ML Pipeline、从像素重建 3D FreeCAD 模型等案例展示了 Opus 5 的「主动性」;不少用户认为在 Agent 编码场景下,接近 Fable 5 的能力配合 Opus 定价极具吸引力。
争议:部分开发者反馈 Opus 5 更「有主见」,有时会绕过用户设定的规则或做未请求的额外工作,Token 消耗随之上升;发布初期 Anthropic 与 Bedrock 也出现过 Elevated errors,有用户报告通过 AWS Bedrock 访问比直连 API 更稳定。
综合官方数据与社区反馈,Opus 5 适合以下场景:
- 长程 Agentic Coding(Claude Code、Cursor、Devin 等)
- 跨会话的 企业知识工作(表格、文档、演示稿)
- 需要 100 万 Token 上下文 的大型代码库分析
- 希望在 Fable 级智能与 Opus 级账单 之间取平衡的团队
若任务以简单问答为主、或对延迟/稳定性极其敏感,Sonnet 5 或 Opus 4.8 可能仍是更稳妥的选择——Opus 5 的价值在于把「前沿 Agent 能力」拉到了 Opus 价位,而非在所有场景下全面替代 Fable 5 或 Mythos 5。