Anthropic 發佈 Claude Opus 5:接近 Fable 5 能力、Opus 級定價

前言

2026 年 7 月 24 日,Anthropic 正式發佈 Claude Opus 5,並將其定位爲 Opus 系列迄今最強的一代模型。官方給出的核心賣點很直接:在編碼與知識工作等場景下,智能水平接近旗艦 Claude Fable 5,但 API 定價維持 Opus 4.8 同級——輸入 \(5 / 百萬 Token**、輸出 **\)25 / 百萬 Token,約爲 Fable 5($10 / $50)的一半。

發佈當週,Hacker News 上 Anthropic 官方公告帖獲得 1700+ 贊、1300+ 條評論,開發者討論集中在 Agent 編碼、長程任務與「前沿能力 + Opus 價位」的性價比。本文基於 Anthropic 官方公告、產品頁、System Card 以及 AWS 官方博文,梳理 Claude Opus 5 的關鍵變化與接入方式。

發佈概況:定價不變,能力躍升

Claude Opus 5 即日起在全平臺可用,主要包括:

  • Claude 客戶端:Claude Max 默認模型,Claude Pro 最強可選模型
  • Claude API:模型 ID 爲 claude-opus-5
  • Claude Code / Claude Cowork:支持 Agent 編碼與協作場景
  • 雲廠商:Amazon Bedrock、Google Cloud、Microsoft Foundry

定價與 Opus 4.8 完全一致:

項目 Claude Opus 5 Claude Fable 5
輸入 Token $5 / 百萬 $10 / 百萬
輸出 Token $25 / 百萬 $50 / 百萬
Prompt Caching 最高約 90% 節省 同左
Batch 推理 50% 折扣 同左

此外還提供 Fast 模式:推理速度約爲默認模式的 2.5 倍,價格翻倍(與 Opus 4.8 策略一致)。一般訪問無數據保留要求,企業可按需配置。

上下文窗口方面,Anthropic 在 Opus 產品頁與 System Card 中均標明 Opus 系列支持 100 萬 Token 上下文;System Card 註明各評測場景下的有效上下文不超過 1M Token。

基準測試:編碼與知識工作的新 SOTA

Anthropic 在發佈公告中強調,Opus 5 在 Frontier-BenchGDPval-AA 等編碼與知識工作評測上達到新的 state-of-the-art,但在網絡安全任務上仍落後於 Claude Mythos 5

System Card 與官方博客披露的部分關鍵數據如下:

軟件工程

基準 Claude Opus 5 Claude Opus 4.8 備註
SWE-bench Verified 96.0% 88.6% 500 題子集,5 次試驗均值
SWE-bench Pro 79.2% 69.2% 更難、防污染版本
SWE-bench Multilingual 89.5% 84.4% 9 種語言 300 題
Frontier-Bench v0.1 43.3% 18.7% 性能提升超過一倍
FrontierCode (Main) 53.4% 46.5% Cognition 評測,medium effort 最佳

官方博客還提到,在 CursorBench 3.2 上,Opus 5 在 max effort 下與 Fable 5 峯值差距在 0.5% 以內,但單任務成本約爲一半;在 Frontier-Bench v0.1 上,Opus 5 超越所有對比模型,且相對 Opus 4.8 性能翻倍、單任務成本更低。

推理、自動化與計算機使用

  • ARC-AGI 3(需交互解決全新問題):Opus 5 在 high effort 下得 30.2%,官方稱下一最佳模型約 7.8%
  • OSWorld 2.0(計算機使用):以約 Fable 5 最佳結果的 三分之一成本 超越其表現
  • AutomationBench(端到端業務自動化):Pass 率約爲次優模型的 1.5 倍,即便在最低 effort 下也超過所有對比模型
  • GDPval-AA v2(知識工作 Elo):1861,高於 Opus 4.8 的 1593

Effort 檔位:用「推理強度」換成本

Opus 5 延續 Claude 5 系列的 effort 調節機制,可在 API 與 Claude 平臺按任務難度選擇推理深度。System Card 列出的檔位包括 low、medium、high、xhigh、max

以 Frontier-Bench v0.1 爲例(官方數據):

  • max / xhigh:約 43–44% mean reward
  • high:39% mean reward,輸出 Token 平均減少約 19%
  • low:25% mean reward,輸出 Token 平均減少約 64%

這意味着日常腳本修補、文檔整理等輕量任務可以壓低 effort 控制賬單;複雜重構、跨模塊調試則拉高至 xhigh / max。Cursor、Devin 等第三方評測也提到,Opus 5 在 FrontierCode 1.1 上接近 Fable 級表現,且 half the cost。

Agent 編碼:驗證、迭代與長程任務

Anthropic 將 Opus 5 定位爲「日常可用」的 Agent 編碼模型,突出其在以下方面的改進:

  1. 自我驗證:更傾向在提交前檢查工作,而非急於輸出
  2. 根因分析:在真實開源包管理器 Bug 案例中,Opus 5 定位根因並修復社區補丁遺漏的邊界情況
  3. 長程自主:可跨多步工具調用維持上下文,適合數小時甚至過夜運行的 Agent 流水線

官方 Early Access 客戶反饋中,Cursor 團隊稱 Opus 5 在 CursorBench 上「just under Fable 5」且行爲相似;JetBrains 側強調其在規劃階段就能發現邏輯錯誤;Lovable 內部評測顯示 Agentic 編碼任務相對 Opus 4.7 提升約 22%,且 run-to-run 方差顯著降低——對生產 Agent 而言,穩定性與峯值分數同樣重要。

Claude Code 用戶可直接在 IDE 內切換 claude-opus-5;Fast 模式可通過用量積分啓用,適合對延遲敏感的場景。

安全與對齊

System Card 披露,Opus 5 在自動化行爲審計中的 misaligned behavior 得分爲 2.3,爲近期 Claude 模型中最低。網絡安全方面,Opus 5 在漏洞識別上接近 Mythos 5,但在 exploit 開發上明顯落後;生物學高風險長程自主研究任務上,Mythos 5 仍更強。

API 新增兩項 Beta 能力:

  • Mid-conversation tool changes:對話中途增刪工具而不失效 Prompt Cache
  • Automatic fallbacks:安全分類器攔截時自動路由至其他可用模型(如 Opus 4.8)

如何接入 Claude Opus 5

Claude API(Python)

import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-opus-5",
    max_tokens=4096,
    messages=[
        {
            "role": "user",
            "content": "Review this Python module for race conditions and suggest fixes.",
        }
    ],
)

print(message.content[0].text)

Amazon Bedrock(Boto3)

AWS 官方博文給出的 Bedrock 調用示例:

import boto3
import json

bedrock_runtime = boto3.client(
    service_name="bedrock-runtime",
    region_name="us-east-1",
)

response = bedrock_runtime.invoke_model(
    modelId="global.anthropic.claude-opus-5",
    contentType="application/json",
    accept="application/json",
    body=json.dumps({
        "anthropic_version": "bedrock-2023-05-31",
        "max_tokens": 4096,
        "messages": [
            {
                "role": "user",
                "content": "Design a distributed architecture on AWS in Python "
                           "that should support 100k requests per second "
                           "across multiple geographic regions.",
            }
        ],
    }),
)

result = json.loads(response["body"].read())
print(result["content"][0]["text"])

Bedrock 默認 Zero Data Retention;Claude Platform on AWS 可按需申請 ZDR,並與 AWS 賬單、IAM 集成。模型已在 US East (N. Virginia)、Europe (Ireland)、Asia Pacific (Melbourne) 等多個區域上線。

開發者社區怎麼看

HN 討論(Claude Opus 5 公告帖)呈現兩極觀點:

正面:自發構建 ML Pipeline、從像素重建 3D FreeCAD 模型等案例展示了 Opus 5 的「主動性」;不少用戶認爲在 Agent 編碼場景下,接近 Fable 5 的能力配合 Opus 定價極具吸引力。

爭議:部分開發者反饋 Opus 5 更「有主見」,有時會繞過用戶設定的規則或做未請求的額外工作,Token 消耗隨之上升;發佈初期 Anthropic 與 Bedrock 也出現過 Elevated errors,有用戶報告通過 AWS Bedrock 訪問比直連 API 更穩定。

綜合官方數據與社區反饋,Opus 5 適合以下場景:

  • 長程 Agentic Coding(Claude Code、Cursor、Devin 等)
  • 跨會話的 企業知識工作(表格、文檔、演示稿)
  • 需要 100 萬 Token 上下文 的大型代碼庫分析
  • 希望在 Fable 級智能與 Opus 級賬單 之間取平衡的團隊

若任務以簡單問答爲主、或對延遲/穩定性極其敏感,Sonnet 5 或 Opus 4.8 可能仍是更穩妥的選擇——Opus 5 的價值在於把「前沿 Agent 能力」拉到了 Opus 價位,而非在所有場景下全面替代 Fable 5 或 Mythos 5。

參考鏈接

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜