GPT-5.6 Luna 價格腰斬再腰斬:OpenAI 如何將 Agent 推理成本壓到每百萬 token 0.2 美元

前言

2026 年 7 月 30 日,OpenAI 宣佈對 GPT-5.6 家族中兩檔模型下調 API 定價:最快、最便宜的 GPT-5.6 Luna 輸入 token 價格直降 80%,降至 0.2 美元/百萬;中端 GPT-5.6 Terra 降價 20%;旗艦 GPT-5.6 Sol 維持原價不變。

這距離 GPT-5.6 三檔模型(Sol / Terra / Luna)於 7 月 9 日 正式 GA 還不到三週。對正在跑 Agent、Codex 流水線或大批量 API 調用的開發者來說,這次調價不是簡單的「促銷」,而是 OpenAI 把內部推理效率紅利直接讓渡給客戶——也側面說明 2026 年下半年 AI 推理成本戰 已經打到明牌。

本文基於 OpenAI 官方公告與 CNBC 等權威報道,梳理新價格表、降價背後的工程邏輯,以及 Prompt Caching、Codex 配額等和實際賬單相關的細節。

GPT-5.6 三檔模型與調價一覽

GPT-5.6 家族按能力分層命名,數字代表代際,Sol / Terra / Luna 是可持續獨立演進的能力檔位:

模型 定位 調價前(輸入/輸出,$/百萬 token) 調價後(輸入/輸出,$/百萬 token) 變動
GPT-5.6 Luna 最快、最便宜,適合高吞吐、成本敏感任務 1 / 6 0.2 / 1.2 輸入 -80%,輸出 -80%
GPT-5.6 Terra 均衡檔,日常 Agent 與知識工作 2.5 / 15 2 / 12 各 -20%
GPT-5.6 Sol 旗艦,複雜編碼與長鏈路推理 5 / 30 5 / 30 不變

三檔模型共享 105 萬 token 上下文窗口128K 最大輸出,API 模型 ID 分別爲 gpt-5.6-lunagpt-5.6-terragpt-5.6-solgpt-5.6 別名路由至 Sol)。

OpenAI 在公告中表示,策略仍是「每一代智能體在更低成本下完成更多工作」。Sol 不降價、Luna 和 Terra 大幅讓利,本質上是在引導開發者按任務複雜度選模型,而不是一律堆旗艦。

降價背後的效率:模型幫模型省成本

OpenAI 把此次降價歸因於 服務 GPT-5.6 本身的端到端成本下降約 20%,以及 token 生成效率提升 超過 15%。官方在 7 月 29 日曾披露:GPT-5.6 在開發過程中參與了生產代碼的重寫與優化,模型「幫自己」降低了運行開銷——這類自舉式效率改進,正在變成大模型廠商降價的硬底氣。

對企業客戶而言,背景更現實:2022 年 ChatGPT 帶火的「token 隨便用」時代過去後,不少公司 AI 賬單已達數億美元量級,開始主動控費。與此同時,Moonshot 的 Kimi K3、Google Gemini 3.6 Flash 等 低價或開源權重模型 在部分基準上逼近閉源旗艦,Anthropic 也在 7 月推出更便宜的 Claude Opus 5。OpenAI 在三週內二次調價,可視爲對 成本敏感工作負載 市場的直接回應。

Prompt Caching:Luna 輸入可低至 0.02 美元/百萬

GPT-5.6 自發布起即支持更可控的 Prompt Caching(顯式緩存斷點、最短 30 分鐘緩存生命週期)。配合 7 月 30 日的新標價,實際賬單還可以再壓一層:

  • 緩存讀取:按標準輸入價的 10% 計費(即 90% 折扣)。Luna 緩存命中後,輸入約爲 0.02 美元/百萬 token
  • 緩存寫入:按未緩存輸入價的 1.25 倍 計費。
  • Batch / Flex 處理:約爲標準價的一半;Luna 在此模式下約爲 0.1 / 0.6 美元/百萬(輸入/輸出)。

對 Agent 類應用,系統提示詞、工具 schema、RAG 知識庫前綴往往高度重複。把穩定前綴放在 prompt_cache_breakpoint 之前、用戶動態內容放在之後,是讓 Luna 在「夠快夠便宜」前提下仍可用的關鍵工程手段——這也是 OpenAI 把 Luna 定位成「可調用工具、完成多步工作流」而不只是分類小模型的原因。

Codex、ChatGPT Work 與 Fast 模式

降價同時覆蓋 OpenAI APICodexChatGPT Work

  • 訂閱費與配額預算不變,但 Terra、Luna 的用量會佔用更少的 credits,相當於間接擴容。
  • Codex 中:Free / Go 用戶可用 Terra;Plus、Pro、Business、Enterprise 可選 Terra 與 Luna。
  • GPT-5.6 Sol 新增 API Fast 模式,取代原 Priority Processing,號稱比標準處理快最高 2.5 倍,價格爲標準價的 2 倍;Codex 中對應 /fast。需要低延遲的編碼 Agent 可據此在 Sol 上權衡速度與成本。

AWS Bedrock 等渠道的價格由雲廠商單獨計費,OpenAI 註明可能與官方 rate card 有差異,上線會分批 rollout。

開發者如何選型

結合已覈實定價,可按 workload 粗分:

  1. 高吞吐、結構化提取、路由/分類、簡單工具鏈Luna。0.2 美元/百萬輸入 + Prompt Caching,適合把 Agent 從「演示」推到「全量上線」。
  2. 日常知識工作、中等複雜度 Agent、Codex 默認檔Terra。性能對標 GPT-5.5 檔,降價後性價比更突出。
  3. 長推理、複雜編碼、Multi-agent / Programmatic Tool CallingSol(必要時開 Fast 模式)。

若你的流水線此前因 Luna 1 美元/百萬輸入而卡在 POC,這次 80% 降幅值得重新跑一遍成本模型;若已在用 Terra,20% 降幅會直接反映在月度賬單上。

小結

2026 年 7 月 30 日的 GPT-5.6 Luna / Terra 調價,是 OpenAI 在 GA 後不到三週內的第二次價格信號:推理效率提升可以很快轉化爲 API 單價,而 Agent 時代的長上下文、多輪工具調用 會把「每百萬 token 多少錢」變成產品能否規模化的核心指標。Luna 輸入 0.2 美元/百萬、配合緩存可至 0.02 美元/百萬,把成本敏感型 Agent 的門檻又往下拉了一檔——接下來比拼的不只是模型榜單分數,還有誰能把同樣質量的推理賣得更便宜。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜