前言¶
2026 年 7 月 30 日,OpenAI 宣佈對 GPT-5.6 家族中兩檔模型下調 API 定價:最快、最便宜的 GPT-5.6 Luna 輸入 token 價格直降 80%,降至 0.2 美元/百萬;中端 GPT-5.6 Terra 降價 20%;旗艦 GPT-5.6 Sol 維持原價不變。
這距離 GPT-5.6 三檔模型(Sol / Terra / Luna)於 7 月 9 日 正式 GA 還不到三週。對正在跑 Agent、Codex 流水線或大批量 API 調用的開發者來說,這次調價不是簡單的「促銷」,而是 OpenAI 把內部推理效率紅利直接讓渡給客戶——也側面說明 2026 年下半年 AI 推理成本戰 已經打到明牌。
本文基於 OpenAI 官方公告與 CNBC 等權威報道,梳理新價格表、降價背後的工程邏輯,以及 Prompt Caching、Codex 配額等和實際賬單相關的細節。
GPT-5.6 三檔模型與調價一覽¶
GPT-5.6 家族按能力分層命名,數字代表代際,Sol / Terra / Luna 是可持續獨立演進的能力檔位:
| 模型 | 定位 | 調價前(輸入/輸出,$/百萬 token) | 調價後(輸入/輸出,$/百萬 token) | 變動 |
|---|---|---|---|---|
| GPT-5.6 Luna | 最快、最便宜,適合高吞吐、成本敏感任務 | 1 / 6 | 0.2 / 1.2 | 輸入 -80%,輸出 -80% |
| GPT-5.6 Terra | 均衡檔,日常 Agent 與知識工作 | 2.5 / 15 | 2 / 12 | 各 -20% |
| GPT-5.6 Sol | 旗艦,複雜編碼與長鏈路推理 | 5 / 30 | 5 / 30 | 不變 |
三檔模型共享 105 萬 token 上下文窗口 與 128K 最大輸出,API 模型 ID 分別爲 gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol(gpt-5.6 別名路由至 Sol)。
OpenAI 在公告中表示,策略仍是「每一代智能體在更低成本下完成更多工作」。Sol 不降價、Luna 和 Terra 大幅讓利,本質上是在引導開發者按任務複雜度選模型,而不是一律堆旗艦。
降價背後的效率:模型幫模型省成本¶
OpenAI 把此次降價歸因於 服務 GPT-5.6 本身的端到端成本下降約 20%,以及 token 生成效率提升 超過 15%。官方在 7 月 29 日曾披露:GPT-5.6 在開發過程中參與了生產代碼的重寫與優化,模型「幫自己」降低了運行開銷——這類自舉式效率改進,正在變成大模型廠商降價的硬底氣。
對企業客戶而言,背景更現實:2022 年 ChatGPT 帶火的「token 隨便用」時代過去後,不少公司 AI 賬單已達數億美元量級,開始主動控費。與此同時,Moonshot 的 Kimi K3、Google Gemini 3.6 Flash 等 低價或開源權重模型 在部分基準上逼近閉源旗艦,Anthropic 也在 7 月推出更便宜的 Claude Opus 5。OpenAI 在三週內二次調價,可視爲對 成本敏感工作負載 市場的直接回應。
Prompt Caching:Luna 輸入可低至 0.02 美元/百萬¶
GPT-5.6 自發布起即支持更可控的 Prompt Caching(顯式緩存斷點、最短 30 分鐘緩存生命週期)。配合 7 月 30 日的新標價,實際賬單還可以再壓一層:
- 緩存讀取:按標準輸入價的 10% 計費(即 90% 折扣)。Luna 緩存命中後,輸入約爲 0.02 美元/百萬 token。
- 緩存寫入:按未緩存輸入價的 1.25 倍 計費。
- Batch / Flex 處理:約爲標準價的一半;Luna 在此模式下約爲 0.1 / 0.6 美元/百萬(輸入/輸出)。
對 Agent 類應用,系統提示詞、工具 schema、RAG 知識庫前綴往往高度重複。把穩定前綴放在 prompt_cache_breakpoint 之前、用戶動態內容放在之後,是讓 Luna 在「夠快夠便宜」前提下仍可用的關鍵工程手段——這也是 OpenAI 把 Luna 定位成「可調用工具、完成多步工作流」而不只是分類小模型的原因。
Codex、ChatGPT Work 與 Fast 模式¶
降價同時覆蓋 OpenAI API、Codex 與 ChatGPT Work:
- 訂閱費與配額預算不變,但 Terra、Luna 的用量會佔用更少的 credits,相當於間接擴容。
- Codex 中:Free / Go 用戶可用 Terra;Plus、Pro、Business、Enterprise 可選 Terra 與 Luna。
- GPT-5.6 Sol 新增 API Fast 模式,取代原 Priority Processing,號稱比標準處理快最高 2.5 倍,價格爲標準價的 2 倍;Codex 中對應
/fast。需要低延遲的編碼 Agent 可據此在 Sol 上權衡速度與成本。
AWS Bedrock 等渠道的價格由雲廠商單獨計費,OpenAI 註明可能與官方 rate card 有差異,上線會分批 rollout。
開發者如何選型¶
結合已覈實定價,可按 workload 粗分:
- 高吞吐、結構化提取、路由/分類、簡單工具鏈 → Luna。0.2 美元/百萬輸入 + Prompt Caching,適合把 Agent 從「演示」推到「全量上線」。
- 日常知識工作、中等複雜度 Agent、Codex 默認檔 → Terra。性能對標 GPT-5.5 檔,降價後性價比更突出。
- 長推理、複雜編碼、Multi-agent / Programmatic Tool Calling → Sol(必要時開 Fast 模式)。
若你的流水線此前因 Luna 1 美元/百萬輸入而卡在 POC,這次 80% 降幅值得重新跑一遍成本模型;若已在用 Terra,20% 降幅會直接反映在月度賬單上。
小結¶
2026 年 7 月 30 日的 GPT-5.6 Luna / Terra 調價,是 OpenAI 在 GA 後不到三週內的第二次價格信號:推理效率提升可以很快轉化爲 API 單價,而 Agent 時代的長上下文、多輪工具調用 會把「每百萬 token 多少錢」變成產品能否規模化的核心指標。Luna 輸入 0.2 美元/百萬、配合緩存可至 0.02 美元/百萬,把成本敏感型 Agent 的門檻又往下拉了一檔——接下來比拼的不只是模型榜單分數,還有誰能把同樣質量的推理賣得更便宜。