前言¶
2026 年 7 月 30 日,OpenAI 宣布对 GPT-5.6 家族中两档模型下调 API 定价:最快、最便宜的 GPT-5.6 Luna 输入 token 价格直降 80%,降至 0.2 美元/百万;中端 GPT-5.6 Terra 降价 20%;旗舰 GPT-5.6 Sol 维持原价不变。
这距离 GPT-5.6 三档模型(Sol / Terra / Luna)于 7 月 9 日 正式 GA 还不到三周。对正在跑 Agent、Codex 流水线或大批量 API 调用的开发者来说,这次调价不是简单的「促销」,而是 OpenAI 把内部推理效率红利直接让渡给客户——也侧面说明 2026 年下半年 AI 推理成本战 已经打到明牌。
本文基于 OpenAI 官方公告与 CNBC 等权威报道,梳理新价格表、降价背后的工程逻辑,以及 Prompt Caching、Codex 配额等和实际账单相关的细节。
GPT-5.6 三档模型与调价一览¶
GPT-5.6 家族按能力分层命名,数字代表代际,Sol / Terra / Luna 是可持续独立演进的能力档位:
| 模型 | 定位 | 调价前(输入/输出,$/百万 token) | 调价后(输入/输出,$/百万 token) | 变动 |
|---|---|---|---|---|
| GPT-5.6 Luna | 最快、最便宜,适合高吞吐、成本敏感任务 | 1 / 6 | 0.2 / 1.2 | 输入 -80%,输出 -80% |
| GPT-5.6 Terra | 均衡档,日常 Agent 与知识工作 | 2.5 / 15 | 2 / 12 | 各 -20% |
| GPT-5.6 Sol | 旗舰,复杂编码与长链路推理 | 5 / 30 | 5 / 30 | 不变 |
三档模型共享 105 万 token 上下文窗口 与 128K 最大输出,API 模型 ID 分别为 gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol(gpt-5.6 别名路由至 Sol)。
OpenAI 在公告中表示,策略仍是「每一代智能体在更低成本下完成更多工作」。Sol 不降价、Luna 和 Terra 大幅让利,本质上是在引导开发者按任务复杂度选模型,而不是一律堆旗舰。
降价背后的效率:模型帮模型省成本¶
OpenAI 把此次降价归因于 服务 GPT-5.6 本身的端到端成本下降约 20%,以及 token 生成效率提升 超过 15%。官方在 7 月 29 日曾披露:GPT-5.6 在开发过程中参与了生产代码的重写与优化,模型「帮自己」降低了运行开销——这类自举式效率改进,正在变成大模型厂商降价的硬底气。
对企业客户而言,背景更现实:2022 年 ChatGPT 带火的「token 随便用」时代过去后,不少公司 AI 账单已达数亿美元量级,开始主动控费。与此同时,Moonshot 的 Kimi K3、Google Gemini 3.6 Flash 等 低价或开源权重模型 在部分基准上逼近闭源旗舰,Anthropic 也在 7 月推出更便宜的 Claude Opus 5。OpenAI 在三周内二次调价,可视为对 成本敏感工作负载 市场的直接回应。
Prompt Caching:Luna 输入可低至 0.02 美元/百万¶
GPT-5.6 自发布起即支持更可控的 Prompt Caching(显式缓存断点、最短 30 分钟缓存生命周期)。配合 7 月 30 日的新标价,实际账单还可以再压一层:
- 缓存读取:按标准输入价的 10% 计费(即 90% 折扣)。Luna 缓存命中后,输入约为 0.02 美元/百万 token。
- 缓存写入:按未缓存输入价的 1.25 倍 计费。
- Batch / Flex 处理:约为标准价的一半;Luna 在此模式下约为 0.1 / 0.6 美元/百万(输入/输出)。
对 Agent 类应用,系统提示词、工具 schema、RAG 知识库前缀往往高度重复。把稳定前缀放在 prompt_cache_breakpoint 之前、用户动态内容放在之后,是让 Luna 在「够快够便宜」前提下仍可用的关键工程手段——这也是 OpenAI 把 Luna 定位成「可调用工具、完成多步工作流」而不只是分类小模型的原因。
Codex、ChatGPT Work 与 Fast 模式¶
降价同时覆盖 OpenAI API、Codex 与 ChatGPT Work:
- 订阅费与配额预算不变,但 Terra、Luna 的用量会占用更少的 credits,相当于间接扩容。
- Codex 中:Free / Go 用户可用 Terra;Plus、Pro、Business、Enterprise 可选 Terra 与 Luna。
- GPT-5.6 Sol 新增 API Fast 模式,取代原 Priority Processing,号称比标准处理快最高 2.5 倍,价格为标准价的 2 倍;Codex 中对应
/fast。需要低延迟的编码 Agent 可据此在 Sol 上权衡速度与成本。
AWS Bedrock 等渠道的价格由云厂商单独计费,OpenAI 注明可能与官方 rate card 有差异,上线会分批 rollout。
开发者如何选型¶
结合已核实定价,可按 workload 粗分:
- 高吞吐、结构化提取、路由/分类、简单工具链 → Luna。0.2 美元/百万输入 + Prompt Caching,适合把 Agent 从「演示」推到「全量上线」。
- 日常知识工作、中等复杂度 Agent、Codex 默认档 → Terra。性能对标 GPT-5.5 档,降价后性价比更突出。
- 长推理、复杂编码、Multi-agent / Programmatic Tool Calling → Sol(必要时开 Fast 模式)。
若你的流水线此前因 Luna 1 美元/百万输入而卡在 POC,这次 80% 降幅值得重新跑一遍成本模型;若已在用 Terra,20% 降幅会直接反映在月度账单上。
小结¶
2026 年 7 月 30 日的 GPT-5.6 Luna / Terra 调价,是 OpenAI 在 GA 后不到三周内的第二次价格信号:推理效率提升可以很快转化为 API 单价,而 Agent 时代的长上下文、多轮工具调用 会把「每百万 token 多少钱」变成产品能否规模化的核心指标。Luna 输入 0.2 美元/百万、配合缓存可至 0.02 美元/百万,把成本敏感型 Agent 的门槛又往下拉了一档——接下来比拼的不只是模型榜单分数,还有谁能把同样质量的推理卖得更便宜。