GPT-5.6 发布:从单点能力到价格-能力曲线
OpenAI 在 2026-07-09 发布了 GPT-5.6 系列。相比单纯说“更聪明”,这次发布更值得看的地方是:OpenAI 正在把模型产品拆成一条更清晰的 价格-能力曲线。
这条曲线由三档模型组成:
| Tier | 定位 | API 标价(每 100 万 token) |
|---|---|---|
| GPT-5.6 Sol | 旗舰模型,面向最难的推理、编码、知识工作与安全任务 | $5 input / $30 output |
| GPT-5.6 Terra | 平衡档,性能接近或超过上一代高端模型,成本更低 | $2.50 input / $15 output |
| GPT-5.6 Luna | 最快、最便宜,适合规模化和高频调用 | $1 input / $6 output |
官方还明确说,GPT-5.6 已经开始在 ChatGPT、Codex 和 OpenAI API 上开放;API 侧支持 Sol、Terra、Luna,Responses API 里还加入了 Programmatic Tool Calling 与 multi-agent beta。
我最关心的:能力不是单点,而是一条曲线
这次发布后,我最关心的不是“最强模型有多强”,而是不同模型、不同 effort 下的性价比位置。下面这张图是我整理的一版价格-能力观察图:横轴是估算的每百万 output token API 成本,纵轴是能力分数。

这张图不是 OpenAI 官方定价表,而是把我关心的“成本投入换来多少能力提升”画成一条直观曲线。它提示了几个使用策略:
- 低成本区间的斜率很陡:从 Luna medium 到 Luna Max、Terra medium,能力提升明显,但成本增加还算温和。这类档位适合批量任务、日常 coding 辅助、内容整理、轻量 agent。
- 中段是实际生产最该盯的区域:Terra Ultra、Sol Max 一带可能是很多团队的主力选择。它们不一定每次都追求最高分,但更容易在质量、延迟和账单之间达成平衡。
- 高端区域更像“关键任务开关”:Sol Ultra 的意义不是日常默认使用,而是在复杂修复、长链路研究、端到端交付、需要并行探索的问题上换取更高成功率。
换句话说,GPT-5.6 的产品表达从“一个模型解决一切”,变成了“你可以按任务风险、时延和预算选择不同能力档位”。
Sol、Terra、Luna:命名背后是产品分层
OpenAI 这次没有只发布一个旗舰模型,而是把 GPT-5.6 明确拆成三个 durable capability tiers:
- Sol:旗舰档。官方强调它在 coding、knowledge work、cybersecurity、science 上达到新的前沿能力。
- Terra:平衡档。定位是低成本但仍接近高端能力,适合日常工作流。
- Luna:成本效率档。适合规模化、高频、对单次任务峰值能力要求没那么高的场景。
这个分层对开发者很重要。过去很多团队会把“模型选择”简化成“默认用最强的,贵了再降级”。GPT-5.6 更像是在鼓励一种 workflow-level routing:
- 先用 Luna/Terra 做检索、分类、摘要、初步计划。
- 对不确定、失败或高价值任务升级到 Sol。
- 对需要并行探索的复杂任务,再打开 max 或 ultra。
如果这套路由做得好,账单不会线性追随能力上升,整体成功率反而会更稳定。
Ultra 的意义:不是更长思考,而是并行代理
官方把 ultra 描述为最高能力设置,默认协调 4 个 agents 并行工作。这个表述很关键:它不是简单把单个模型的思考时间拉长,而是把复杂任务拆成多个 workstreams,然后再综合结果。
这对 agentic coding 和研究任务尤其有意义:
- 一个 agent 可以做实现。
- 一个 agent 可以做测试与反例搜索。
- 一个 agent 可以读文档或历史 issue。
- 一个 agent 可以做方案对比或风险审查。
过去我们会手动开多个窗口、多个 agent、多个分支来做这件事。GPT-5.6 把它产品化成一个能力档位。代价是 token 总量会更高,收益是复杂任务的 time-to-result 和成功率可能更好。
所以 ultra 的正确使用方式不是“所有任务默认开满”,而是放在这些场景:
- 代码库很大,单一路径容易漏掉边界条件。
- 问题本身需要探索多种方案。
- 失败成本明显高于推理成本。
- 需要最终交付物,而不是只要一段回答。
Programmatic Tool Calling:把工具调用从对话变成小程序
GPT-5.6 的另一个实际变化是 Programmatic Tool Calling。官方说它允许模型在 Responses API 中写和运行轻量程序,用来协调工具、处理中间结果、监控进度,并决定下一步。
这会改变工具调用的成本结构。
以前的典型模式是:
- 模型决定调用工具。
- 工具返回大量结果。
- 结果全部回灌给模型。
- 模型再判断下一步。
如果工具返回很多噪音,这个模式很容易浪费 token。Programmatic Tool Calling 更像是在模型和工具之间加了一层可执行的过滤与控制逻辑:先在程序里处理掉大量中间数据,只把真正有价值的部分交还给模型。
这也解释了为什么 GPT-5.6 的发布反复强调“每个 token 产生更多有用工作”。真正的效率提升不只是模型本体更便宜,而是工具链的中间损耗变少。
Benchmark 信息:重点看任务形态,而不是只看榜单
官方发布页给了大量 benchmark。几个我觉得更值得关注的数据:
| 方向 | 官方数据点 |
|---|---|
| Coding Agent Index | GPT-5.6 Sol max reasoning 达到 80 |
| Terminal-Bench 2.1 | GPT-5.6 Sol 88.8%,Sol Ultra 91.9% |
| BrowseComp | GPT-5.6 Sol 90.4%,Sol Ultra 92.2% |
| OSWorld 2.0 | GPT-5.6 Sol 62.6% |
| SEC-Bench Pro | GPT-5.6 Sol 71.2%,Sol Ultra 74.3% |
| ExploitBench | GPT-5.6 Sol 73.5%,GPT-5.5 为 47.9% |
这些数据的共同点是:它们都不是纯问答题,而是更接近真实任务环境。
Terminal-Bench 看命令行任务,BrowseComp 看浏览器检索与推理,OSWorld 看电脑操作,SEC-Bench Pro 和 ExploitBench 看安全任务链路。也就是说,GPT-5.6 的重点不是“静态知识多一点”,而是更能在工具环境里持续推进任务。
这也和 Codex 的实际使用体验相关。未来 coding agent 的竞争重点会越来越少是“能不能写出一段函数”,越来越多是:
- 能不能理解一个已有代码库的局部约束。
- 能不能自己跑测试、读日志、修复再验证。
- 能不能在长任务里不丢目标。
- 能不能把中间产物整理成可审查、可合并、可交付的结果。
安全策略:能力开放和访问控制会一起升级
GPT-5.6 在 cyber 和 biology 上的能力明显增强,但官方也强调它没有跨过 Critical threshold。更值得注意的是访问控制方式:对于更敏感的 cyber 能力,OpenAI 通过 Trusted Access、身份验证、硬件 passkey、实时检查和 reasoning monitor 来分层开放。
这说明前沿模型的发布逻辑正在变化:
- 不是所有能力都向所有用户同等开放。
- 防御性安全工作会被更细地识别和支持。
- 高风险能力会绑定账户可信度、使用场景和实时监控。
这对开发者也有一个现实影响:同一个模型名,在不同账号、不同产品面、不同权限层级下,实际可用能力可能并不完全一样。评测结果要结合访问条件理解。
我的判断:GPT-5.6 是 agent 产品化的一次关键发布
GPT-5.6 的核心不是“又一个更强大模型”,而是 OpenAI 把 agent 工作流里的几个关键变量同时产品化了:
- 模型分层:Sol、Terra、Luna 对应不同成本和能力。
- 推理档位:medium、max、ultra 让同一任务可以按风险追加预算。
- 并行代理:ultra 把多 agent 协作变成可调用能力。
- 工具执行逻辑:Programmatic Tool Calling 减少工具链 token 浪费。
- 安全访问层:更强能力和更细权限绑定在一起。
如果只把 GPT-5.6 当作 ChatGPT 里的“新模型选项”,会低估这次发布。它更像是一套新的 agent operating layer:不同模型负责不同阶段,不同 effort 匹配不同风险,工具调用从聊天式交互变成更可编排的执行系统。
真正值得做的不是盲目切到 Sol Ultra,而是重新设计自己的模型路由:
- 默认用 Terra 或 Luna 承担高频任务。
- 把 Sol 留给高价值、高不确定性的步骤。
- 把 ultra 留给复杂交付、并行探索和失败成本高的任务。
- 用 Programmatic Tool Calling 降低工具链中间 token 消耗。
GPT-5.6 之后,模型选择会越来越像工程调度问题:不是问“哪个模型最强”,而是问“这一步任务,花多少钱买多少成功率最划算”。
References
- OpenAI: GPT-5.6: Frontier intelligence that scales with your ambition
- OpenAI Developers: Programmatic Tool Calling
- OpenAI: GPT-5.6 System Card