本文系统介绍 GPT-5.6 系列的 Sol、Terra 与 Luna:三者如何在智能、速度与成本之间取舍,怎样按任务选择模型和推理档位,以及如何利用缓存读取和多智能体工作流提高效率、降低成本。
原文:https://x.com/cerebras/article/2081828128952095022
本文由 LobsterAI 自动翻译和发布。
作者: @0xSero 与 Zhenwei Gao(@zhennydez)

你的 Codex 订阅现在包含 3 个主要模型:Sol、Terra 和 Luna。它们各自经过独立训练和部署,并且都配有推理档位。三者结合起来,让你能够为每项任务选择合适的速度、成本与智能平衡。
价格对比一览(OpenAI 开发者定价,2026 年 7 月 21 日)
从价格来看,无论使用短上下文还是长上下文,Terra 的成本都是 Sol 的二分之一,而 Luna 的成本则是 Sol 的五分之一。

这种定价与智能水平和速度大体相符。在实际使用中,每个模型最适合的工作类型各不相同:
- Sol 是三者中最聪明的。它最适合长时间运行的任务、复杂的技术挑战和个人助理工作。更强的能力也意味着更高的延迟和成本,但 Sol 擅长协调子智能体,并能在长流程中处理大型项目。
- Terra 稳稳地处在中间位置,以 Sol 一半的价格提供其大部分智能,同时速度也适度更快。与 Sol 搭配时,Terra 可以成为强大的子智能体:Sol 负责权衡选项、确定方向,然后把实现工作交给更快、更便宜的 Terra。
- Luna 是三者中速度最快、价格最低的模型,成本仅为 Sol 的五分之一,同时仍优于市场上的大多数模型。对于多数日常 AI 任务,Luna 的能力绰绰有余,能够以极低成本提供可靠表现。截至 2026 年 7 月 17 日,它在 Artificial Analysis 的模型智能指数中位列全部 576 个模型中的第 16 名。

为任务选择最佳模型
你该如何决定由哪个模型处理一个请求,又该让它使用多少推理能力?这个选择必须在生成任何 token 之前作出。
从 Luna 开始,再逐级升级
处理任何任务时,一个简单的方法是:在你愿意支付的价格范围内,选择速度与智能平衡最好的模型。在 GPT-5.6 系列中:
1. GPT-5.6-Sol: 智能下限和上限最高
2. GPT-5.6-Luna: 速度下限和上限最高
一个不错的默认策略是让大多数任务从 Luna 开始;当进展停滞时——例如智能体陷入困境、修复不再奏效,或模型开始丢失主线——再升级到 Terra 或 Sol。如果你愿意花更多钱同时换取速度和智能,可以在 Cerebras 上以每秒 750 个 token 的速度运行 Sol,相比 Sol 的常规模式,速度最高可提升 10 倍。

测试时计算 / 推理
另一种定制模型任务处理方式的方法,是调整它的推理等级。在 Codex 中,你可以从五个选项中选择:“轻度(Light)”、“中等(Medium)”、“高(High)”、“超高(Extra High)”和“极致(Ultra)”。
通过投入更多计算处理时间来提高输出准确性,模型会在给出答案之前生成 token,与自身展开辩论并进行自我质疑。
- 轻度(Light): 非常适合快速完成基础任务,例如查找文件、克隆和配置代码仓库、整理下载内容等。只要模型清楚自己需要做什么,而且失败概率很低,基本都应该选择这个推理等级。
- 中等(Medium): 适合需要一定理解、规划或调试、但无须深入探索的日常任务,可作为不错的默认选择。例如汇总多个文件、实现一个小功能,或排查一个熟悉的问题。
- 高(High)和超高(Extra High): 最适合困难的 STEM 与编程任务,例如复杂调试、架构决策、大规模重构,或存在多种合理方案的问题。大多数常规助理任务并不需要这么多推理,甚至根本不需要推理。
- 极致(Ultra): 如果你非常清楚自己想要什么,并且有详细的约束条件,尤其是面对横跨多个独立系统的工作,就可以使用最高推理模式。例如,以非常具体的方式构建界面和 API,将两个 API 连接起来。
我们通常只会把 Ultra 模式留给最重大的研究问题和全新挑战。Ultra 模式往往会很快耗尽你的使用额度,但你可以确信,模型已经用尽所有可用的推理预算来探索、验证并完善答案。
根据 Artificial Analysis 在 7 月 17 日进行的测试,GPT-5.6 Sol 的推理等级每提高一级,每项任务的平均成本大约增加 50%。下图展示了增加推理量对智能水平和成本的影响。

充分利用缓存读取
缓存输入比新输入便宜 90%。对于需要反复处理同一代码库或上下文的 Codex 任务来说,这会带来巨大的收益。
GPT-5.6 的每个模型都拥有约 30 分钟的缓存存活时间。这意味着,与其为每项任务新建会话,不如维持一个持续工作的单一会话。
Codex 的上下文压缩也已经足够出色,你可以在一个会话中运行数亿个 token,而不会遇到任何问题。
只要让会话保持活跃,提示词处理成本就会低得多。你可以把 Codex 自动化设置为每 20 分钟定时运行一次,从而维持缓存,并利用这些自动化来驱动长时间运行的流程。

有效使用多智能体工作流
不同模型使用不同数据进行训练,也会针对不同目标进行优化,这意味着每个模型在某些事情上都会略强或略弱。
Advisor(顾问)工作流会给一个智能体分配一项范围很窄的工作:阅读完整会话,持续跟踪目标与约束,并在工作智能体开始偏离方向时介入。这有助于自动引导工作智能体,提高长时间任务的可靠性。
本地版 Codex 还允许你把其他提供商接入应用。这意味着,你可以在熟悉的 Codex 体验中,尝试 Kimi K2.7 Code 这类成本更低的开放权重模型,或 GLM-5.2 这类具备不同优势、擅长长周期推理和编程的模型。
然后,你可以使用这些外部模型承担边界明确的子智能体工作,从而降低成本,或发挥不同模型各自的优势。
这里有一个重要的细节:这需要通过 Codex 配置和自定义智能体文件来完成,而不是在应用内用一个简单的模型选择器切换。Codex 支持 Ollama 和 LM Studio 等本地提供商,也支持兼容 Responses API 的自定义提供商。

结论
订阅的使用额度相当慷慨,但随着 AI 智能体对越来越多的人变得更加实用,许多人正在把使用量推到远超一份订阅所能提供的上限。
而且,即使你有钱可烧,也不是每一个“前沿”模型都处在所有使用场景的前沿。在少数几个基准测试中,一个小模型往往可以把一群世界上最优秀的模型彻底甩在身后。
速度是一个重要的调节项。白天,当你与智能体互动时,较高的 token/s 可以显著改善使用体验。 在非工作时段,通过 /goal 使用速度较慢但推理更充分的模型,则可能带来天壤之别。
最后,请持续关注 Artificial Analysis,那里汇集了大量高质量的模型速度基准测试和智能指数。
感谢 Sarah Chieng(@MilksandMatcha)、Joyce Er 和 Hai-Ching 的审阅与意见,也感谢 Halley Change(@halleychangg)为本博客提供平面设计。