GPT-6 Sol 与 Luna:把 Astra 的智能铺到更便宜的档位
2026 年 9 月 22 日,OpenAI 宣布扩展 GPT-6 宇宙:GPT-6 Sol 与 GPT-6 Luna。[1] 官方逻辑很清楚——本月早些时候的 GPT-6 Astra 仍是「最强、最对齐」的峰值模型;大量日常工作却需要不同规模、节奏与预算。Sol / Luna 用相近训练方法把 Astra 在专业工作、事实性、编码、计算机使用与对齐上的进展,铺到更快、更便宜的档位,并把缓存与推理省下的成本以 相对 GPT-5.6 促销价降 50% 的 API 标价回馈用户。[1]
当天稍早,Anthropic 发布了 Claude Opus 5.5。两家贴身发版,读者会对照价格、能力与安全限制。姊妹篇见 Claude Opus 5.5:降价与旗舰性能。[2] 本篇独立写清 GPT-6 这一侧:Sol / Luna 的价位与定位、官方挑了哪些基准切片、缓存改进对 agent 账单意味着什么、Astra 的能力故事(含公开验证的 Enigma 破译)怎么当副线,以及 coding agent 该如何分档,而不是「全部默认最贵」。
先分清三代角色:Astra / Sol / Luna
把名字记成产品分层,比记口号有用:
| 模型 | 官方角色(据 OpenAI) | API 标识 | 本轮标价(每百万 token) |
|---|---|---|---|
| GPT-6 Astra | 全场最佳;最难、最重要项目仍用它 | gpt-6-astra(此前已发) | 本文未在 Sol/Luna 公告中核对到新的 Astra 绝对标价,故不臆造 |
| GPT-6 Sol | 复杂工作(含编码)的主力实惠档 | gpt-6-sol | 输入 10(由 5.6 Sol 的 20 腰斩) |
| GPT-6 Luna | 高吞吐、目标清晰的任务(摘要、抽取、快问快答等) | gpt-6-luna | 输入 0.50(由 5.6 Luna 的 1.20 下调;输出侧官方表为 $0.50) |
价格与降幅来自 OpenAI 本品公告表格。[1] TechCrunch 补充产品直觉:Sol 偏复杂任务如编码,Luna 偏文书与批量清晰目标任务;并指出 Anthropic Opus 5.5 约早 90 分钟发布。[3]
可用性(以公告当日为准):Sol 与 Luna 进入 ChatGPT Work 与 Codex,面向 Plus / Pro / Business / Enterprise / Edu;Free 与 Go 可在桌面端使用 Luna;公告写明当时尚未进入 Chat;API 为 gpt-6-sol / gpt-6-luna;为稳定服务计划当日逐步放量。[1]
Astra 主叙事见 OpenAI 2026-09-03 前后的发布材料与安全概述:官方宣称其在计算机使用、浏览、软件工程、网络安全、科学与专业工作等方向处于前沿,并作为 Preparedness 框架下网络安全能力达到 Critical 等级的模型被讨论。[4][5] 本篇不把 Astra 的全部基准表重抄一遍,只在需要解释「Sol/Luna 在下放什么」时引用。
价格与缓存:降的不只是百万 token
标价腰斩
相对 GPT-5.6 促销价,Sol / Luna API 降 50%。[1] 对本来就把 Sol 当编码默认的团队,这是直接的预算松绑;对把 Luna 跑在抽取、分类、短回复链路上的团队,则是把「便宜模型」再推一档。
选型时仍要问:降价后你会不会把更多任务升到更贵的模型? 额度与心理账户变化后,总支出可能上升。分母应用「成功完成的任务 / 合并 / 关闭工单」,而不是日消耗美元。
Prompt caching:agent 长对话的第二刀
OpenAI 写明改进了 GPT-6 的 prompt caching:默认更高缓存命中,帮助 agent 复用上下文、更快响应,并对缓存命中的输入 token 读取提供 90% 折扣。[1] 配套能力包括:
- Prompt Caching 仪表盘与诊断工具,解释未命中原因;
- 调整 reasoning effort、开关工具时,尽量不打断既有前缀的缓存复用;
- 显式断点,让开发者决定缓存前缀止于何处。[1]
GitHub 反馈:过去数月相关改进使需要全新处理的 prompt token 占比下降超过 50%(数十亿次请求量级)。[1] 这对 Codex / Copilot 类长会话是结构性变化:模型标价与缓存命中率会乘在一起。
可复现的验收步骤(建议抄进内部 runbook)
- 打开缓存仪表盘,对同一 agent 工作流跑 50 次「同前缀、微变后缀」请求,记录命中率与美元。
- 故意每轮改工具 JSON 的字段顺序或描述措辞,观察命中率崩塌——这是 harness 问题,不是模型没降价。
- 在努力档(effort)升降时核对:公告称可在保持缓存的前提下调 effort / 工具可用性;若你的封装层重写了整段系统提示,官方优化帮不上。[1]
- 把「缓存读折扣后的有效输入单价」写进报表,与 Anthropic 侧「缓存读标价」对照时,注意两边会计科目并不相同。
三类会抵消「腰斩」的账单陷阱
- 档位上浮:Sol 便宜后,团队把本该 Luna 的抽取任务也丢给 Sol,或把 Sol 失败立刻升级 Astra;平均单价回升。
- 缓存未命中:工具 schema、系统提示、文件顺序每轮抖动,90% 缓存读折扣形同虚设。[1]
- 重试风暴:事实性变好不等于零错误;若编排层在超时后无脑重试 5 次,降价会被乘回去。
发版周先修这三项,再谈「我们是否跑赢 Anthropic 的相对成本图」。
官方能力切片:Sol/Luna 自己挑的战场
OpenAI 没有声称 Sol 全面超过 Astra。叙事是:在更低成本上逼近或局部超过竞品高价配置。下列数字均来自 Sol/Luna 公告,均为厂商自报,且 effort / harness 与竞品配置需对照原文脚注。[1]
专业工作流
- AutomationBench:Sol 在 xhigh 上 33.2%,每任务约 $0.27;相对 Claude Opus 5 max(26.9%)宣称约 9% 的每任务成本;并称超过低 effort 的 Astra,以及带 Opus 5 回退的 Fable 5.1 配置(并脚注 Fable 成本因回退未完全计入而被低估)。[1]
- Agents’ Last Exam:Sol 在 max effort 上 56.4%,相对 Claude Opus 5 最高分,宣称每任务成本约低 60%。[1]
读这些数字时记住:Anthropic 同日的 Opus 5.5 公告里,AutomationBench 上 GPT-6 Astra 为 41.4%、Opus 5.5 为 40.0%——不同文章、不同模型、不同日期切片,不能直接拼成一张「终极表」。[2]
事实性
内部事实性评测基于用户曾标记错误的真实对话(经去标识):Sol 错误大约减半,接近 Astra 级可靠性且更便宜;Luna 在更高 effort 下能以约百分之一成本达到 GPT-5.6 Sol 的水平。[1] 官方同时声明:这些对话不代表典型流量(典型场景错误更少),且分数未按长度严格控制。[1]
编码
- FrontierCode 1.1 Main:Sol 相对 5.6 Sol 明显提升,并能以更低成本匹配 Claude Fable 5.1 xhigh 水准(官方表述)。[1]
- DeepSWE v1.1:Sol max 68.8%,相对 Claude Fable 5 最高 69.9%(xhigh)差 1.1 个百分点,每任务成本约低 80%;Luna max 66.6%,接近 Opus 5 / Fable 5 的 medium;相对 Opus 5 / Fable 5 每任务成本约低 93% / 96%。[1]
OpenAI 还给出内部用量背景:按 API 价格估值,研究者日均 token 用量中位数超过 7000——用来说明「编码 agent 变长之后,持续成本开始决定你敢不敢把任务做大」。[1]
计算机使用
Astra 仍被官方称为计算机使用上的世界最佳;Sol 在 OSWorld 2.0 offline、xhigh 上 60.5%,接近 Claude Opus 5 medium 的 60.3%,每任务成本约低 80%;Luna max 可超过 GPT-5.6 Sol medium,成本约十分之一。[1]
协作文风
Sol/Luna 继承 Astra 的沟通改进:更清晰、少行话、少怪句式、少低价值细节、略短但不丢实质。官方用改站「bento + 右上角滑动切换」的例子对比 5.6 Sol 与 6 Sol:后者更少过早下结论、更少复述显而易见细节、更坦白做过/未做过的检查。[1]
对齐与安全:继承 Astra,但别当成「无闸门」
Sol/Luna「建立在 Astra 对齐工作之上」;在对齐评测中相对各自的 5.6 对应档有改进,包括编码工作中误导性陈述的比率下降。[1] 评测故意挑难场景,不代表典型失败率;细节见 system card。[1]
Astra 本身的安全故事更重:OpenAI 安全概述将其描述为广泛部署中能力最强的模型之一,并在 Preparedness 框架下把网络安全能力标到 Critical,配套隔离、强化拒答边界、红队与对齐评估等措施。[5] Sol/Luna 公告没有逐项复述这些 Critical 级控制是否原样下放到每一档;工程上应默认:更强模型档位的滥用面更大,路由与审计策略仍要按任务敏感度分档,而不是假设「便宜模型 = 无安全问题」或「对齐改进 = 可关监控」。
与 Anthropic Opus 5.5 的对照(细节见姊妹篇):Anthropic 对生物/网络采用透明回退与验证计划;OpenAI 侧在 Astra 上强调 Critical cyber 与对齐套件。[2][5] 两边都不是「裸奔旗舰」。做 coding agent 时,把「会不会触发拒答/降级」写进验收,比背新闻稿安全形容词更有用。
副线:Astra 与 MVUEH Enigma——能力故事怎么读
选题里的 Astra 叙事,不宜只停在发布片播放量。一则可核的第三方记录来自 Crypto Cellar Research:2026-09-15,Carter Leffer 请站点维护者验证 GPT-6 Astra 对 1941-07-10 德军 Enigma 报文 MVUEH(自 2005 年起未破)的破译;维护者确认密钥与明文正确,并描述模型在几乎无人工密码分析指导的情况下,自行选择候选报文、怀疑与已破 SIPVX 明文相关、编写模拟器与 Bombe 类软件、利用 ROSENOW 反复地名 crib 完成破译;后续日志甚至出现对德国联邦档案馆馆藏编号的专业检索线索。[6]
如何读这条副线:
- 它证明的是长程研究型 agent 能力与工具使用,不是 Sol/Luna 的标价或 AutomationBench 分数。
- 它不能直接外推到你的产品仓库。密码分析成功依赖公开语料、可写代码、可跑搜索的环境,与「在私有 monorepo 里按规范改接口」不是同一分布。
- 它强化「峰值模型仍有单独价值」:OpenAI 自己也说最难项目仍找 Astra;Sol/Luna 解决的是把同代方法铺开,不是取消峰值档。[1]
- YouTube 官方介绍片(约两周内数百万播放量级信号)适合当作发布叙事入口,不宜当作可引用跑分来源;具体能力以文字公告、system card 与可核第三方记录为准。[7]
发布节奏与竞争语境(不把谣言当事实)
TechCrunch 将 Sol/Luna 放在 Astra「本月早些时候」发布之后,并强调效率、事实性与编码错误率改进;同时记录与 Opus 5.5 约 90 分钟之差的贴身发版。[3] 机器之心 / 36氪对照文进一步把两家叙事收束为「单位任务成本」竞争,并引用 OpenAI「Building abundant intelligence」一类「客户买的是任务完成」的论述。[9]
本稿采信的边界:
- 采信:官方标价表、可用性声明、带脚注的基准自称、缓存 90% 折扣、GitHub 缓存占比反馈。[1]
- 审慎引用:第三方 Enigma 破译记录(能力故事,非定价)。[6]
- 不采信为事实:未证实的后续发版日程、社交平台上的瞬时跑分、把两家新闻稿数字直接加减得到的「总冠军」。
对读者更有用的问题不是「谁赢了 9 月 22 日」,而是:「我的路由表是否在 9 月 24 日仍然反映真实单价与真实失败模式?」
平台可用性细节:写进变更说明,避免支持工单
公告当日细节容易在转发中丢失,建议原样写进内部变更说明:[1]
- 付费用户:ChatGPT Work 与 Codex 可用 Sol/Luna;
- Free / Go:桌面应用可用 Luna;
- Chat(消费级主会话)当时尚未提供这些模型,并计划当日逐步放量——若同事截图说「我 Chat 里还没有」,可能是滚动发布而非账号故障;
- API 名称:
gpt-6-sol、gpt-6-luna。
支持与文档组应准备两句标准答复:「Work/Codex 与 API 的路径」以及「Chat 是否已轮到你的账号以产品界面为准」。
和 Opus 5.5 怎么选(本篇独立结论)
| 维度 | GPT-6 Sol / Luna(本篇) | Claude Opus 5.5(摘要) |
|---|---|---|
| 角色 | 把 Astra 代际能力铺到中低价位 | 单型号冲击 Fable 级能力 + Opus 级价位 |
| 标价 | Sol 10,Luna 0.50(相对 5.6 促销价 -50%) | 输入 20、缓存读 $0.20(相对 Opus 5 典型任务约 -40%) |
| 编码叙事 | DeepSWE / FrontierCode / Codex 用量与缓存 | Terminal-Bench / FrontierCode / CursorBench 自报 |
| 安全叙事 | 继承 Astra 对齐;Astra 另有 Critical cyber 故事 | 生物/网络同级闸门 + 验证计划 + preserved thinking |
| 默认直觉 | OpenAI / Codex 栈:日常 Sol,批量 Luna,尖峰 Astra | Claude Code 栈:优先试 Opus 5.5 默认 effort |
coding agent 分档建议:
- 已在 Codex / ChatGPT Work:把默认编码档从 5.6 Sol 切到 6 Sol,用同一批仓库任务比合并率与美元;批量抽取/摘要走 Luna。
- 尖峰任务(难复现 bug、大型架构迁移、高失败代价):显式路由 Astra,并单独设预算帽。
- 多厂商:用任务类型路由,而不是品牌;两边新闻稿的「相对成本」都不要直接进财务模型。[1][2]
- 判断层可拆开:若用结构化决策模型做门禁/路由,换聊天旗舰不必重做判断层;见站内 Jev 文。[8]
为什么「双模型下放」和「单旗舰降价」不是同一招
把 OpenAI 与 Anthropic 同日动作说成「都在打价格战」太粗。机制不同:
- OpenAI:峰值(Astra)与规模化(Sol/Luna)拆档;降价发生在中低档,峰值仍单独售卖「最难项目」叙事。[1]
- Anthropic:用 一个 Opus 5.5 同时冲击「接近 Fable 的能力」和「相对旧 Opus 更便宜」;Fable / Mythos 仍以防护与验证计划区分用途,而不是简单的「便宜版旗舰」。[2]
对采购与平台组,这意味着路由表字段不同。OpenAI 栈常是「任务难度 → 三档模型」;Claude 栈常是「默认 Opus 5.5,敏感域看是否触发回退 / 是否申请验证」。混用两家时,不要假设对方的档位名称可以一一映射。
编码 agent:从「敢不敢做大」到「如何做大」
OpenAI 用内部研究者用量(中位 >7000/日,按 API 估值)说明一个转变:当 agent 会话以小时计、以仓库计,持续成本开始决定产品经理敢不敢把范围做大。[1] Sol/Luna 降价与缓存改进,直接作用于这个约束。
可落地的产品策略:
- 范围闸门与模型档位绑定。例如:单 PR、单服务 → Luna 或低 effort Sol;跨仓接口契约 → Sol;未知根因的生产事故 → Astra,并要求人工在场。
- 失败代价写入路由。事实性评测显示 Sol 在「曾出错过的对话」上错误减半,但仍提醒该集合偏难、非典型流量。[1] 对对外客户可见的答复,事实代价高,应偏向更高档或增加检索核对;对内部草稿,可用 Luna。
- 把「合并性」当验收,而不是「能编译」。FrontierCode 强调可合并性(测试质量、范围纪律、风格与仓库规范)。[1] 这与站内讨论 harness / 规范文件(如
AGENTS.md、技能)的方向一致:模型更强以后,规范与门禁的回报更高。 - 过夜任务的观察面。缓存命中、工具调用次数、是否拒答、是否静默改范围——四类指标比单一「成功/失败」更能解释账单与风险。
一周 A/B 剧本(Codex / API)
- 选 12 个近期真实工单:4 个机械、4 个模糊多文件、4 个需浏览或外部文档。
- 对照组:旧默认(如 5.6 Sol);实验组:6 Sol,effort 固定为你们的生产默认。
- Luna 另跑一条「只做摘要/抽字段」流水线,禁止它直接改生产代码,观察成本与错误率。
- Astra 只允许在实验组失败或人工升级时介入,并单独记账。
- 通过线示例:在美元 ≤ 旧默认 70%(反映腰斩后的预期)时,合并级完成率不下降;或完成率上升且人工编辑行数下降。
若腰斩后美元几乎没降,先查:是否默默升到 Astra、是否 Fast/高 effort 全开、是否缓存命中崩溃、是否重试倍增。
与 Claude Code / 站内文章如何衔接
本站读者大量使用 Claude Code,但同一批人也在评估 Codex 与双厂商路由。建议阅读顺序:
- 本篇:OpenAI 侧价位与分档;
- 姊妹篇:Opus 5.5 价位与防护;[2]
- Claude Code harness:结构与循环;
- Jev × Claude Code:判断层不要和聊天模型绑死。[8]
小米等开源模型动态见站内 MiMo 相关文,可作「第三选项」校准,但不在本篇展开基准对打。
沟通风格为什么也算「成本」
官方刻意展示 Sol 文风变短、变清楚。[1] 这对 agent 团队不是审美问题:
- PR 描述与会话日志若更短且结论前置,人工审计人时下降;
- 更少「听起来很能干但没检查过」的措辞,有助于降低虚假信心;
- 在多 agent 转发时,短而可核的状态同步比长散文更不易失真。
建议在验收里加一项主观但可操作的检查:抽 10 段工具轨迹,让未参与该任务的工程师根据模型自述复述「做了什么、没做什么」;复述失败率下降,才算文风改进兑现。
安全工程清单(Sol/Luna 发版周)
- 分档 ACL:哪些工作区允许 Astra,哪些只允许 Sol/Luna。
- 记录 model id:账单与审计按真实模型名聚合,避免「GPT-6」一锅炖。
- 拒答与降级告警:对齐改进不等于零拒答;把政策拒答从能力失败中拆出。[1]
- 蒸馏与提示注入:Sol/Luna 公告未展开与 Opus 5.5「preserved thinking」对等的集成破坏项;若你有改写历史上下文的代理层,仍应回归测试,不要假设行为与 5.6 完全相同。
- Critical cyber 意识:Astra 的 Critical 评级提醒——把峰值模型接到可写 shell、可装包的环境时,隔离与审批要比便宜档更严。[5]
和「只换模型名」相反的集成检查
不少团队会在发版日只改一行 model=。对 GPT-6 这一代,至少再检查五件事:
- effort 参数是否仍被旧封装吞掉。Sol/Luna 的对比大量建立在 high / xhigh / max 等档位上;若你的网关写死 medium,公告里的优势图与你无关。[1]
- 工具列表是否稳定排序。缓存断点与前缀复用依赖稳定前缀;动态插入工具会降低命中。
- 系统提示是否按用户维度拼接。每用户一段不同的长政策,会让「默认更高命中」难以兑现。
- 输出长度惩罚与截断策略。文风变短后,旧的「强制 2000 token 详解」模板可能在浪费钱。
- 评估集是否更新。沿用 5.6 时代的黄金集可以,但应单列「事实性敏感」与「合并性敏感」子集,避免平均分掩盖回归。
做完这五步,再宣布「我们已升级到 GPT-6」,才对财务与质量负责人都诚实。
实务清单
- 更新 API 模型名:
gpt-6-sol/gpt-6-luna;保留回退到 5.6 或 Astra 的开关。[1] - 打开缓存仪表盘,修「每轮重写系统提示 / 工具 schema」类命中杀手。
- 固定 10–20 个真实编码任务做 A/B(effort 档位写死)。
- 为拒答与策略降级打点,避免和「模型变笨」混为一谈。
- 与姊妹篇一起维护三档路由:Astra / Opus 5.5 / Sol–Luna。[2]
- 产品说明写清:Free/Go 桌面 Luna、付费 Work/Codex 的 Sol/Luna、Chat 是否已放量——以控制台为准,公告当日 Chat 尚未开放。[1]
未核实或刻意省略
- Astra 在 Sol/Luna 公告中的绝对美元标价未给出完整对照表,本文不编造 Astra 单价。
- 36氪 / 机器之心对照文中的部分竞品绝对价与单任务成本曲线,若未在 OpenAI/Anthropic 主公告核对,不写入结论。[9]
- YouTube 演示中的即时分数、社交媒体截图跑分:无独立复现则不引用。
- Crypto Cellar 文中「两天完成人类数周工作」为作者评价,保留为引用语境,不当作可迁移的 SLA。
- 不预测 Chat 全量开放时间表。
结语
GPT-6 Sol 与 Luna 的主线不是「再宣布一个世界第一」,而是 OpenAI 在 Astra 峰值之后,把同代方法与对齐进展铺到可规模化的价位,并用缓存基础设施把长 agent 会话的有效成本再砍一刀。[1] Astra 仍守最难项目;Enigma MVUEH 这类第三方记录提醒我们峰值档的研究型能力故事还在继续。[6] 对编码 agent 负责人,更有用的动作是:分档路由、修好缓存前缀、用自己的合并率与美元做验收——需要和 Claude 侧对照时,读姊妹篇。[2]
参考来源
[1] OpenAI, “Introducing GPT-6 Sol and Luna”, 2026-09-22. https://openai.com/index/introducing-gpt-6-sol-and-luna/
[2] 站内姊妹篇:Claude Opus 5.5. /cn/blog/claude-opus-5-5-price-and-performance/
[3] TechCrunch, “OpenAI launches GPT-6 Sol and Luna…”, 2026-09-22. https://techcrunch.com/2026/09/22/openai-launches-gpt-6-sol-and-luna/
[4] OpenAI, “GPT-6 Astra: A new generation of intelligence”. https://openai.com/index/gpt-6-astra/
[5] OpenAI, “Safety overview: GPT-6 Astra”. https://openai.com/index/safety-overview-gpt-6-astra/
[6] Crypto Cellar Research, “The MVUEH Break”, updated 2026-09-19. https://www.cryptocellar.org/bgac/the-mvueh-break.html
[7] OpenAI YouTube, “Introducing GPT-6 Astra…”. https://www.youtube.com/watch?v=1QNsdr-Qx_I
[8] 站内:Jev × Claude Code. /cn/blog/jev-claude-code-10x-and-25-lines/
[9] 机器之心 / 36氪欧洲站, 2026-09-23. https://eu.36kr.com/zh/p/3995195771588745(二次来源)