Claude Opus 5.5:降价近四成,旗舰性能怎么选

发布于 2026年9月24日 作者 Remy

2026 年 9 月 22 日,Anthropic 发布了 Claude 5.5 系列的首款模型 Claude Opus 5.5。[1] 官方叙事很直接:多数工作达到 Claude Fable 5.1 的水平,相对 Opus 5 在典型负载上大约便宜 40%,输出更快,并且在自家行为审计里拿到迄今最好的分数。同日稍后,OpenAI 放出 GPT-6 Sol 与 Luna;两家几乎贴着发,读者天然会拿它们对照。姊妹篇见 GPT-6 Sol、Luna 与 Astra。[2]

本文只写 Opus 5.5,尽量站在「你要不要把 coding agent 的默认模型切过去」这一侧:价格怎么算、官方基准说了什么、安全限制会卡哪些真实工作、以及和站内既有 Claude Code / agent harness 文章怎么衔接。数字一律优先核官方页面;二级稿只作背景,不硬造未核价格。

发布窗口:为什么这次值得单独写

过去一年,模型发版越来越像「能力 + 单价 + 防护」三件套。Opus 5.5 的特别之处在于三件事叠在一起:

  1. 定位上抬:Anthropic 明确写,它在多数工作上达到 Fable 5.1 水准,同时是 Claude 5.5 家族的第一枪;Sonnet 5.5 / Haiku 5.5 将在随后几周跟上。[1]
  2. 单价与任务成本双降:百万 token 标价相对 Opus 5 小幅下调,但缓存读价降幅更大;再叠加「同样任务用更少 token / 更少步数」,官方测试里典型负载总成本约降 40%。[1]
  3. 安全叙事更硬:这是 Anthropic 在 CEO 呼吁「放缓前沿节奏、让安全追上能力」之后的首次正式发版;外部评测方包含 Frontier Design 与 METR,并配套与 Fable 5.1 同级的生物与网络安全防护。[1][3]

对日常跑 Claude Code、长时间改仓库的团队,这不是「又一个榜单涨点」的新闻,而是默认模型、预算上限和失败回退策略都可能要改的节点。站内此前写过 Claude Code 的 harness 结构Jev × Claude Code 落地路径;本篇补的是模型层的价格与限制,不重复安装与技能接入细节。[4][5]

TechCrunch 也点出节奏:距 Opus 5(2026-07-24)大约两个月再发旗舰;同日与 OpenAI 发版几乎贴身,竞争信号很强,但读者仍应以官方参数与自家账单为准,而不是标题里的「谁赢了」。[3]

价格:先看表,再看「做完一件事」

官方给出的每百万 token 价格如下:[1]

项目Claude Opus 5.5Claude Opus 5
缓存读(cache reads)$0.20$0.50
输入$4$5
输出$20$25
缓存写(cache writes)$5$6.25

另有 Fast mode(Claude Code 与 Claude Platform):输入 8/百万、输出8 / 百万、输出 40 / 百万,官方称最高约 2.5 倍速度。[1]

只看输入输出,降幅大约是 20%。真正拉开差距的是两点:

  • 缓存读降 60%。Agent 与 coding 工作里,反复读上下文、工具结果、仓库片段的「缓存读」往往是账单大头;Anthropic 也明示,缓存读构成多数 agentic / coding 成本主体。[1]
  • 完成同一任务所需 token 与步数更少。官方写法是:单价更低 + 每任务 token 更少,合起来典型负载约降 40%;输出速度相对 Opus 5 提高超过 30%。[1]

因此选型时不要只比「每百万多少钱」。更贴近工程的问题是:一次过夜迁移、一轮多仓审计、一次 Cursor / Claude Code 长会话,做完要花多少钱、要不要人盯着返工。OpenAI 同日也在强调 per-task 成本;两家口径一致,说明市场已经从「峰值智力」转向「单位任务成本」。[2][6]

订阅面:Anthropic 表示 Pro / Max / Team / 按席位企业计划的五小时用量上限会提高,并提供可自行选择时机使用的速率限制重置。[1] 具体额度以控制台为准;本文不臆造数字。

API 模型标识为 claude-opus-5-5,已在 Claude Platform 以及 AWS、Google Cloud、Microsoft Azure 上线。[1]

一个可复现的粗算框架(用你自己的 trace)

下面不是官方公式,而是把公告里的成本结构落成可检查步骤,避免「听起来便宜、月底账单没变」:

  1. 从现有 Opus 5(或当前默认)日志抽出最近 20 个已完成的 agent 任务,记录:输入 token、输出 token、缓存读、缓存写、墙钟时间、是否人工返工。
  2. 用上表单价重算一版「若单价变成 5.5、用量不变」的对照账单——这是纯标价效应
  3. 再假设输出与非缓存输入各减少 20%–40%(来自官方「更少 token / 更少步数」方向,不是保证),得到效率效应区间。
  4. 把 Fast mode 单独列一列:只对「人在等」的交互路径加价换速度,不要默认全开。
  5. 把「防护回退到 Opus 4.8」的任务单独记账:回退成功仍算业务完成,但模型名与单价可能已变,混在总账里会误判 5.5 的性价比。

若第三步的乐观假设下仍不够便宜,问题多半在 harness(无效重试、上下文抖动、工具描述每轮重写),而不是模型没降价。这和站内讨论 Claude Code harness 时的结论同向:模型只是账单的一部分。[4]

官方基准:能信什么,不能信什么

Anthropic 放出一张对照表,涵盖 Opus 5.5、Fable 5.1、Opus 5,以及他们引用的 GPT-6 Astra、GPT-5.6 Sol(部分条目)。节选如下(完整脚注见官方页):[1]

评测Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.0(agentic coding)66.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 Main54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%41.7%
GDPval-AA v2.1(知识工作 Elo)18461735170815421588
AutomationBench(Zapier)40.0%31.4%26.9%41.4%28.8%
Humanity’s Last Exam(含工具)67.7%65.6%63.6%57.2%
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
OSWorld 2.0(partial)81.8%80.7%74.0%

读这张表时建议带着三项官方脚注:

  1. effort / harness 不一致。例如 Terminal-Bench 4.0 上 Opus 5.5 取 xhigh、Astra 取 OpenAI 公布的 high;不同 harness 与试验次数会带来噪声。官方还给出 Terminal-Bench 上 Opus 5.5 约 ±2.6 个百分点的标准误量级提示。[1]
  2. 生产防护会拖分。官方写明:评测开启生产级防护;网络安全任务被拦截时由 Claude Opus 4.8 接手,生物与前沿 LLM 开发类任务由 Opus 5 接手——这会压低 Opus 5.5 在相关基准上的表观分数。[1]
  3. AutomationBench 无回退时更严。Zapier 跑分若把防护介入视为失败、且无回退模型,分数会低于实际业务里「回退后仍能完成」的体验;表中 Astra 在 AutomationBench 上仍高于 Opus 5.5(41.4% vs 40.0%)。[1]

Anthropic 自己也承认:能力到了这一档,榜单分差不如真实工作差异可靠;他们内部使用中,Opus 5.5 与 Fable 5.1 的体感差距比分数暗示的更窄。[1] 这和读者经验一致:长仓库迁移、模糊需求的多文件改动、是否需要人反复纠正,往往比一两个百分点更能决定「值不值得换」。

成本效率方面,官方强调若干相对结论(仍以官方页为准,不擅自换算绝对美元):[1]

  • FrontierCode 默认 effort 下,相对 GPT-6 Astra 约以每任务 约五分之一成本 取胜;
  • Terminal-Bench 4.0 上以约 40% 成本 追平 Astra;
  • CursorBench 上相对 GPT-5.6 Sol 高出约 11 个百分点,成本约三分之一。

这些都是厂商自报对照。交叉阅读时请同时打开 OpenAI 的 Sol/Luna 公告:对方会挑自己占优的 AutomationBench、DeepSWE、OSWorld 切片来讲「更便宜」。[2] 同一天两份新闻稿,不是同一份独立复现报告。

反例:什么时候「更高分」反而更贵、更糟

官方与二次报道都提到一类现象:提高 test-time compute / effort,不一定单调提升 FrontierCode 一类强调「改动范围纪律」的分数——模型可能多改无关文件,被评分惩罚。[1][6] 对工程团队,对应踩坑是:

  • 把所有任务默认拉到 max effort,会话变长、账单上升,合并质量却更差;
  • 用「单次最高分」的演示配置去估生产预算;
  • 忽略防护介入:表面上「失败」,其实是策略切模型,你却据此认定 5.5「不会做安全相关活」。

更稳的做法是:按任务类型固定 effort 档位(日常 medium、疑难再升),并在报表里分开「能力失败 / 策略回退 / 人工改需求」三类。

编码与长任务:早期测试者在说什么

官方案例里,编码向信号集中在「更长、更散、更少返工」:

  • 一名测试者用其完成约 68 万行 代码迁移,耗时不到一天;同类工作若靠工程团队可能要数周。[1]
  • 另一例:约 20 万行 代码库审计与修复,Opus 5.5 不到 3 小时,Opus 5 超过 20 小时且 token 用量约 2.5 倍。[1]
  • 内部把 HAProxy 从 C 译到 Rust:两者几乎都通过原回归测试,但 Opus 5.5 用时 9.5 小时、相对 Fable 5.1 的 12 小时更短,成本约低 51%。[1]
  • 网页性能:要求压低整站各页加载时间时,Opus 5.5 在 40 次里成功 39 次;Opus 5 改进幅度更小,且有时改变应用行为。[1]
  • GitHub、Lovable、Kiro、交易与咨询客户等提供了「更少步数 / 更少 token / 过夜无人值守」类反馈;这些是厂商挑选的背书,适合当作假设,不适合当作你仓库的保证。[1]

对 coding agent 负责人,可落地的解读是:

  1. 默认 medium effort 可能就够。官方文案多次强调默认设置下的性价比;把一切拉到 max 不一定更划算。[1]
  2. 长会话的账单结构变了。缓存读降价 + 更短轨迹,意味着「挂一夜」的边际成本下行;但你仍要管好工具循环、日志与人工验收门禁。
  3. 文风改善会影响审查成本。官方用大量篇幅对比 Opus 5 与 5.5 的说明方式:更先讲结论、更少行话。对依赖 PR 描述与会话记录做审计的团队,这会直接减少「读模型废话」的时间。[1]
  4. 「最安全的编码 agent」是产品组合拳。公告还提到动作前分类器、可审计的开源沙箱、合并前代码审查,以及在 Gray Swan 等评测中与 Fable 5.1 并列的低提示注入成功率。[1] 模型分只是其中一层。

若你已经在用 Claude Code,可把本次发版当成一次 A/B:同一批真实任务,固定 harness,比完成率、返工轮次与美元成本,而不是只看公开榜。站内 harness 文讨论的是结构;本篇补充的是换模型时的计量口径。[4]

建议的一周验收剧本(可直接抄)

目标:决定「默认模型是否切到 claude-opus-5-5」,而不是收集观感。

  1. 选任务池:8 个机械迁移 / 依赖升级;6 个多文件模糊需求;4 个需要读外部文档的集成修复;2 个故意越权或敏感安全探针(用于观察防护,而非追求越狱)。
  2. 固定变量:同一仓库快照、同一系统提示与工具集、同一 effort 起点(建议 medium)、禁止中途换模型(除非记录为回退事件)。
  3. 记录字段:是否一次合并级完成、人工编辑行数、工具调用次数、缓存读占比、美元、是否触发安全回退。
  4. 通过线(示例):在美元不高于旧默认的 90% 时,合并级完成率不低于旧模型;或完成率持平但人工编辑行数下降 30% 以上。按你们的风险偏好改数字。
  5. 失败归因:区分「不会做」「做了但风格不符」「策略回退」「评测任务设计有坑」(例如指令本身有错、模型指出了——官方也有金融评测里纠错指令的例子)。[1]

知识工作与沟通:编码之外的两条线

Opus 5.5 不只是 coding 模型。官方知识工作侧信号包括:

  • 在「财报难找」的模拟网页上写季度报告,自动评分核对数字与引文:18 份里 16 份过线;Fable 5.1 与 Opus 5 在相同设定下未过线。[1]
  • GDPval-AA v2.1 上 Elo 1846,高于 Fable 5.1 的 1735 与 Opus 5 的 1708;并称默认 effort 下相对 max effort 的 Astra 仍有成本优势叙事。[1]
  • 并购财务模型 + 高管演示:与 Opus 5 结论相近,但 5.5 更完整、更易读,用时 63 分钟对 93 分钟,成本约低 50%。[1]

沟通侧是 Opus 5 用户抱怨集中的区域。官方并排示例显示:5.5 更早给出「额外跌幅来自计费重构 bug」这类结论句,结构更适合给经理看的摘要。[1] 对 agent 团队,这意味着:同样一次工具轨迹,后人审查与交接的成本下降——这是隐性人时,很少出现在 token 账单里,却常出现在「我们不敢让 agent 过夜」的决策里。

安全与限制:旗舰能力伴随同级闸门

Anthropic 写明:Opus 5.5 在生物与网络安全能力上可与 Claude Mythos 5.1 相比,因此采用与 Fable 5.1 相近的防护。[1]

要点整理(细节以 System Card 与帮助中心为准):

  • 网络安全:多数网络安全类任务会透明回退到 Opus 4.8;常规开发生命周期里的找 bug / 修 bug仍可用。面向防御方的 Cyber Verification Program 将扩展到 Opus 5.5,并含更宽松的受信层级;Claude Security 已可搭配 Mythos 5.1。[1]
  • 生物:走与 Fable 5.1 相同的生物防护;受阻的研发可通过 Life Sciences Verification Program 申请,面向经过核验的学术实验室、初创与药企等。[1]
  • 蒸馏防护:引入此前在 Fable 5.1 上的 preserved thinking,阻止 API 用户通过改写先前上下文来抽取推理;适用于 2026-08-31 及之后新建的 API 账号对相关模型的使用。[1]
  • 对齐评测:自动化行为审计覆盖近两千场景,官方称多项错位行为指标好于近期 Claude;在新的「越界」评测中,试图绕过边界的频率相对 Opus 5 / Mythos 5.1 约低 85%,且尝试多为低严重度并自我报告。[1]
  • 诚实的局限:官方承认模型常能察觉自己在被评测,这削弱对真实部署行为的外推;解释性监测仍在建设中。他们同时在收紧强化学习环境过滤、改进对齐奖励与自动化场景生成。[1]
  • 其他:支持零数据留存(与以往 Opus 一致);配合欧盟 AI 法案的水印措施;不再支持关闭 thinking 模式。[1]

对工程团队的实际含义:

  • 若你的 agent 会碰漏洞研究、攻防演练、生物序列设计等,先确认是否会触发回退,并设计「回退后任务是否仍成功、如何记账」的路径。
  • 若你主要做产品代码、迁移、评审、知识工作,防护更多体现为「边界更稳、更少擅自做难逆操作」,与自动化无人值守场景直接相关。[1]
  • 若你维护代理层或多租户 API,注意 preserved thinking 对「改历史上下文」类集成的破坏性;官方提供帮助中心说明与文档。[1]

TechCrunch 的报道与官方一致:同级防护限制了在已编译程序中挖利用、以及可识别生物武器相关工作等用途;并指出这是 Amodei 呼吁 pacing 之后的首发。[3]

和「只看标价」相反的三类账单陷阱

发版周最常见的误判,不是读错官方表,而是把三种完全不同的钱混在一张图里:

  1. 标价下降 vs 用量上升。五小时额度提高、速率重置可用,可能让团队更敢开长任务;单价降了,总支出仍可能升。应用「每成功合并 / 每关闭工单」做分母,而不是只看日消耗美元。
  2. Fast mode 渗漏。交互式路径需要速度时开 Fast mode 合理;若 CI 里的批量 agent、夜间迁移也走 8/8/40,会把「旗舰变便宜」的叙事抵消掉。配置上应让 Fast mode 成为显式选择,而不是全局默认。[1]
  3. 多云与代理加价。模型在 AWS / GCP / Azure 上线后,云市场与自建代理常有自己的计价与最低消费;以 Anthropic 主站表做预算,却在别的通道下单,会出现「对不上公告」的假矛盾。[1]

这三类陷阱与模型智力无关,却最容易在发版后两周的财务会上变成「你们不是说便宜 40% 吗」。提前把分母与通道写进验收剧本,比再贴一张基准表有用。

和 GPT-6 家族怎么对照(本篇独立结论)

姊妹篇展开 Sol / Luna / Astra。[2] 这里只给 Opus 5.5 读者够用的对照框架,避免两篇互相重复灌水:

维度Opus 5.5(本篇)GPT-6 侧(摘要)
角色Anthropic 新一代旗舰 Opus;对标 Fable 级能力、Opus 级价位带Astra 为峰值;Sol/Luna 把同代能力铺到更低价位
标价信号相对 Opus 5:输入/输出约 -20%,缓存读 -60%;典型任务约 -40%Sol/Luna 相对 5.6 促销价 API 降 50%(Sol 2/2/10,Luna 0.10/0.10/0.50)[2]
编码叙事Terminal-Bench / FrontierCode / CursorBench 自报领先或高性价比DeepSWE、FrontierCode、Codex 用量与缓存命中
安全叙事生物/网络同级闸门 + 验证计划 + preserved thinkingAstra 已单独强调对齐与 Preparedness;Sol/Luna 继承对齐改进
选型直觉Claude 栈、长仓库、要稳的默认旗舰要峰值选 Astra;要量大、便宜迭代选 Sol/Luna

怎么选(coding agent):

  1. 已经在 Claude Code / Anthropic API 上:优先在真实任务上试 Opus 5.5 默认 effort;把缓存命中、步数、返工写进报表。生物/网络敏感工作先跑一遍触发测试。
  2. 多模型路由:高峰智力用 Astra 或 Fable 档,日常迭代用 Sol / Opus 5.5;用任务类型与失败代价路由,而不是品牌忠诚。
  3. 不要用对方新闻稿里的「相对成本」直接做预算:harness、effort、是否含回退费用都不透明;以你自己的 trace 账单为准。
  4. 和判断层拆开:若你用 Jev 一类结构化决策模型做路由/门禁,换旗舰聊天模型不必重做判断层;边界见站内 Jev 文。[5]

机器之心 / 36氪同日对照文把这场发布概括为「单位任务成本」战争,并引用 Anthropic 与 OpenAI 官方链接;其中部分 Fable 标价与内部成本曲线来自二次整理,本文未把未在 Anthropic 本品页核实的 Fable 绝对标价写进结论表。[6]

实务清单:这周可以做什么

  1. 改默认模型标识claude-opus-5-5,保留一键回退 Opus 5 / Sonnet 的开关。[1]
  2. 固定 10–20 个真实任务(迁移、评审、多仓接口、模糊产品需求),记录:成功率、人工介入次数、美元、墙钟时间。
  3. 打开缓存与 prompt 结构检查:缓存读降价后,前缀稳定性、工具描述是否频繁抖动,会直接影响账单。
  4. 为防护回退写告警:区分「模型能力不足」与「被安全策略切到 Opus 4.8」。
  5. 同步产品与法务:零数据留存、水印、thinking 不可关,可能影响既有集成假设。[1]
  6. 和姊妹篇一起做路由表:峰值 / 日常 / 高吞吐三档,分别绑 Astra、Opus 5.5、Sol/Luna。[2]
  7. 沟通规范:若团队靠会话记录做审计,抽查 5.5 的说明是否真的「结论前置」;把这当成验收项,而不是营销句子。

未核实或刻意省略的说法

  • YouTube 演示片、社交平台截图中的即时跑分,若无官方或可复现仓库,本文不引用具体分数。
  • 二级稿提到的 Fable 5.1 绝对美元标价、以及「medium 约 0.8/max0.8 / max 约 6.19」一类单任务成本曲线,因本稿未能在 Anthropic Opus 5.5 主公告中逐条核对到相同表格,不写入正文结论;读者应以 Anthropic 定价页与控制台为准。
  • 「680k 行一天迁完」等为厂商早期测试者叙述,环境不可复现,只作能力方向信号。
  • 本文不预测 Sonnet 5.5 / Haiku 5.5 的具体日期与价格。
  • HN 上的高赞评论与传闻(例如未证实的后续 Fable 发版日程)一律不当作事实。

结语

Opus 5.5 的故事不是「又一个第一」,而是 Anthropic 试图把 Fable 级能力 放进更可规模化的 Opus 价位与速度,同时用更严的生物/网络闸门和验证计划兑现「放缓前沿」的安全叙事。[1][3] 对跑 coding agent 的人,下一步很具体:用自己的任务量一下默认 effort 的完成率与美元,再决定要不要把旗舰默认切过去;需要和 OpenAI 侧对照时,请读姊妹篇,而不是只看同一天的标题矩阵。[2]

参考来源

[1] Anthropic, “Claude Opus 5.5”, 2026-09-22. https://www.anthropic.com/claude-opus-5-5
[2] 站内姊妹篇:GPT-6 Sol、Luna 与 Astra. /cn/blog/gpt-6-sol-luna-and-astra/;OpenAI 原文见该篇引用。
[3] TechCrunch, “Anthropic releases Opus 5.5 with lower prices and Fable-level performance”, 2026-09-22. https://techcrunch.com/2026/09/22/anthropic-releases-opus-5-5-with-lower-prices-and-fable-level-performance/
[4] 站内:Inside Claude Code agent harness. /cn/blog/inside-claude-code-agent-harness/
[5] 站内:Jev × Claude Code. /cn/blog/jev-claude-code-10x-and-25-lines/
[6] 机器之心 / 36氪欧洲站转载对照, 2026-09-23. https://eu.36kr.com/zh/p/3995195771588745(二次来源;价格与基准以 [1] 与 OpenAI 官方页为准)