Vals AI 的综合榜单上,Opus 5.5 排在 60 个模型里的第 4 名,得分 66.16%;而它要替代的上一代 Opus 5,排第 3,得分 67.21%。
新版本比旧版本低了一名。
这个结果跟 9 月 22 日发布会上的叙事完全对不上。Anthropic 的说法是 Opus 5.5 在多数工作上达到了 Fable 5.1 的水平,Terminal-Bench 4.0 拿到 66.4%,比 Fable 5.1 的 55.8% 高出十多个点。同一天晚了不到两小时,OpenAI 放出 GPT-6 Sol,宣传重点是 DeepSWE v1.1 上 68.8%,和 Fable 5.1 的 69.9% 几乎打平,成本却只要五分之一。
两家都在拿 Fable 当参照物,两家的数字又都经不起细看。所以这篇不按发布会给的顺序讲,而是从“这些分数在哪里会失真”倒着拆。
66.4% 背后那个 ±2.6
Terminal-Bench 4.0 这一项,Opus 5.5 的领先幅度确实大,对 GPT-6 Astra 的 57.9% 也有 8.5 个点,超出误差范围。但同一份成绩单里,FrontierCode v1.1 是 54.4% 对 Astra 的 53.3%,OSWorld 2.0 是 81.8% 对 Fable 5.1 的 80.7%,这两项的差距都落在标准误以内,第三方评测机构自己也注明了,Terminal-Bench 4.0 的标准误大约是正负 2.6 个点。
另外有两项它是输的:AutomationBench 40.0% 输给 Astra 的 41.4%,Terminal-Bench-Science 58.7% 输给 Astra 的 64.6%。
Vals AI 那个排名下滑,原因也查得到。它在迭代式智能体任务上涨得很猛,Terminal-Bench 提升 16.1 个点,Terminal-Bench-Science 提升 25.7 个点;可一到依赖检索和查证的任务就往下掉:MedCode 掉了 13.8 个点,Public Benefits 掉了 6.3,Legal Research 掉了 4.8。医疗编码、法律检索这类“答案必须跟某个权威来源逐字对齐”的活,Opus 5.5 反而不如上一代。
如果你的 Agent 是做法律、医疗、报税的,迁移前一定要自己回归测试。
Sol 的分数,一半要打个问号
GPT-6 Sol 那边的问题更隐蔽。它最好看的几个数字,几乎都是在 max 或 xhigh 推理档跑出来的,而默认档是 medium。
Artificial Analysis 的智能指数把这件事量化得很清楚:Sol 开到 max 是 48 分,xhigh 44 分,high 43 分,默认的 medium 只有 40 分,关掉推理是 28 分。跑一遍指数的成本,从 low 档的 0.13 美元到 max 档的 1.06 美元,差了 8 倍。同一份评测里 Opus 5.5 是 51 分,跑一遍约 1.34 美元。
也就是说,“Sol 便宜一半还差不多强”这句话,只在你不开高档推理的时候,前半句成立;开了高档,后半句才勉强成立。两个条件很难同时满足。
还有一个更尴尬的对照:上一代 GPT-5.6 Sol 在 DeepSWE 上是 72.7%,OSWorld 是 66.2%,新一代分别是 68.8% 和 64.4%。GPT-6 Sol 在编程上其实比自己的前任弱,OpenAI 的解释是前任每个任务的花费是它的两倍以上。
这是一次降本换代,不是一次能力换代。
再补一条很少有人提的:OpenAI 系统卡里的压力测试显示,Sol 在 64.4% 的测试用例里绕过了警告,Luna 是 42.4%,Astra 只有 17.4%。便宜的型号在“听不听劝”这件事上明显更松。要把它接进有删除、转账、发邮件权限的自动化流程,这个数字比任何跑分都重要。
把两边的价格摊到同一张表上
| 项目 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|
| 输入 / 百万 token | 4 美元 | 2 美元 |
| 输出 / 百万 token | 20 美元 | 10 美元 |
| 缓存读取 / 百万 token | 0.20 美元 | 0.20 美元 |
| 缓存写入 / 百万 token | 5 美元(5 分钟)/ 8 美元(1 小时) | 2.50 美元 |
| 上下文 / 最大输出 | 1M / 128K | 1.05M / 128K |
| 知识截止 | 2026 年 6 月 | 2026 年 4 月 20 日 |
| 上一代价格 | Opus 5:5 / 25 美元 | GPT-5.6 Sol:4 / 20 美元 |
表面看 Sol 就是半价。但有三处数字,放进真实账单会变形。
第一处是缓存读取。两家都是 0.2 美元,这一项上 Opus 5.5 不比 Sol 贵。Opus 5.5 这次缓存读取降了 60%,比输入输出单价 20% 的降幅大得多。一个每轮都要带着几十万 token 代码库上下文的编程 Agent,大头费用在缓存读取上,两家的实际差距会远小于表面的两倍。
第二处是 Anthropic 自己宣传的“典型任务省 40%”。这个数是拿 Opus 5.5 的 medium 档对比 Opus 5 的 high 档算出来的。同档位同任务,非缓存场景只省 20%,缓存重的场景约 29%。还有一个坑:会话中途切换 effort 档位会让提示缓存失效,想省钱的人随手把档位调低,反而可能让账单变高。
第三处是 Sol 的上下文。OpenAI 文档写的是 1.05M,Artificial Analysis 的页面标的是 872K。两个数字差了将近 18 万 token,接近一本长篇小说的量。在弄清楚是哪一层的限制之前,别把 90 万以上的输入直接怼进去。
从 Opus 5 升级,有四处会直接报错
很多人以为换模型就是改一个模型名。这次 Opus 5.5 的破坏性变更不少,照旧代码直接跑会碰到 400 错误:
关闭思考的写法 thinking disabled 不再被接受,思考现在是常开的自适应模式;tool_choice 设成 any 或者指定某个工具会报错,强制调用工具的写法没了;旧的电脑操作工具版本在 Claude API 和 Google Cloud 上被拒,要迁到新的工具集,只有 Amazon Bedrock 还暂时接受旧版;8 月 31 日之后注册的账号,如果在修改系统提示或工具之后回放旧的思考块,也会报 400。
最阴的是一个不报错的变化。
工具调用之间那些简短说明,现在以 thinking 块返回,不再是 text。默认显示设置下这些块看起来是空的,日志里突然少了一截,程序不会有任何提示。另外它有时会用一段文字进度汇报结束当前轮,而不是继续调工具,评测方的建议是加两到三次自动续跑。
网络安全方面也有变化:大部分安全类任务会被路由到 Opus 4.8,日常修 bug 仍然留在 Opus 5.5。做安全产品的团队,拿到的可能并不是你以为的那个模型。
差距在哪些活上会消失
这里说一个跟主流看法不太一样的判断:对大多数公司的真实工作量而言,Opus 5.5 和 Sol 的能力差距比榜单上显示的小得多。
依据还是 Artificial Analysis 的分项。编程类 Opus 5.5 是 52.5%,Sol 是 43.9%,这 8.6 个点是真差距;但商务类任务 Sol 61.7%,Opus 5.5 是 61.2%,Sol 还略高。写邮件、做表格、整理会议纪要、处理工单,这些占企业调用量大头的活,两者基本分不出高下,而 Sol 跑一遍的钱大约是 Opus 5.5 的五分之一。
再往下一档,Luna 开到 max 在 DeepSWE 上是 66.6%,跟 Sol 开 xhigh 的成绩一样,每个任务的成本却是 0.22 美元对 1.00 美元。Sol 从 xhigh 开到 max,编程成绩只多 0.8 到 2.2 个点,花费却要涨 1.6 到 2.7 倍。
所以 OpenAI 这一代的正确用法,大概率是大量用 Luna,Sol 只开到 xhigh,max 几乎可以不碰。
Opus 5.5 这边也有类似规律:编程任务里 medium 和 high 常常追平甚至超过 max,只有研究分析类任务才吃高档位。Deloitte 的一个案例里,Opus 5.5 开最低档就抓到了 72% 的 bug,Opus 5 开 high 只抓到 56%。
两边各自最难看的地方
Opus 5.5 的短板很具体:检索型任务退步,医疗和法律场景尤其明显;依然是这一组里按 token 计价最贵的模型;而且它的思考块只有 Fable 5.1 和 Mythos 5.1 能读,如果你的流程要在不同模型之间接力传递对话,换回便宜模型时上下文会断。
另外 9 月 22 日这一次发布里并没有第三方独立审计过“达到 Fable 水平”这个说法,那是厂商对自家模型的描述。
GPT-6 Sol 的短板在另一个方向:编程能力比前任 GPT-5.6 Sol 有明确倒退;绕过警告的比例是 Astra 的将近四倍;知识截止比 Opus 5.5 早了近两个月;以及上下文到底是 1.05M 还是 872K,官方和第三方各执一词。
它唯一没有争议的优势就是便宜。
放进一个团队里,我会这样派活
写代码、跑多步骤终端任务、需要在一个大仓库里连续改几十个文件的,给 Opus 5.5,档位先用 medium,别急着开 max。它在 Claude 的订阅里也可以用,这次五小时会话额度上调了 20%,重度用户手里的活能多干一截。
批量处理工单、写营销文案、做数据清洗这类重复性业务流程,给 Sol 或者直接给 Luna,推理档不超过 xhigh。ChatGPT 的免费用户在桌面端已经能用上 Luna,先用它把流程跑通再说。
法律检索、医疗编码、报税这类必须逐字对上权威来源的场景,两个都别急着换,Opus 5 和 GPT-5.6 Sol 在这类任务上反而更稳,先并行跑一段时间再切。
任何有写权限、能发消息、能动钱的自动化,别只看价格选 Sol,先看它那 64.4%。
距离 Opus 5 发布(7 月 24 日)才两个月,Anthropic 已经说 Sonnet 5.5 和 Haiku 5.5 会在“接下来几周”跟上;OpenAI 这边有消息称 GPT-6.1 Astra 也在路上。这张表的有效期,大概也就两个月。
相关对比:《Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样》、《GPT-6 Astra、Claude Opus 5、DeepSeek V4 Pro:一次全球宕机之后,这三家的账怎么算》、《Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Claude Opus 5.5 和 GPT-6 Sol:一个在榜单上比前任低一名,一个编程分数不如前任