Gemini 4 Argon、Claude Opus 5.5、GPT-6.1 Sol:和 Sol 标价相同的 Argon,每道题贵出 2.7 倍,多数人还调不出来
Endor Labs 让 Codex 把同一套 179 道安全编码题跑了几遍,发票上的数字是:GPT-6 Astra 468 美元,GPT-6 Sol 104 美元。换成 9 月 29 日发布的 GPT-6.1 Sol,Azure 那边还没出账,按标价估算是 70 到 85 美元。能力上,6.1 Sol 的安全解题率 34.1%,Astra 34.6%,差半个点。
花五分之一的钱,拿到几乎一样的分。
我想拿这套题对一下另外两家。结果 Claude Opus 5.5 能跑,按 4 美元输入、20 美元输出的单价,账单好看不了;Gemini 4 Argon 根本调不起来。10 月 1 日有人在 Gemini API 的模型列表里逐个数过,61 个模型,没有一个叫 argon,直接请求返回 404。
所以这篇三方对比里,有一方绝大多数人只能看纸面,我会把实测和发布会表格分开讲。
一张账单上缺了一个名字
三家的发布时间挤在 9 天里:Opus 5.5 是 9 月 22 日,GPT-6.1 Sol 是 9 月 29 日 DevDay,Argon 是 9 月 30 日。
但”发布”在三家嘴里不是一回事。Opus 5.5 当天就进了 API、claude.ai 和 Claude Code,是 Claude Code 现在的默认模型。GPT-6.1 Sol 开放给 Plus 及以上的付费用户,入口却只有 ChatGPT Work 和 Codex,普通的 ChatGPT 聊天界面里暂时选不到它。Argon 的首批用户是美国政府和谷歌 Fairwind 计划里的网络安全防御方,谷歌说下一步给付费 API 客户和 AI Ultra 订阅者,没给日期。月付 99.99 美元的 Ultra 订阅页上,旗舰写的还是 3.1 Pro。
就连能用的那两家也不稳。10 月 3 日起,有人在 Codex 里用 ChatGPT 账号登录、选 gpt-6.1-sol,拿到一条 400 错误,提示”用 ChatGPT 账号时不支持该模型”,套餐明明在资格范围内,原因至今没有官方说法。10 月 6 日轮到 Claude,Opus 5.5 的请求错误率升高,claude.ai、API、Claude Code 一起受影响,当天修复。
今天还有消息在传:谷歌内部在测后续代号 Carbon,员工说它写代码堪比 Opus 5.5,早期 Argon 约等于 Opus 5。我没找到一手出处,只当风向听。真是这样,Argon 还没开放就成了过渡款。
纸面上的 Argon,和第三方量出来的 Argon
谷歌发布会那张表列了 19 项基准,Argon 赢了 14 项、平了 1 项。几个最抢眼的:Vals Index 68.9%,Opus 5.5 是 67.0%;DeepSWE v1.1 是 77.9%,Opus 5.5 是 74.2%;Harvey 的法律代理测试 19.6%,Opus 5.5 只有 3.8%;长上下文的 GraphWalks 256K 到 1M 区间是 84.2%,Opus 5.5 是 66.8%。
小字里有个细节:DeepSWE 那一项,Argon 用的是谷歌自己的 mini-swe 框架,对手分数取自公开榜单和系统卡。脚手架不同,这 3.7 个点的领先不能照单全收。
输的几项反而更说明问题。Terminal-Bench 4.0 上 Argon 57.4%,Opus 5.5 是 66.4%,落后 9 个点;FrontierSWE v2 是 55.0%,GPT-6 Astra 65.5%。都是要在终端里长时间来回操作的编程活。
Artificial Analysis 拿到了测试权限,独立跑了一遍。它的智能指数给 Argon 53 分,排 227 个模型里的第 8;GPT-6.1 Sol 开到 max 是 52 分,第 11;Opus 5.5 是 58 分,排第一。Terminal-Bench 4.0 在它的环境里是 Opus 5.5 60%、Astra 59%、Argon 57%、6.1 Sol 56%,Opus 5.5 的 9 个点领先缩成了 3 个点。
厂商自测放大优势不新鲜,新鲜的是方向:被挤掉水分最多的,是 Opus 5.5 自报的 66.4%,AA 测出 59.6%。
单价一样,按题算差了 2.7 倍
Argon 首发价是每百万 token 输入 2 美元、输出 10 美元,缓存输入便宜 95%,0.10 美元。这串数字和 GPT-6.1 Sol 一模一样,很多人看到这里就以为两家打成了平手。
问题在话多。
AA 跑完整套指数,Argon 一共吐出 1.1 亿个输出 token,全部模型的中位数是 8200 万;平均每道题约 6.2 万个输出 token,Astra 只要 2.7 万。摊到每题成本,Argon 首发价 1.99 美元,6.1 Sol 是 0.72 美元,单价相同,实际差 2.7 倍多。谷歌提过它在监控 Argon 的思维链,这会拖慢输出。
首发价还有保质期。谷歌只说之后涨到 4 美元和 20 美元,没说哪天涨,AA 的说法是”至少一个月”。涨完之后每题 3.98 美元,比 GPT-6 Astra 的 3.26 美元还贵。
Opus 5.5 的问题同源,而且更重。AA 页面上它跑一遍指数用掉 2.6 亿个输出 token,每题 5.98 美元,是 6.1 Sol 的 8 倍多。Anthropic 发布时说 Opus 5.5 比 Opus 5 便宜 40%,这个数是在默认档、”典型负载”下算的;AA 在 max 档量到它每题约 11.9 万输出 token,Opus 5 是 7.3 万,单价降了 20%,量涨了 60%,最后每题成本和 Opus 5 持平。
把三家的关键账目放在一起:
| Gemini 4 Argon | Claude Opus 5.5 | GPT-6.1 Sol | |
|---|---|---|---|
| 输入 / 输出(美元/百万 token) | 首发 2 / 10,之后 4 / 20 | 4 / 20 | 2 / 10 |
| 缓存输入 | 0.10(首发期) | 0.20 | 0.10 |
| 长输入加价 | 未公布 | 1M 内不加价 | 超 27.2 万整单按 4 / 15 |
| 单次最大输出 | 1M | 128K | 128K |
| AA 智能指数 | 53 | 58 | 52(max) |
| AA 每题成本 | 1.99(首发价) | 5.98 | 0.72 |
| AA 输出速度 | 未公布 | 96.4 tok/s | 55.6 tok/s(max) |
表里最容易漏看的是长输入那一行。
GPT-6.1 Sol 的输入一旦超过 27.2 万 token,第三方价格表的写法是整个请求都按长上下文价收:输入 4 美元、输出 15 美元,不是只对超出的部分加价。往一个 30 万 token 的代码仓库里问一句话,输入费直接翻倍。Opus 5.5 在 1M 窗口内不分档,同样塞 30 万 token,它和 Sol 的输入单价就打平了。Argon 在这件事上什么都没公布,要等真开放了再看。
缓存这一行也变过。上一代 GPT-6 Sol 缓存读取是 0.20 美元,和 Opus 5.5 一样;6.1 Sol 砍到 0.10 美元。Endor Labs 那次测试里,6.1 Sol 约 94% 的输入命中缓存,编程代理的账单主要由缓存价决定,这一刀砍在了要害上。
10 月 8 日 OpenAI 又给 6.1 Sol 加了 Ultrafast 档,最快每秒 300 个 token,API 价格是标准档的 6 倍:输入 12 美元、输出 60 美元,缓存输入 0.60 美元,缓存写入 15 美元;输入超过 27.2 万 token 时变成 24 美元和 90 美元。输出单价因此是 Opus 5.5 的 3 倍,而在 Codex 里只有每月 500 美元的 Pro 档能开。
安全这件事,三家走到了三个方向
这是我觉得这一轮最有意思、也最少人提的地方。
谷歌把 Argon 先给了网络安全防御方。它在 CWE-bench v1 上 68%,跟 Astra 并列第一,Opus 5.5 是 67%;谷歌还说内部用它把 Fuchsia 的 Zircon 内核 80 多万行 C/C++ 迁到了 Rust。最强的模型,第一批用户就是做安全的。
Anthropic 反过来。Opus 5.5 的生物和网络安全能力被评到了和 Mythos 级模型同档,所以上了同一套防护:写漏洞利用、扫二进制漏洞、做渗透测试这类请求,被分类器识别出来后会回落给 Opus 4.8 处理。官方用的词是”透明”回落,调用方未必知道这一轮是谁答的。分类器看的也不只是你那条消息,读进来的文件、搜索结果、记忆都算,上下文里有一段 PoC 代码就可能触发。
做安全产品的团队用 Opus 5.5,花的是 Opus 5.5 的钱,拿到的可能是上上代的能力。修普通 bug、扫源码漏洞不受影响,这条线卡在”进攻性”三个字上。
OpenAI 是第三种。原定 10 月和 6.1 Sol 一起发的 GPT-6.1 Astra 被撤了,华尔街日报的说法是内部测试里它欺骗倾向更高、更容易不问用户就往下做。上线的 6.1 Sol 在”绕过明确限制”这项压力测试里是 23.5%,比上一代 GPT-6 Sol 的 64.4% 好了一大截,但仍比 Astra 的 17.4% 松。
Gray Swan 的间接提示注入测试里,Argon 被攻破 0.7%,Opus 5.5 是 1.0%,Astra 8.5%。6.1 Sol 不在名单上,我不替它下结论。
一个和主流看法相左的判断放在这里:都说 Opus 5.5 是安全研究的首选,我觉得眼下恰恰相反。做防守方漏洞分析、需要让模型真去写 exploit 验证的,Opus 5.5 的回落机制会让结果不可复现,同一个任务这次是 5.5 答、下次是 4.8 答。等 Argon 对付费 API 开放,这类活大概率会先流走一批。
15% 的幻觉率,换来的是少答对的题
Argon 在 AA-Omniscience 上的幻觉率只有 15%,Astra 是 51%,6.1 Sol 是 54%。Hacker News 发布帖 1200 多分、近 800 条评论,这个数字是被夸得最多的一处。
另一半很少有人转:Argon 的准确率是 50%,Astra 是 63%。它少编,是因为它更常说”不知道”,不是因为它知道得更多。
这对两类人意味着不同的东西。做客服知识库、法规问答,答错比不答代价大,这种性格是优点;做调研初稿、头脑风暴,它的保守会让你多跑几轮。同一个帖子里也有人泼冷水:在 AA 上比 Opus 5.5 低 5 分,还发一个大家用不了的模型。
三家各自栽过的跟头
Opus 5.5 的跟头摔在”想太多”。Simon Willison 试过一次 max 档任务,模型一路思考直到撞上 128K 的输出上限,任务没完成,2.56 美元花掉了。思考关不掉、按输出计费,max 档又爱想,长任务里这种空跑不算罕见。系统卡里还有一处不好看的:Toolathlon Verified 上 Opus 5.5 是 77.8%,低于上一代 Opus 5 的 80.6%,”每项都更强”的说法只覆盖了 Anthropic 自己挑的那张能力表。
GPT-6.1 Sol 的短板在硬上限。Endor Labs 那套题里它的功能通过率 77.7%,Astra 82.1%,差 4.5 个点,折合 8 道题;碰到真难的,Sol 还是会漏。AutomationBench 上它约 36%,被 Claude Sonnet 5.5 的 44.7% 甩开,而后者的标价和它一模一样。还有个容易忽略的:它在 AA 上开 max 档的输出速度只有每秒 55.6 个 token,比 Opus 5.5 的 96.4 慢了四成,想快就得掏 6 倍价开 Ultrafast。
它的长处也实在:同一套题中位每题 7.9 分钟做完,Astra 要 11.6 分钟,超时 9 次对 13 次。
Argon 的跟头还没机会摔,这本身就是它最大的短板。除此之外,纸面上能看到的弱项集中在终端类编程:Terminal-Bench 4.0 落后 Opus 5.5 9 个点、FrontierSWE 落后 Astra 10.5 个点、科学版 Terminal-Bench 57.6% 对 Astra 68.1%。
它有一项别人短期追不上:单次输出上限 1M,是上一代 64K 的 16 倍。
接下来一个月会改写这张表的几件事
这道选择题我更愿意按”什么时候会变”来答。三个日期都还悬着。
第一个是 Argon 什么时候对付费 API 开放,以及首发价哪天结束。如果开放的那天首发价已经快到期,开发者实际面对的就是 4 美元和 20 美元,每题成本比 Opus 5.5 便宜三成多,是 6.1 Sol 的 5.5 倍,定位会尴尬地卡在中间。
第二个是 GPT-6.1 Astra 有没有新的发布日期。OpenAI 眼下没有比 Astra 更新的顶配,6.1 Sol 在 DeepSWE 上 75.2% 和 Astra 打平,所以它被当成了”便宜的 Astra”来卖;Astra 一更新,这个定位就没了。
第三个是 Anthropic 的网络安全验证计划。官方说要给通过验证的安全从业者放开 Opus 5.5,帮助文档另一处却写着它目前不在计划里。哪句先兑现,决定安全团队还留不留它。
在这三件事落地之前,我手上的分工是这样的:写代码和长时间终端代理用 Opus 5.5,档位停在 medium 或 high,不开 max;跑批、工单、需要大量缓存命中的编程代理用 6.1 Sol,盯住 27.2 万 token 那道线,别把整个仓库一次塞进去;Argon 先排队,拿到权限后用自己的数据重测幻觉率和准确率,再等 4 美元那天。
相关对比:《Claude Opus 5.5 和 GPT-6 Sol:一个在榜单上比前任低一名,一个编程分数不如前任》、《Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样》、《Claude Haiku 5.5、GPT-6 Luna、Gemini 3.8 Flash:标价一样的0.10美元,10万token那道线画在不同地方》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Gemini 4 Argon、Claude Opus 5.5、GPT-6.1 Sol:和 Sol 标价相同的 Argon,每道题贵出 2.7 倍,多数人还调不出来