9 月 3 日晚上,智谱在社交平台上发了一句「我们还在线」。那会儿 Downdetector 上 OpenAI 的故障报告已经堆到一万两千份以上,Claude 一千二百份,Grok 一千份左右,Cursor 跟着一起挂——它的后端同时依赖后两家。三家头部平台一起躺了三小时四十分钟,这种事以前没怎么见过。
第二天早上,OpenAI 发布了 GPT-6 Astra,官方口径是「欢迎来到 AGI 时代」。
这两件事挨在一起,让选型这件事变得比看跑分复杂。下面把 Astra、Claude Opus 5、DeepSeek V4 Pro 三条线的账重新算一遍,包括那些通稿里不会写的部分。
一次宕机暴露的东西
宕机本身不稀奇,三家同时宕机才稀奇。更值得注意的是连带效应:Cursor 是把 Claude 和 Grok 当推理后端的产品,上游一断,它自己的状态页也跟着变红。如果你的产品链路上只挂了一家美国厂商,9 月 3 日那三个多小时就是一次免费的压力测试,测出来的结果多半不好看。
国内几家当时正常。这不是技术优越性,是物理隔离带来的副作用——两套基础设施本来就不共用同一批机房、同一批负载均衡。但对于做多模型路由的团队,这条经验是实打实的:备用链路不能选和主链路同一时区、同一家云的模型。
272000 这个数字,比 10 美元更值得盯
Astra 的标价是输入每百万 token 10 美元、输出 50 美元,缓存输入 1 美元。比 GPT-5.6 Sol 那一代贵了大约 1.5 倍,媒体口径普遍说是「2.5 倍」,取决于你拿哪个档位比。
真正会咬人的不是这个标价。
Astra 的计费规则里有一条:单次请求的输入一旦越过 272000 token,整个请求的输入和缓存费率翻倍、输出费率乘 1.5。注意是整个请求重算,不是超出的那一部分单独加价。这意味着一个 271000 token 的请求和一个 273000 token 的请求,账单差距远不止两千 token 的钱——前者按 10 美元算,后者整包按 20 美元算。
做长文档处理的,这条得写进代码里。把上下文切到 27 万以内,比什么优化都省钱。
另外还有个 Fast 模式,速度最高到标准档的 2.5 倍,价格翻倍,也就是输入 20 美元、输出 100 美元。对话式产品用得上,批处理没必要。
跑分榜之外:BenchLM 给 Astra 的两个分项排名
官方那套数字很好看:FrontierMath Tier 4 拿到 97.6%,ExploitBench 100%,GPQA Diamond 96%,OSWorld 2.0 计算机操作 72.6% 且每个任务耗时比 Sol 少约 47%。ARC-AGI-3 是最被拿来说事的一项,从 GPT-5.6 Sol 的不到 8% 跳到接近满分。
这里有两个细节值得核一下。
一是 ARC-AGI-3 的分数在同一天里有两个版本在传,98.6% 和 99.9% 都有媒体在用。二是这个成绩依赖一套有状态的、开销很大的评测框架;换成无状态的普通 API 调用,分数会掉不少。你在自己的应用里调 Astra,拿到的是后一种环境。
第三方榜单给出的画像也不太一样。BenchLM 把 Astra 放在 231 个模型里的第 4 位,综合 81.9 分;但拆开看,Agentic 工具使用只排到第 23 名(59.5 分),Coding 第 32 名(62.1 分)。同一个站点还标注了一句让人清醒的话:它跟踪的 417 个基准槽位里,Astra 只有 26 行有数据,「尚不足以给出一个已核实的位次」。
换句话说,「全面登顶」这个说法目前只在 OpenAI 自己公布的那批基准上成立。等第三方把剩下的槽位填满,排名会不会变,谁也不敢打包票。
Opus 5 的位置有点尴尬
Opus 5 的价格是输入 5 美元、输出 25 美元,和上一代 Opus 4.8 一模一样。上下文 100 万,单次输出上限 128K。SWE-bench Verified 96%,这个数字很硬。
尴尬在更难的那个变体上。SWE-bench Pro 里 Opus 5 是 79.2%,排第三,前面站着 Mythos 5(80.3%)和 Fable 5(80.0%)——都是 Anthropic 自家的模型。也就是说在 Anthropic 的产品序列里,Opus 5 不是编程最强的那个,它是「综合最稳的那个」。
Anthropic 自己新做的 Frontier-Bench v0.1 上,Opus 5 拿 43.3%,反超 Fable 5 的 33.7% 和 GPT-5.6 Sol 的 34.4%。这个基准是他们自己出的,参考价值打个折,但至少说明 Opus 5 的强项在长链路、需要权衡取舍的任务上,不在单点刷题。
如果你的团队买 Opus 是为了写代码,先看看 Fable 5 是不是更合适、更便宜。
DeepSeek V4 的两笔账,方向相反
API 这笔账好看到不太真实。V4 Pro 0813 的价格是输入未命中缓存 0.435 美元、命中缓存 0.003625 美元、输出 0.87 美元,全部按百万 token 计。
缓存命中和未命中差 120 倍。
这个倍率在业内是极端值。Astra 那边是 10 倍,很多厂商在 4 到 10 倍之间。120 倍意味着 DeepSeek 把「你要不要好好设计 prompt 前缀」这件事变成了一道数学题:同样一天的调用量,前缀复用率从 30% 提到 80%,账单能差出一个数量级。反过来,如果你的请求每次都是全新拼装的长上下文,V4 的便宜就享受不到多少。
还有一层历史:2026 年 5 月它做过一次永久降价,降到原价的四分之一。现在这个价不是限时活动,是常态价。
模型本身,V4 是 1.6 万亿总参的 MoE,每 token 激活 490 亿,原生 100 万上下文,单次最大输出 384K——输出上限是三家里最高的,是 Astra 和 Opus 5 的三倍。预览版 4 月 24 日开源,Pro 正式版 8 月 12 日发布。V4-Pro-Max 在 SWE-bench Verified 上 80.6%,是第一个把这项跑过 80 的开源模型,贴着 Claude Opus 4.6 的 80.8%。
另一笔账是公司层面的,方向完全相反。据《财经》援引参与交易人士的说法,DeepSeek 今年前七个月营收约 4.75 亿元,同期 AI 基础设施相关支出约 110 亿元;2025 年这部分支出是 12 亿元。最新估值约 5000 亿元,计划在第二轮融资中募集 500 亿元。
营收和基建支出是两个财务口径,不能直接拿来算亏损。但 23 倍的差额摆在那里,任何一个把生产链路整个压在 V4 低价上的团队,都该给自己留一个迁移预案。低价能撑多久,不取决于技术。
三张价目表放一起
| 项 | GPT-6 Astra | Claude Opus 5 | DeepSeek V4 Pro |
|---|---|---|---|
| 输入(美元/百万 token) | 10 | 5 | 0.435(未命中缓存) |
| 缓存输入 | 1 | — | 0.003625 |
| 输出(美元/百万 token) | 50 | 25 | 0.87 |
| 上下文 | 1.05M | 1M | 1M |
| 单次输出上限 | 128K | 128K | 384K |
| 特殊计费 | 输入超 272K 后整包 ×2 / 输出 ×1.5 | 无公开加价档 | 无 |
| 代表成绩 | FrontierMath T4 97.6%、OSWorld 2.0 72.6% | SWE-bench Verified 96%、Pro 79.2% | SWE-bench Verified 80.6%(Pro-Max) |
| 开源 | 否 | 否 | 是 |
按活儿分:谁该出现在你的哪条链路上
要跑长时间、多步骤的自动化任务,比如让模型自己操作浏览器、连续调十几次工具,Astra 的 OSWorld 成绩和它省下的那 47% 单任务时间是有意义的。代价是每百万输出 50 美元,以及你得盯住 272K 那条线。这类任务的上下文最容易失控。
要做需要反复权衡、上下文里塞满业务规则的活儿(合同审查、跨系统排障、需求拆解),Opus 5 是三家里最省心的。它在 Frontier-Bench 上反超两个更贵或更新的模型,说明这类任务的能力和参数规模不是线性关系。但如果你的主要用途就是写代码,先比一比 Fable 5。
要处理大批量、结构固定、前缀高度重复的活儿(文档抽取、批量改写、日志分析、离线标注),V4 Pro 的账没有对手。前提是你愿意为缓存命中率做工程。384K 的输出上限还给它加了一类独占场景:一次性生成超长内容,另外两家得分批拼。
另外一条建议和模型能力无关:不管你主用哪家,把 9 月 3 日那三个多小时当成常态的一部分来设计。三家里至少留两家的密钥,且别都在同一边。
最后一句关于「AGI 时代」这个说法。Astra 在 ExploitBench 上拿了 100 分,OpenAI 也承认它是第一个被认定达到「临界」网络安全能力阈值的模型,能在没有人工逐步引导的情况下发现并利用防护严密系统的未知漏洞,内部测试里找出过两个零日。这件事的分量比 ARC-AGI-3 那个分数大得多,但它证明的是能力边界,不是通用智能。两回事。
相关对比:
Gemini 3.8 Flash 和 Muse Spark 1.3 同周上线,从 Opus 5 迁过去要分四次算账
Qwen3.8-Max-0902 和 Claude Fable 5.1:缓存价现在一模一样,差价全在别处
GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro:两个月都用下来,我给的选择清单
© 版权声明
文章版权归作者所有,未经允许请勿转载。






GPT-6 Astra、Claude Opus 5、DeepSeek V4 Pro:一次全球宕机之后,这三家的账怎么算