把一条线上的模型从 Opus 5 换成 Gemini 3.8 Flash,最先要动的不是 prompt,是预算表。而且要动两次。
第一次是现在:$0.75 输入、$3.75 输出,每百万 token。第二次是 2027 年 1 月:$1.50 和 $7.50。谷歌这轮是明码标价的限时价,2026 年底一到自动翻倍。你今天按促销价算出来的迁移收益,四个月后腰斩。
这本来只是两家的账。9 月 2 日周三,Meta 把 Muse Spark 1.3 推了出来,同一天谷歌发了 3.8 Flash 和 3.8 Flash Cyber,账变成三家的。
下面按迁移的时间顺序走一遍,每一段只回答那个时点你真正需要知道的东西。
动手之前:价目表上没写的那部分
三家的挂牌价差得很开。Opus 5 是 $5 / $25,跟前代 Opus 4.8 一分没涨。Gemini 3.8 Flash 促销期 $0.75 / $3.75,缓存输入 $0.075。Muse Spark 1.3 的价格 Meta 还没公布,1.2 的定价是 $1.25 / $4.25,另外挂了一个贡献者档,$0.10 输入、$0.20 输出。
贡献者档和标准档差了十二倍。
这是三家里最大的一个变量,也是 1.3 定价公布之前谁都不该拍板的原因。光看这三行数字,Gemini 便宜六到七倍,Muse 更是能便宜到看不清小数点。但这三行数字都不是你最后付的钱。
因为它们全是推理模型,输出 token 里混着思考 token,而思考 token 按输出价计费。Gemini 这边更彻底:你付 $3.75 一百万买来的推理过程,自己是看不到的,接口只回一段摘要。
这不是理论上的损耗。上一代 3.7 Flash 在高推理档下,token 消耗比 3.6 Flash 高了大约 40%,平均每个任务吐 37k 输出 token。单价没动,每任务成本涨四成。3.8 Flash 官方明确说了在复杂任务上会执行更多推理步骤、更频繁地迭代调工具,方向只会更狠。
该算的不是每百万 token 多少钱,是你那条业务线上一个典型任务烧掉多少 token。
这两个数在不同模型上不成比例。
接上去当天:上下文和输出上限
Gemini 3.8 Flash 的上下文是 1,048,576 输入、65,536 输出。Muse Spark 1.3 也是 1M 上下文。
输入侧一百万这个数字现在已经不稀奇了,真正卡人的是输出侧那 65,536。做长文档生成、批量代码改写、大规模结构化抽取的场景,这个上限会比上下文先撞墙。迁移时如果你原来的流水线靠一次性吐出一大坨结果,改造量在这儿,不在 prompt。
速度这一项 Artificial Analysis 测出来是每秒 305.1 token,3.8 Flash 在它那个智能指数上拿 59 分(high effort 档),195 个模型里排第 16。交互式产品会喜欢这个速度,批处理场景没什么感觉。
顺带说一句缓存。$0.075 的缓存输入价是标准输入价的十分之一,系统 prompt 长且固定的话,这一项省下的钱可能比换模型本身还多。三家都适用,很多团队没配。
跑满一周:跑分和账单开始打架
| 项目 | Gemini 3.8 Flash | Claude Opus 5 | Muse Spark 1.3 |
|---|---|---|---|
| HLE-Verified | 54.9% | 54.4% | — |
| DeepSWE v1.1 | 官方列为领先项 | 74.0 | 75.4 |
| Terminal-Bench 2.1 | — | 89.1(max effort) | 88.8 |
| SWE-bench Verified / Pro | — | 96.0% / 79.2% | — |
| ARC-AGI-3 | — | 30.2% | — |
| Frontier-Bench v0.1 | — | 43.3% | — |
| 代码库理解 | — | — | 59.4 |
| 标准档定价(每百万,输入/输出) | $0.75 / $3.75(2026 年底前) | $5 / $25 | 1.2 为 $1.25 / $4.25 |
那半个百分点先放一放。HLE-Verified 上 3.8 Flash 54.9%、Opus 5 54.4%,这是本周被引用最多的一组数字,也是最没用的一组。0.5 个百分点落在这类评测的抽样噪声里,换一批题目、换一次采样温度就可能反过来。拿它证明”Flash 价位达到了 Opus 能力”,不成立。
DeepSWE v1.1 这一行更麻烦,因为两边说法对不上。Muse Spark 1.3 报 75.4,压过 Opus 5 的 74.0;谷歌同时把 DeepSWE v1.1 列进了 3.8 Flash 的领先项清单,跟 MMMU-Pro、GPQA Diamond、Vals Finance Agent v2、Harvey 法律智能体基准并列。同一个基准两家都说自己领先,公开数字又没摆在同一张表上。
遇到这种情况,把这一行整个划掉。
Terminal-Bench 2.1 上 Opus 5 是 89.1(max effort),Muse Spark 1.3 是 88.8,差 0.3。这一档真正的第一是 GPT-5.6 Sol 的 89.5(xhigh),Grok 4.6 在 high 档是 88.4。四个模型挤在 1.1 个百分点里,这张榜已经不具备区分度了。
没有争议的是 SWE-bench Verified 那 96.0%,以及 SWE-bench Pro 的 79.2%。Opus 5 保持了几个月,另外两家目前没有可比的公开成绩。ARC-AGI-3 的 30.2% 和 Frontier-Bench v0.1 的 43.3% 也在 Opus 5 手里,后者领先 Fable 5 的 33.7% 和 GPT-5.6 Sol 的 34.4% 接近十个点,是三家里差距最大的一项。
然后是账单和跑分打架的地方。已经有开发者反映,在一些简单的软件工程任务上,3.8 Flash 的实际花销比 Fable 还高。原因就是前面那条推理开销:模型不区分题目难易,一律认真想一遍,简单题上那份认真是纯浪费。
另一头也有反例。有人拿同一个 /design 提示在 FlappyBench 上跑了三家,Muse Spark 1.3 花钱最少、结果最好,Gemini 3.8 Flash 花钱最多且没跑完。单个基准说明不了什么,但它至少证明”Flash 便宜”这个直觉在真实任务上会翻车。
如果你的负载里简单任务占多数,换到 3.8 Flash 可能是省了单价、亏了总账。
三个月之后
三件事会在这个时间点变得明显。
一是价格翻倍。2027 年 1 月一到,Gemini 那条线成本乘二,而你的业务量大概率已经涨上去了。这时候再迁回去,迁移成本付第二遍。
二是 Muse Spark 的定价落地。Meta 一直在开源闭源之间横跳,Muse Spark 是它第一个闭源系列,扎克伯格又说后续会有开放权重的版本。这个组合意味着定价策略随时可能大改。押注在一个价格还没公布的模型上,等于把变量留给了别人。
三是失败方式的差异会浮出来。这一条没有任何基准在测,但用满三个月的人都有体感:同样是做不出来,一个模型会说”我找不到这个函数”,另一个会自信地编一个不存在的 API。前者浪费三分钟,后者浪费三小时,跑分表上都记零分。
正好这周有开发者提到一个持续了一年的现象:Claude 系的编程工具在各类基准上屡屡靠后,使用量却一直第一。原因大概率就在这里。基准测的是做对的概率,人用起来在乎的是做错时的代价。
各自的短板
Opus 5 最硬的短板是价格。$5 / $25 在今天这个价格带里是明显的异类,从 Opus 4.8 到 Opus 5 一分没降,而竞品把同类任务的单价压到了七分之一。”我更稳”这个理由需要非常具体的场景才撑得住。
Gemini 3.8 Flash 的短板是成本不可预测。限时价、2027 年 1 月的翻倍时间表、不可见的思考 token、随难度浮动的推理开销,四样叠在一起,你很难提前算准下个月的账单。要做预算的团队会很难受。它的 Cyber 变体是另一个话题,专门做漏洞发现和自动修复,不属于日常开发选型。另外提一句,谷歌今年 5 月说过新一代 Pro 会在次月推出,结果 3.7 Flash 上月发、3.8 Flash 这周发,Pro 一直没来。这条线的节奏本身就不稳。
Muse Spark 1.3 的短板是不确定性本身。定价没公布,贡献者档的门槛和限制没说清,开放权重没有时间表。技术指标好看,商务条款一片空白。生产环境里这种组合通常只能进 POC,进不了主干。Meta AI 过去的信誉主要建立在开源上,这次是它第一次要求别人相信一个闭源产品的定价承诺。
换还是不换
负载以简单任务为主、量大、对偶发错误容忍度高的,Gemini 3.8 Flash 值得试,但要先跑一周真实流量看每任务成本,别信价目表,同时把 2027 年 1 月的价格写进预算模型。
做长周期智能体任务的,一次跑几十步、中途出错代价很大的,Opus 5 那 96.0% 和它保守的失败方式还是值这个价。贵是贵在你不用回头查。
Muse Spark 1.3 现在的正确用法是接进来测,不是接进来上。等定价,等贡献者档细则,等开放权重那句话落地。它已经在 Command Code 的 GOAT、Pro、Max 和 API 方案里全线上了,试用成本不高。
还有一种情况是不换。
这周的三组数字里,能被称为”能力代差”的一个都没有。0.5 个百分点、0.3 个百分点、一个两家口径打架的基准,加起来不构成迁移理由。构成理由的只有价格,而价格那部分收益,谷歌已经明确告诉你四个月后收回去一半。
如果你现在跑得好好的,把这周省下来的迁移工时拿去配缓存,收益更实在。
相关对比:《Qwen3.8-Max-0902 和 Claude Fable 5.1:缓存价现在一模一样,差价全在别处》、《Cursor vs Claude Code vs Codex vs Trae:2026 年 8 月,AI 编程工具到底该怎么选》、《GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro:两个月都用下来,我给的选择清单》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Gemini 3.8 Flash 和 Muse Spark 1.3 同周上线,从 Opus 5 迁过去要分四次算账