八月底我把一个批处理任务从 Gemini 3.8 Flash 挪回 3.7 Flash,当月账单降了六成,产出质量肉眼看不出差别。
荒唐的地方在于,3.8 Flash 的标价并不比 3.7 高。多花的钱不在价目表上。
这一档模型现在挤得厉害。OpenRouter 的口径是全网 token 用量一年涨了 25 倍,最近一个月直接翻倍,吃掉这些量的主力正是所谓的便宜档:OpenAI 的 GPT-5.6 Luna 单月处理了近 12 万亿 token,智谱 的 GLM-5.3-Flash 是 11.4 万亿,后者环比增长超过 1000%。
三家的标价我都列一遍,然后讲各自藏钱的地方。
三家把同一份活报了三个价
| 项目 | GPT-5.6 Luna | GLM-5.3-Flash | Gemini 3.8 Flash |
|---|---|---|---|
| 输入(每百万 token) | 0.20 美元 | 0.15 美元(deepinfra 口径) | 0.75 美元 |
| 输出(每百万 token) | 1.20 美元 | 0.50 美元 | 3.75 美元 |
| 缓存命中读取 | 0.02 美元 | 官方未单列 | 未单列 |
| 缓存写入 | 0.25 美元 | — | — |
| 上下文 | 1050K 上下文 | 1M 上下文 | 长上下文 |
| 最大输入 / 输出 | 922000 / 128000 | — | — |
| 价格性质 | 7 月 30 日降价 80% 后的常规价 | 常规价 | 促销价,12 月 31 日到期 |
光看这张表,Gemini 3.8 Flash 是三个里最贵的,输出价 3.75 美元是 GLM 那 0.50 美元的 7.5 倍。但它在 Artificial Analysis 智能指数上开 high reasoning 能拿 59 分,和 GPT-5.6 Sol 持平,折算成每个指数任务是 0.58 美元。作为对照,Anthropic 的 Claude Fable 5.1 是 66 分、3.69 美元一个任务。
九成的能力,六分之一的钱。这是它敢标 3.75 美元输出价的底气。
0.02 那一栏才是 Luna 的杀招
Luna 的输入价 0.20 美元不算特别便宜,GLM 的 0.15 美元比它低两成半。真正拉开差距的是缓存命中读取价:0.02 美元。
十分之一。
什么活儿吃这个价?系统提示词长、few-shot 例子多、RAG 前缀固定、多轮对话前面几十轮不变的场景,输入里通常有七八成是逐字重复的。命中缓存之后这部分按 0.02 美元结算,整张账单会掉到只看 0.20 美元标价时估算的三分之一上下,负载越规整降幅越大。我手上一条日均两千万 token 的抽取链路,锁死前缀之后月度支出从 380 美元降到 140 美元,输出内容一个字没改。
代价是缓存写入要 0.25 美元,比输入原价还贵两成半。这套机制对”同一个前缀被反复打”的负载近乎白送,对”每次前缀都不一样”的负载是净亏,一天只命中两三次的那种基本打平。
还得注意时间线:Luna 这个价是 7 月 30 日一次性砍下来的,降幅 80%。降价前后的评测文章现在混在一起挂在搜索结果里,读的时候先看日期,否则会拿一份作废的价目表做决策。
272000:一个数字在两个地方对不上
Luna 官方文档写的是 1050K 上下文,最大输入 922000 token,最大输出 128000 token。但 7 月 18 日 OpenAI 推的 Codex CLI 0.144.6,把 CLI metadata 里的上下文改成了 272000。
两个数字都是官方的,差了将近四倍。
这不是文档笔误。超过大约 272000 输入 token 的请求,整个请求按输入价 2 倍、输出价 1.5 倍计费,注意是整个请求而不是超出的那一截。272000 是计费档位线,1050K 上下文是技术上限,两者本来就不是一回事,只是没人把这件事写在同一页上。
坑在中间层。路由器、截断逻辑、预算护栏这些组件都读 metadata 决定行为:读到 1050K 的会心安理得地把一个 40 万 token 的请求发出去,然后你收到一张按 2 倍输入价结算的账单;读到 272000 的又会把本来塞得进去的内容提前砍掉,召回率悄悄掉一截。这两种错法在预发环境都测不出来,因为测试用例的输入普遍不超过 3 万 token。
云厂商那边还有一层。有记录显示微软 Azure 在宣称已跟进 OpenAI 新定价的同时,对 GPT-5.6-Luna 的计费一度高到 5 倍。走中间商买这个模型,价格必须自己对一遍。
Gemini 这边,你付钱的 token 你看不见
回到开头那笔账。Gemini 3.8 Flash 的问题不在 0.75 美元的标价,在思考 token。
这个模型默认就跑 medium 级别推理,每一个内部推理 token 都按 3.75 美元的输出价计费,而它们不出现在响应体里。你拿到 500 token 的回答,实际可能付了 3000 token 的钱,从返回内容上一点都看不出来。我那条被挪走的链路,实测思考 token 是可见输出的 4 到 6 倍。
模型的来路也值得说一句:3.8 Flash 不是新基座,是在 3.7 Flash 上做的,官方说法是它会”更努力地工作”,也就是主动烧更多思考 token 换质量。Google 自己在文档里建议,效率优先的负载留在 3.7 Flash。
厂商公开劝你别升级,这种话该当真。
另一颗定时炸弹是日期。0.75 美元和 3.75 美元是促销价,12 月 31 日到期,1 月 1 日直接翻倍到 1.50 美元和 7.50 美元。现在按促销价算出来的单位经济模型,元旦当天整体作废。毛利本来就薄的产品,这个日子得写进日历。
智谱的位置:便宜,但没便宜到无脑用
GLM-5.3-Flash 的国内官方口径是输入 0.8 元、输出 2.8 元每百万 token,海外渠道折算是 0.15 美元和 0.50 美元。1M 上下文、多模态、带 coding 能力,配置表上一样不缺。
LLM Stats 的综合评分它拿 50.7,Luna 是 45.4,差 5.3 分;这是个聚合分,把 MMLU、GPQA 这类学科题和代码题按固定权重加总,权重表一改名次就会动,所以它只能说明两者同档,说明不了谁在你那摊活儿上更强。
但这个分数得配着社区反馈一起看。linux.do 上有一条讨论标题直接叫”GLM 5.3 Flash 吹得过头了”,跟帖里的意见是:高强度测试下它并不比 DeepSeek V4 Flash 更好,尽管官方评测里它的数字更漂亮。这种”官方榜单赢、日常手感输”的落差在开放权重模型上很常见,通常来自评测集的采样偏好。
技术侧有一处官方自己承认的短板:GLM-5.3-Flash 的 KV 缓存占用仍高于 Kimi-K3 和 DeepSeek-V4-Flash,被列进了后续优化方向。KV 缓存大意味着同样显存能塞下的并发更少,自部署或者高并发场景里这一项会直接变成钱。
所以它的定位挺清楚:单价最低那一档里能力最全的,但不是这一档里工程效率最高的。
OpenRouter 的用量榜说明了什么
Luna 单月 12 万亿 token,GLM-5.3-Flash 11.4 万亿,已经贴得很近,而 GLM 的环比增速超过 1000%。
1000% 不能直接读成”更受欢迎”。开放权重模型的调用会被大量中转商、聚合平台、二次封装产品重复计入,Luna 的量主要来自直连和几家大网关,两条统计口径本来就不对等。
不过有件事是真的:这一档正在吃掉整个市场的大头。一年 25 倍、一个月翻倍,这种增速不可能来自旗舰模型,旗舰太贵跑不出这个量。真正被大规模消耗的是”够用就行”的那一档,而 SWE-bench 之类的榜单排名对这类采购几乎没有影响力。
中端逼近前沿,去年是个论点,今年是账单上的事实。
三个都有的毛病,各不相同
Luna 的问题是计费复杂度。缓存读 0.02 美元、写 0.25 美元两套价,272000 那条档位线,再加上云厂商可能 5 倍加价,任何一环没对齐,实际支出和预算能差出好几倍。三个里它最需要你自己写监控。
Gemini 3.8 Flash 的问题是不透明叠加有期限。看不见的思考 token 让成本预估失真,12 月 31 日的到期日又让长期规划失真。它适合短周期、对质量敏感、不太在乎多花点钱的活。
GLM-5.3-Flash 的问题是官方评测和实际手感之间有落差,KV 缓存这块的工程成本也没优化到位。0.15 美元是它最硬的优势,也差不多是唯一的硬优势。
三个都不适合闭眼选。
钱花在哪儿,你得自己盯。
我手上这几条链路是这么派活的
前缀固定、量大、结构化输出的批处理走 Luna。0.02 美元的缓存命中价在这类负载上是碾压性的,只要 prompt 前缀锁死,成本能压到别家的零头。
需要一点真推理的中等难度任务,比如复杂分类、多步抽取、带条件判断的改写,走 Gemini 3.8 Flash,但只在促销期内,并且必须把思考 token 的实际消耗打进监控。12 月 31 日之前重新评一次。
成本敏感、质量要求不高、走国内合规的活,走 GLM-5.3-Flash。中文场景下 0.8 元的输入价没什么对手,前提是你接受它的输出偶尔需要重试一次。
如果只能挑一个,我挑 Luna。理由不是它最强,是它的计费规则虽然复杂但至少稳定,不会在某个日期突然翻倍。
最后提醒一句:这三家的价格在过去 60 天里改了不止一次。你现在读到的任何一篇对比,包括这一篇,写的都是某一天的快照。下单前去官网对一遍价目表,这个动作值当。
相关对比
Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样
Qwen3.8-Flash-Next vs GLM-5.3-Flash vs DeepSeek V4 Pro:一周之内,国产模型把价格打到了这个地步
© 版权声明
文章版权归作者所有,未经允许请勿转载。






GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同