GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同

AI资讯4分钟前发布 lomax
426 0

八月底我把一个批处理任务从 Gemini 3.8 Flash 挪回 3.7 Flash,当月账单降了六成,产出质量肉眼看不出差别。

荒唐的地方在于,3.8 Flash 的标价并不比 3.7 高。多花的钱不在价目表上。

这一档模型现在挤得厉害。OpenRouter 的口径是全网 token 用量一年涨了 25 倍,最近一个月直接翻倍,吃掉这些量的主力正是所谓的便宜档:OpenAI 的 GPT-5.6 Luna 单月处理了近 12 万亿 token,智谱 的 GLM-5.3-Flash 是 11.4 万亿,后者环比增长超过 1000%。

三家的标价我都列一遍,然后讲各自藏钱的地方。

三家把同一份活报了三个价

项目 GPT-5.6 Luna GLM-5.3-Flash Gemini 3.8 Flash
输入(每百万 token) 0.20 美元 0.15 美元(deepinfra 口径) 0.75 美元
输出(每百万 token) 1.20 美元 0.50 美元 3.75 美元
缓存命中读取 0.02 美元 官方未单列 未单列
缓存写入 0.25 美元
上下文 1050K 上下文 1M 上下文 长上下文
最大输入 / 输出 922000 / 128000
价格性质 7 月 30 日降价 80% 后的常规价 常规价 促销价,12 月 31 日到期

光看这张表,Gemini 3.8 Flash 是三个里最贵的,输出价 3.75 美元是 GLM 那 0.50 美元的 7.5 倍。但它在 Artificial Analysis 智能指数上开 high reasoning 能拿 59 分,和 GPT-5.6 Sol 持平,折算成每个指数任务是 0.58 美元。作为对照,Anthropic 的 Claude Fable 5.1 是 66 分、3.69 美元一个任务。

九成的能力,六分之一的钱。这是它敢标 3.75 美元输出价的底气。

0.02 那一栏才是 Luna 的杀招

Luna 的输入价 0.20 美元不算特别便宜,GLM 的 0.15 美元比它低两成半。真正拉开差距的是缓存命中读取价:0.02 美元。

十分之一。

什么活儿吃这个价?系统提示词长、few-shot 例子多、RAG 前缀固定、多轮对话前面几十轮不变的场景,输入里通常有七八成是逐字重复的。命中缓存之后这部分按 0.02 美元结算,整张账单会掉到只看 0.20 美元标价时估算的三分之一上下,负载越规整降幅越大。我手上一条日均两千万 token 的抽取链路,锁死前缀之后月度支出从 380 美元降到 140 美元,输出内容一个字没改。

代价是缓存写入要 0.25 美元,比输入原价还贵两成半。这套机制对”同一个前缀被反复打”的负载近乎白送,对”每次前缀都不一样”的负载是净亏,一天只命中两三次的那种基本打平。

还得注意时间线:Luna 这个价是 7 月 30 日一次性砍下来的,降幅 80%。降价前后的评测文章现在混在一起挂在搜索结果里,读的时候先看日期,否则会拿一份作废的价目表做决策。

272000:一个数字在两个地方对不上

Luna 官方文档写的是 1050K 上下文,最大输入 922000 token,最大输出 128000 token。但 7 月 18 日 OpenAI 推的 Codex CLI 0.144.6,把 CLI metadata 里的上下文改成了 272000。

两个数字都是官方的,差了将近四倍。

这不是文档笔误。超过大约 272000 输入 token 的请求,整个请求按输入价 2 倍、输出价 1.5 倍计费,注意是整个请求而不是超出的那一截。272000 是计费档位线,1050K 上下文是技术上限,两者本来就不是一回事,只是没人把这件事写在同一页上。

坑在中间层。路由器、截断逻辑、预算护栏这些组件都读 metadata 决定行为:读到 1050K 的会心安理得地把一个 40 万 token 的请求发出去,然后你收到一张按 2 倍输入价结算的账单;读到 272000 的又会把本来塞得进去的内容提前砍掉,召回率悄悄掉一截。这两种错法在预发环境都测不出来,因为测试用例的输入普遍不超过 3 万 token。

云厂商那边还有一层。有记录显示微软 Azure 在宣称已跟进 OpenAI 新定价的同时,对 GPT-5.6-Luna 的计费一度高到 5 倍。走中间商买这个模型,价格必须自己对一遍。

Gemini 这边,你付钱的 token 你看不见

回到开头那笔账。Gemini 3.8 Flash 的问题不在 0.75 美元的标价,在思考 token。

这个模型默认就跑 medium 级别推理,每一个内部推理 token 都按 3.75 美元的输出价计费,而它们不出现在响应体里。你拿到 500 token 的回答,实际可能付了 3000 token 的钱,从返回内容上一点都看不出来。我那条被挪走的链路,实测思考 token 是可见输出的 4 到 6 倍。

模型的来路也值得说一句:3.8 Flash 不是新基座,是在 3.7 Flash 上做的,官方说法是它会”更努力地工作”,也就是主动烧更多思考 token 换质量。Google 自己在文档里建议,效率优先的负载留在 3.7 Flash。

厂商公开劝你别升级,这种话该当真。

另一颗定时炸弹是日期。0.75 美元和 3.75 美元是促销价,12 月 31 日到期,1 月 1 日直接翻倍到 1.50 美元和 7.50 美元。现在按促销价算出来的单位经济模型,元旦当天整体作废。毛利本来就薄的产品,这个日子得写进日历。

智谱的位置:便宜,但没便宜到无脑用

GLM-5.3-Flash 的国内官方口径是输入 0.8 元、输出 2.8 元每百万 token,海外渠道折算是 0.15 美元和 0.50 美元。1M 上下文、多模态、带 coding 能力,配置表上一样不缺。

LLM Stats 的综合评分它拿 50.7,Luna 是 45.4,差 5.3 分;这是个聚合分,把 MMLU、GPQA 这类学科题和代码题按固定权重加总,权重表一改名次就会动,所以它只能说明两者同档,说明不了谁在你那摊活儿上更强。

但这个分数得配着社区反馈一起看。linux.do 上有一条讨论标题直接叫”GLM 5.3 Flash 吹得过头了”,跟帖里的意见是:高强度测试下它并不比 DeepSeek V4 Flash 更好,尽管官方评测里它的数字更漂亮。这种”官方榜单赢、日常手感输”的落差在开放权重模型上很常见,通常来自评测集的采样偏好。

技术侧有一处官方自己承认的短板:GLM-5.3-Flash 的 KV 缓存占用仍高于 Kimi-K3 和 DeepSeek-V4-Flash,被列进了后续优化方向。KV 缓存大意味着同样显存能塞下的并发更少,自部署或者高并发场景里这一项会直接变成钱。

所以它的定位挺清楚:单价最低那一档里能力最全的,但不是这一档里工程效率最高的。

OpenRouter 的用量榜说明了什么

Luna 单月 12 万亿 token,GLM-5.3-Flash 11.4 万亿,已经贴得很近,而 GLM 的环比增速超过 1000%。

1000% 不能直接读成”更受欢迎”。开放权重模型的调用会被大量中转商、聚合平台、二次封装产品重复计入,Luna 的量主要来自直连和几家大网关,两条统计口径本来就不对等。

不过有件事是真的:这一档正在吃掉整个市场的大头。一年 25 倍、一个月翻倍,这种增速不可能来自旗舰模型,旗舰太贵跑不出这个量。真正被大规模消耗的是”够用就行”的那一档,而 SWE-bench 之类的榜单排名对这类采购几乎没有影响力。

中端逼近前沿,去年是个论点,今年是账单上的事实。

三个都有的毛病,各不相同

Luna 的问题是计费复杂度。缓存读 0.02 美元、写 0.25 美元两套价,272000 那条档位线,再加上云厂商可能 5 倍加价,任何一环没对齐,实际支出和预算能差出好几倍。三个里它最需要你自己写监控。

Gemini 3.8 Flash 的问题是不透明叠加有期限。看不见的思考 token 让成本预估失真,12 月 31 日的到期日又让长期规划失真。它适合短周期、对质量敏感、不太在乎多花点钱的活。

GLM-5.3-Flash 的问题是官方评测和实际手感之间有落差,KV 缓存这块的工程成本也没优化到位。0.15 美元是它最硬的优势,也差不多是唯一的硬优势。

三个都不适合闭眼选。

钱花在哪儿,你得自己盯。

我手上这几条链路是这么派活的

前缀固定、量大、结构化输出的批处理走 Luna。0.02 美元的缓存命中价在这类负载上是碾压性的,只要 prompt 前缀锁死,成本能压到别家的零头。

需要一点真推理的中等难度任务,比如复杂分类、多步抽取、带条件判断的改写,走 Gemini 3.8 Flash,但只在促销期内,并且必须把思考 token 的实际消耗打进监控。12 月 31 日之前重新评一次。

成本敏感、质量要求不高、走国内合规的活,走 GLM-5.3-Flash。中文场景下 0.8 元的输入价没什么对手,前提是你接受它的输出偶尔需要重试一次。

如果只能挑一个,我挑 Luna。理由不是它最强,是它的计费规则虽然复杂但至少稳定,不会在某个日期突然翻倍。

最后提醒一句:这三家的价格在过去 60 天里改了不止一次。你现在读到的任何一篇对比,包括这一篇,写的都是某一天的快照。下单前去官网对一遍价目表,这个动作值当。

相关对比

Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样

Qwen3.8-Flash-Next vs GLM-5.3-Flash vs DeepSeek V4 Pro:一周之内,国产模型把价格打到了这个地步

Gemini 3.8 Flash 和 Muse Spark 1.3 同周上线,从 Opus 5 迁过去要分四次算账

© 版权声明

相关文章

GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同 暂无评论

none
暂无评论...