先说一个具体的场景,可能比任何跑分都更能说明这周发生了什么。
假设你在做一个文档处理的活儿,每天要过一百万 token 的输入、吐三十万 token 的输出。三个月前你大概率跑在 Claude 或者 GPT 上,一天的账单在两三百块人民币。这周之后,同样的活儿用 GLM-5.3-Flash 的限时价,一天不到七块钱。
不是打折,是重新定价。8 月 26 日晚上,阿里和智谱前后脚发了两个模型,加上 8 月 12 日刚转正式版的 DeepSeek V4 Pro 0813,国产第一梯队在两周内换了一轮。这篇就把这三个放一起,看看到底该怎么选。
先把账算清楚
价格这块必须先摊开,因为它是这轮竞争的主线。
| 项目 | Qwen3.8-Flash-Next | GLM-5.3-Flash | DeepSeek V4 Pro 0813 |
|---|---|---|---|
| 总参数 / 激活 | 1250 亿 / 60 亿 | 3200 亿 / 180 亿 | 1.6 万亿 / 490 亿 |
| 输入(每百万 token) | 1 元(海外 $0.16) | 限时 $0.075,原价 $0.15 | $0.435(未命中缓存) |
| 输出(每百万 token) | 3 元(海外 $0.47) | 限时 $0.25,原价 $0.50 | $0.87 |
| 缓存命中价 | — | $0.015 | $0.003625 |
| 上下文 | 1M | — | 1M |
| 开源 | 是(含 FP8) | 是 | 是 |
| 多模态 | 是 | 是(GLM-5 系列首个原生) | 否 |
DeepSeek 那个 0.003625 的缓存命中价不要看漏了。如果你的业务是”同一份长文档反复问”这种形态——法律合同问答、代码库检索、客服知识库——缓存命中率能做到七八成,那 V4 Pro 的实际单价会比表面上便宜一个数量级,反而是三个里最省的。
能力上谁强
Artificial Analysis 的综合智能指数是目前相对中立的第三方口径:GLM-5.3-Flash 57 分,DeepSeek V4 Pro 正式版 53 分,同类模型的中间值只有 18 分。两个都进了全球前沿区间。
Qwen3.8-Flash-Next 没有对应的 AA 分数,但它自己给的成绩单也够看:Base 版在 14 个基准里 8 个排第一,包括 MMLU-Pro、SuperGPQA、BBH、GSM8K;编码这块 SWE-bench Pro 62.5、SWE-bench Multilingual 81.0,官方说九项标准基准里有八项超过 Claude Opus 4.6 Max。
DeepSeek V4 Pro 的强项在另一处。LiveCodeBench 93.5%,长文本召回率从 V3.2 的 45% 直接干到 97%,中文 SuperCLUE 70.98 分国内第一。智能体编码这块的跃升尤其夸张:DeepSWE 从 12.8 到 62.7,CyberGym 从 52.7 到 83.3,Terminal Bench 2.1 从 72.1 到 87.9。
把这些分数并排看,会发现三个模型的”强”其实不在同一个维度上:Qwen 强在极低激活下的通用能力密度,GLM 强在综合智力和多模态,DeepSeek 强在长上下文召回和智能体化的编码任务。
口碑:社区实际怎么说的
GLM-5.3-Flash 这次的口碑来路比较特别。它在正式发布前以匿名模型 Ox-Alpha 的身份在 OpenCode 和 OpenRouter 上跑了六天,双平台调用量都创了新高,六天处理超过 20 万亿 token,中文社区管它叫”牛来”。匿名期拿到的反馈没有品牌滤镜,这批用户是真觉得好用才反复调的。智谱自己的 Z.ai Code Bench 体感评估里,它的编程表现和 Claude Opus 4.8 相当——注意”体感评估”这个词,说明是主观打分,不是标准基准。
Qwen3.8-Flash-Next 在开发者社区里被讨论最多的不是分数,是那张 510 亿参数的 N-gram 嵌入表可以异步卸载到主机内存。本地部署的人对这个特别敏感——它意味着显存需求和总参数量脱钩了。unsloth 那边很快就出了 GGUF 量化版,社区跟进速度说明了兴趣度。
DeepSeek V4 Pro 走的是另一条口碑路线:稳。4 月首发,5 月底调价,8 月 12 日 0813 版转正式版,节奏不快但每一步都落地。中文场景下它至今是很多人默认的第一选择,SuperCLUE 国内第一那个成绩不是白来的。抱怨也集中——高峰期排队、偶发的输出截断,这些在社区里被提了大半年。
还有一件事:芯片
GLM-5.3-Flash 有一个容易被价格盖过去的点——它的全部流量由国产 AI 芯片集群承载,官方说在同一硬件上端到端推理性能比初始基线提升 3 倍,成本可以比肩主流英伟达 GPU。
过去国产芯片跑推理的公开案例,规模都停在”能跑”这一层。20 万亿 token 的真实流量压过去是另一回事。这周英伟达刚在财报里确认向中国客户卖出的 H200 收入占数据中心收入不到 1%,还为过剩库存计提了 4 亿美元。两条消息撞在一起看,味道就出来了。
所以怎么选
成本敏感、量大、任务不算太难——GLM-5.3-Flash 的限时价没有对手,输入 0.075 美元每百万 token 这个数字目前是独一档。批量摘要、分类打标、内容审核、客服首轮应答,闭眼选它。要注意限时价会结束,按原价 0.15/0.50 重新算一遍账再上生产。
要本地部署、显存有限——Qwen3.8-Flash-Next。60 亿激活参数加上可卸载的嵌入表,是三个里对硬件最友好的,还给了 FP8 量化版。做私有化交付的团队这条几乎是唯一选项。
长文档反复问、中文重、要做智能体编码——DeepSeek V4 Pro。97% 的长文本召回率和那个便宜到离谱的缓存命中价是组合拳,一份长合同问二十遍的场景下总成本反而最低。Terminal Bench 从 72 到 88 那一跳,说明它在”自己动手跑命令”这类任务上是认真做过的。
要多模态——Qwen3.8-Flash-Next 和 GLM-5.3-Flash 二选一,DeepSeek V4 Pro 这一代不支持。
最后说句实在的。这三个模型的差距,比它们和一年前同价位模型的差距小得多。真正该纠结的不是选哪个,而是你的场景到底需不需要顶配——很多活儿用 Flash 级别绰绰有余,省下来的钱够多跑十倍的量。
站内相关条目:通义Qwen3、智谱AI、DeepSeek、Claude。
相关对比
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Qwen3.8-Flash-Next vs GLM-5.3-Flash vs DeepSeek V4 Pro:一周之内,国产模型把价格打到了这个地步