上周我给团队批了一张 24G 显存的卡,四千出头。同一周,我们在 DeepSeek 上的 API 账单是 316 元。
这两个数摆在一起,采购的同事问了一句很实在的话:那张卡多久回本?
按峰时价算,DeepSeek flash 系列输出每百万 token 是 8 元,空闲时段 4 元;输入缓存未命中 2 元、命中 0.04 元。新价从 9 月 10 日 12:00 起执行。就算把用量翻三倍,一张卡也要烧一年多才追平。纯算账,云端赢得毫无悬念。
但 9 月 17 日之后,情况变了一点。三款模型前后脚落地,它们代表三种完全不同的归属关系:一个你租,一个你按次买,一个你直接搬回自己机器上。
三款模型这周各自发生了什么
中国电信 9 月 17 日开源了星辰 Xing4.0-29B-A4B。总参数 29B,激活 4B 参数,原生 256K 上下文,可扩展到 512K 上下文。它的宣传重心不在跑分,在”全栈国产”:昇腾芯片训练,国产框架适配,架构自研,生态开源。
阶跃星辰发的是 Step5Preview,稀疏 MoE,总参数 600B,激活 27B 参数,100 万 token 上下文,原生支持文本和视觉输入。它在 Artificial Analysis 综合智能指数里进了全球开源模型前三,官方口径是单任务成本仅为 Claude Opus 5 的八分之一。10 月 15 日正式开源。
DeepSeek 的 V4.1 Flash 不是新东西,但它是这场对照里的基准线。现在绝大多数中文团队的日常调用都压在这一档上。
| Xing4.0-29B-A4B | Step5Preview | DeepSeek V4.1 Flash | |
|---|---|---|---|
| 总参数 / 激活 | 29B / 4B | 600B / 27B | 未公开 |
| 上下文 | 256K 原生,可扩 512K | 100 万 token | 长上下文档 |
| 开源 | 已开源 | 10 月 15 日 | 闭源 API |
| 怎么跑 | 自己机器 | 云端 / 自建 | 云端 API |
| 标志性数字 | 4bit 后 15GB 显存 | Opus 5 的 1/8 成本 | 输出 4~8 元 / 百万 token |
29B 和 600B,差的不是体型
这两个数字放一起容易误读。600B 听着比 29B 大二十倍,但实际每次推理过电的参数,Step5Preview 是 27B,Xing4.0 是 4B,差的是七倍不是二十倍。稀疏 MoE 的意义就在这儿:参数总量决定你能存多少知识,激活量决定你每次算多久、花多少钱。
Step5Preview 的激活比是 4.5%。所以”单任务成本是 Opus 5 的八分之一”这个说法,来源主要就是这个比例,不是什么玄学优化。
同一个道理也解释了 Xing4.0 为什么敢说消费级显卡能跑。4B 激活配 29B 总量,4-bit 量化之后权重占用压到 15GB,比 FP16 省约 75%,一张 RTX 3090 或 4090 就装得下。
SuperCLUE 那边给它的智能体能力打了 93.52 分,排第三,和前两名的 Qwen 系差距不到 1 分。一个二十多 B 参数的模型贴到这个位置,架构上的取舍算是成立的。
15GB 这个数字,少算了一样东西
这是我最想提醒的一条,官方材料里不会写。
15GB 说的是模型权重加载后的占用。推理时真正吃显存的还有 KV cache,它随上下文长度和并发数线性增长。你拿 24G 的卡跑短对话完全没问题,但一旦真把 256K 上下文填满,而这正是这个模型被宣传的卖点,剩下那 9GB 够不够,要看你的批大小和具体实现。
“能跑 256K 上下文”和”能在 24G 卡上同时跑满 256K 上下文且多路并发”,是两件事。买卡之前最好按自己的实际并发量先试一轮。
第二条容易忽略的是适配成本。Xing4.0 把微调侧(LLaMA-Factory、MindFormers)、推理侧(SGLang、vLLM、KTransformers)和智能体框架侧(OpenCode、Claude Code、OpenClaw、Hermes)都对齐了一遍,模型同时上线了 HuggingFace、GitHub、魔搭、Gitee、魔乐 5 个社区。这活儿其实很费工夫,各家智能体框架的工具调用格式都不一样,不做定向调优就会冒出各种莫名其妙的解析错误。愿意铺这一层,说明它是奔着被人真用去的。
三家各自最难看的地方
Xing4.0 的短板是知识总量。29B 参数就是 29B 参数,冷门领域的事实性问题上它比不过几百 B 参数的模型,这不是量化和上下文能补的。另外”全栈国产”这条对大多数开发者并不构成选型理由,除非采购清单里明确要求它。
Step5Preview 的问题是它还没开源,现在能看到的全是官方数字,而且官方给的是 AA 综合指数的名次,没有放 SWE-bench 这类可复现的工程基准分数。”八分之一成本”这个口径尤其要留个心眼:不同模型的一次成功率不一样,一次做不对要重跑两遍,账得重算。它主打的编程、软件工程、金融这几类任务链条都长,中间任何一环返工,成本是乘出去的。
DeepSeek Flash 这一档最大的问题是你完全不掌握它。价格调过、缓存策略调过、峰谷两档的划分也调过,每一次都得重新算账。好处是省心,代价是所有变量在别人手里。
顺便说一个第三方测的结果。FlappyBench 上 DeepSeek V4.1 Flash 和 Qwen 3.8 Omni Flash 都以不到 0.015 美元的成本拿到 9/10,而 Gemini 3.8 Flash 花了 0.205 美元只拿 5/10,且被判定仍属硬编码。13 倍的价差换来一半的分数。便宜档内部的差距,比大家默认的要大得多。
如果非要给一个归属
我的实际做法是三条线并行,但分得很清楚。
日常高频、不敏感、量大的活儿留在 Flash 档,按 4 元到 8 元每百万 token 的输出价,这部分不值得折腾。复杂的长链任务等 10 月 15 日开源之后再评,现在下结论太早。
真正让我动心的是第三条。数据不能出内网的活儿,比如合同、代码库、内部文档,以前的选择是要么放弃 AI,要么申请一堆合规流程。现在一张 4000 元的卡就能在本地跑起一个智能体能力排进前三的模型,这个门槛降得有点狠。
那张卡未必能在 API 账单上回本。但有些活儿,它是唯一能干的那个。
相关对比:《Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上》、《DeepSeek V4.1 Flash 和 V4 Pro:单价全线下调,我的账单反而涨了 36%》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Xing4.0-29B-A4B、Step5Preview、DeepSeek V4.1 Flash:一张 4000 块的卡,和三种归属关系