DeepSeek V4.1 Flash 和 V4 Pro:单价全线下调,我的账单反而涨了 36%

AI资讯13分钟前发布 Brisk
240 0

一份量化策略的回测报告,正文里的年化收益是 18.4%,翻到结尾汇总表变成 16.9%。

同一次生成,同一份数据,中间没有任何口径说明。这是我换到 V4.1 Flash 第二天撞上的第一个坑,也是排查起来最费劲的一类错,因为每一段单独拿出来看都完全成立。

后来在长篇小说任务上复现了同类问题:章节之间的人物关系前后对不上,第七章刚死的人第十一章又出来说话;再往后拿它整理一份三万字的行业材料,同一家公司的成立年份在开头写 2019、在附录写 2021,两处都言之凿凿。这类错有个共同点,它们全都出现在长度超过某个阈值之后,短任务里一次也没遇到过。

短的它做得极好,长的它开始失忆。

换代真正该被讲清楚的就是这一面。DeepSeek 把 V4 Pro 的下线时间钉死在 9 月 14 日 12:00,之后所有发给 deepseek-v4-pro 的请求会被整体路由到 V4.1 Flash,按 Flash 的价格计费。你没有选择要不要换,只有四天时间决定怎么换。

552B 里只激活 8B,这件事决定了后面所有的数字

V4.1 Flash 是 552B 的 MoE,用的是一套新的 Causal-Encoder-Decoder 结构。它的特别之处在于输入和输出不对称:输入侧激活 8B,输出侧激活 16B。

官方给的两个数字更能说明问题。相对初代模型,KV Cache 压到了原来的 1/437;相对上一代,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。

把这三个数字换算一下:同样一台机器,能同时挂住的会话数是上一代的四倍起步,而首次把长文档灌进去的那一次 SSD 读写量只有原来的八分之一。

说的是同一件事。

显存不再是瓶颈了。

推理成本的大头从来不是算力,是显存带宽和缓存驻留。KV Cache 小一个数量级,同一张卡上能同时塞进去的并发请求就多一个数量级,单位 token 的边际成本随之塌下来,DeepSeek 敢在发布同一天就把三档价格全部下调,靠的就是这个;这也顺带解释了另一件事,为什么这一代是原生多模态视觉理解,而不是像上一代那样外挂一个视觉编码器再拼接特征。省下来的显存预算,正好够把图像通道直接做进主干里,代价是模型必须重新训一遍,这就是为什么它顶着一个新的结构系列名字而不是叫 V4.2。

速度是真的快,快到会改变你的用法

实测数据里几个倍数比较扎实:49K 长上下文检索速度提升 5.2 倍,SVG 代码生成提升 6.0 倍。生成速度用户测到 284 token/s 这一档,接近旧版的三倍,也有人在轻负载时段跑出 400 tps。

视觉侧的变化更夸张。原来要走「截图上传—OCR—再喂给模型」三步的短视觉任务,现在直接读图,耗时从几百秒降到十几秒。

速度提升到这个幅度,影响的不只是等待体验,它会直接改掉你使用模型的姿势:原来因为太慢而不敢做的事情现在可以做了,比如把整个代码仓库丢进去让它通读一遍再动手,比如一次会话里连续开十几个子任务、人在旁边实时看它改,再比如把原本拆成三轮问的需求合并成一轮丢过去。这些用法在 V4 Pro 上不是做不到,是等到结果回来的时候你已经忘了自己最初想干嘛。

然后账单来了。

单价全线下降,我的月账单涨了 36%

V4.1 Flash 的新价从今天 12:00 生效,空闲时段输入缓存命中 0.02 元每百万 token,缓存未命中 1 元,输出 4 元;高峰时段整体翻倍。

对照 V4 Pro 自 8 月 17 日起执行的峰谷价:空闲时段缓存命中 0.05 元、未命中 1.5 元、输出 4.5 元,高峰时段 0.10 元、3 元、9 元。

单价(元/百万 token) V4 Pro 空闲 V4.1 Flash 空闲 V4 Pro 高峰 V4.1 Flash 高峰
输入·缓存命中 0.05 0.02 0.10 0.04
输入·缓存未命中 1.5 1 3 2
输出 4.5 4 9 8

每一格都降了。缓存命中价降幅最大,砍掉六成;未命中降三分之一;输出只降了一毛一,幅度最小,这个细节后面有用。

有开发者在游戏生成和小说生成两类任务上做过对照,同样的提示词、同样的计费口径,V4.1 Flash 的总花费比旧版高了 36%。

单价降了,总账涨了。

原因不在价格表里,在模型行为里。因为快,因为便宜,模型自己更倾向于展开:那一轮测试中它累计开了 37 个子 Agent。每个子 Agent 都要重新灌一遍上下文,每一次灌都是一次缓存未命中。单价打了六折,调用次数翻了几倍。

空闲时段缓存命中 0.02 元、未命中 1 元,两者相差 50 倍,账单的开关就卡在这个比例上。把系统提示、长文档、工具定义这些固定部分死死钉在前缀里,别让任何动态内容插到中间,是接下来必须做的工程活。做不到这一点,降价对你就是负的。

半年三次改价,这条线本身就是信息

把 2026 年 DeepSeek 的定价动作按时间摆开,能看出一条挺清楚的节奏。

5 月 23 日,V4-Pro 结束 2.5 折优惠活动,直接永久降到原价的 1/4,输入缓存命中 0.025 元、未命中 3 元、输出 6 元,当时的宣传口号是”每百万 tokens 输入仅需 2.5 分钱”;到了 8 月 17 日,价格结构从单一价变成峰谷两套价,高峰时段最高一档涨到 27 元每百万 token,那一轮外界的普遍读法是涨价而不是降价;再到 9 月 10 日,新模型发布并同步下调三档单价,四天之后老旗舰整个下线。

四个月,三次改价。

三次动作方向不一致,但目标是一致的:把用户从高峰期赶到闲时,把请求从大模型赶到小模型,把上下文赶进缓存。定价一直在替架构做调度。

两边各自的窟窿

V4.1 Flash 的短板已经很明确了。长篇一致性不行,超过一定长度之后自己跟自己打架,前面提到的回测数字和小说人物就是这类。它擅长的是快速、局部、可验证的任务;不擅长的是需要全程记住一套设定的长活儿。

第二个短板是成本不可预测。子 Agent 想开就开,一次复杂任务花多少钱事先估不出来,做面向 C 端的按次计费产品尤其难受。

V4 Pro 的短板同样不少。慢,贵,没有原生视觉能力,需要在外面拼一套 OCR 流水线。最致命的是它马上就没了。

还有一个变化容易被忽略:DeepSeek 把原来的快速模式、专家模式、识图模式合并成了一个统一的智能模式,模型自己检测查询复杂度、自己决定要不要激活视觉。对普通用户是省心,对做产品接入的人是麻烦。原来靠切模式来控成本、控延迟的做法,现在没有那个开关了。

一个跟主流不太一样的判断

现在的普遍说法是”小模型全面超越大模型,参数竞赛结束了”。官方给的口径也是 V4.1 Flash 在性能、费用、速度、总用时各项指标上全面超越 V4 Pro。

我不同意。

被超越的是 V4 Pro 这个具体型号,不是”大模型”这个类别。DeepSeek 已经说了 V4.1 Pro 会上线,中间这几天只是让 Flash 顶一下班。所谓的全面超越,比较对象是一个即将退役的旧型号,不是同代旗舰。

更实际的一层:Agentic Benchmark 上的分数高,和长篇任务里数字不打架,是两种不同的能力。前者靠的是每一步做对,后者靠的是全程记住。当前这一代 Flash 明显是前者强、后者弱,而恰恰是后者决定了它能不能进生产环境写财报、写合同、写长报告。

把小模型的胜利宣布得太早,代价是把它塞进它做不了的活儿里,然后在季度复盘上花两周时间排查那些看起来毫无规律的数字错误。这个坑我已经替你踩过一次了。

四天之内该干什么

如果你的服务现在还在调 deepseek-v4-pro,9 月 14 日 12:00 之后请求不会失败,会被静默路由到 Flash 并按 Flash 计费。表面上什么都没变,这恰恰是最危险的。

建议做三件事:把超过 2 万字的长任务单独拎出来跑一遍回归,重点比对全文里所有出现两次以上的数字;把提示词的固定前缀整理干净,用 usage 里的 prompt_cache_hit_tokens 字段确认命中率,低于 70% 就说明前缀被动态内容打断了;给子 Agent 数量加一个硬上限,上面那个 36% 的案例开了 37 个,正常业务给到 5 个已经足够。

模型名改成 deepseek-flash 就能提前切过去,不用等到被动路由。多模态视觉的能力此前已经在 DeepSeek-V4-Flash-Vision-Exp 上放出来过,走的是 Chat Completions 和 Messages 两套接口,接过内测版的团队这次改动量几乎为零。

下游已经跟上了。OpenCode Go 发布首日就接了 V4.1 Flash,并把用量限额临时提到 4 倍、持续 72 小时。Command Code 也预告了自己的 DeepSeek 集成更新。想先试试手感的,这两个入口比自己搭一套快。

相关对比:《GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同》《Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样》

© 版权声明

相关文章

DeepSeek V4.1 Flash 和 V4 Pro:单价全线下调,我的账单反而涨了 36% 暂无评论

none
暂无评论...