9 月 10 日中午 12 点,DeepSeek 的 Flash 系列开始按新价目表计费。三档降幅不一样:缓存命中降 60%,缓存未命中降 33.33%,输出只降 11.11%。空闲时段的输入缓存价还能再往下压。
这个降幅结构值得单独说一句。真正被砍到四折的是缓存命中那一档,也就是同一段前缀被反复送进去的场景——系统提示词、长文档、多轮对话里越堆越长的历史。输出价几乎没动。
换句话说,这次降价对谁最划算,基本已经写在价目表里了:谁的 prompt 重复度高,谁省得多。做客服机器人、文档问答、代码库助手这类活儿,同一份上下文一天要送进去几万次,命中率能做到八九成,账单直接对折还不止。反过来,做长文生成、翻译、批量改写的,输入短输出长,这次基本没什么感觉。
同一天还有另一件事:DeepSeek V4.1 Flash 的中间版本开启内测。官方给的说法是换了新的模型结构,原生支持多模态,能力更强、速度更快、成本更低。接入方式没变,base_url 保持原样,把模型名改成 deepseek-v4.1-flash 就能跑。
把这两件事放一起看,逻辑就顺了。新结构先内测,价格先降下去,等中间版本跑稳了再正式推。国内几家现在的打法都差不多——不靠一次发布会砸场子,靠价格和迭代节奏慢慢把人黏住。
要提醒一句的是,内测版本随时可能改。真跑生产的话,最好先把成本模型按新价重算一遍,再决定要不要把线上流量切过去。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






DeepSeek Flash 明天降价,缓存命中价直接砍到四折