网上现在有个说法传得很广:开源编码模型已经把闭源的性价比优势吃干净了,Kimi K2.7 Code 单价只有头部闭源模型的五分之一,剩下的只是习惯问题。这个说法有个前提从来没人提——它成立的条件是你的上下文塞得进 256K,而且缓存命中率足够高。这两条有一条不满足,账就翻过来了。
今天正好是个验证这件事的日子。DeepSeek V4 Pro 从今天起停止独立服务,请求全部改道到 9 月 10 日上线的 V4.1 Flash。一批原本按 Pro 的价格和上下文规划过流水线的团队,被迫在这周重新算一遍账。顺手把 Kimi K2.7 Code 和 GPT-5.6 Luna 也拉进来比,是很自然的动作。
三张价目表,先把货币统一
这三家的定价不在一个计价体系里,直接摆数字会误导人。
Kimi K2.7 Code 按美元计,每百万 token 输入 0.95 美元、输出 4.00 美元,缓存命中输入降到 0.19 美元。模型 ID 是 kimi-k2.7-code,6 月 12 日上的 Hugging Face。
GPT-5.6 Luna 是这三个里明面上最便宜的:输入 0.20 美元、输出 1.20 美元,缓存输入 0.02 美元。官方说缓存能把重复上下文的输入成本砍掉九成。
DeepSeek V4.1 Flash 报的是人民币,而且分时段。9 月 10 日 12:00 生效的价格是:空闲时段缓存命中 0.02 元、未命中 1 元、输出 4 元;高峰时段全部翻倍。按 7.1 的汇率折算,空闲时段输出约合 0.56 美元每百万 token,高峰时段约 1.13 美元。
折完之后排序是这样的:输出侧 DeepSeek 最便宜,哪怕在高峰时段也比 GPT-5.6 Luna 略低一点点;Kimi 的输出价是 DeepSeek 空闲价的七倍多。输入侧三家咬得很紧,缓存命中之后 DeepSeek 和 Luna 都到了 0.02 这个数量级,Kimi 的 0.19 高出一个档。
分时段计价这件事在国内 API 里越来越常见,但它对跨境团队是个隐性成本。DeepSeek 的空闲时段按北京时间划,团队在欧美时区作业的话,正好整天踩在高峰价上。这条没写在价格页的显眼位置。
256K 这个数字卡住的是谁
上下文窗口这一栏差得离谱。
V4.1 Flash 支持 100 万 token 上下文、38.4 万 token 输出。GPT-5.6 Luna 是 110 万上下文、单次最多输出 12.8 万。Kimi K2.7 Code 只有 256K。
256K 在日常编码里够用。一个中等规模的仓库,加上依赖声明和几个相关模块,塞进 256K 没什么压力。真正会撞墙的是两类活:一类是整库重构,要模型同时看到几十个文件的调用关系;另一类是长会话的 Agent 任务,跑到第三四十轮时历史消息本身就把窗口占满了。
撞墙之后的处理方式决定了成本。你得做上下文裁剪或者分段摘要,这一层工程量不小,而且每做一次摘要就丢一次信息,模型改错的概率上升。把这部分人力成本折进去,五分之一的单价优势能剩下多少,得看具体项目。
V4.1 Flash 的 100 万上下文有个架构上的来路值得说明。它是 552B 的 MoE,用了一套 Causal-Encoder-Decoder 结构,输入和输出不对称:输入侧只激活 8B 参数,输出侧激活 16B。配合新的 KV Cache 设计,跟上一代比对 HBM 的需求降到四分之一、对 SSD 的需求降到八分之一。长上下文真正贵的地方在显存,不在算力,这个改动是冲着那里去的。
顺带说,这一代还加了原生的多模态视觉理解,可以直接吃图。对写前端的人来说,把设计稿丢进去这条路打通了。
各自的短板
K2.7 Code 最被认可的改进是它不再”想太多”。K2.6 那一代有明显的过度推理问题,反复自我验证、来回纠错,思考 token 烧得很凶。K2.7 把思考 token 用量压低了大约三成,输出也更果断。幻觉率从 K2.6 的 65% 降到 39%。
39% 还是很高。
它的另一个短板在成品质感。多份实测提到同一个现象:K2.7 生成的前端页面干净规整,但规整得过头,看着像模板,要人工再调一轮才有设计感。综合能力上,它也没有追平 Claude Opus 4.8 或者 GPT-5.5 这一档。
GPT-5.6 Luna 的问题是定位。它在编码索引上拿到 71.4%,截至 9 月 10 日在编码类目排到第 9。这个成绩配上 0.20 美元的输入价确实划算,但第 9 名的意思就是前面还有八个。它适合承接量大、单个任务不难的活,真碰上需要深度推理的重构,换模型是更省事的选择。
OpenAI 自己也在收缩这条产品线。上个月宣布 GPT-5.3-Codex-Spark 下周退役,从发布到下线只活了七个月。那是每秒 1200 token 的极速型号,也是 OpenAI 第一个不跑在英伟达上的模型。官方给的理由是用量往下掉。便宜档的模型迭代和退役都快,把模型 ID 写死在流水线里的团队每隔几个月就要被迫迁移一次。
V4.1 Flash 的短板不在模型本身,在部署侧。SemiAnalysis 的实测给了一组很扎眼的数字:CUDA 的 vLLM 支持 V4.1 Flash 两天之后 AMD 才发出自己的镜像,功能没问题,但每美元性能比 H200 差最多 14.8 倍,比 B200 和 B300 差最多 42 倍。想自己托管开源权重的团队,卡的选择基本被锁死了。
跑分这次帮不上忙
比较这三个模型时最容易走的捷径是看榜,而这次榜单帮不上忙。
Moonshot 公布 K2.7 Code 成绩时,用的是 Kimi Code Bench v2(比 K2.6 提升 21.8%)、Program Bench(提升 11.0%)和 MLS Bench Lite(提升 31.5%)。这三个基准都只能和自家上一代比。业界通用的 SWE-bench Verified、SWE-bench Pro 和 Terminal-Bench,官方结果里一个都没有。
官方倒是给了一个 SWE-bench Pro 的厂商自报数字,声称领先 GPT-5.4(xhigh 档)和 Claude Opus 4.6(max effort 档)。厂商自报的对比里,对手的推理档位是自己挑的,这种数字参考价值有限。
所以只能自己跑。可行的办法是从自己项目的历史里挑二十个已经解决掉的 issue,把改动前的代码快照和 issue 原始描述一起喂给三个模型,让它们各出一版 patch,然后人工逐条核对:改对了几个、改错了几个、有几个是看起来对但引入了新的回归。二十个样本不算多,但足够把三家在你这个代码库上的真实差距拉出来,比照着别人的榜单选型可靠得多。这件事一个人做大概要两天,摊到后面几个月的 API 支出上,回本很快。
谁该用哪个
整库级别的重构、长会话 Agent、需要读图的前端任务,选 V4.1 Flash。100 万上下文加上多模态,这一组在三家里独一份,输出价也最低。前提是你接受按北京时间划分的分时计价,以及自托管时被锁在英伟达卡上。
量大、单任务简单、缓存命中率高的场景,选 GPT-5.6 Luna。0.02 美元的缓存输入价在长期批处理里能拉开很大差距。别拿它啃硬骨头。
中等规模仓库的日常编码,尤其是前端和交互类任务,K2.7 Code 是均衡的那一个。它的价值在稳定和快,不在上限。做完记得自己再过一遍页面。
还有一条现实路径是别自己拼。月费 10 美元的 OpenCode Go 把 Kimi K3、K2.7 Code、GPT-5.6 Luna 一起打包,靠按任务分流做到了连续两周收支平衡。个人开发者与其纠结三家的单价表,不如先看看这类打包套餐够不够用。
相关对比:《DeepSeek V4.1 Flash 和 V4 Pro:单价全线下调,我的账单反而涨了 36%》、《GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同》、《GPT-Live-1、GPT-Realtime-2.1、Gemini 3.1 Flash Live:每分钟 5 美分只是前台价,三份规格表各藏一个坑》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上