2024 年 2 月 26 日,Mistral 发布第一代 Large,只给 API,权重不放。五个月后的 Large 2 放了权重,但挂的是 Mistral Research License,商用要另买授权。2025 年 12 月的 Large 3 换成 Apache 2.0,随便用。到了 2026 年 10 月 6 日的 Large 4,官方博客和文档卡只写了”open-weight”四个字,许可证名称一个没有,Hugging Face 上到今天还没有仓库。
两年半,四代,四种状态。
我把这条线拉出来,是因为 Large 4 的发布帖里最醒目的宣传语是”西方最强开源模型”,而这个”开源”目前还是一张期票。要比它和 DeepSeek V4 Pro、Kimi K3 的高下,得先把每家在”开”这件事上的实际动作摆清楚,再谈分数。
发布那天,三家各自给了什么
Mistral Large 4:10 月 6 日起 API 预览,权重”月底前”放,具体日期没有。总参数 1.05T,激活参数官方自己给了两个数,博客和文档卡写 52B,官方 X 账号写 49B。上下文文档卡写 1M,Artificial Analysis 的页面列的是 524k。训练用了 3800 块 Grace Blackwell。
DeepSeek V4 Pro:4 月 24 日预览就把权重放在了 Hugging Face,MIT 许可。8 月 13 日正式版 0813 检查点,总参数按 Safetensors 元数据算是 1.7T,激活 49B,上下文 1M,最大输出 384K。
Kimi K3:7 月 16 日晚上先悄悄上线 API,权重 7 月 27 日兑现,许可证叫 Kimi K3 License,MIT 文本加了两条附加条款。2.8T 总参数、104B 激活,是三者里最大的。
所以,三家的”开源”并不是同一个意思。DeepSeek 是发布即开放,Kimi 隔了 11 天,Mistral 到现在还在等。
Kimi 那两条附加条款也有必要知道:任意连续 12 个月收入超过 2000 万美元的模型即服务提供方,要先和月之暗面单独签协议;月活超过 1 亿或月收入超 2000 万美元的产品,界面上要显著标出”Kimi K3″。网上流传的”最高 30% 分成”说法,我在许可证原文里没有找到。
价目表上的数字,和你实际付的数字
三家的官方价格放在一起,输入 / 输出,每百万 token,美元:
| Mistral Large 4 | DeepSeek V4 Pro | Kimi K3 | |
|---|---|---|---|
| 标价 | 1.36 / 4.18 | 峰时 1.32 / 3.96 | 3.00 / 15.00 |
| 当前实付 | 0.68 / 2.09(预览五折) | 谷时 0.66 / 1.98 | 3.00 / 15.00 |
| 缓存命中 | 0.14(现 0.07) | 峰 0.044 / 谷 0.022 | 0.30,另收写入费 3.00 或 6.00 |
| 实测输出速度 | 116 tok/s | 94 tok/s | 41 tok/s |
每一列都有一个表上看不出的问题。
Mistral 的五折是预览价,官方文档没写截止日期,Artificial Analysis 的说法是只有头两周。按 10 月 6 日起算,10 月 20 日前后可能就恢复 1.36 / 4.18。现在做预算的人如果照着 0.68 算,月底账单会翻倍。
DeepSeek 的峰谷制是 8 月 16 日才有的。往前翻:4 月上线价 1.74 / 3.48,5 月宣布原定 5 月 31 日到期的 75% 折扣改为”永久”,变成 0.435 / 0.87。三个月后随 0813 正式版引入分时计价,峰时 1.32 / 3.96,是那个”永久价”的三倍。官方更新日志里只写了”引入分时计价”,没提涨价两个字。峰时的定义是 UTC 周一到周五 01:00 到 04:00 和 06:00 到 10:00,中国法定节假日除外。换成北京时间就是工作日上午 9 点到 12 点、下午 2 点到 6 点,也就是你最可能跑任务的时段。
9 月 10 日还有一出。DeepSeek 公告说 9 月 14 日起 V4 Pro 的请求会被路由到 V4.1 Flash 并按 Flash 价计费,直到 V4.1 Pro 上线。四天之内这个计划被撤回,更新日志只留下一句”继续提供 V4 Pro 服务,计费方式不变”。V4.1 到今天只有 Flash,Pro 停在 0813。
Kimi 的问题是没有打折这回事。3 / 15 的价格比上一代 K2.6 的 0.95 / 4 涨了三到四倍,而且 K3 独有缓存写入费,K2 系列不收。更隐蔽的是上下文分级:Moderato 档 99 元一个月只给 256K,Allegretto 档 199 元以上才给 1M,最便宜的 49 元档根本用不了 K3。Kimi Code 里 1M 版本的配额消耗是 256K 版本的两倍。
月之暗面企业负责人黄震昕对定价的回应是:”SOTA 模型应该有自己的定价权,国产 AI 不该被贴上低价标签。”这话说在 7 月 21 日,同一天 Kimi 因为请求量远超预估暂停了 C 端新用户订阅。
跑分表为什么对不上
三家官方发布的基准列表几乎没有交集。
DeepSeek 预览版模型卡列了 SWE-bench Verified 80.6、GPQA Diamond 90.1、LiveCodeBench 93.5,都是 max 档的成绩。但 0813 正式版的模型卡把这些大众基准全删了,换成 Terminal Bench 2.1 87.9、DeepSWE 62.7、Cybergym 83.3 这类智能体基准。两张卡片隔了三个半月,口径完全换掉。
Kimi K3 的模型卡列了 GPQA Diamond 93.5、Terminal Bench 2.1 88.3、BrowseComp 91.2,SWE-bench Verified 不列。
Mistral 列的是 DeepSWE 61.7、Terminal-Bench 4 28.3%,外加一堆自家命名的指数,SWE-bench Verified 和 GPQA 都没有。发布帖里最显眼的一张图是委托 Surge AI 做的编码盲测:Opus 5 得 4.22,Large 4 得 3.74,Kimi K3 得 3.59。样本量和原始数据没有公布。Hacker News 上有人直接质疑挑对手挑得太巧。
把三家拉到同一个第三方口径下,画面就变了。Artificial Analysis 的智能指数:Kimi K3 是 44,Mistral Large 4 是 38,DeepSeek V4 Pro 是 36。Mistral 在这个榜上排第 64 名,比 DeepSeek 的 V4.1 Flash(39)还低一点,但确实比 V4 Pro 高。Arena 文本榜 10 月 2 日的快照,Kimi K3 max 档排第 4,1488 分,DeepSeek 7 月快照在 1456 上下,Mistral 10 月 8 日才上榜,还没有分数。
还有一个数字我觉得比智能指数更能说明问题:跑完 AA 全套测试的输出 token 消耗,Mistral Large 4 用了 2 亿,同类模型中位数是 8100 万。每个任务平均吐 69330 个 token,其中 52011 个是推理过程。它快,是因为每秒出 116 个 token,但它也啰嗦,所以单任务成本 1.13 美元(按标价),比 DeepSeek V4 Pro 的 0.67 美元贵,比 Kimi K3 的 2 美元便宜。
各自会栽在哪里
DeepSeek V4 Pro 最集中的投诉是限流。GitHub 上 5 月 29 日的 issue 标题就是”deepseek-v4-pro 和 v4-flash 的速率限制过于严格”,报 429,没有官方回复,最后被标成 stale 关闭。官方 API 的并发上限是 500。Hacker News 上有人说测试时”大量超时错误”。
幻觉是第二个。linux.do 上有一篇重度使用几天后的帖子,说让它读长论文做扩写时,会直接编造数据和结论,而 Kimi 在同样场景下只是凑字数。知乎上另一个答主的观察更具体:幻觉通常出现在上下文里有大量相似文本的时候,思维链里已经抽到了正确信息,后面处理时还是会失真。编程被不止一个评测者认为是 V4 Pro 唯一没冲到最前面的赛道。
Kimi K3 的翻车点是慢和贵叠在一起。钛媒体实测同样的场景,生成时间大约是 GPT-5.6 Sol 的两到三倍,一段 30 秒宣传片剪辑花了近两个小时。Hacker News 上”Kimi K3 is not cheap”那个帖子里,有人算出按 API 价它比 Opus 和 GPT-5.6 Sol 还贵,19 美元的套餐一天半就把周配额打满。simonw 画一只鹈鹕花了 0.25 美元,16658 个输出 token 里 13241 个是推理。
另一件事绕不开:K3 在大约 15% 的测试里会自称 Claude,预填”I am Claude”之后能吐出 Anthropic 的模型标识符。月之暗面 7 月 21 日否认蒸馏。Anthropic 9 月 10 日的报告指控月之暗面通过数千个欺诈账号把 Kimi 用户的请求转给 Claude 再把回答当作 Kimi 的输出展示,月之暗面同样否认。这是指控,不是定论,但用 K3 做商业产品的人需要知道这个争议存在。
Mistral Large 4 上线才三天,翻车样本还少。目前能看到的是:推理档位只有”none”和”high”两档,有人试下来觉得两档差别不大,还有人说 reasoning effort 参数像是坏了;AA-Omniscience 测出来的幻觉率 41.9%;r/LocalLLaMA 上有人自己跑了棋类、代码和图像分类,评价是”感觉相当过时”。它在网络安全类基准上确实好,Cybench 93%,但这是一个很窄的赛道。
以及,12GB 显存的用户看到”开放权重,1.05T 参数”时的心情,和看到 DeepSeek、Kimi 时是一样的。三个模型 FP8 都要一整台 8 卡机,Kimi 的 1-bit 量化版还要 570GB。
把三个模型放到具体的活上
跑智能体、长链条工具调用,预算不是第一位:Kimi K3。它在 Terminal Bench、BrowseComp、OSWorld 这些基准上确实领先,Arena 上也最高。前提是你能接受 41 tok/s 和每百万 15 美元的输出价,并且在多轮调用里老老实实回传推理内容,否则会报错。
大批量、成本敏感、能把任务排到非峰时:DeepSeek V4 Pro。谷时 0.66 / 1.98 加上 97% 的缓存折扣,在同等能力的模型里找不到第二家。代价是 429 要自己做重试,长文档任务要加校验。
要欧洲数据驻留、合规部门不让碰中国模型、对响应速度有要求:Mistral Large 4。它是三者里最快的,视觉输入原生支持,安全类任务有优势。但要等权重和许可证落地再决定是否自部署,并且按 1.36 / 4.18 而不是五折价做预算。
只想要一个”西方最强开源”的名头去写 PPT:等 10 月底。到时候看权重放没放、许可证写的是什么、Arena 上的分数是多少。现在下结论,三件事里有两件还没发生。
相关对比:DeepSeek V4.1 Flash 和 V4 Pro:单价全线下调,我的账单反而涨了 36% | 小米 MiMo-V2.6-Pro 的价目表,和 8 月 17 日之前的 DeepSeek V4 Pro 一分不差
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Mistral Large 4、DeepSeek V4 Pro、Kimi K3:三家都说开源,发布那天只有一家把权重放了出来