一道指令遵循题:写十句话,分别以数字 1 到 10 结尾,每一句都要读得通。
小米 MiMo-V2.6-Pro 前九句交得干净,第十句读起来别扭。出题的人自己拿不准,把这句贴给 DeepSeek 去判,DeepSeek 回复说这句的语法确实有问题。画面有点滑稽:今天要拿来对比的两个模型,一个在答题,一个在阅卷。
后面几道题更难看。画一只骑自行车的鹈鹕,MiMo 想了大约一个半小时,交出来的鹈鹕全程没扶车把,脚画成了人腿;画一个拉复合弓的射手,又等了半个多钟头,头和身子错位,右手握弓的手掌翻成了左手,弓弦跑到手的外侧,这个姿势根本开不了弓。让它写一个跑在浏览器里的仿操作系统,页面上点哪里都没反应。测评者最后用一句粤语收尾,意思是退货。
同一周,这个模型在 Artificial Analysis 的智能指数上拿了 46 分,开放权重模型里排第一,压过了 Kimi K3 和 Qwen3.8 Max,离 GPT-5.6 Sol (max) 的 47 分只差 1 分。
两件事都是真的。
我把它和 DeepSeek V4 Pro 放在一起写,起因不是跑分,是一张价目表。
一张被捡回来的价目表
MiMo-V2.6-Pro 在 9 月 22 日发布,官方定价是输入缓存命中 0.025 元、缓存未命中 3 元、输出 6 元,都按每百万 token 计;美元口径是 0.0036、0.435、0.87 美元。小米特意说明,这个价和 V2.5 系列相同,一分没动。
这三个数字眼熟。
8 月 13 日 V4 Pro 正式版挂出来的价格,就是缓存命中 0.025 元、未命中 3 元、输出 6 元,美元价也分毫不差。
它只维持了四天。8 月 17 日零点起,DeepSeek 换成峰谷两套价:北京时间工作日 9:00 到 12:00、14:00 到 18:00 算高峰,V4 Pro 的缓存命中涨到 0.30 元,涨幅 1100%;未命中 9 元,涨 200%;输出 27 元,涨 350%。其余时间按高峰价的一半收,8 月 23 日起周六周日全天按空闲价。
所以小米这一次谈不上打价格战。它站到了 DeepSeek 一个多月前站过的位置上,然后没跟着涨。
DeepSeek 也没有回头的迹象。8 月 6 日那条”计划近期整体上调 API 定价、预计涨幅较大”的预告,十一天后兑现的就是这组数。9 月 24 日又有报道说 DeepSeek 的年化收入已经到了 10 亿美元,比几个月前翻了一倍多,增长里有一部分直接来自这轮涨价,梁文锋在投资人会上的说法是客户数没有因此减少。收入涨了、客户没跑,指望 V4 Pro 回到 3 元和 6 元不太现实。
| 项目 | MiMo-V2.6-Pro | DeepSeek V4 Pro(空闲 / 高峰) |
|---|---|---|
| 输入·缓存命中(元/百万 token) | 0.025 | 0.15 / 0.30 |
| 输入·缓存未命中 | 3 | 4.5 / 9 |
| 输出 | 6 | 13.5 / 27 |
| 总参数 / 激活参数 | 1.02T / 42B | 1.6T / 49B |
| 上下文 / 单次最大输出 | 1M / 128K | 1M / 384K |
| 输入模态 | 文本、图像、视频、音频 | 仅文本 |
| AA 智能指数 / 每任务成本 | 46 / 0.13 美元 | 36 / 0.67 美元(max 档) |
| 输出速度 / 首 token | 42.3 token/s / 3.26 秒 | 76.4 token/s / 1.71 秒 |
0.13 美元和 0.67 美元,中间隔着的主要是单价
Artificial Analysis 跑完一整套指数题,MiMo-V2.6-Pro 平均每个任务花 0.13 美元,V4 Pro 的 max 推理档花 0.67 美元,差了 5 倍多;GPT-5.6 Sol (max) 是 1.99 美元。
这个差距不该读成”小米更省 token”:跑同一套题,MiMo 吐了约 1.4 亿个输出 token,V4 Pro 是 1.6 亿,只少 12.5%。剩下的倍数来自价格表,AA 给 V4 Pro 按高峰价算,输出 3.96 美元,是 MiMo 的 4.55 倍。
token 效率这件事也别太乐观。有人实测,V2.6 的输出 token 量比 V2.5 翻了一倍,单价没变,长链路 Agent 任务的账单照样上涨。
假设一次 Agent 任务读进 200 万 token、90% 命中缓存、最后输出 15 万 token。MiMo 合计约 1.55 元,V4 Pro 空闲时段约 3.2 元,工作日高峰约 6.39 元,输出一项占了大头。
2 倍到 4 倍,取决于任务落在一天里的哪个钟点。
缓存这一项的比例也不一样。MiMo 命中价和未命中价差 120 倍,V4 Pro 两档都是 30 倍。前缀做得干净的团队,在 MiMo 上吃到的折扣更深;前缀乱七八糟的,两家的差距会缩回未命中价之间的 1.5 到 3 倍。
两家报的根本不是同一套分
想拿具名基准正面比,会发现无从下手。DeepSeek 给 V4 Pro Max 报的是 SWE-bench Verified 80.6%、SWE-bench Pro 55.4%、GPQA Diamond 90.1%、Terminal Bench 2.0 67.9%、带工具的 HLE 48.2%。小米给 MiMo-V2.6-Pro 报的是 DeepSWE v1.1 71.9、Toolathlon-Verified 76.9、Terminal Bench 2.1 89.9、OSWorld-Verified 82.0。
两张表几乎没有交集。Terminal Bench 看着同名,一个是 2.0、一个是 2.1,67.9 和 89.9 放在一起比没有意义。DeepSWE 用的是小米自己的 harness 和评分器,RL 过程中从 58.4 爬到 72.57,没法和别家的 SWE-bench 成绩对齐。即便在自己选的表上,MiMo 的 DeepSWE 也还落后 Claude Opus 5 的 74.0。
能同尺比较的只剩第三方综合指数,46 对 36。V4 Pro 在 AA 的开放权重榜上目前排第 8。
10 分不是小差距。
可它是推理、知识、编程、Agent 任务揉在一起的平均数,开头那种画鹈鹕、搭仿操作系统的题,它兜不住。
MiMo 这边的毛病:慢,而且挑工具链
AA 最近一次测到 MiMo-V2.6-Pro 的输出速度是每秒 42.3 个 token,在 115 个同类模型里排第 54,首 token 要等 3.26 秒。V4 Pro 是每秒 76.4 个,首 token 1.71 秒。发布头几天第三方页面上 MiMo 一度测到每秒 134 个,几天之内掉到现在这个数,小米没解释原因。
那只想了一个半小时的鹈鹕,一半要算在速度头上。
小米的办法是另卖一个 UltraSpeed 版,同一个 1T checkpoint,模型页写的是输出速度约为原版 10 倍,发布文档里写的是最高 20 倍加速。两个口径对不上,按保守的算。
第二个毛病更隐蔽,B 站有人用小米自家的 MiMo 桌面端测,成绩平平,换成第三方工具链重测,结论整个反转。评论区点出的是桌面端多智能体并行改文件的权限冲突和 loop 卡死。你在某篇评测里看到的 MiMo,很可能是它的工具链,不是模型本身。
还有两条硬限制写在规格里:单次最大输出 128K token,API 速率每分钟 100 次请求、1000 万 token。V4 Pro 的单次输出上限是 384K,正好三倍。
V4 Pro 这边的毛病:不在能力,在这一个多月的反复
V4 Pro 正式版的出场并不顺。8 月 12 日深夜它在 API 文档里静默上线,第二天官网首页的横幅和公告就撤了。用户抓到的问题很具体:把 reasoning_effort 开到 max,模型反而不到 10 秒就停止思考、直接给结果;做 3D 游戏的任务,产出粗糙,逻辑断层明显。有人怀疑是发错了模型。
另一位开发者的记录更能说明它现在的脾气。用 V4 Pro 查一个复杂项目的 bug,它挖出了 Grok 4.6 没发现的深层问题;轮到动手修,它在几种改法之间反复试错,任务停在原地,一次下来花了 20 元,token 消耗是其他工具的好几倍。
会找病,不太会开刀。
涨价之后这点更要命,试错循环里的每一轮输出,工作日白天都按 27 元计。
版本线同样让人没法提前做计划。9 月 10 日 V4.1 Flash 发布时,DeepSeek 原本宣布 9 月 14 日之后把所有 V4 Pro 请求转给 Flash、按 Flash 计费;没等到那天就改了口,更新日志里写的是 9 月 14 日之后继续提供 V4 Pro 的 API,计费方式不变。V4.1 Pro 到今天没有公布发布时间、参数和价格。六周里上线又撤、涨价、改价、宣布退役、收回退役,一样不落。
46 比 36,不等于该把 DeepSeek 换掉
这两天最常见的说法是”开源第一换人了,MiMo 可以直接替掉 DeepSeek”。
API 这条线上,我同意一大半。自部署这条线上,替换的理由要弱得多。
两家的权重都是 MIT 协议。MiMo-V2.6-Pro 总参 1.02T、激活 42B,官方推荐 8 到 16 张卡跑 SGLang 或 vLLM。V4 Pro 总参 1.6T、激活 49B,专家权重用 FP4、其余用 FP8,靠压缩稀疏注意力把推理 FLOPs 降到上一代的 27%。放到自己机房里,DeepSeek 8 月那轮涨价跟你毫无关系,MiMo 最大的那块优势当场归零;激活参数两者只差 7B,吞吐不会拉开太多。
反过来,API 这条线上,只要 DeepSeek 不把价格调回去,MiMo 的输出单价就便宜 2.25 到 4.5 倍,而且能直接吃图像、视频和音频。V4 Pro 只收文本,要看图得另外转给 Flash。
小米这次还把 7000 多个 RL 任务环境、端到端训练框架和技术报告一起放了出来。RL 阶段 Pro 花了 262 万美元、Flash 花了 85 万美元,reward hacking 比例压在 2% 以下。想自己做强化学习的团队,拿到的不只是一份权重。
按手上的活对号入座
- 工作日白天大批量调用、前缀固定、缓存命中率能做到九成以上:MiMo-V2.6-Pro。
- 一次要生成超过 128K token 的长内容:只有 V4 Pro 的 384K 能一口气写完,MiMo 得拆段拼。
- 输入里有截图、视频、录音:MiMo,V4 Pro 这条路走不通。
- 高并发线上服务:MiMo 每分钟 100 次请求和 V4 Pro 的 500 并发口径不同,但前者更紧,上线前先压测。
- 前端页面、SVG、交互小游戏这类要长时间思考的生成:两边都别盲信跑分。
回到开头那道十句话的题。阅卷的那位,输出价从 6 元涨到了 27 元;写错一句的那位,价格还停在 6 元。
下一次谁给谁阅卷,不好说。
相关对比:《DeepSeek V4.1 Flash 和 V4 Pro:单价全线下调,我的账单反而涨了 36%》、《GPT-6 Astra、Claude Opus 5、DeepSeek V4 Pro:一次全球宕机之后,这三家的账怎么算》、《Kimi K2.7 Code、DeepSeek V4.1 Flash、GPT-5.6 Luna:便宜五分之一的前提,没人写在价格页上》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






小米 MiMo-V2.6-Pro 的价目表,和 8 月 17 日之前的 DeepSeek V4 Pro 一分不差