混元 Hy4 preview 的 2.99 分说明不了什么,GLM-5.3 和 Kimi K3 的账才该算清楚

AI资讯37分钟前发布 Scrimp
2.9K 0

「均分 2.99,略优于 GLM-5.3 与 Kimi K3」——这句话出自腾讯混元自己发的 Hy4 preview 通稿。163 名专家、203 个工程任务、盲测。方法听着比刷榜单讲究多了。

盲测挡得住评委的品牌偏见,挡不住出题人的偏好。谁挑的这 163 个人,谁定的这 203 道题,评分细则怎么写的,通稿一个字没提。第一方组织评测、自家模型排第一,这个组合在哪个行业都得打个折扣,何况打折之后剩下的差距还在小数点后面。

更该盯的是 2.99 这个数本身。

四分制里 3 分通常意味着「能用,但要改」。三家全都卡在 3 分上下,说的不是谁赢了,是三家都还没跨过「能直接交付」那条线。腾讯把 0.0x 的领先写进标题,恰恰暴露了这一档已经没有别的东西可写。

GLM-5.3 走了一条很反常的路,代价被通稿藏起来了

智谱这版是 8 月 14 日发的,19 日上 API。7430 亿总参数、约 400 亿激活的 MoE。和 GLM-5.2 比,基座是同一个,一个参数都没换。官方说编程能力比 5.2 提升 50%,全部来自后训练。

后训练怎么练的,这块信息比跑分有用:不再喂孤立的编程题,而是喂「发现问题 → 分析方案 → 实施 → 验证 → 交付」的完整流程,有些训练任务的工作量相当于一个资深工程师连着干好几天。硬指标上,Z.ai Code Bench 的 High 档准确率 31.4%,压过 Claude Opus 4.8 最高档的 29.5%;Terminal-Bench 3.0 上是开源第一。

基座没动这件事有个通稿不会说的推论,但对已经在用 5.2 的人来说是最实际的:

迁移几乎零成本,但 5.2 在基座层面的毛病,5.3 一个都修不掉。

提示词不用重调,上下文行为不变,token 预算可以直接沿用。这是好的一面。反过来,如果你之前撞到的是它对模糊需求理解偏差、或者长链路里容易自作主张这类问题,那些长在基座里,后训练只能压不能除。社区里有篇实测的标题起得很准:能写干净代码,但别让它独立思考。

价格跟 5.2 一致:输入约 5.6 元、输出约 19.6 元、缓存命中 1.4 元,每百万 token。上下文 1M,最大输出 128K。

Kimi K3 标价 100 元,但这个数字会骗人

月之暗面7 月 17 日放出来的 K3,2.8 万亿总参数,896 个专家每 token 激活 16 个,原生视觉,1M 上下文。价格是它最被骂的地方:输出 100 元/百万 token,比上一代直接翻了 5 倍。

骂声里有一半是没算清楚账。

K3 的输入分两档,缓存命中 2 元,未命中 20 元——差 10 倍。这不是折扣,是它整个成本模型的支点。配合 Mooncake 那套分离式推理,官方称编程场景命中率超过 90%,社区实测在大代码库、长上下文的情况下能到 95% 到 98%。按缓存命中、未命中输入、输出 7:2:1 的真实调用比例算下来,混合成本大约 3.8 元/百万 token

3.8 和 100,差了 26 倍。

所以 K3 的真实成本几乎完全由你的调用形态决定。反复在同一份代码上迭代、长会话、agent 多轮——便宜。大量彼此无关的一次性短请求——缓存全落空,那 100 元就是实打实的 100 元。这条陷阱在DeepSeek 那种平价模型上不存在,因为它没有 10 倍的档位差,估错了也错不到哪去。

混元这一支从来不在同一个赛道上

它比的不是分数,是门槛。

Hy4 preview 今天才放,完整规格还没出来。能参照的是上一代 Hy3-preview:295B 总参数、21B 激活、256K 上下文、Apache 2.0 开源、输入 1 元/百万 token。

参数量比另外两家小一个数量级,上下文只有四分之一,价格是最低的那个。这套配置指向的用户很明确:要私有化部署、要能商用、硬件预算有限。Apache 2.0 在三家里是最宽松的许可证,这对企业内部落地是个实打实的门槛降低,比多几个百分点的跑分重要得多。

Hy4 我还没跑够,不给结论。

盲测覆盖的四个方向里,软件工程和办公分析本来就是混元一贯的舒适区,游戏开发和科学研究是新加的,这两块的成色得等一批真实项目跑完才知道。

一笔按真实用量算的账

Kimi K3 GLM-5.3 混元 Hy3-preview
总参数 / 激活 2.8 万亿 / 896 专家激活 16 7430 亿 / 约 400 亿 2950 亿 / 210 亿
上下文 1M 1M(输出上限 128K) 256K
输入(元/百万) 2 命中 / 20 未命中 约 5.6(缓存 1.4) 1
输出(元/百万) 100 约 19.6
实际混合成本 约 3.8(7:2:1 调用比) 价格结构平,估算不易出错 三家最低
开源 开放权重 开放权重 Apache 2.0

看这张表的正确姿势不是找最小的数,是先问自己缓存命中率能到多少。这一个变量对总账单的影响,比三家的标价差距大得多。

有一点我和主流看法不一样

先把话说明白。

现在通行的说法是「国产开源第一梯队能力已经收敛,接下来拼价格」。前半句我认,后半句我不认。

收敛发生在被测过的那些任务上。203 道工程题、Terminal-Bench、Code Bench,这些评测集合本身就是有共识的那部分,各家都朝着它优化,分数当然会挤到一起。真正拉开差距的地方恰恰是没被测的:长链路任务里出错之后能不能自己发现、需求写得含混时是追问还是硬猜、连续跑八小时之后行为会不会漂。

这几件事没有公开基准,只能靠自己在真实项目里踩。所以「拼价格」这个结论下得太早。它成立的前提是三家在你的场景里真的一样强,而这一点评测证明不了。

换与不换

已经在 GLM-5.3 上跑顺了的,别动。0.0x 分的差距换不来重调提示词、重跑一遍回归、重新校准 token 预算这一整套成本,而它基座不变带来的稳定性和可预期性,恰恰是三家里最好的一项,这个优势在生产环境里比任何跑分都值钱。

做长上下文 agent 又在乎成本的,先花两天把自己的缓存命中率量出来,再决定要不要上 K3。能稳到 90% 以上,它是三家里综合最划算的;量不出来或者达不到,别碰,输出 100 元会把你教做人。

要私有化部署、或者需要明确的商用许可,混元这一支最值得试,Hy4 preview 刚开源可以直接拉权重。心里要有数的是上下文只有 256K,工具链成熟度也不如另外两家。

还有一类人现在不该做决定:手上没有稳定评测集的。

三家咬得这么死的时候,换哪个模型带来的收益,都小于先花一周搭一套属于自己业务的评测集。没有那把尺子,你连换过之后是变好还是变坏都判断不了,只能跟着通稿的标题走——而通稿的标题,这篇开头已经拆过了。

相关对比:
Qwen3.8-Flash-Next vs GLM-5.3-Flash vs DeepSeek V4 Pro:一周之内,国产模型把价格打到了这个地步
Kimi K3 和 DeepSeek V4 到底怎么选?一个堆到 2.8T,一个把价格摁在地板上
Cursor vs Claude Code vs Codex vs Trae:2026 年 8 月,AI 编程工具到底该怎么选

© 版权声明

相关文章

混元 Hy4 preview 的 2.99 分说明不了什么,GLM-5.3 和 Kimi K3 的账才该算清楚 暂无评论

none
暂无评论...