智谱 GLM-5.3-Flash 上线:320B 只激活 18B,价格砍到 Opus 4.8 的四十分之一

AI头条22分钟前发布 Cedric
2.5K 0

那个在开源社区被叫做”牛来”的匿名模型 Ox-Alpha,谜底揭开了——是智谱的 GLM-5.3-Flash。

发布前它在 OpenCode 和 OpenRouter 上以匿名身份跑了六天,双平台调用量都创了新高,处理超过 20 万亿 token。这种匿名压测的做法这两年越来越常见,好处是拿到的反馈不掺品牌滤镜。

参数上,总参 320B,激活只有 18B,是 GLM-5 系列第一个原生多模态模型。Artificial Analysis 的综合智能指数给了 57 分,高于 DeepSeek V4 Pro 正式版的 53 分,同类模型的中间值才 18 分。智谱自己的 Z.ai Code Bench 体感评估里,编程表现和 Claude Opus 4.8 相当。

价格更狠。限时优惠期内每百万 token 输入 0.075 美元、缓存输入 0.015 美元、输出 0.25 美元,缓存存储暂时不收费;原价是 0.15、0.03、0.50。折算下来大约是上一代 GLM-5.3 的十分之一,限时期内是二十分之一,对比 Claude Opus 4.8 是四十分之一。

架构上用了稀疏加线性注意力的混合方案。但这次最该被记住的其实是另一件事:全部流量由国产 AI 芯片集群承载,官方说在同一硬件上端到端推理性能比初始基线提升了 3 倍,成本可以比肩主流英伟达 GPU。

之前国产芯片跑推理的公开案例,规模都不大,多半停在”能跑”这一层。20 万亿 token 的真实流量压过去,性质不太一样。这条线要是稳住了,国内大模型的算力账本得重算。

© 版权声明

相关文章

智谱 GLM-5.3-Flash 上线:320B 只激活 18B,价格砍到 Opus 4.8 的四十分之一 暂无评论

none
暂无评论...