腾讯混元放出了 Hy4 preview 的轻量版,权重从接近 1.5TB 压到约 214GB。压缩比接近七倍。
靠的是两件事。一是自研的 Sherry 稀疏三值量化算法,最激进的那一档权重平均压到 1.25 比特;二是 MIX-STQ1_0 混合精度策略,按敏感度逐层决定每层用多少比特,在同样的平均比特预算下把量化误差压得更低。
逐层定比特这个思路不新,难点一直在”怎么判断哪层敏感”。这套方案的实际效果是:压缩后的模型在长文理解和多轮长上下文检索上,跟原始版本基本持平。长上下文最怕量化——注意力分布一乱,检索准确率就塌——这一栏没掉,说明敏感度判断做对了。
量化 GGUF 库和相关代码都开源了。
更有意思的是同时公布的异构推理方案。一台 4090 笔记本加一台四卡 A4000 服务器,显存合计 80GB、内存 64GB,把 MoE 层拆开分配到两台机器上协同跑,速度 1.02 token/s。
1 token/s 慢得没法交互,但对照组是笔记本单机 offload,那个速度只有它的六分之一。这个数字的意义不在能不能用,在于它把”跑 770B 模型”的硬件门槛从数据中心拉到了两台散装设备。
顺着这条线走下去,本地部署大模型的瓶颈会从显存容量转向调度效率,这是完全不同的一类工程问题。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






混元4把1.5TB权重压到214GB,一台4090笔记本加一台四卡服务器就能跑起来