姚顺雨从 OpenAI 到腾讯之后说过一句”做大模型其实并没有什么秘密”,当时不少人当玩笑听。腾讯混元4(Hy4 preview)交卷之后,这句话的含金量有点不一样了。
先看骨架。770B 参数、支持百万上下文,主干隐藏维度 6144、78 层、64 个注意力头。这套配置几乎是对齐了智谱 GLM-5(744B)已经跑通并立住口碑的工程解。在深度、宽度、注意力并行结构上,700B 这个档位现在有了近似共识的最优区间,后来者站上去就行,不用自己趟。
再看注意力。混元4 的稀疏注意力借的是 DeepSeek 在 V3.2 里开源的 DSA——用一个轻量索引器在超长上下文里筛 Top-K Token,不遍历全部历史。然后又叠了智谱在 IndexCache 里验证过的跨层索引复用:相邻 Transformer 层直接复用已有索引结果,最高能砍掉 75% 的索引器计算量。
残差侧更直白。混元4 放弃了复杂的 mHC,改用 iHC(恒等超连接),而这个方案的源头是微软研究员谢天在社交平台上公开讨论过的东西。不是论文,是发帖。
四个月完成大语言与多模态部门重组,同时把这些散在各家的成果拼成一个能打的 770B,靠的不只是读论文。清华姚班毕业的白雨石,此前是智谱 GLM-5 新模型架构及 DSA 的负责人,数月前正式加入腾讯混元团队,名字出现在混元长上下文稀疏注意力论文的作者栏里。
隐性工程经验没法写进论文,但人可以换公司。这才是”没有秘密”的实际含义——只要能被论文、代码和实验数据表达出来的优势,独占期都在急剧缩短;剩下那部分独占期,被人才流动继续压缩。
对追赶者是好消息,对领先者不是。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






腾讯混元4的技术拆解:700B档位上,几乎每个关键选择都能在别家论文里找到出处