腾讯混元 Hy4 preview 开源,专家盲测微胜 GLM-5.3 和 Kimi K3

AI头条55分钟前发布 Lubos
416 0

腾讯混元发了 Hy4 preview,开源。主打软件工程、办公分析、游戏开发、科学研究四块能力。

评测方式这次挺讲究:163 名专家,203 个工程任务,盲测。均分 2.99 / 4.00,略优于 GLM-5.3 和 Kimi K3。

先说这个评测本身。专家盲测比刷榜单可信度高一个档次——203 个任务、163 个人,样本量够,而且盲测能挡掉品牌滤镜。但”略优于”这三个字要认真读:2.99 是四分制,也就是说三家都在 3 分上下打转,差距在小数点后。这种差距在实际使用中基本感知不到,换个任务集排名就可能翻过来。

所以这个结果的正确读法不是”混元赢了”,而是”国产开源第一梯队现在挤在同一个格子里”。GLM、Kimi、混元三家在工程任务上的水平已经收敛,选谁更多看价格、看部署方便程度、看生态。

另一半消息更有意思:配合 Hyra,模型把三维 Blaschke–Lebesgue 几何难题的体积下界推进到 0.41104,距最终证明还差约 2%。

这是个纯数学问题——在给定宽度的三维凸体里找体积最小的那个。猜想说答案是 Meissner 体,但没人证出来,几十年来大家只能一点点抬高下界。现在的进展是把下界推到 0.41104。

AI 做这类事的价值不在”证明定理”这四个字有多响,在于它把一类特定的苦力活儿吃下去了:构造不等式、搜索参数空间、验证边界情况。这些活儿以前得研究生一个个手推,现在能批量跑。剩下那 2% 大概率还是要靠人,但人不用再花时间在前面 98% 上。

把这两件事放一起看,腾讯这次发布的重点其实不在跑分。跑分只是入场券,Hyra 那个数学结果才是它想讲的故事——从”能写代码”往”能做研究”挪。这条线上现在挤了不少人,OpenAI 的 Astra、各家的自动化研究 agent,都在争同一个叙事。

模型在 Hugging Face 上开源,这点得给个赞。国产大模型这一年在开源上的诚意,确实比大洋对岸足。

© 版权声明

相关文章

腾讯混元 Hy4 preview 开源,专家盲测微胜 GLM-5.3 和 Kimi K3 暂无评论

none
暂无评论...