智谱发了一篇技术博客,标题起得挺大:迈向递归自我改进。内容本身其实比标题克制。
事情是这样的:GLM-5.3-Flash 现在的生产推理服务,跑在 10 万颗以上的国产 AI 加速器上。这套推理基础设施,主要是由 GLM-5.3 驱动的一个 Infra Agent 协助搭起来的。
两个结果数字:从模型适配到上线,不到两周;端到端吞吐量提升约 3 倍。
国产卡上做推理适配是出了名的苦活。算子要重写,精度要对齐,性能要一点点抠,以前靠人往往是按月计。两周这个速度,放在这个背景下看是很硬的。
团队自己总结的关键词是“密集反馈”:分层测试、日志、追踪、基准测试一层层铺好,让 Agent 能持续定位问题、改代码、看效果、再改。换句话说,AI 能干好基础设施的前提,是人先把反馈系统搭得足够密。
他们也明确说了,这还不算递归自我改进。模型帮着搭了自己的推理服务,但没有改自己的权重,也没有自己决定下一步研究什么。
这跟 Anthropic 那边“八成代码由 Claude 写”的路子是一个方向:模型公司最先被 AI 改造的,是模型公司自己。想试 GLM 系列的,可以从智谱清言入手。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






GLM-5.3-Flash 的推理服务,大半是 GLM 自己搭起来的