俄罗斯团队让模型直接交换隐藏状态,声称把推理成本压到二十分之一

AI资讯32分钟前发布 Cezary
1.9K 0

一家叫 Mostik AI 的初创公司说,他们把多模型系统里的推理成本压到了原来的二十分之一。做法是让模型之间不再用文字说话。

先说现在的做法。AI agent 里的多模型协作已经很常见——一个模型负责规划一串动作,另一个负责执行;或者大模型处理复杂的那部分,小模型负责把结果写成人话。但它们之间的交流方式是文本:前一个模型生成输出,后一个模型把这段文本重新读一遍。

这中间有一层浪费。模型处理每个 token 的时候会构建一堆数值向量,也就是它的隐藏状态,里面装着上下文、以及它对这段内容的理解方式。生成文本的那一步,等于把这些高维向量压缩成一串字;下一个模型读进来,又得从这串字里把向量重新算一遍。压缩一次,解压一次,两头都花算力,中间还丢信息。

Mostik 的思路是直接把隐藏状态传过去。CEO Sasha Malysheva 的描述是让大模型做计算密集的那部分工作,小模型基于传过来的内部状态直接生成回复。

二十倍这个数字要打折看。它显然是在特定的模型组合和特定任务上测出来的最好情况,而且有个绕不过去的前提:两个模型的隐藏状态得是可对齐的。不同架构、不同词表、不同层数的模型,向量空间根本不在同一个坐标系里,要么得用同一家族的模型,要么得额外训练一个投影层——而这个投影层本身就有成本和精度损失。

另一个代价是可观察性。文本接口最大的好处是人能读:出了问题你能看到上一个模型到底输出了什么。换成向量之后这条调试路径就断了,中间状态成了一串谁都看不懂的数字。微软刚发的那份 AI 行为准则里有一条要求”以人类能够理解的方式进行沟通”,跟这个方向正好相反。

不过省钱的诱惑很实在。agent 产品的成本结构里,模型之间来回传递的 token 占比一直被低估——一个五步的工作流,中间四次传递都在重复描述同一件事。

© 版权声明

相关文章

俄罗斯团队让模型直接交换隐藏状态,声称把推理成本压到二十分之一 暂无评论

none
暂无评论...