本地跑的编程代理,卡脖子的一直是模型:大的跑不动,小的不会干活。JetBrains开源的Mellum2.1,就是想在这道夹缝里站住。
规格是12B总参数的混合专家架构,每次推理激活2.5B。总参数决定模型能装下多少知识,激活参数决定每生成一个token要算多少,所以它的推理开销更接近一个2.5B的小模型,能力上限却按12B来算。对显卡和算力都有限的个人电脑,这个组合挺友好。
不过12B的权重还是要整份加载,内存占用不会像2.5B模型那么小,这点别搞混。
许可证是Apache 2.0,商用、改造、二次分发基本没有限制。权重已经放在Hugging Face上,直接能下。
训练方式才是重点。
Mellum2.1用的是真实环境里的强化学习,让模型在实际代码仓库里动手,而不是只对着静态代码片段学续写。练出来的本事也就偏向代理式工作:自己探索代码库,找到该改的文件,动手编辑,再回头检查改动对不对。这和传统补全模型是两种活。补全只管猜你下一行要写什么,代理得把一件事从头做完。
这也算Mellum这条线的一次转向。早先的Mellum是JetBrains给自家IDE做的代码补全专用模型,定位就是快和准,不负责“想事情”。到了2.1,目标换成了能在本机独立干活的代理底座。
对在意代码不出本机的团队,这类模型的价值很实在:公司仓库不用上传到任何云端,代理就能在本地读代码、改代码。至于实际能干到什么程度,还得看社区拿真实项目跑出来的结果。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






JetBrains开源Mellum2.1:12B参数只激活2.5B,Apache 2.0许可,冲着本地编程代理去