11.6万行代码藏了70个bug:Claude动态工作流找出66个,单智能体最多27个

AI头条16分钟前发布 hushpup
744 0

一个11.6万行的代码库,人为埋进70个bug,让AI去找。单个智能体跑一次能找出14到27个,每次结果还不太一样;换成Claude Managed Agents新上线的动态工作流,找出了66个,多次运行也比较稳定。

这组数字是Anthropic自己测的。题目自己出,bug自己埋,成绩自己报,拿来参考可以,别当第三方评测看。人为藏进去的bug,和真实项目里那种跨模块、要特定运行环境才能复现的问题,难度也未必在一个档次。

不过14到27和66之间的差距,大到很难只用测试设计来解释。原因在架构上。

动态工作流是分层干活的:一个主智能体先看全局,把任务拆开,分派给一批子智能体,每个子智能体只盯自己那一块,干完交回,主智能体再汇总。单次执行最多能同时调度1000个智能体。

放到找bug这件事上,就是把11.6万行切成很多片,每片都有专人逐行看,而不是让一个模型从头读到尾。后一种做法的毛病大家都见过,上下文拉得越长注意力越散,读到后面前面的细节就丢了,漏检再正常不过。

Managed Agents本身是Anthropic托管的智能体服务,开发者不用自己搭沙箱、写调度逻辑。动态工作流相当于把多智能体编排这一层也替你包了。

适用的场景很清楚:大代码库审查、海量数据清洗,凡是能把一件大事拆成几百件小事同时做的任务都算。

账单也会跟着并行。

上千个智能体一起跑,token消耗是成倍往上走的。官方这次没提那场测试花了多少钱、跑了多久,对打算上生产的团队来说,这两个数可能比66更要紧。

© 版权声明

相关文章

11.6万行代码藏了70个bug:Claude动态工作流找出66个,单智能体最多27个 暂无评论

none
暂无评论...