一个11.6万行的代码库,人为埋进70个bug,让AI去找。单个智能体跑一次能找出14到27个,每次结果还不太一样;换成Claude Managed Agents新上线的动态工作流,找出了66个,多次运行也比较稳定。
这组数字是Anthropic自己测的。题目自己出,bug自己埋,成绩自己报,拿来参考可以,别当第三方评测看。人为藏进去的bug,和真实项目里那种跨模块、要特定运行环境才能复现的问题,难度也未必在一个档次。
不过14到27和66之间的差距,大到很难只用测试设计来解释。原因在架构上。
动态工作流是分层干活的:一个主智能体先看全局,把任务拆开,分派给一批子智能体,每个子智能体只盯自己那一块,干完交回,主智能体再汇总。单次执行最多能同时调度1000个智能体。
放到找bug这件事上,就是把11.6万行切成很多片,每片都有专人逐行看,而不是让一个模型从头读到尾。后一种做法的毛病大家都见过,上下文拉得越长注意力越散,读到后面前面的细节就丢了,漏检再正常不过。
Managed Agents本身是Anthropic托管的智能体服务,开发者不用自己搭沙箱、写调度逻辑。动态工作流相当于把多智能体编排这一层也替你包了。
适用的场景很清楚:大代码库审查、海量数据清洗,凡是能把一件大事拆成几百件小事同时做的任务都算。
账单也会跟着并行。
上千个智能体一起跑,token消耗是成倍往上走的。官方这次没提那场测试花了多少钱、跑了多久,对打算上生产的团队来说,这两个数可能比66更要紧。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






11.6万行代码藏了70个bug:Claude动态工作流找出66个,单智能体最多27个