一位开发者提了个观察:Claude Code 在层出不穷的编程基准测试里屡屡排在后面,却依然是使用量第一的 AI 编程工具,增速还超过大多数竞品。这个错位已经持续一年了。
这不是段子,是编程工具这个品类的一个结构性问题:现有的基准根本没在测真实工作。
主流编程基准大多是”给一个孤立任务,看能不能一次做对”。SWE-bench 这类已经算贴近真实的了,但它测的仍然是在一个已知仓库里修一个已知 issue。而人真正用编程工具的时候,八成时间花在别的地方:搞清楚这个仓库是怎么组织的、找到该改的那三个文件、改完之后确认没把别的地方弄坏、以及在自己说不清需求的时候被反问一句。
这些能力目前没有基准在测。
还有一条更少被提到——工具的失败方式比成功率更影响体验。同样是做不出来,一个工具会老老实实说”我没找到”,另一个会自信满满地编一个不存在的 API。前者浪费你三分钟,后者浪费你三小时。基准分数里这两种都记零分。
反过来说,跑分高的工具也不是靠作弊。它们确实在特定题型上更强,只是那些题型和日常工作的分布对不上。Cursor 这类产品的用户增长同样不是跑分驱动的,是编辑器体验驱动的。
所以选工具这件事,暂时还得靠自己试。拿你自己项目里最烦的那个任务,让候选工具各跑一遍,看谁交出来的东西你敢直接合并。这个测法土,但比任何榜单都准。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Claude Code 跑分老是垫底,用的人反而最多,这事已经一年了