数据智能体的评测榜上,第一次有方案越过了90%。
做到这一点的是OceanBase团队。他们提交的Data Agent方案在Data Agent Benchmark(DAB)上拿到90.62%的准确率,排名第一,底层模型用的是智谱的GLM-5.2,也就是智谱清言所属的GLM系列。被它压在后面的,有好几套基于GPT、Claude Opus、Claude Fable搭建的方案。
DAB由UC Berkeley EPIC Data Lab和Hasura PromptQL合作推出,题目覆盖本地生活、金融股票、生物医学、知识产权、企业运营、政务、媒体文娱等多个领域,数据分散在PostgreSQL、MongoDB、SQLite、DuckDB等不同数据库里。
它和常见的Text-to-SQL评测不是一回事。后者主要看模型能不能把一句自然语言翻成SQL;DAB则把智能体扔进真实的数据环境,数据散、格式杂,要它自己理解数据、挑数据、规划分析路径、执行查询计算,最后还得验证答案对不对。
所以这个分数考的不只是模型。模型管理解和推理,Agent管规划和执行,数据系统管数据发现、关联计算和结果校验,三块拼不好,模型再强也拿不到正确答案。
OceanBase的方案先用DataLens给数据建画像,识别字段和数据之间的关系;再按任务复杂度规划执行路径,完成选择、筛选、关联和计算;结果出来后,用证据追踪和答案校验复核一遍,发现问题就调整方案重新验证。
我觉得拉开差距的就是最后这一步。数据分析最怕的不是算不出来,而是算错了还给出一个看起来很像样的数字。能自己回头查账的Agent,在企业里才敢用。
这套方案的内部代号叫Scout,相关能力后续会并入OceanBase DataPilot,那是它面向AI数据分析的产品方向。
对数据库厂商来说,这个成绩的用处很实在。当AI Agent成了数据的新使用者,数据库光把数据存好、算好、取出来已经不够,还得帮AI看懂数据、把分析做完。
单一榜单的第一,也不等于在企业真实场景里一定好用。GLM-5.2在这套方案里贡献了多少,系统工程又贡献了多少,外人目前还分不清。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






国产组合登顶DAB数据智能体榜:OceanBase加GLM-5.2