9月3日OpenAI发Astra的博客时出了点状况:公告刚上线就被撤下,页面长时间打不开。官方解释是内容管理系统故障加上网络中断,并且强调撤稿跟任何基准成绩无关。
问题出在博客重新上线之后。
有人盯着改动记录发现,评测数据被反复调整过。最扎眼的是幻觉率:先从4.2%降到2%,过一阵又调回4.2%。GPT-5.6 Sol的ExploitBench分数从5.5%上调到11.5%。连Anthropic家Fable 5.1的数学成绩也被调低过约10个百分点,随后回升。
OpenAI给的说法是,调整是为了让数字更好地代表对模型性能的最佳估计。
这个解释本身没什么毛病,评测流程里出错、重跑、修正都正常。但”改自家的数字”和”改竞品的数字”是两件事,而且部分修改的时间点早于官方对外说明。
这事真正伤到的不是OpenAI,是基准这套东西本身。厂商自测、自报、自己解释口径,读者能做的只有信或者不信。企业选型时如果拿一张官方跑分表当采购依据,那张表随时可能在你签合同之后被改一遍。
短期看,能用的办法只有一个:拿自己的业务样本跑一遍。哪怕只有两百条,也比任何一张榜单更接近你要的答案。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Astra的幻觉率一周内改了两次,模型基准这套东西还能信吗