Astra的幻觉率一周内改了两次,模型基准这套东西还能信吗

AI头条30分钟前发布 Quibble
1.3K 0

9月3日OpenAI发Astra的博客时出了点状况:公告刚上线就被撤下,页面长时间打不开。官方解释是内容管理系统故障加上网络中断,并且强调撤稿跟任何基准成绩无关。

问题出在博客重新上线之后。

有人盯着改动记录发现,评测数据被反复调整过。最扎眼的是幻觉率:先从4.2%降到2%,过一阵又调回4.2%。GPT-5.6 Sol的ExploitBench分数从5.5%上调到11.5%。连Anthropic家Fable 5.1的数学成绩也被调低过约10个百分点,随后回升。

OpenAI给的说法是,调整是为了让数字更好地代表对模型性能的最佳估计。

这个解释本身没什么毛病,评测流程里出错、重跑、修正都正常。但”改自家的数字”和”改竞品的数字”是两件事,而且部分修改的时间点早于官方对外说明。

这事真正伤到的不是OpenAI,是基准这套东西本身。厂商自测、自报、自己解释口径,读者能做的只有信或者不信。企业选型时如果拿一张官方跑分表当采购依据,那张表随时可能在你签合同之后被改一遍。

短期看,能用的办法只有一个:拿自己的业务样本跑一遍。哪怕只有两百条,也比任何一张榜单更接近你要的答案。

© 版权声明

相关文章

Astra的幻觉率一周内改了两次,模型基准这套东西还能信吗 暂无评论

none
暂无评论...