64 分,人类平均,天才档,151 分。
这是 AI 在挪威门萨智商测试上连续四年的成绩单。三年前那个 64 分,基本等于随机乱选的水平,说明当时的模型面对这套题几乎摸不着门道。第二年,分数追平了人类平均值。再过一年,进入了能被归为“天才”的区间。今年直接做到 151,也就是这套测试能给出的最高分。
满分本身不是最有意思的部分。
更要紧的是后半句:这套测试已经没有更高的刻度了。考生一旦碰到天花板,分数就不再携带新信息。今年的 AI 和一个“刚好也能做满”的系统,在这张卷子上看起来一模一样;它离天花板还差多远、明年会不会继续变强,这张卷子都回答不了。所以这条曲线接下来会一直停在 151,原因不是进步停了,而是尺子到头了。按这个测试衡量的 AI 认知表现往后怎么走,目前没有办法知道。
这其实是 AI 评测这几年反复上演的剧情。一个基准刚推出时模型分数惨淡,大家拿它当长期标尺,结果两三年就被刷满,只能再去造更难的题。智商测试原本是为人设计的,题目难度的分布围绕人群来定,本来就不负责区分两个都远超常人的答题者。
另外一层得分开看。这类题考的是在封闭条件下归纳规则、识别模式,每道题都有唯一答案。AI 拿到满分,说明它在这种推理上已经足够稳定;可这不等于它在开放世界里做判断、处理模糊信息的能力也同步到了“天才”级别,两件事经常被混成一件来讨论。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






挪威门萨智商测试被AI做到151分封顶,三年前它的成绩还和瞎蒙差不多