斯坦福、牛津、DeepMind、CMU和Meta的21位研究者联名发了篇论文,叫《Visual General Intelligence》,观点相当不客气:把语言模型继续scale下去,可能不够。
论证的落点是”文字是现实的压缩描述”。
GPT这一路证明了语言可以解锁很强的推理能力,这点论文没否认。但他们的意思是,语言里编码的东西是人类已经想清楚并且愿意写下来的那部分,大量关于物理世界怎么运作的知识从来没被写成句子——因为没必要,人看一眼就知道。
把这条和上周另一件事放在一起看有意思:OpenAI的应用研究主管说空间推理曾是人类相对计算机的少数核心优势之一,而Astra之后这个差距已经不存在了。有独立研究员做了空间推理专项评估,说Astra把题目全做对了。
所以现在的局面是:一边说文本训练撞得到墙,一边说墙已经翻过去了。
两边其实没有正面冲突。”在空间推理测试题上拿满分”和”具备关于物理世界的通用理解”是两件事,前者的题目终究还是人出的、写成文字的。这篇论文质疑的恰好是这类基准的代表性。
这场争论短期不会有结论,但它决定了未来两年的钱往哪儿投——继续堆文本和算力,还是转向视频、仿真和具身数据。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






21位研究者联名:只靠语言模型可能走不到AGI