英伟达的 AI 编程智能体 AVO 在 ARC-AGI-3 交互式推理基准上取得 100% 的成绩,25 个公开环境里的全部 183 个关卡全部通关。
ARC-AGI 这套基准的设计目的一直很明确:不让模型靠记忆和模式匹配拿分。第三代加了交互性,意味着智能体不能只看一眼给答案,得在环境里动手试。而 AVO 的运行方式恰好卡在这个点上——它没有预定义规则,也不给明确目标,靠自己做实验、观察结果、再根据过往经验调整策略。
技术上真正新的一点在记忆。以往的模型碰到上下文重置就等于失忆,一切从头再来。AVO 的做法是让学习成果跨越上下文重置继续累积,所以它在一个环境里反复交互的过程,是一条持续上升的曲线而不是锯齿。这也是它能把 183 关全部啃下来的原因——很多关卡靠的不是灵光一闪,是攒够了对这个环境的理解。
底层模型用的是 Claude Opus 5。这个组合此前还有过另一个战绩:连续几天自动优化 GPU 代码。英伟达用别家的模型去驱动自己的智能体,然后跑在自己的硬件上,这条链路本身挺有意思。
需要说清楚的是,满分不等于通用智能。ARC-AGI-3 的 25 个公开环境是有边界的集合,AVO 掌握的是”针对特定环境的任务”,官方表述里也用的是这个措辞。真正的考验是私有环境集和后续版本,那才是这套基准存在的意义。
但即便打了这些折扣,一个不给目标、靠试错和长期记忆自己摸索的系统能把交互式推理刷到满分,仍然是过去一年里少见的结果。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






英伟达的 AVO 在 ARC-AGI-3 上拿了满分,183 关全通