此前,ARC-AGI-3框架用于测试 AI 模型对陌生环境和信息的适应能力,如今已成为评估 AI 模型情境推理能力的首选基准。它让模型在没有任何先验知识的情况下学习并完成一系列简单的电子游戏。模型必须测试输入、处理正面和负面反馈、推断游戏目标,并最终尝试实现这些目标。
尽管其他类型的情境推理已经取得了长足进展,但 AI 模型在 ARC-AGI-3 所规定的这类任务上仍然表现极差。该基准于 3 月推出时,所有前沿系统的得分都低于 1%。
此后,这一成绩逐步小幅攀升。OpenAI 的 GPT-5.6 Sol 在今年晚些时候取得了 7.8% 的成绩,随后这一纪录又在本周被竞争对手 Anthropic 打破。上周五,Claude Opus 5取得了7.8% 的成绩,随后这一纪录又在本周被竞争对手 Anthropic 打破。上周五,Claude Opus 5取得了30.2% 的成绩,以相当大的优势位居排行榜首位。该测试由创建这一基准的 ARC Prize Foundation 负责执行。
OpenAI 对这一挑战的防御性回应
本周三,OpenAI 的研究人员发布声明,试图解释其模型看似不佳的表现。他们声称,问题不在模型本身,而在于包裹模型运行的软件;正是该软件限制了模型的性能。
这款名为 harness 的软件是一段代码,负责管理模型在每一轮中可获得的信息以及可用的工具集。ARC Prize Foundation 在其自有 harness 中优先考虑简洁性,前提是这样可以让模型充分展现自身能力,并提供公平的竞争环境。
然而,OpenAI 的说法是,这种精简方法干扰了 Sol 的方法论。模型会在执行每个动作前生成私有笔记,从而将每个动作置于其正在验证的更广泛理论背景下。OpenAI 声称,ARC harness 会在每次移动后清除这些笔记,导致模型被强制遗忘,并破坏了测试流程。
同样,模型可用的游戏历史记录上限为 175,000 个字符。超过这一上限后,最早的日志会被删除以腾出空间,这意味着关键的早期发现也可能随之丢失。结果可能是,模型已经相当擅长控制游戏中的动作,却忘记了自己一开始究竟要做什么。
OpenAI 表示,结果是其模型甚至还没提供一次输入,成功机会就已经被意外削弱。
为证明这一点,研究人员进行了内部测试。据报道,测试在 25 个公开可用的 ARC-AGI-3 游戏中取得了38.3% 的成绩(使用原始 harness 时为 13.3%)。他们修改了 harness 的代码,使推理笔记能够在不同移动之间持续保留。此外,他们还采用了一种称为压缩的技术,对游戏历史进行压缩,而不是直接删除。
38.3% 并非 ARC-AGI-3 的自报纪录
值得注意的是,公开可用版本的 ARC-AGI-3 被大幅精简,只包含 ARC Prize Foundation 执行的官方基准版本中 135 个游戏里的 25 个。
因此,在这一版本测试中记录的任何结果都没有资格进入该基金会的主要排行榜。自定义 harness、自定义模型设置和额外工具同样不被允许。另有一个社区排行榜,用于记录自行报告的结果,但其排名明显较低。ARC 官方本身警告称,这些结果并不能可靠反映机器智能,因为它们不会验证代码,因此人的推理可能会影响结果。即便考虑到这些限制,OpenAI 自行报告的得分或许仍没有纸面上听起来那么令人印象深刻。
本月早些时候,Impossible Research 的研究人员声称,他们使用自定义 harness 搭配 Sol,在公开游戏集上取得了 95.35% 的成绩。同一团队还使用同一 harness,让 Claude Opus 4.8 和 Fable 5 协同运行,记录了99% 的自报成绩。
