自3月推出以来,ARC-AGI-3基准测试已成为AI实验室在想要论证其模型能够处理陌生任务时会援引的测试。它把模型放进一个小型2D电子游戏里,却不作任何说明:没有规则、没有控制方式、没有明确目标。模型必须按下各种东西,观察发生了什么变化,并弄清楚游戏希望它做什么。发布时,所有前沿系统的得分都低于1%。

上周五,排行榜发生了变化。Anthropic的Claude Opus 5 在ARC-AGI-3上获得了经验证的30.2%成绩,大约是此前经验证最高分7.8%的四倍,而这一成绩此前由OpenAI的GPT-5.6 Sol创下。构建并管理该基准测试的ARC Prize Foundation自行运行了这项测试。

周三,OpenAI发布了一篇算是回应的文章。其研究人员认为,Sol表现不佳主要是模型外围软件的问题,而不是模型本身的问题,并且在调整了两项设置后,Sol在25个公开游戏上的得分达到38.3%

这篇文章的关键在于一句话:“基准测试很少孤立地衡量AI模型。” 过去的假设是,分数属于模型,因此低分意味着模型无法完成任务。OpenAI的说法是,分数属于模型加上其周围的每一段代码,而低分也可能意味着外围代码在每次行动之间丢弃了模型的工作结果。对于任何把排行榜视为能力代理指标的人来说,这改变了这些数字究竟能证明什么。

测试框架当时在做什么

这个包装层有个名字:测试框架。它是决定模型每一轮能看到什么、记住什么,以及能调用哪些工具的代码。ARC的测试框架刻意保持简洁,其理由是,简洁的设置更能暴露模型弱点,也能让实验室之间的比较更公平。

OpenAI发现了两个它不满意的地方。像Sol这样的模型会在每次行动前生成私有推理,实质上就是关于自己为何这样做的工作笔记。ARC的测试框架会在每一步后删除这些笔记,因此模型能看到自己按下了某个按钮,却看不到这次按压是在检验什么理论。其次,一旦运行历史超过175,000个字符,最早的记录就会被丢弃,这可能会抹掉那个解释整个游戏的早期发现。

OpenAI重建了测试框架,使其在行动之间保留推理,并将删除替换为一种称为“压缩整理”的技术,这种技术会把旧历史压缩成一个浓缩包,让模型将其带入一个新的工作空间,而不是丢失开头部分。得分从13.3%升至38.3%。输出token——即模型生成的文本单位,也是客户为之付费的项目——下降了大约六倍。未涉及任何重新训练。

为什么38.3%不是排行榜纪录

这一数字来自OpenAI运行自己的配置并报告自己的结果。ARC的验证测试政策排除了客户端测试框架、手工构建的工具和定制化模型设置,并将由测试框架驱动的结果归入单独的社区排行榜,在那里分数由用户自行报告,且ARC明确警告不要将其视为通向通用智能进展的证据。

公开游戏也只是较容易的一半。在模型无法提前研究的保留测试集中,Sol经验证的得分下降,从13.33%降至7.78%。没人知道38.3%在经过同样削减后会变成多少。

而且,38.3%也不是这些游戏上自报的最高测试框架成绩。本月早些时候,Impossible Research团队报告称,其Schema测试框架在公开测试集上达到了约99%,使用Claude Opus 4.8和Fable 5时如此,而使用Sol时达到95.35%。ARC Prize总裁Greg Kamradt的公开回应是,在看不到代码的情况下,很难判断其中预先植入了多少人类的问题求解能力。

还有一个数字值得记住。OpenAI估计,人类测试者在这些游戏上的平均得分为48%。其改进后的结果仍低于这一水平。

文章最后建议使用OpenAI的Responses API,而不是其较旧的接口,这既是销售话术,也是一项结论。不过,其底层发现依然成立:基准分数衡量的是整个系统,而大多数已发布分数并不会告诉你这个系统是如何组装的。真正值得关注的数字不是38.3%,而是同一套设置在它从未见过的游戏上会得到多少分。