The ARC-AGI-3 프레임워크는 AI 모델이 낯선 환경과 정보를 얼마나 잘 적응하는지 테스트하며, 이제 AI 모델의 맥락적 추론 능력을 평가하는 대표 벤치마크로 자리 잡았다. 이 프레임워크는 사전 지식이 전혀 없는 상태에서 모델이 일련의 간단한 비디오 게임을 학습하고 완료하도록 하는 방식으로 작동한다. 모델은 입력을 시험하고, 긍정적·부정적 피드백을 처리하며, 게임의 목표를 추론한 뒤 궁극적으로 이를 달성하려고 해야 한다.

다른 유형의 맥락적 추론에서는 큰 진전이 있었지만, AI 모델은 ARC-AGI-3가 제시하는 유형의 작업에서는 여전히 매우 취약하다. 3월 벤치마크가 출시됐을 당시에는 모든 최첨단 시스템의 점수가 1% 미만이었다.

이후 점수는 조금씩 상승했다. OpenAI의 GPT-5.6 Sol은 올해 후반 7.8%를 기록했지만 이번 주 경쟁사 Anthropic이 세운 기록으로 곧바로 경신됐다. 지난 금요일 Claude Opus 5는 30.2%를 기록해 상당한 격차로 순위표 1위에 올랐다. 이 테스트는 해당 벤치마크를 만든 ARC Prize Foundation이 진행했다.

도전에 대한 OpenAI의 방어적 대응

이번 수요일 OpenAI 연구진은 자사 모델이 겉보기에는 저조한 성과를 낸 이유를 설명하려는 성명을 발표했다. 연구진은 모델 자체에는 책임이 없다고 주장했다. 대신 모델을 감싸고 있던 소프트웨어가 성능을 저해한 것이 원인이라는 설명이다.

하네스(harness)라고 불리는 이 소프트웨어는 매 차례 모델에 제공되는 정보와 모델이 사용할 수 있는 도구를 관리하는 코드다. ARC Prize Foundation은 단순한 하네스가 모델의 능력을 있는 그대로 드러내고 공정한 경쟁 환경을 제공한다는 전제 아래 자체 하네스의 단순성을 우선시한다.

그러나 OpenAI의 주장은 이러한 축소된 접근 방식이 Sol의 방법론을 방해했다는 것이다. 이 모델은 수행하는 각 행동에 앞서 비공개 노트를 생성하며, 이를 통해 테스트 중인 더 큰 이론의 맥락 안에서 각 행동을 설정할 수 있다. OpenAI에 따르면 ARC 하네스는 매번 움직임이 끝날 때마다 이 노트를 삭제해 강제적인 기억상실을 초래했고, 테스트 절차를 망가뜨렸다.

마찬가지로 모델이 이용할 수 있는 게임 기록의 최대 문자 수는 175,000자였다. 이 한도를 넘으면 공간을 확보하기 위해 가장 오래된 로그가 삭제됐고, 그 과정에서 중요한 초기 발견도 함께 사라질 수 있었다. 그 결과 모델은 게임의 행동을 조작하는 데는 상당히 능숙해졌지만, 애초에 무엇을 해야 했는지는 잊었을 수 있다.

OpenAI에 따르면 그 결과 모델은 입력을 단 한 번도 제공하기 전에 의도치 않게 성공 가능성이 가로막혔다.

이를 입증하기 위해 연구진은 자체 내부 테스트를 진행했으며, 그 결과 공개된 ARC-AGI-3 게임 25개에서 38.3%의 점수를 기록했다고 보고했다(기존 하네스 사용 시 13.3%). 연구진은 하네스 코드를 수정해 추론 노트가 움직임 사이에도 유지되도록 했다. 또한 게임 기록을 완전히 삭제하는 대신 압축하는 컴팩션(compaction)이라는 기법도 적용했다.

38.3%는 자체 보고된 ARC-AGI-3 기록이 아니다

ARC-AGI-3의 공개 버전은 ARC Prize Foundation이 운영하는 공식 벤치마크 버전의 135개 게임 중 25개만 포함해 상당히 축소돼 있다는 점에 주목할 필요가 있다.

따라서 이 버전의 테스트에서 기록된 결과는 재단의 주요 순위표에 등재될 수 없다. 맞춤형 하네스, 맞춤형 모델 설정 및 추가 도구도 허용되지 않는다. 자체 보고된 결과가 기록되는 별도의 커뮤니티 순위표는 위상이 훨씬 낮다. ARC 측은 코드가 검증되지 않기 때문에 인간의 추론이 결과에 영향을 미칠 수 있어 이러한 결과가 기계 지능의 신뢰할 만한 지표가 아니라고 경고한다. 이런 단서를 감안하더라도 OpenAI가 자체 보고한 점수는 서류상 수치만큼 인상적이지 않을 수 있다.

이달 초 Impossible Research의 연구진은 Sol과 자체 하네스를 사용해 공개 게임 세트에서 95.35%의 점수를 기록했다고 주장했다. 같은 팀은 Claude Opus 4.8과 Fable 5를 함께 실행한 동일한 하네스로 자체 보고 점수 99%를 기록했다고 밝혔다.