O ARC-AGI-3 é uma estrutura que testa a adaptabilidade de modelos de IA a ambientes e informações desconhecidos e agora é o principal benchmark para avaliar o raciocínio contextual de um modelo de IA. Isso é feito fazendo o modelo aprender e concluir uma série de videogames simples sem nenhum conhecimento prévio. Os modelos precisam testar entradas, processar feedback positivo e negativo, inferir os objetivos do jogo e, por fim, tentar alcançá-los.

Embora tenham sido feitos grandes avanços em outros tipos de raciocínio contextual, os modelos de IA continuam muito ruins no tipo de tarefa definido pelo ARC-AGI-3. Quando o benchmark foi lançado em março, todos os sistemas de fronteira registraram pontuações abaixo de 1%.

Desde então, esse índice vem subindo gradualmente, com o GPT-5.6 Sol, da OpenAI, marcando 7,8% mais tarde no ano, um recorde superado nesta semana pela empresa rival Anthropic. Na última sexta-feira, o Claude Opus 5 atingiu 30,2%, assumindo o topo da classificação com uma vantagem considerável. O teste foi administrado pela ARC Prize Foundation, que criou o benchmark.

A resposta defensiva da OpenAI ao desafio

Nesta quarta-feira, pesquisadores da OpenAI divulgaram uma declaração tentando explicar o desempenho aparentemente fraco de seu modelo. Eles afirmaram que o próprio modelo não era o culpado. Em vez disso, a culpa era do software no qual ele estava inserido, que prejudicava seu desempenho.

Esse software, chamado de harness, é um código que gerencia as informações disponíveis para o modelo a cada turno e o conjunto de ferramentas ao seu alcance. A ARC Prize Foundation prioriza a simplicidade em seu próprio harness, partindo do pressuposto de que isso permite que os modelos falem por si mesmos e oferece condições equitativas.

No entanto, a alegação da OpenAI é que essa abordagem simplificada interferiu na metodologia do Sol. O modelo gera notas privadas antes de cada ação que executa, permitindo que enquadre cada ação no contexto de uma teoria mais ampla que está testando. Segundo a OpenAI, o harness da ARC apagava essas notas após cada movimento, resultando em uma amnésia forçada e em um procedimento de teste comprometido.

Da mesma forma, o histórico do jogo disponível para o modelo tinha um limite máximo de 175.000 caracteres. Depois disso, os registros mais antigos eram apagados para liberar espaço, o que significava que descobertas iniciais importantes também poderiam ser eliminadas. O resultado é que o modelo pode ter ficado bastante hábil em controlar as ações de um jogo, mas esquecido o que deveria fazer desde o início.

Segundo a OpenAI, o resultado foi que as chances de seu modelo foram inadvertidamente prejudicadas antes mesmo que ele fornecesse uma única entrada.

Para provar o ponto, os pesquisadores realizaram seus próprios testes internos, que supostamente resultaram em uma pontuação de 38,3% nos 25 jogos do ARC-AGI-3 disponíveis publicamente (contra 13,3% usando o harness original). Eles fizeram isso editando o código do harness para permitir que as notas de raciocínio persistissem entre os movimentos. Também implementaram uma técnica chamada compactação, comprimindo o histórico do jogo em vez de simplesmente apagá-lo.

38,3% não é um recorde autodeclarado no ARC-AGI-3

Vale observar que a versão do ARC-AGI-3 disponível publicamente é consideravelmente reduzida, apresentando apenas 25 dos 135 jogos da versão oficial do benchmark administrada pela ARC Prize Foundation.

Por isso, quaisquer resultados registrados nessa versão do teste não são elegíveis para a principal classificação da fundação. Harnesses personalizados, configurações personalizadas de modelo e ferramentas adicionais também não são permitidos. A classificação comunitária separada, na qual são registrados resultados autodeclarados, tem uma posição significativamente inferior. A própria ARC alerta que esses resultados não são um indicador confiável da inteligência das máquinas, pois o código não é verificado e, portanto, o raciocínio humano pode influenciar os resultados. Mesmo com essas ressalvas, a pontuação autodeclarada da OpenAI talvez ainda seja menos impressionante do que pode parecer no papel.

No início deste mês, pesquisadores da Impossible Research afirmaram ter alcançado uma pontuação de 95,35% no conjunto público de jogos usando seu harness personalizado com o Sol. A mesma equipe registrou uma pontuação autodeclarada de 99% com o mesmo harness executando Claude Opus 4.8 e Fable 5 em conjunto.