A Prime Intellect, fornecedora de computação e ferramentas de treinamento de IA com sede em San Francisco, lançou seu harness de código aberto Prime Agent na quarta-feira. As pontuações de benchmark auto-relatadas pela empresa sugerem que ele pode ampliar significativamente as capacidades dos principais modelos de IA.

O ARC-AGI-3 é um teste gerenciado pela ARC Prize Foundation, que coloca modelos de IA em uma série de jogos 2D sem instruções prévias sobre como concluí-los. Cabe então ao modelo descobrir as regras de cada jogo por tentativa e erro e, em seguida, concluí-los. A maior pontuação oficialmente verificada nesse teste é de 30,2%, obtida pelo Claude Opus 5, da Anthropic.

No entanto, ao executar o Claude Opus 5 dentro de seu harness personalizado, a Prime Intellect relatou uma pontuação de 95,5% — 0,1% acima até mesmo da pontuação de referência de especialistas humanos.

É importante ressaltar que esses números não foram verificados de forma independente. A ARC Prize mantém uma tabela de classificação separada para resultados auto-relatados, ou seja, aqueles que dependem de software personalizado além dos próprios modelos.

O que o harness da Prime Intellect faz de diferente

A diferença, segundo a empresa, está no harness: o invólucro que gerencia a memória e o conjunto de ferramentas do modelo de IA que opera dentro dele. O resultado de 95,5% da Prime Intellect foi produzido usando seu próprio harness personalizado, em vez da configuração oficial de avaliação da ARC Prize, o que significa que não é diretamente comparável aos resultados verificados da tabela de classificação.

O harness da própria Prime Intellect aparentemente permite que um modelo reescreva dinamicamente suas próprias instruções — prompts, memória e funções de agentes auxiliares — dando-lhe uma vantagem sobre harnesses que "forçam o modelo a contornar sua própria estrutura em vez de aproveitá-la". Um relatório da OpenAI afirmou que o harness padrão da ARC Prize estava forçando seus modelos a sobrescrever a própria memória no meio das tarefas, prejudicando seu progresso e afetando negativamente suas pontuações.

O harness da Prime Intellect, por sua vez, é executado em uma sessão Python ativa que persiste durante toda a tarefa. O histórico da sessão pode ser pesquisado programaticamente, o que significa que ele usa menos tokens do que harnesses comparáveis que exigem que o modelo releia sua própria saída. Um comando “refine” é o recurso que permite ao modelo editar seu próprio manual em tempo real.

Outros resultados de testes do Prime Agent além do ARC-AGI-3

A Prime Intellect colocou seu harness à prova em uma ampla variedade de testes. Um deles envolvia criar emuladores de consoles de jogos retrô do zero na linguagem de programação Rust. Outro pedia que ele jogasse o popular game de gerenciamento de produção Factorio, no qual conseguiu alcançar uma pontuação de produção de seis dígitos em apenas algumas horas.

Durante o jogo, a Prime Intellect relatou que um modelo não identificado em execução dentro do Prime Agent descobriu que podia explorar comandos do console para gerar recursos diretamente em suas máquinas. A função refine do harness então transformou essas explorações bem-sucedidas em habilidades reutilizáveis. Em seguida, o modelo recorreu repetidamente a essa tática bem-sucedida, apesar dos lembretes automatizados regulares para não trapacear.

No geral, os resultados são o dado mais recente a destacar que os invólucros para modelos de IA agora são tão importantes quanto os próprios modelos.

Embora o próprio harness do Prime Agent não custe nada e tenha sido lançado sob a licença MIT, a empresa por trás dele agora está avaliada em US$ 1 bilhão. Um relatório da TechCrunch detalhou a rodada de financiamento Série A de US$ 130 milhões da empresa, contra uma receita anualizada de US$ 100 milhões.