Prime Intellect, el proveedor de herramientas de computación y entrenamiento de IA con sede en San Francisco, lanzó su sistema de evaluación de código abierto Prime Agent el miércoles. Las puntuaciones de las pruebas de referencia autodeclaradas por la empresa sugieren que puede mejorar significativamente las capacidades de los principales modelos de IA.

ARC-AGI-3 es una prueba administrada por la ARC Prize Foundation, que introduce modelos de IA en una serie de juegos 2D sin instrucciones previas sobre cómo completarlos. Corresponde entonces al modelo descubrir las reglas de cada juego mediante ensayo y error, y después completarlos. La puntuación oficialmente verificada más alta en esta prueba es del 30,2 %, en manos de Claude Opus 5 de Anthropic.

Sin embargo, al ejecutar Claude Opus 5 dentro de su sistema personalizado, Prime Intellect informó de una puntuación del 95,5 %, un 0,1 % superior incluso a la puntuación de referencia de los expertos humanos.

Es importante destacar que estas cifras no han sido verificadas de forma independiente. ARC Prize mantiene una clasificación separada para los resultados autodeclarados, es decir, aquellos que dependen de software personalizado adicional al de los propios modelos.

Qué hace de forma diferente el sistema de evaluación de Prime Intellect

La diferencia, según la empresa, está en el sistema de evaluación: la capa envolvente que gestiona la memoria y el conjunto de herramientas del modelo de IA que opera en su interior. El resultado del 95,5 % de Prime Intellect se obtuvo utilizando su propio sistema personalizado en lugar de la configuración de evaluación oficial de ARC Prize, lo que significa que no es directamente comparable con los resultados verificados de la clasificación.

Según se informa, el sistema de evaluación propio de Prime Intellect permite que un modelo reescriba dinámicamente sus propias instrucciones —prompts, memoria y roles de los agentes auxiliares—, lo que le da ventaja sobre los sistemas que «obligan al modelo a sortear su propia estructura en lugar de aprovecharla». Un informe de OpenAI afirmó que el sistema de evaluación genérico de ARC Prize obligaba a sus modelos a sobrescribir su propia memoria durante la tarea, obstaculizando su progreso y perjudicando sus puntuaciones.

En cambio, el sistema de evaluación de Prime Intellect funciona mediante una sesión activa de Python que persiste durante toda la tarea. El historial de la sesión se puede consultar mediante programación, por lo que utiliza menos tokens que sistemas comparables que obligan al modelo a volver a leer sus propios resultados. Un comando «refine» permite al modelo editar su propio manual de instrucciones sobre la marcha.

Otros resultados de las pruebas de Prime Agent más allá de ARC-AGI-3

Prime Intellect puso a prueba su sistema en una amplia variedad de evaluaciones. Una de ellas consistió en crear desde cero emuladores de consolas de videojuegos retro en el lenguaje de programación Rust. En otra se le pidió jugar a Factorio, el popular juego de gestión de producción, donde logró alcanzar una puntuación de producción de seis cifras en apenas unas horas.

Durante la partida, Prime Intellect informó de que un modelo no identificado que se ejecutaba dentro de Prime Agent descubrió que podía aprovechar los comandos de consola para generar recursos directamente en sus máquinas. La función refine del sistema convirtió entonces estas estrategias exitosas en habilidades reutilizables. Después recurrió repetidamente a esta táctica eficaz, pese a los recordatorios automatizados periódicos de que no debía hacer trampas.

En conjunto, los resultados son el dato más reciente que pone de relieve que las capas envolventes de los modelos de IA son ahora igual de importantes que los propios modelos.

Aunque el sistema de evaluación Prime Agent no cuesta nada y se publicó bajo la licencia MIT, la empresa que lo respalda está valorada ahora en 1.000 millones de dólares. Un informe de TechCrunch detalló la ronda de financiación Serie A de 130 millones de dólares de la empresa, frente a unos ingresos anualizados de 100 millones de dólares.