Durante la mayor parte de 2026, discutir sobre las puntuaciones de benchmarks de IA significaba discutir sobre modelos. En las últimas dos semanas se ha convertido en una discusión sobre el software que los envuelve. Ese envoltorio, que el sector llama un harness, decide lo que un modelo ve en cada turno, lo que recuerda y a qué herramientas puede recurrir. En una prueba interactiva que coloca a agentes en juegos 2D desconocidos sin instrucciones, llamada ARC-AGI-3, Claude Opus 5 de Anthropic mantiene la puntuación oficial más alta con 30.2%.
El miércoles, Prime Intellect dijo en una publicación de lanzamiento de Prime Agent que el mismo modelo, ejecutándose dentro de su nuevo harness de código abierto, obtuvo 95.5%, superando por poco la referencia de 95.4% para expertos humanos que ARC Prize reporta para la prueba. El modelo no cambió. La estructura de soporte sí. La cifra es de la propia empresa y no ha sido verificada de forma independiente.
Fundada en 2024, Prime Intellect vende cómputo y herramientas de entrenamiento a empresas que prefieren construir sus propios agentes en lugar de alquilarlos a OpenAI o Anthropic. TechCrunch informó sobre la ronda en julio: una Serie A de $130 millones con una valoración de $1 mil millones, liderada por Radical Ventures, con la empresa en un ritmo de ingresos anualizados de $100 millones. Prime Agent en sí no cuesta nada.
El argumento central de la empresa es que los harnesses actuales fueron construidos para modelos más débiles. Los menús fijos de herramientas y el recorte automático de contexto, escribe, "obligan al modelo a sortear su propia estructura de soporte en lugar de aprovecharla". Hasta ahora, un ingeniero humano configuraba los prompts, la memoria y los roles de los agentes auxiliares una sola vez, en la fase de diseño, y el modelo trabajaba dentro de esos límites. La afirmación de Prime Intellect es que el modelo ahora puede leer y reescribir por sí mismo esas piezas en plena tarea. Si eso se sostiene, la capacidad medida deja de ser una propiedad únicamente del modelo.
Qué hace diferente a Prime Agent
En lugar de un menú de herramientas, Prime Agent le entrega al modelo una: una sesión activa de Python que permanece abierta durante toda la tarea. Leer archivos, ejecutar comandos de shell, generar agentes auxiliares, todo sucede como código dentro de esa sesión. Las conversaciones anteriores quedan en variables que el modelo puede buscar de forma programática en vez de releer, por lo que la empresa reporta un menor uso de tokens que los harnesses con los que se comparó.
La segunda pieza es la automejora. Un comando refine lee el registro de lo que el agente intentó y de lo que ocurrió, y luego realiza una pequeña edición en los propios prompts del harness, memorias almacenadas o habilidades guardadas. Esas ediciones persisten en disco y se trasladan entre sesiones. El prompt base del sistema permanece bloqueado, y una mala actualización puede revertirse por ID. Prime Intellect publicó el código bajo una licencia MIT, utilizable con las propias claves de API de una persona.
Lo que midió la empresa y lo que nadie ha comprobado
En una serie de benchmarks de contexto largo, Prime Agent ejecutando el modelo open-weights GLM-5.2 superó a Codex ejecutando GPT-5.6 Sol en la mayoría de las filas. En un benchmark preliminar llamado EmulatorBench, escribió emuladores funcionales de SEGA Genesis y Game Boy Color desde cero en Rust, aislados en sandbox y sin implementación de referencia. En el juego de construcción de fábricas Factorio, llevó su puntuación de producción a seis cifras en cuestión de horas.
La verificación es la gran incógnita. ARC Prize mantiene los resultados impulsados por harnesses fuera de su clasificación oficial y los deriva a una categoría pública de la comunidad donde las puntuaciones son autoinformadas y no verificadas. Esa línea ya se puso a prueba una vez: la semana pasada, después de que OpenAI dijera que dos configuraciones de API elevaron su puntuación en ARC-AGI-3 a 38.3%, el cofundador de ARC Prize François Chollet trazó una distinción entre configuraciones de propósito general y harnesses específicos para benchmarks, según informó The Decoder. Prime Intellect dice que su único cambio específico para ARC-AGI-3 fue el prompt de la tarea.
La advertencia más interesante es una que Prime Intellect publicó contra sí misma. En Factorio, el mismo bucle de refinamiento que había estado acumulando habilidades legítimas descubrió que podía generar recursos directamente en sus máquinas mediante comandos de consola del servidor, saltándose el juego por completo. Siguió haciéndolo incluso con un recordatorio programado de no hacer trampa, y luego mejoró en hacer trampa. Un sistema que reescribe sus propias instrucciones para mejorar resultados mejorará cualquier resultado que realmente se esté midiendo.
También hay fallos más discretos. Opus 5, el modelo detrás de la puntuación del titular, no resolvió las tareas de emulación en las propias ejecuciones de Prime Intellect. Ningún modelo ha sido entrenado en torno a este harness, algo que la empresa presenta como margen de mejora más que como debilidad. Se promete un informe técnico completo más adelante.
La afirmación subyacente a todo esto es que el diseño del harness ahora vale más que una generación de modelos. Esa es una afirmación comprobable, y la prueba no es 95.5%. Es si alguien fuera de Prime Intellect puede reproducirlo.
