Según informes sobre la familia de modelos más reciente de OpenAI, cuyo nombre provisional es Astra, este último grupo se especializará en tareas de medio y largo plazo que tardan varias horas o días en completarse. Su objetivo es complementar la línea actual de Sol, Terra y Luna, no reemplazarla. Sam Altman pasó esta semana presentando los nuevos modelos a legisladores en Washington.

Para mostrar las capacidades de Astra en la resolución de problemas complejos, OpenAI publicó este sábado una publicación con soluciones para 10 problemas de informática y matemáticas, la mayoría de los cuales habían permanecido abiertos durante años. Afirma que estas soluciones fueron producidas por una versión interna de Astra durante las pruebas.

La empresa afirma que el costo total estimado en tokens de estos resultados fue de alrededor de $2,000, calculado utilizando las tarifas de la API de su actual modelo insignia GPT-5.6 Sol. La empresa añadió que "atribuir la autoría humana de una demostración generada íntegramente por un sistema de IA tergiversaría tanto la contribución del sistema como la naturaleza del verdadero trabajo intelectual humano."

Esto se debe a que anuncios anteriores de soluciones matemáticas impulsadas por IA se publicaron bajo nombres de autores humanos, con el modelo mencionado únicamente como colaborador. Sin embargo, en la publicación más reciente de OpenAI, el propio modelo figura como el principal resolutor del problema, mientras que los colaboradores humanos asumieron la responsabilidad de preparar los manuscritos.

Una de las soluciones en cuestión —que resolvía un problema de un área del álgebra abstracta llamada teoría de grupos— se filtró en X varias horas antes del anuncio oficial. Elliot Glazer, matemático jefe de Epoch AI, describió rápidamente el trabajo como el resultado más importante de la IA en matemáticas hasta la fecha.

El investigador de IA Sébastien Bubeck, que ahora trabaja en OpenAI, bromeó diciendo que esperaba que la IA superara sus habilidades matemáticas en 2030, no en 2026.

Desglose de las soluciones de Astra

El resultado filtrado primero en Twitter cerró una cuestión que permanecía abierta desde que el matemático Benjamin Weiss acuñó el término “sofico” en el año 2000. En términos sencillos, un grupo matemático es un conjunto de movimientos más una regla para combinarlos, no muy distinto de las rotaciones de un cubo de Rubik. Un grupo “sofico” es aquel en el que, si amplías cualquier pequeña parte del sistema, puedes construir una versión finita que se comporta casi exactamente de la misma manera.

Hasta ahora, ningún investigador había logrado identificar un grupo que no fuera sofico; todos los grupos conocidos presentaban la misma propiedad. La revelación del sábado marcó el primer contraejemplo conocido.

Los otros nueve resultados se extienden a otras áreas de las matemáticas. Uno refuta una conjetura de larga data del matemático Alain Connes sobre el comportamiento de ciertas estructuras matemáticas. Otro encuentra una respuesta mejor a la pregunta de cuán estrechamente se pueden empaquetar esferas en espacios de muy alta dimensión, mejorando un récord que se mantenía desde 1978.

Por qué algunos dudan de los resultados de OpenAI

OpenAI no es el único desarrollador de IA de frontera que aplica sus modelos a problemas matemáticos sin resolver. Claude Fable 5, desarrollado por Anthropic, supuestamente identificó un contraejemplo que puso fin a la conjetura jacobiana, de 87 años de antigüedad, en tres variables. El matemático de UCLA Terence Tao verificó públicamente el resultado el 21 de julio.

Las afirmaciones anteriores de OpenAI sobre las capacidades matemáticas de sus modelos han sido objeto de escrutinio. La empresa atribuyó el 10 de julio a GPT-5.6 Sol Ultra una demostración de la Conjetura del doble recubrimiento de ciclos —un problema matemático de larga data sobre la disposición de bucles en una red—. Los matemáticos Sang-il Oum y Jim Geelen escribieron críticas independientes de ese argumento, mientras que Wolfram MathWorld registra que la afirmación no había llegado a una publicación revisada por pares al final del mes.

Algunos críticos también han expresado escepticismo sobre resultados anteriores de pruebas comparativas autodeclarados y publicados por la empresa. Sin embargo, cada uno de estos resultados más recientes iba acompañado de un certificado de Lean —una demostración escrita para su verificación informática—, así como de los manuscritos y las narraciones del proceso de razonamiento del modelo. No obstante, es importante señalar que los resultados aún no han pasado por una revisión por pares convencional.