La iniciativa de investigación avanzada de Tether lanzó QVAC Genesis III el miércoles, un conjunto de datos sintéticos de 191.43 mil millones de tokens diseñado para entrenar modelos de IA más pequeños en razonamiento STEM y mejorar su capacidad para ejecutarse en laptops, teléfonos y servidores locales.

Según un comunicado, el conjunto de datos contiene 159.6 millones de documentos que abarcan 19 disciplinas en los niveles de secundaria, universidad y formación profesional. Entre ellas se incluyen matemáticas, física, química, informática y medicina.

Tether afirmó que el conjunto de datos se basa en dos métodos de entrenamiento. El primero, el Análisis de fallos, devuelve los errores de un modelo más pequeño como material de entrenamiento, mientras un modelo más grande, el «profesor», rastrea dónde falló el razonamiento y desarrolla la solución correcta.

El otro método es el Razonamiento a nivel de opciones, que explica por qué una respuesta correcta es correcta y por qué cada alternativa es incorrecta.

Según el comunicado, los investigadores de Genesis III descubrieron que los modelos entrenados con el conjunto de datos superaron a los modelos equivalentes entrenados con Cosmopedia-v2 en varias arquitecturas, incluidas Qwen, Llama, SmolLM y Gemma.

En comparación con un modelo de Cosmopedia-v2 con el mismo número de tokens, Genesis III mejoró las puntuaciones en 28.57 puntos porcentuales en ARC-Easy, 21.35 puntos en ARC-Challenge y 15.03 puntos en la evaluación STEM MMLU, afirmó Tether.

Genesis III sigue a Genesis I, presentado el 24 de octubre de 2025, y a Genesis II, presentado el 22 de diciembre de 2025. Su artículo fue aceptado para su presentación en la Conference on Language Modeling 2026.