L’initiative de recherche avancée de Tether a publié mercredi QVAC Genesis III, un jeu de données synthétiques de 191.43 milliards de tokens conçu pour entraîner de plus petits modèles d’IA au raisonnement STEM et améliorer leur capacité à fonctionner sur des ordinateurs portables, des téléphones et des serveurs locaux.
Selon une déclaration, le jeu de données contient 159,6 millions de documents couvrant 19 disciplines aux niveaux secondaire, universitaire et professionnel. Il s’agit notamment des mathématiques, de la physique, de la chimie, de l’informatique et de la médecine.
Tether a déclaré que le jeu de données reposait sur deux méthodes d’entraînement. La première, l’analyse des échecs, réinjecte les erreurs d’un modèle plus petit comme matériau d’entraînement, tandis qu’un modèle « enseignant » plus grand identifie l’étape où le raisonnement a échoué et élabore la solution correcte.
L’autre méthode est le raisonnement au niveau des options, qui explique pourquoi une bonne réponse est correcte et pourquoi chaque autre option est erronée.
Selon la déclaration, les chercheurs de Genesis III ont constaté que les modèles entraînés sur ce jeu de données obtenaient de meilleurs résultats que ceux entraînés avec une quantité équivalente de données Cosmopedia-v2 sur plusieurs architectures, notamment Qwen, Llama, SmolLM et Gemma.
Par rapport à un modèle Cosmopedia-v2 utilisant le même nombre de tokens, Genesis III a amélioré les scores de 28.57 points de pourcentage sur ARC-Easy, de 21.35 points sur ARC-Challenge et de 15.03 points sur le benchmark STEM MMLU, a déclaré Tether.
Genesis III fait suite à Genesis I, le 24 oct. 2025, et à Genesis II, le 22 déc. 2025. Son article a été accepté pour une présentation à la Conference on Language Modeling 2026.
