A iniciativa de pesquisa avançada da Tether lançou o QVAC Genesis III na quarta-feira, um conjunto de dados sintéticos com 191,43 bilhões de tokens, desenvolvido para treinar modelos menores de IA em raciocínio STEM e melhorar sua capacidade de operar em laptops, celulares e servidores locais.
Segundo um comunicado, o conjunto de dados contém 159,6 milhões de documentos abrangendo 19 disciplinas nos níveis de ensino médio, superior e profissional. Entre elas estão matemática, física, química, ciência da computação e medicina.
A Tether disse que o conjunto de dados depende de dois métodos de treinamento. O primeiro, Análise de Falhas, devolve os erros de um modelo menor como material de treinamento, enquanto um modelo maior, o "professor", rastreia onde o raciocínio falhou e desenvolve a solução correta.
O outro método é o Raciocínio em Nível de Opção, que explica por que uma resposta correta está certa e por que cada alternativa está errada.
Segundo o comunicado, os pesquisadores do Genesis III descobriram que os modelos treinados com o conjunto de dados superaram o treinamento equivalente com o Cosmopedia-v2 em várias arquiteturas, incluindo Qwen, Llama, SmolLM e Gemma.
Em comparação com um modelo Cosmopedia-v2 com correspondência de tokens, o Genesis III melhorou as pontuações em 28,57 pontos percentuais no ARC-Easy, 21,35 pontos no ARC-Challenge e 15,03 pontos no benchmark STEM MMLU, disse a Tether.
O Genesis III sucede o Genesis I, de 24 de outubro de 2025, e o Genesis II, de 22 de dezembro de 2025. O artigo foi aceito para apresentação na Conference on Language Modeling 2026.
