Tether의 첨단 연구 이니셔티브는 수요일 QVAC Genesis III를 공개했다. 이 데이터셋은 1,914억 3,000만 토큰 규모의 합성 데이터셋으로, 더 작은 AI 모델이 STEM 추론 능력을 학습하고 노트북, 휴대전화, 로컬 서버에서 실행될 수 있도록 설계됐다.

성명에 따르면 성명이 데이터셋에는 고등학교, 대학, 전문 과정 수준에 걸친 19개 학문 분야의 문서 1억 5,960만 개가 포함돼 있다. 여기에는 수학, 물리학, 화학, 컴퓨터 과학, 의학이 포함된다.

Tether는 이 데이터셋이 두 가지 학습 방법을 활용한다고 밝혔다. 첫 번째는 실패 분석(Failure Analysis)으로, 더 작은 모델의 오류를 학습 자료로 다시 활용하고, 더 큰 "교사" 모델이 추론이 잘못된 지점을 추적한 뒤 올바른 해법을 도출한다.

다른 방법은 선택지 수준 추론(Option-Level Reasoning)으로, 정답이 왜 맞는지와 각 오답 선택지가 왜 틀렸는지를 설명한다.

성명에 따르면 Genesis III 연구진은 이 데이터셋으로 학습한 모델이 Qwen, Llama, SmolLM, Gemma를 비롯한 여러 아키텍처에서 동일한 규모의 Cosmopedia-v2 학습보다 우수한 성능을 보였다고 밝혔다.

Tether에 따르면 토큰 수를 맞춘 Cosmopedia-v2 모델과 비교했을 때 Genesis III는 ARC-Easy에서 28.57퍼센트포인트, ARC-Challenge에서 21.35퍼센트포인트, MMLU STEM 벤치마크에서 15.03퍼센트포인트만큼 점수를 높였다.

Genesis III는 2025년 10월 24일 공개된 Genesis I과 2025년 12월 22일 공개된 Genesis II에 이은 후속작이다. Genesis III 논문은 Conference on Language Modeling 2026에서 발표될 논문으로 채택됐다.