Tetherの先端研究イニシアチブは水曜日、1,914.3億トークンの合成データセットQVAC Genesis IIIを公開した。このデータセットは、より小型のAIモデルにSTEM分野の推論を学習させ、ノートパソコンやスマートフォン、ローカルサーバー上で動作させる能力を高めることを目的としている。

According to a 声明によると、このデータセットには高校、大学、専門職レベルにまたがる19分野の1億5,960万件の文書が含まれている。分野には数学、物理学、化学、コンピューターサイエンス、医学などがある。

Tetherによると、このデータセットは2つの学習手法に基づいている。1つ目のFailure Analysisでは、小型モデルの誤りを学習材料としてフィードバックし、より大型の「教師」モデルが推論のどこで誤ったのかを特定し、正しい解答に至るまでの過程を検証する。

もう1つの手法であるOption-Level Reasoningは、正解がなぜ正しいのか、また各選択肢がなぜ誤りなのかを説明する。

声明によると、Genesis IIIの研究者は、このデータセットで学習したモデルが、Qwen、Llama、SmolLM、Gemmaなど複数のアーキテクチャで、同等のデータ量で学習したCosmopedia-v2を上回ることを確認した。

Tetherによると、トークン数をそろえたCosmopedia-v2モデルと比較して、Genesis IIIはARC-Easyで28.57ポイント、ARC-Challengeで21.35ポイント、MMLU STEMベンチマークで15.03ポイントスコアを向上させた。

Genesis IIIは2025年10月24日のGenesis I、2025年12月22日のGenesis IIに続くものだ。同プロジェクトの論文は、Conference on Language Modeling 2026での発表に採択されている。