Tether 的高级研究计划于周三发布了 QVAC Genesis III。这是一套包含1914.3亿个词元的合成数据集,旨在训练较小的 AI 模型进行 STEM 推理,并提升其在笔记本电脑、手机和本地服务器上的运行能力。

根据一份声明,该数据集包含1.596亿份文档,涵盖高中、大学和专业级别的19个学科,包括数学、物理、化学、计算机科学和医学。

Tether 表示,该数据集采用两种训练方法。第一种是失败分析:将较小模型的错误反馈为训练材料,由更大的“教师”模型追踪推理出错的环节,并逐步推导出正确解法。

另一种方法是选项级推理,解释为什么正确答案是正确的,以及为什么每个其他选项都是错误的。

声明称,Genesis III 的研究人员发现,在该数据集上训练的模型在包括 Qwen、Llama、SmolLM 和 Gemma 在内的多种架构上,表现优于使用 Cosmopedia-v2 进行同等规模训练的模型。

Tether 表示,与 token 数量匹配的 Cosmopedia-v2 模型相比,Genesis III 在 ARC-Easy 上的得分提高了28.57个百分点,在 ARC-Challenge 上提高了21.35个百分点,在 MMLU STEM 基准测试上提高了15.03个百分点。

Genesis III 发布于 Genesis I(2025年10月24日)和 Genesis II(2025年12月22日)之后。其论文已被接受,将在 2026 年语言建模大会上进行展示。