Moonshot AI 于 7 月 27 日将 Kimi K3 的权重上线,使这个迄今发布的最大开源模型可供任何人免费下载。它是这家成立于 2023 年的北京初创公司推出的 2.8 万亿参数系统,既能读取图像,也能读取文本,并且单次查询可接受 100 万个 token,足以一次性容纳整个代码库。

真正让业界关注的是它在排行榜上的表现。独立追踪机构将 K3 排在该领域最顶尖的位置附近:在 Artificial Analysis 的智能指数上仅次于 Claude Fable 和 GPT-5.6 Sol Max,在 Frontend Code Arena 上则排名第一,而运行成本只有后者的一小部分。开放权重意味着任何人都可以下载、检查、改造它,并将其保留在自己的网络内,而领先的闭源模型无论价格多高都不允许这样做。这正是上周令许多人感到不安的地方,也正因如此,这次发布被解读为针对 OpenAI 和 Anthropic 的竞争性行动,而不只是一次研究里程碑。

但其中有一个不太受关注的问题。可下载并不等于可运行。这些文件总大小达到 1.56 TB,实际运行意味着需要配备数据中心 GPU 的多节点机架。对于没有这类设备的人来说,开放权重大多只是一个技术层面的概念。

Pipe Network 已经发布了一个开源移植版本,缩小了这一差距,让 K3 的可运行版本得以部署到单台 Apple Silicon 台式机上。

障碍始终是内存。即便采用最激进的压缩形式,K3 仍需要大约 870 GB 内存。现存最大的 Mac——M3 Ultra Mac Studio——统一内存上限也只有 512 GB。这并不是差一点就够。

两项工程改进解决了这个问题。

流式转换

模型要想在 Mac 上运行,首先必须将其文件改写为 Apple 机器学习软件能够读取的格式。标准工具的做法是将整个模型加载到内存中,完成转换后再保存回去。这适用于人们在家运行的小型模型,但在这里行不通,因为 K3 的原始大小为 5.6 TB,而市面上没有任何机器拥有接近这一容量的内存。

模型并不是一个完整的固体块,而是一组层层叠加的区段。K3 有 93 个区段,每个区段完成一部分工作后再交给下一个区段。该移植项目的转换器利用了这一点:它加载一个区段,完成转换,将其写入磁盘,然后丢弃,再处理下一个区段。整个过程中无需让全部内容同时存在,因此执行任务的机器只需要几十 GB 的内存,而不是几千 GB。这更像是管道工程,算不上什么光鲜的技术,但没有它,项目中的其他工作都无法进行。

剪掉你用不到的专家

K3 的大部分内容在任意时刻都没有参与计算,而这正是设计使然。它并不是一个庞大的通用网络,而是由一组专业范围狭窄的专家组成。其 93 个区段各自包含 896 个专家,路由器会根据正在处理的词,选出最合适的 16 个。其余专家则暂不参与。计算下来,模型磁盘占用的大约 98% 是某一时刻处于闲置状态的专家,但它们仍然占据空间。

这些专业模块被称为专家,而 REAP 是 Cerebras 提出的一种决定保留哪些专家的技术。它会将一部分与你实际关心的文本类型相似的样本文本输入模型,观察哪些专家承担了主要工作,然后丢弃那些始终无法证明其空间价值的专家。应用于 K3 后,该方法将模型从 1.56 TB 缩减至 350 GB,可以放进一台 Mac Studio,并且还有余量。

语料库就是产品

代码仓库中最有意思的结果是:用于校准的样本文本,决定了最终模型能够完成什么任务。

团队测量了不同类型内容所依赖的专家。欧洲语言彼此聚集成簇,代码也聚集成簇。中文和代码之间几乎没有重叠,低于随机情况下的预期。

其影响会体现在输出中。使用英语和代码进行校准的版本会完全失去中文能力,并开始重复自身内容。仅使用中文校准的版本能够流畅书写中文,却无法生成可运行的代码。同时使用两者校准的版本则能兼顾二者。你压缩的不只是模型,也是在选择它的哪些能力能够保留下来。

团队谨慎地指出,这一结论基于少量测试提示词,而不是正式评估;同一实验的早期版本还得出了一个后来被发现是错误的结论。

坦诚的限制说明

训练是教会模型的过程。推理则是每次使用模型时发生的过程,也就是将你的提示词逐字转换成答案。每生成一个词,机器都必须扫描模型权重中的很大一部分,这也是为什么推理速度主要取决于计算机移动数据的速度,而不是模型有多聪明。

这里的速度为每秒 0.14 至 0.20 个 token。生成一个句子需要几分钟。每生成一个词,就需要从内存中读取约 87 GB 数据,因此这属于硬件上限,而不是软件漏洞;进一步加大剪枝力度也无法解决。一个小了 100 GB 的版本,运行速度几乎没有提升。

这就是该项目真正的启示。通过软件将模型装入机器是可以解决的问题,但让它变得可用则不是;这相当准确地说明了,在“本地”成为有意义的描述之前,这种规模的模型仍然需要多少硬件。它是一种批处理工具,适合启动任务后离开,稍后再回来查看,而不是聊天机器人。不过,消费级机器的内存带宽仍在不断提升,软件基础工作现在已经完成并公开,等硬件性能跟上即可使用。

有两件事运行得很顺利。视觉组件已经用 Moonshot 自己的代码进行了测试,结果与其相符,误差仅在舍入范围内,因此图像处理可以端到端运行。幸存的专家与原版逐位完全一致,因为源格式和 Apple 的格式恰好以相同方式编码数字。唯一丢失的信息就是剪枝本身。

该代码仓库对于哪些内容尚未经过测试也异常直白。完整的未剪枝版本从未生成过单个 token,因为不存在能够容纳它们的计算机。