Moonshot AI 于 7 月 27 日将 Kimi K3 的权重上线,使这个有史以来发布的最大开放模型可供任何人免费下载。它是一个来自北京初创公司的 2.8 万亿参数系统,该公司成立于 2023 年;它既能读取图像,也能处理文本,并且单次查询可接受 100 万 tokens,足以一次性容纳整个代码库。
真正让业界关注的是它在排行榜上的位置。独立追踪机构将 K3 排在该领域最顶尖的位置之一,在 Artificial Analysis 的 intelligence index 上仅次于 Claude Fable 和 GPT-5.6 Sol Max,并在 Frontend Code Arena 位列第一,而运行成本却只占其一小部分。开放权重意味着任何人都可以下载、检查、调整它,并将其保留在自己的网络内部,而任何领先的闭源模型无论价格多高都不允许这样做。这正是上周让很多人感到不安的部分,也是为什么这次发布被解读为针对 OpenAI 和 Anthropic 的竞争举措,而不只是一个研究里程碑。
不过有一个较少被关注的问题:可下载并不等于可运行。这些文件总计 1.56TB,实际意味着需要由数据中心 GPU 组成的多节点机架。对于没有这类条件的人来说,开放权重大多只是一个技术意义上的说法。
Pipe Network 已发布一个开源移植版本,缩小了这一差距,让 K3 的可运行版本登上了单台 Apple Silicon 桌面设备。
障碍始终是内存。即便在压缩程度最高的形式下,K3 仍需要大约 870GB。现有规格最高的 Mac,也就是 M3 Ultra Mac Studio,统一内存上限为 512GB。这不是差一点点。
两项工程工作填补了这一鸿沟。
流式转换
在模型能够在 Mac 上运行之前,首先必须将其文件重写为 Apple 机器学习软件可读取的格式。标准工具的做法是把整个模型加载到内存中,进行转换,然后再保存回磁盘。这对人们在家运行的小模型有效。但在这里行不通,因为 K3 的原始形态有 5.6TB,而市面上没有任何机器拥有接近这么大的内存。
模型并不是一个完整的大块头。它是由一叠模块组成的,而 K3 有 93 个这样的模块,每个模块完成一部分工作后再交给下一个。这个移植版本的转换器正是利用了这一点。它加载一个模块,进行转换,写入磁盘,丢弃,再处理下一个。在任何时刻,都不需要让整个模型同时存在,因此执行这项工作的机器只需要几十 GB 内存,而不是数千 GB。这更像是管线工程,而不是什么华丽的突破,但没有它,项目中的其他部分都无从谈起。
剪掉你用不到的专家
在任何给定时刻,K3 的大部分其实都没有在工作,而且这是有意为之。它不是一个庞大的通用网络,而是被构建成一组狭窄的专门模块。它的 93 个模块中每个都包含 896 个这样的单元,路由器会挑选出最适合当前处理词语的 16 个,其余的则闲置。算下来,模型磁盘体积中大约 98% 都是这些在任一时刻处于空闲状态的专门单元,但它们依然占据空间。
这些专门单元被称为“专家”,而 REAP 是来自 Cerebras 的一种技术,用于决定保留哪些专家。它会将一批你真正关心的文本样本输入模型,观察哪些专家承担了主要工作,然后丢弃那些从未证明自己值得占据空间的部分。应用到 K3 后,这会把 1.56TB 降到 350GB,足以放进一台 Mac Studio,而且还绰绰有余。
语料就是产品
这个 repo 中最有意思的结果是,你用来校准的样本文本决定了最终模型能做什么。
团队测量了不同类型内容依赖哪些专家。欧洲语言聚成一类,代码也聚成一类。中文与代码几乎没有重叠,甚至低于随机情况所预期的程度。
其后果会体现在输出上。一个用英语和代码校准的构建版本会完全丧失中文能力,并开始重复自己。一个只用中文校准的构建版本可以写出流畅的中文,但无法生成可运行的代码。一个同时用两者校准的版本则能同时保留两种能力。你不只是在压缩一个模型,你是在选择它的哪些能力能够存活下来。
团队谨慎指出,这一结论建立在少量测试提示上,而不是正式评估;并且同一实验的早期版本曾得出一个后来被他们发现是错误的结论。
坦诚的提醒
训练决定了模型学会什么。推理则是你每次使用模型时发生的过程,即把你的提示转化为答案、一次生成一个词。每个词都要求机器遍历模型权重中的很大一部分,这也是为什么推理速度主要取决于计算机搬运数据的速度,而不是它有多聪明。
这里的速度是每秒 0.14 到 0.20 个 token。生成一句话需要数分钟。每生成一个词,都需要从内存中读取大约 87GB,因此这是硬件上限,而不是软件 bug,更激进的剪枝也无法解决。一个体积再小 100GB 的构建版本,速度也几乎没有变快。
这才是该项目真正的启示。将模型塞进机器里可以通过软件解决。让它变得可用却不行,而这也相当准确地表明,在“本地”成为一个有意义的描述之前,这种规模的模型依然需要多少硬件。这是一个适合启动任务后离开、稍后再回来查看结果的批处理工具,而不是聊天机器人。不过,消费级机器的内存带宽仍在持续提升,而软件层面的基础工作如今已经完成并公开,就等硬件追上来了。
有两点确实运作得很顺利。视觉组件已对照 Moonshot 自家的代码进行了测试,结果在舍入误差范围内一致,因此图像功能可以端到端正常工作。而保留下来的专家与原始版本完全逐位一致,因为源格式和 Apple 的格式碰巧以相同方式编码数字。唯一丢失的信息就是剪枝本身。
这个 repo 也异常直接地说明了哪些内容尚未经过测试。完整的未剪枝版本从未生成过哪怕一个 token,因为根本不存在能够容纳它们的计算机。
