基础模型是一个机器学习模型,它在广泛数据上训练,因此可以适配许多不同任务,而不是只为某一项任务构建。它是可复用的起点,而不是完成的应用程序。
一种有用的思维模型
“基础”一词描述的是该模型在一条链条中的位置。
broad training data
↓
pretraining
↓
foundation model
↙ ↓ ↘
prompt task fine-tuned
layer derivative
↘ ↓ ↙
downstream models and applications基础包含在广泛预训练期间学到的模式。后续步骤会将这些模式引向某一项具体工作。一种适配可以用于对支持工单分类,另一种可以用于回答问题,还有一种可以用于将图像与文字描述匹配起来。
关键区别在于:模型可以具备广泛能力,却未必已经准备好用于某个特定产品。“基础”之所以有价值,是因为不同的构建者可以复用它,而不必每次都从零开始完成任务。
基础模型如何工作
首先,开发者会汇集广泛的训练数据。“广泛”是相对于预期领域而言的。语言模型可能从多种文本中学习,而医学影像基础模型可能从各种扫描图像和临床场景中学习。广泛并不意味着必须涵盖现实中所有类型的数据。
接下来,模型会经历预训练。许多基础模型采用自监督学习:数据本身提供学习信号。文本模型可以通过预测被隐藏的文本片段或下一个文本片段来学习。图像-文本模型可以学习哪些说明文字与哪些图像相匹配。具体目标各不相同,但目的都是学习在某个狭窄任务之外仍然有用的模式。
预训练会生成一个检查点:即保存模型所学数值的一份记录。随后可以通过多种方式适配该检查点:
- 提示在输入中提供指令或示例。它会改变模型的即时行为,但不会改变模型学到的数值。
- 添加特定任务层附加一个小型组件,将模型的内部输出转换为某种特定结果,例如一组类别。
- 微调在更窄的数据集上继续训练。它会改变部分或全部已学数值,以提升模型在某项任务或某个领域中的表现。
- 系统集成将模型与搜索、数据库、工具、规则和界面连接起来。即使底层模型保持冻结,这也会改变应用能够执行的操作。
这些方法可以组合使用。但没有任何一种方法能够保证适配后的结果准确、安全或适合其预期用途。每一种下游用途仍然需要单独进行评估。
一个具体例子
假设一家公司从一个经过广泛预训练的语言模型开始,希望处理客户支持工单。
为了快速制作原型,团队向模型提供一个提示,其中包含允许使用的路由标签和几个示例。模型学到的数值不会改变。
为了实现更一致的路由,团队添加一个分类层,并在历史工单上对其进行微调。这样便形成了原始模型的一个特定任务衍生版本。
为了构建面向客户的支持助手,团队将模型连接到经批准的帮助文章、账户工具、权限检查和用户界面。最终得到的是一个围绕该模型构建的 AI 系统,而不只是基础模型本身。
同一个起始检查点支持了三种结果:通过提示实现的行为、适配后的模型,以及完整的应用。这种复用正是它成为基础模型的原因。
这种模式并非假设。最初的 BERT 研究将一个预训练语言模型适配到 11 项语言任务中,通常只需添加一个输出层。后续研究展示了不同形式的复用:GPT-3 无需微调,仅凭文本指令和示例就能执行任务;CLIP 则使用自然语言标签,对从未接受过专门分类训练的图像进行分类。
基础模型为何重要
基础模型将大量昂贵而广泛的学习工作集中到共享的预训练阶段。这样,下游团队便可以将精力投入任务数据、评估、产品设计和安全防护。
这种共享基础能够产生杠杆效应。基础模型的一项改进可以惠及许多用途。但它也会带来集中化风险。如果基础模型包含偏见、安全弱点或系统性故障,许多适配模型和产品都可能继承这些问题。研究人员称之为同质化:许多系统开始依赖同一小组底层方法或模型。
适配可以减少某一使用场景中的问题,但不会自动消除基础模型的局限。经过精心打磨的应用可以掩盖共同来源,却无法移除它。
常见误解
“基础模型”就是“大语言模型”
LLM 的定义依据是其对语言的关注以及规模大小。基础模型的定义依据则是广泛预训练和下游复用。许多 LLM 都是基础模型,但基础模型这一类别还包括用于图像、音频、机器人、生物学以及多种数据类型组合的模型。
每个基础模型都会生成内容
原始定义并不要求模型具备生成能力。基础模型可以生成可复用特征、对输入排序或分类,也可以连接文本和图像。供应商网页经常将“基础模型”作为生成式模型的简称,因为这些模型是其产品销售的对象,但这是一种更窄的用法。
规模大就够了
不存在一个通用的参数数量标准,可以将基础模型与其他模型区分开来。一个为单一固定任务训练的超大型模型,并不会自动成为基础模型。更有力的判断标准是:它是否从广泛数据中学习,以及是否能够作为多种下游任务的有意义基础。
政策文件可能会为受监管的子集设定数值门槛,例如“通用基础模型”。这些门槛界定的是该政策术语的适用范围,而不是整个技术类别。
提示会训练模型
普通提示为一次交互提供临时输入。微调则通过额外训练更新已学数值。两者都可以使模型行为适应某项任务,但只有后者会改变模型本身。
“基础”意味着值得信赖
这一术语并不代表质量认证。最初提出这一术语的作者之所以选择它,部分原因在于强调下游系统依赖其底层基础。薄弱的基础传播故障的效果,可能与坚实的基础传播有用能力的效果一样明显。
“基础模型”说明了它的许可方式
并非如此。基础模型可能提供可下载权重、受限权重,或仅通过 API 访问。“开放”“开放权重”和“闭源”描述的是访问方式和许可,而不是模型是否发挥基础作用。
它在更广泛系统中的位置
基础模型位于广泛预训练与具体使用之间。
在它之前,是用于创建检查点的数据、学习目标、架构、计算资源和评估。在它之后,则是提示、微调衍生模型、特定任务组件、检索来源、安全控制、工具和用户界面。
将这些层次区分开,有助于评估相关说法。如果助手检索到一个最新事实,该事实可能来自连接的搜索系统,而不是模型的预训练。如果聊天机器人拒绝某项请求,这种行为可能来自模型训练、系统指令、外部过滤器,或多个层次共同作用。用户看到的产品并不能揭示究竟是哪一层完成了这项工作。
下一步阅读方向
当你遇到“基础模型”这一标签时,请检查两点:该模型是否经过足够广泛的训练,能够支持不止一项狭窄任务;以及在你所考察的产品中,模型是如何被适配的。模型卡片或技术报告应当帮助你了解预训练范围、预期下游用途、适配方法和已知局限。
如果缺少这些细节,仅凭这一标签,你几乎无法了解模型的能力、可靠性、访问方式或安全性。
阅读什么是 AI 模型?以了解更广义的模型概念,阅读什么是 AI 训练?以了解学习参数是如何创建的,并阅读什么是生成式 AI?以了解基础模型应用中的一个重要类别。