一种有用的思维模型
可以把生成式 AI 想象成一张经过学习的地图,用来表示接下来可能合理出现的内容。
对于文本,这张地图描述哪些后续内容与输入及已经生成的文本相匹配。对于图像,它可以描述哪些视觉变化能够把噪声变成符合文字描述的图像。这张地图存储在AI 模型学到的参数中,而不是以已完成答案目录的形式存在。
提示词会缩小可能性的范围。“写一个句子”允许大量有效输出;“为湿滑地面写一条六字警示标签”则会使其中更小的一部分范围变得合适。
然后,模型会从它学到的各种可能性中进行采样。采样意味着选择一个可能的下一步,通常会带有一定程度的受控随机性。这个选择会成为下一步的输入的一部分。重复这一过程,就会产生最终结果。
这就是从学习模式到创建内容之间的关键桥梁:
Training examples -> learning objective -> learned pattern model
|
Prompt + initial state -> repeated sampling --+-> generated output这张图有意保持了一般性。“初始状态”可能是开头的文本序列、一片噪声、待编辑的现有图像,或其他形式的数据。“反复采样”可能意味着每一步添加下一个文本单元,或逐步去除少量噪声。
生成式 AI 如何工作
大多数生成式系统包含两个不同阶段。
1. 学习分布
在训练期间,模型会看到许多属于其需要表示的数据类型的示例。学习目标会衡量模型执行某项任务的能力,而该任务能够揭示这些数据的结构。模型会调整参数以提高得分。
具体任务取决于模型家族:
- An 自回归模型根据序列中此前的单元,预测下一个单元。
- A 扩散模型学习如何逆转逐步添加噪声的过程。
- A 变分自编码器学习一个可能数据的结构化空间,以及从该空间中解码样本的方法。
- A 生成对抗网络(GAN)训练一个生成器,使其生成的样本能够让第二个模型——判别器——无法可靠地区分它们与训练示例。
这些方法各不相同,但每种方法都为系统提供了生成样本的方式,使其呈现出与训练数据相似的模式。在正式的机器学习意义上,这正是模型具有生成性的原因。
2. 对输出进行采样
使用训练好的模型时,你的输入会对生成过程施加条件。“条件化”简单来说就是:输入会改变模型认为合理的输出范围。
生成通常从一个起始状态开始。文本模型的起始状态包括提示词和目前已经生成的文本。图像扩散模型通常从噪声开始。模型预测下一步,选择或计算出该步骤,更新状态,并不断重复,直到达到停止点。
这个重复过程非常重要。生成器不保证选择唯一最可能的完整答案,通常也不是从存储中取出一个已经完成的条目。微小的选择会逐步累积。同一个提示词可能因为不同选择而产生不同的有效输出。
一个文本示例
假设文本生成器收到以下输入:
The trail was closed because the river had
在下一步,假设模型为这些可能性分配了以下概率:
- risen——54%
- flooded——21%
- overflowed——12%
- 其他所有后续内容——13%
这些数字仅用于说明,并不描述某个具体模型。
如果模型选择了“risen”,当前文本就会变成:
The trail was closed because the river had risen
现在,模型会根据提示词和“risen”计算一组新的可能性。下一步它可能更倾向于生成“overnight”“above”或标点符号。这个过程会持续到响应完成。
有两个细节可以解释生成式 AI 的许多行为。
第一,生成是有条件的。把“trail”改成“airport”,最可能的后续内容就会改变。第二,看起来合理并不等于符合事实。即使现实中不存在某条小径或某条河,模型也能写出一条流畅的关闭通知。单靠生成过程,模型不会将这一说法与现实进行核验。
这个术语有广义和狭义之分
在机器学习中,生成模型是指任何能够充分表示数据分布,从而估计或生成可能示例的模型。这一类别通常与判别模型相对:判别模型侧重于预测标签或区分类别。学习手写数字外观的模型属于生成模型;只判断图像显示的是 0 还是 1 的模型,则可以是判别模型。
在日常产品语言中,“生成式 AI”通常有更狭义的含义:由提示词驱动、能够创建复杂数字内容的系统。这些系统通常使用大型通用模型,但广义技术定义并不要求模型具备大规模和通用性。正如NIST 所指出的,并非所有生成式 AI 都来自基础模型。
这就是为什么不同定义听起来可能并不一致。有些定义描述的是一种统计模型类别;另一些描述的则是当前利用这类模型构建的产品。
生成式 AI 为什么重要
传统预测系统通常返回固定标签集合中的一个标签或一个数字。生成式系统则可以构建一个其确切内容并未预先指定的输出。
这使得同一个模型能够用于许多可以表述为“生成”的任务。文本模型可以起草、总结、翻译、重新格式化或编写代码,因为每项任务都可以表述为生成合适的序列。图像模型可以创建、扩展或编辑图像,因为每项任务都可以表述为在不同条件下生成视觉数据。
同样的灵活性也带来了主要的可靠性问题。有许多输出看起来都合理,但只有其中一部分能够满足用户未明确表达的需求、符合外部事实、避免有害内容,或遵守法律和社会约束。模型能够生成令人信服的形式,并不保证该形式中的内容正确。
常见误解
“它会搜索数据库,然后拼接出一个答案”
生成模型通常是通过反复应用学到的参数来创建输出,而不是选择某个存储好的响应。这并不意味着模型不可能记忆内容。模型可能会复现部分训练数据,尤其是那些重复出现或具有鲜明特征的材料。“不是数据库查询”和“从不复现训练材料”是两个不同的说法。
“生成的内容都是真的”
生成过程追求的是与学到的模式和输入条件相匹配。真实性则需要另一套标准:证据、计算、观察或可信来源。流畅的回答仍然可能包含虚构的人名、引文、事件或因果解释。
“生成的内容一定是原创的”
从有限的意义上说,输出可能是新的,因为系统是在本次运行中组装出它,而不是检索一条完整的存储记录。但这并不能确定它是否具有创意原创性、是否受到法律保护、是否源自现有作品,或是否受到记忆内容的影响。这些问题取决于输出本身、训练过程以及适用的规则。
“生成式 AI 就是聊天机器人”
聊天机器人是一种界面和应用模式。生成式 AI 则是能够生成内容的模型和系统这一底层类别。它还包括图像、音频、视频、代码以及专用数据生成器。
“所有生成式 AI 系统都是同一种模型”
自回归、扩散、变分、对抗式以及其他生成方法使用不同的学习目标和采样过程。它们共享的是用途,而不是一种通用架构。
它如何融入更广泛的系统
模型只是生成式 AI 产品的一部分。完整的应用可以在模型周围加入指令、用户控制、外部信息、安全检查、内容过滤器、工具和输出验证。
这些周边部分可以改变系统行为,却不会改变生成式 AI 的基本定义。搜索连接可以为文本生成器提供最新证据;过滤器可以阻止生成某些图像;代码工具可以运行生成代码的测试。生成器仍然负责提供候选内容,其余系统则负责提供上下文、能力和检查。
接下来阅读什么
如果你想了解学到的模型本身包含什么内容,可以先阅读什么是 AI 模型?然后阅读什么是基础模型?了解许多当前生成式产品背后广泛适用、可复用的模型;或者阅读什么是多模态 AI?了解能够处理文本、图像、音频和视频的系统。