术语模态指信息被表示或感知的一种独特方式。段落、照片、录音和深度传感器读数属于不同的模态。它们的结构不同,但可以描述同一事件。

一项任务,多种证据

假设你上传了一张餐厅收据的照片,并输入:

Ana 喝了汤,Bo 吃了意大利面,他们一起分享了沙拉。请按各自食物消费总额的比例分摊税费。

价格存在于图像中。归属和分摊规则存在于文本中。单独来看,任何一种输入都不够。要回答这个问题,模型必须将“汤”和“沙拉”等词关联到收据上的正确区域,将相应价格带入计算,并遵循书面规则。

这种关联正是核心思想。多模态 AI 不只是把多个输入并排放在一起。来自一种模态的信息必须改变对另一种模态信息的解读或使用方式。

这比说多模态 AI“像人类的感官一样工作”更加准确。人类确实会结合视觉、声音和语言,但 AI 模型接收的是经过编码的数据,而不是人类体验。这种类比只有在结合不同证据渠道这一层面上才有帮助。

多模态 AI 如何工作

不同架构会以不同方式实现多模态能力。常见流程包含四个阶段。

1. 编码每个输入

原始像素、声波和文本具有不同的形态。称为“编码器的模态专用组件,会将每个输入转换为能够捕捉所学特征的数字数组。

对于收据图像,特征可能保留与字符、商品条目和版式相关的视觉模式。对于指令,文本会被划分为可处理的单元,并转换为数值表示。模型不需要让两种输入一开始就采用相同的形式。

2. 对齐相关信息

模型必须学习不同模态之间哪些部分相互对应。在训练过程中,与图像配对的说明文字、与语音配对的转录文本,以及与视频配对的描述,都能提供这类关联的示例。

对齐不要求完美的一一对应。一句话可以描述整张图像,一个词可以指向一个小区域,一段声音可以跨越许多视频帧持续存在。模型学习的是有用的统计对应关系,而不是一张完整的符号映射。

例如,CLIP

3. 组合证据

这些表示需要一个彼此交互的空间。这个步骤通常称为“融合”。

有些系统会在早期组合特征,然后将它们作为整体进行处理。有些系统则让每种模态先分别经过自身流程的大部分阶段,再组合结果。许多现代模型会采用介于两者之间的方式,让选定的图像、音频或视频特征影响语言处理。

Flamingo展示了一种设计:在分别预训练的视觉组件和语言组件之间加入学习得到的层,将二者连接起来。原始的《Gemini 技术报告》描述了另一种训练选择,即从一开始就在多种模态上联合训练模型。二者都是多模态的。“多模态”描述的是能力,而不是某一种架构。

4. 生成所需输出

组合证据后,模型或系统会生成输出。输出可能是文本、图像、音频、类别、图像中的位置或控制信号。

输入和输出支持是彼此独立的能力决策。模型可以:

  • 接受文本和图像,然后输出文本;
  • 接受文本、音频和视频,然后输出文本;
  • 接受文本,然后输出图像;
  • 接受混合输入,并生成不止一种输出模态。

仅凭这个标签无法判断具体属于哪一种情况。

Image ──> image encoder ──┐
                          │
Audio ──> audio encoder ──┼─> alignment and fusion ─> task output
                          │
Text ───> text encoder ───┘

实际设计可能会合并这些阶段、重复执行这些阶段,或使用多个独立模型。该图展示的是功能,而不是强制性的布局。

一个完整示例

回到收据和书面分摊指令这个例子。

  1. 视觉输入会被转换为能够保留收据文本和版式的特征。
  2. 书面指令会被转换为文本表示。
  3. 训练中学到的关联有助于将“汤”“意大利面”和“沙拉”分别对应到收据上的匹配条目。
  4. 模型将这些价格与归属规则结合起来。
  5. 它会生成文本答案,显示每个人的小计和应分摊的税额。

其中可能出现多种错误。模糊的数字可能导致价格错误。模型可能将“沙拉”与错误的行对齐。它也可能正确读取每一行,却错误应用税费规则。多模态能力免去了你手动转录图像的需要,但并不会消除感知、对齐或推理错误。

实现方式也会影响准确的表述。如果一个组件先使用光学字符识别(即从图像中提取书面字符的软件),再由纯文本模型处理所得转录文本,那么该应用是一个多模态系统。但其中的纯文本模型并不会因此成为多模态模型。如果一个模型直接将所学的图像特征与指令结合起来,那么该模型本身就是多模态的。

多模态 AI 为什么重要

许多有用的任务包含一些无法在不损失重要信息的情况下还原为干净文本的证据。表单中的版式承载着含义。语音中的语气和时序携带信息。动作使视频区别于无序的图片堆。图表和场景中的空间关系也很重要。

组合不同模态可以消除歧义。诸如“为什么这个部位在漏水?”这样的书面问题,并没有说明“这个”指的是哪个部位。配套图像可以提供这一指代信息。音轨可以区分两种外观上都在运行的电机:一种声音正常,另一种发出异常噪声。

多模态界面还可以减少手动转换。你可以用照片指出目标、口述指令或附上图表,而不必先将所有内容转换成详细的书面描述。

这些是可能性,而不是保证。只有当额外模态包含相关证据,并且模型能够正确对齐这些证据时,它才会有所帮助。相互矛盾或质量低下的输入可能引入新的错误。

常见误解

“多模态”意味着它能处理所有媒体类型的所有任务

不是这样。能力有两个方面:哪些内容可以输入,以及哪些内容可以输出。请分别检查各个方向支持的模态,以及在同一个请求中组合它们时存在的限制。

任何图像生成器都是通用多模态模型

文本到图像模型会将一种模态转换为另一种模态,因此按照某些宽泛定义,它属于多模态模型。但这并不意味着它能够检查图像、比较两张图像、理解音频或对混合输入进行推理。具体的输入—输出契约比这个标签更有用。

多模态 AI 和生成式 AI 是一回事

它们描述的是不同的维度。生成式 AI会生成新的内容。多模态 AI 则处理或关联不止一种模态。一个系统可以同时属于两者,也可以只属于其中一个,或者两者都不属于。

分析图像和传感器读数并选择固定安全类别的模型是多模态的,但不一定是生成式的。纯文本写作模型是生成式的,但属于单模态。如今许多助手兼具这两种特征。

多模态 AI 必须是一个统一的模型

不一定。研究人员可能用这个术语指一个经过学习的模型,而产品团队可能用它指由相互连接的组件组成的系统。应当询问模态在何处以及如何交互。如果不同组件独立生成答案,而应用只是将它们显示在一起,那么该系统不一定执行了跨模态推理。

模态越多,准确率总会越高

额外证据可能有所帮助,但也可能无关、嘈杂或相互矛盾。性能取决于数据质量、对齐情况、任务本身以及模型的训练方式。自信的回答并不能证明模型正确关联了不同模态。

多模态 AI 如何融入更广泛的系统

多模态能力可以出现在多个层面:

  • 数据:训练示例会配对或交错使用不同模态。
  • 模型:经过学习的组件会对齐并组合不同模态的表示。
  • 应用:产品会在不同组件之间路由文件、传感器数据流或模型输出。
  • 界面:用户可以通过文本、语音、图像或视频进行交流。

不应将这些层面合并成一个笼统的说法。多模态界面可能隐藏着由专用模型组成的流程。多模态模型可能位于纯文本界面的背后。在图像和文本配对数据上训练的模型,可能只支持范围狭窄的匹配任务,而不是开放式对话。

评估产品或模型时,请提出三个问题:

  1. 它能在同一项任务中接受哪些模态?
  2. 它能生成哪些模态?
  3. 来自这些模态的信息在哪里以及如何交互?

这些答案比“多模态”本身能告诉你更多信息。

接下来学习什么

参阅“什么是 AI 模型?”了解更广义的模型概念,并参阅“什么是生成式 AI?”区分生成内容的能力与组合模态的能力。阅读模型卡片或产品页面时,请分别列出其输入和输出,然后查找证据,确认它是否在需要利用不止一种模态的信息的任务上经过测试。