术语表

用通俗语言解释现代 AI 的核心术语:从 token 与上下文窗口,到推理、智能体与基准测试,每一条都链接到完整的解读文章。

  1. A
  2. L

A

AI Harness
AI harness 是围绕 AI 模型的软件,用于控制模型接收什么、如何处理模型的输出,以及模型如何连接到应用程序的其他部分。它可以小到只是管理聊天历史记录的代码,也可以大到管理工具、记忆、权限、重试和长时间运行任务的运行时。
AI 中的 Token
AI 中的 token 是 LLM 用来表示和生成文本的词汇表中的一个条目。根据模型的 tokenizer,一个 token 可以对应一个单词、单词的一部分、标点符号、空白,甚至编码字符的一部分。
AI 中的推理
AI 中的推理是指在不更新模型已学内容的情况下,将输入提供给训练好的模型并生成输出的过程。这是模型的使用阶段:输入一张照片,输出一个标签;或者输入一个提示词,输出生成的文本。
AI 智能体
AI 智能体是一种软件系统,它使用 AI 模型选择下一步行动、观察结果,并持续执行,直到完成任务、需要帮助或达到限制。不同于只能生成答案的模型,智能体可以控制多步骤流程,并在既定权限范围内通过工具采取行动。
AI 模型
AI 模型是 AI 系统中将输入转换为输出的部分,输出可以是预测、分类、推荐、动作或生成结果。在当前大多数用法中,它指的是行为由训练数据塑造的机器学习模型。
AI 知识截止日期
AI 知识截止日期是指模型内置知识预计能够反映其训练数据的截至日期。它是一个粗略边界,并不保证模型知道此前的每一条事实,也不意味着 AI 产品无法获取之后的信息。
AI 聊天机器人
AI 聊天机器人是一种利用人工智能,通过文本或语音与人进行对话的软件应用。它接收消息,使用 AI 模型对消息进行理解或回答,并管理继续对话所需的上下文、规则、数据和操作。
AI 训练
AI 训练是改变模型可调内部数值的过程,使其输出更好地满足既定目标。模型通过反复获得反馈并进行更新来改进,而不是由程序员为每种情况编写规则。

L

LLM
大型语言模型(LLM)是一种在大量语言数据集合上训练的 AI 模型,用于处理或生成可能的文本序列。大多数用于文本生成的 LLM 会接收提示,并一次生成一小段响应。
LLM 中的工具使用
LLM 中的工具使用是一种机制,使语言模型能够请求外部操作(例如搜索数据库、执行计算或发送消息),并在其响应中使用返回的结果。模型通常会选择工具并提供拟议的输入;模型周围的软件则决定是否执行该调用。

上下文窗口
上下文窗口是 AI 模型在生成一次响应时可以使用的最大令牌化内容量。在许多语言模型 API 中,这一预算涵盖输入和生成的输出,但提供商也可能分别设置输入或输出限制。

人工智能
人工智能(AI)是设计计算机系统的领域:这些系统使用与学习、推理、感知和语言等能力相关的方法,生成面向目标的输出,例如预测、内容、推荐或决策。AI 也指这一领域所创建的系统。

基础模型
基础模型是在广泛数据上训练的机器学习模型,因此可以适配许多不同任务,而不是只为某一项任务构建。它是可复用的起点,而不是完成的应用程序。

多模态 AI
多模态 AI 是能够处理并关联多种数据类型(例如文本、图像、音频或视频)中的信息,以完成一项任务的 AI。多模态模型可能接受图像和书面指令,但只输出文本;“多模态”并不意味着每种数据类型都既能作为输入又能作为输出。

推理 Token
推理 Token 是 AI 模型在生成答案过程中产生的 Token,与您看到的答案文本分开。它们代表规划、检查或尝试某种方法等额外的生成步骤;即使服务将其隐藏,它们也可能计入用量和限制。
推理吞吐量
推理吞吐量是指推理系统在单位时间内完成的模型工作量,统计范围涵盖它正在处理的所有请求。它可以用每秒完成的请求数、推理次数、样本数或令牌数来衡量。
推理延迟
推理延迟是指 AI 系统接收输入到生成指定输出之间经过的时间。只有明确计时器从哪里开始、在哪里停止,以及什么样的输出算作完成,延迟数值才有意义。

机器学习
机器学习是一种构建软件的方法:软件从示例或反馈中学习模式,并利用这些模式,对此前未见过的案例做出有用的预测、决策或输出。它是人工智能的一种方法,并不是所有人工智能的同义词。

模型参数
模型参数是存储在已拟合模型内部的数值,它们决定模型如何将输入转换为输出。在神经网络中,模型参数通常包括权重和偏置;这些数值在训练期间确定,并在模型进行预测时重复使用。
模型权重
模型权重是经过学习得到的数值,用于决定模型在计算输出时对每个输入或中间信号的使用强度。它们通常以称为矩阵或张量的大型数值组形式存储;训练会调整这些数值,使模型的输出更好地符合其目标。

每秒令牌数
每秒令牌数(TPS 或 tok/s)用于衡量 AI 系统在一秒内生成的令牌数量。这个数值可能描述单个响应的输出速度,也可能描述整个服务系统的综合吞吐量,因此仅凭标签无法判断其含义。

生成式 AI
生成式 AI 是一种人工智能,它从现有数据中学习模式,并利用这些模式生成新的内容,例如文本、图像、音频、视频或代码。它通常会根据指令或其他输入来生成内容。

神经网络
神经网络是一种机器学习模型,它通过将输入数字传过由简单计算组成的连接层,学习把输入数字转换为有用的输出数字。这些层共同构成一个可训练的数学函数,而不是一个字面意义上的电子大脑。

输入令牌
输入令牌是模型在开始生成下一条响应之前接收并处理的令牌。它们来自完整的面向模型的请求,而不只是你最近输入的文字。
输出令牌
输出令牌是模型生成响应时所产生的单位。它们通常构成你收到的文本、代码、结构化数据或工具指令,不过提供商也可能将隐藏的推理计入输出用量。

首个令牌时间
首个令牌时间(Time to First Token,TTFT)是指从开始发送语言模型请求到收到其响应的首个令牌之间经过的时间。它衡量的是初始等待时间,而不是后续响应到达的速度。