学习
推理与服务
推理与服务
6- 概念什么是 AI 中的推理?↗AI 中的推理是指在不更新模型已学内容的情况下,将输入提供给训练好的模型并生成输出的过程。这是模型的使用阶段:输入一张照片,输出一个标签;或者输入一个提示词,输出生成的文本。
- 概念什么是推理吞吐量?↗推理吞吐量是指推理系统在单位时间内完成的模型工作量,统计范围涵盖它正在处理的所有请求。它可以用每秒完成的请求数、推理次数、样本数或令牌数来衡量。
- 概念什么是推理延迟?↗推理延迟是指 AI 系统接收输入到生成指定输出之间经过的时间。只有明确计时器从哪里开始、在哪里停止,以及什么样的输出算作完成,延迟数值才有意义。
- 概念什么是每秒令牌数?↗每秒令牌数(TPS 或 tok/s)用于衡量 AI 系统在一秒内生成的令牌数量。这个数值可能描述单个响应的输出速度,也可能描述整个服务系统的综合吞吐量,因此仅凭标签无法判断其含义。
- 概念什么是首个令牌时间?↗首个令牌时间(Time to First Token,TTFT)是指从开始发送语言模型请求到收到其响应的首个令牌之间经过的时间。它衡量的是初始等待时间,而不是后续响应到达的速度。
- 比较延迟 vs. TTFT vs. 每秒令牌数 vs. 吞吐量↗延迟是一次推理请求所需的时间;TTFT 是流式请求开始返回答案所需的时间;每秒令牌数是一种速率,可能描述单个流,也可能描述整个系统;吞吐量则是系统随时间完成的总工作量。最关键的区别在于范围:延迟和 TTFT 衡量单个请求所花的时间,而吞吐量统计一个测量时间窗口内完成的工作量。