目前没有统一的AI 智能体定义。较早的含义包括任何能够感知环境并在其中采取行动的 AI 系统。在当前的软件产品中,这个术语通常指模型能够指导至少一部分工作流的系统。本页面采用这种现代且更狭义的含义。
最简单的理解方式
你向智能体提供的是目标,而不是每一个步骤。
如果你要求普通自动化系统处理发票,开发者通常已经预先编写好了流程:读取这些字段、应用这些规则、更新这个系统。如果你要求智能体解决发票问题,模型可能会检查发票、查找采购订单、发现不匹配、请求缺失的凭证,然后选择更新记录或将其升级处理。
区别并不在于智能体可以随心所欲地做任何事,而在于它对接下来发生什么拥有受约束的控制权。
一个实用的判断方法是:
系统收到结果后,由谁选择下一步?
如果始终由固定代码做出选择,那么该系统主要是工作流。如果模型可以根据结果选择不同的行动,那么该系统就具有类似智能体的控制能力。实际产品可以将两者结合起来:固定代码负责审批和付款,而模型决定如何调查异常。
AI 智能体如何工作
当前大多数软件智能体都将一个AI 模型与一个AI 执行框架结合起来。模型负责理解情境并提出行动建议。执行框架提供上下文、公开获准使用的工具、执行已批准的行动、记录状态并实施限制。
基本循环如下:
Goal, context, and limits
|
v
Model chooses a next step <------------------+
| |
v |
Harness checks and executes the action |
| |
v |
Environment returns an observation ----------+
|
v
Finish, ask for help, or stop at a limit1. 智能体接收目标
目标描述期望的结果。指令会增加各种约束,例如可以更改什么、哪些操作需要审批,以及什么才算完成。明确的停止条件很重要,因为“继续尝试”并不是一个安全或有用的目标。
2. 模型选择下一步
模型会接收目标和当前状态。它可能直接回答、提出问题、选择工具,或判断自己无法继续。它也可以制定或修改计划,但并非每个智能体都需要详细计划。
3. 执行框架处理行动
工具是系统用来检索信息或更改模型之外的事物的接口。它可以搜索记录、运行代码、读取日历或提交更新。
模型通常会提出工具名称和输入参数。执行框架会验证该请求、检查权限、在需要时请求批准,并运行底层代码。这种分离可以防止生成的指令自动变成获得授权的行动。
4. 环境返回证据
工具结果会成为一次观察:搜索结果、错误、测试报告、确认编号,或来自模型之外的其他证据。模型利用这一观察再次选择行动。
这种反馈闭合了循环。没有反馈,系统可能生成一套看似合理的成功叙述,却不知道任何事情是否真的发生。
5. 循环停止
智能体会在达到完成条件、无法继续、需要人工决策或触及限制时结束。限制可以包括允许执行的操作、经过的时间、步骤数或资源使用量。能够安全停止的智能体,比只会不断行动的智能体设计得更好。
一个完整示例
假设你要求一个配送智能体:
把周二的杂货配送改到我在家的时间。不要更改商品。
智能体不需要为每一种可能的日历和配送状态编写硬编码脚本。
- 它检索当前订单,并检查所请求的订单是否安排在周二。
- 它通过执行框架获准使用的工具读取你的日历。
- 观察结果显示,当前配送时段与一项预约重叠。
- 它请求配送服务提供周二可用的时间段。
- 它将这些结果与日历进行比较,并选择一个不冲突的选项。
- 执行框架发现重新安排配送会更改外部记录,因此暂停并请求你的批准。
- 获得批准后,执行框架提交更改。
- 配送服务返回确认信息。智能体检查日期、时间段和商品列表是否符合原始请求,然后停止。
如果不存在有效时间段,模型可能会询问周三是否可以。如果日历工具失败,它可能会询问你的可用时间。如果订单已经发货,它应该解释阻碍,而不是编造一个成功结果。
这些分支揭示了智能体的特征。固定工作流也可以执行相同的理想路径步骤,但模型驱动的系统可以根据每次观察选择新的路径。
AI 智能体为何重要
当目标明确但所需步骤会变化时,智能体非常有用。它们可以处理缺失信息、工具错误和变化中的条件,而不需要人在每一步之后都发出新的指令。
这种灵活性也有代价。每次模型决策都会增加时间和资源消耗。早期的错误行动还可能影响之后的每一步。赋予系统更多工具,会同时增加它能够完成的事情以及它可能造成的损害。
因此,实际问题不是“它能有多自主?”而是“系统可以安全地做出哪些选择,以及哪些环节应由固定规则或人工审批接管?”开放式调查可能允许多个自主执行的步骤。转账、删除数据或做出具有约束力的决定,通常需要更严格的边界。
常见误解
“任何使用 AI 模型的应用都是智能体”
模型可以通过一次调用总结文档或回复消息。这是 AI 驱动的功能,但不一定是智能体。更强的信号是模型对流程的驱动式控制:选择行动、接收观察结果,并决定接下来做什么。
“调用一次工具就算智能体”
聊天机器人可以始终调用同一个天气函数,然后显示结果。这条路径可能只是普通自动化。只有当工具结果能够改变模型下一步决定做什么时,该工具才成为智能体循环的一部分。
“智能体只是更聪明的模型”
模型能力有所帮助,但智能体是一个系统。模型不会自行创建数据库凭据、执行自己的代码或授予自己权限。执行框架和工具接口决定了哪些拟议行动能够变成实际行动。
“自主就意味着无人监督”
自主性是程度问题,而不是非此即彼的属性。智能体可以独立研究选项,在做出重要更改前暂停,并在证据不足时将控制权交还给人类。检查点和升级处理是设计的一部分,并不意味着系统就不再是智能体。
“智能体总是会从经验中学习”
有些智能体会在多次运行之间存储信息,另一些则会在任务结束后忘记一切。记忆和学习可以扩展智能体的行为,但目标导向的行动并不保证它具备其中任何一种能力。
“自信的回复意味着任务已经完成”
语言模型会生成可能性较高的输出。完成是一项外部事实。可靠的智能体会在报告成功前检查回执、文件状态、测试结果或其他观察结果。
智能体如何融入 AI 系统
模型、执行框架和智能体彼此相关,但不能互换。
- The 模型根据它接收到的上下文生成文本或结构化选择。
- The 执行框架将模型连接到指令、状态、工具、权限、审批和日志。
- 当模型能够利用这些机制,根据反馈指导一个流程时,便形成了具有目标导向的智能体系统。
聊天机器人可以是智能体的交互界面,但仅有对话并不会使聊天机器人具有智能体属性。智能体也可以在后台运行,完全不需要聊天窗口。
这一边界在一定程度上取决于编辑约定。有些软件框架将配置好的模型组件称为“智能体”,而另一些框架只将整个运行中的循环称为智能体。评估产品时,不要在意标签,而要检查其行为:它接收什么目标、可以采取哪些行动、谁选择每个下一步、它观察什么证据,以及什么条件会使它停止?
接下来阅读什么
阅读什么是 AI 模型?以了解负责做出选择的组件。然后阅读什么是 AI 执行框架?以了解提供工具、状态、权限和执行能力的外围系统。继续阅读LLM 中的工具使用是什么?以了解行动循环,或使用AI 模型、聊天机器人、执行框架与智能体的对比来比较完整技术栈。