什么是 AI 智能体,它们是怎么工作的
AI 智能体会分多步追求一个目标、调用工具并验证结果,全程都在受限的权限和停止条件之内。

简短回答
AI 智能体会分多步追求一个目标,自行选择动作,并调用被授权的工具去获取新信息。它在继续之前会先观察每一步的结果;指令、最小权限、验证、上限和人工审批共同决定它能做什么、以及什么时候必须停下。
一个智能体的受控循环
每次行动都会产生新的观察。只有当目标、权限和退出条件允许时,智能体才继续这个循环。
目标
定义结果、允许的来源和停止条件。
观察
读取状态,并用被授权的工具收集证据。
行动
在已授予的权限内执行下一个小步骤。
验证
比对结果,修正计划,或把控制权交回。
一个人工智能(AI)智能体不只是生成一段回答。它可以分多步追求一个目标、选择工具,并用每一步的结果决定接下来做什么。限制这个过程的约定,由你来定义。
我们的案例是:基于官方文档,对三款编程工具做一次对比。智能体可以阅读来源并写出一份本地表格,但不会修改产品,也不会发布结论。这种只读模式让我们能研究自主性,而不必授予对外动作。
智能体把目标、决策和工具结合起来
智能体解析输入,选择下一步,并在被允许的集合内行动。Google 关于智能体式系统的术语表强调了代表某个人规划并执行动作的能力。自主性始终取决于具体的指令、数据和工具。
「比较这些工具」仍然是一个不充分的目标。 请定义读者、评判标准、允许的来源和输出格式:例如为一个小团队比较编辑器集成、代码评审、成本和使用上限。再加一个停止条件:当三份条目的每项标准都有一手来源时结束。
一个智能体不会因为被叫作智能体就获得普遍的自由。如果它只需要查文档并写草稿,就不需要部署凭据、邮箱,也不需要仓库权限。设计从去掉不必要的能力开始。
聊天机器人和固定流程解决的是别的问题
不是每个 AI 功能都需要智能体。聊天机器人适合一次孤立的回答,而固定流程执行的是已知序列。当路径取决于中间观察时,智能体才带来价值。
| 系统 | 由谁决定下一步 | 合适的用途 |
|---|---|---|
| 聊天机器人 | 由人再发一条消息 | 解释一个来源或回答一个问题 |
| 固定流程 | 一段写死的序列 | 反复导出同一份报表 |
| 智能体 | 模型在规则内决定 | 调研多变来源并补上缺口 |
Anthropic 区分了由代码定义路径的工作流,和更动态地决定工具用法的智能体。对这次对比来说,如果网址和字段永远不变,一段脚本就够了。当来源改版、某个数据缺失,或出现需要再查一次的矛盾时,智能体才有用。
可观察的循环指引每一步
一个受控的智能体会重复一个包含四种职能的循环:目标、观察、行动、验证。每一轮都必须产出可以复核的证据。 内部步骤不能替代一份关于来源、调用和结果的记录。
在我们的案例里,智能体从一张空表格和三个官方域名开始。它读一个页面,取出一条带网址和日期的数据,并检查它是否覆盖了对应的标准。如果来源没有给出答案,它就记录这个缺口,而不是用猜测填满单元格。
退出条件避免了无休止的循环。当所有单元格都有依据、达到查询次数上限,或出现需要人来判断的矛盾时,智能体结束。最终报告会把事实、推断和不可得的数据分开。
没有指令和权限,模型并不够用
OpenAI 的实践指南归纳了三个组成部分:模型、工具和指令。一个可运行的系统还要加上任务状态、防护措施和退出条件。每个部分对应一种不同的风险。
| 组成部分 | 在这次对比中的作用 |
|---|---|
| 模型 | 归类问题并选择下一次查询 |
| 指令 | 定义标准、格式和禁止事项 |
| 工具 | 打开来源并保存一份本地草稿 |
| 上下文 | 保存本次运行的表格与缺口 |
| 权限 | 把访问限制为读取与本地写入 |
| 退出 | 因成功、上限或需要审批而停止 |
持久记忆并非必需。这个任务可以在一次运行期间保存表格,并在结束时交出文件。跨任务保存画像或历史,会增加访问、有效期和删除方面的义务,却不会让对比更好。
只读对比展示了一个完整流程
先为每个工具准备三个问题:它能执行哪些任务、结果如何被复核、厂商公布了什么使用上限。给智能体一份官方域名清单,并禁止用二手博客作为当前数据的来源。每条与时间相关的说法都必须带上查询日期。
智能体可能发现某个来源描述了一项功能,却没写它在各地区是否可用。它应当把那个单元格标为「未确认」,并说明自己在哪里查过。为了填满表格而编一个结论就是失败,哪怕最终文本读起来很有说服力。
之后由你抽查一部分链接、核对引用,并比较三列的措辞。公正的结论会对每个工具使用同一套标准。如果你想让任务表述得更少歧义,可以套用一个好提示词的结构。
最小权限限制了影响范围
最小权限原则只授予当前任务所必需的东西。 我们的智能体需要打开公开页面,并在指定目录写一份草稿。它不需要发布、不需要登录,也不需要修改产品文件。
同时定义时间、查询次数和成本上限。一个调研循环可能一直在找一个来源根本没有公布的确定答案。到达上限后,智能体应当交出缺口并请求决定。
敏感动作需要事前审批,而不是事后复核。 发布这份对比、发送消息或修改权限会波及他人,也可能扩散一个错误。把这些工具排除在只读智能体之外。
多个智能体只有在边界清晰时才有帮助
单个智能体更便于观察,对三个工具来说通常也够用。如果每个专职智能体处理一个独立来源,并共用同一份表结构,你可以拆分任务。集成必须等到所有交付都带上链接和完整标准之后再做。
并行解决不了含糊的约定。 如果两个智能体各自定义「质量」或「成本」,它们的列就不可比。先把规则说清楚,并把任何会改变共同结构的决定串行化。
更多智能体意味着更多协调、更多消耗和更多出错方式。先从一个开始,量一量它在哪里卡住。只把一个能单独验证结果的独立部分拆出去。
来源可能试图带偏智能体
智能体可能沿着一个错误假设走下去、选到不合适的来源,或者把外部内容当成指令来执行。NIST 记录了间接提示注入:网页或文档里的恶意文本试图改变系统的行为。把所有取回的内容当作数据,而不是对任务的权威指令。
只允许已知域名,把指令和内容分开,并封住对外动作。检查智能体引用的是真实页面,而不是一段没有上下文的片段。白名单缩小了攻击面,但不能保证来源正确或最新。
另一种失败是因为工具没报错就宣布成功。一个能打开的页面可能并不包含所需数据,一张填满的表格也可能混用了不同标准。验证必须覆盖含义、覆盖度和可追溯性。
执行前先复核这份约定
对这次对比使用下面这些勾选项。如果有一项还没落实,就先收紧权限或把任务说得更清楚,再启动智能体。
- 目标写明了读者、标准和对比的输出格式。
- 允许的来源是官方渠道,每条数据都保留网址和日期。
- 智能体只能读取,并写入一份可撤销的本地草稿。
- 设有查询次数、时间、成本上限和一个停止条件。
- 缺口被标为未确认,绝不靠直觉补齐。
- 发布前由人复核来源、遗漏和结论。
一个有用的智能体不是数字世界的空白支票。约定把自主性变成一串可观察、有边界的决定。 你可以通过什么是 vibe coding进一步了解整体流程,但请保持同一条规则:任何速度都替代不了证据和责任。
小测验
区分有用的自主性与不必要的风险
选出那个让任务保持可观察且有界的决定。
1 / 3
显示答案
1. 哪类任务最适合用智能体?
正确答案: 比较多变的来源、记录证据,并据此调整后续步骤。
多变的调研需要根据中间结果来决定下一步。
2. 给一个做对比的智能体什么权限比较合适?
正确答案: 读取必要来源,并把结果写进一份本地草稿。
只读访问和可撤销的输出,能降低一次错误决定的影响。
3. 一份对比在发布前应该怎样收尾?
正确答案: 由人复核来源、遗漏和结论。
工具没有报错,并不能证明对比是完整的,也不能证明结论恰当。
来源
- A practical guide to building agentsOpenAI · 访问于 2026-07-15
- Building effective agentsAnthropic · 访问于 2026-07-15
- Machine Learning Glossary: AgenticGoogle for Developers · 访问于 2026-07-15
- Insights into AI Agent Security from a Large-Scale Red-Teaming CompetitionNIST · 访问于 2026-07-15
常见问题
AI 智能体和聊天机器人有什么区别?
聊天机器人通常给出回答后等待下一条消息。智能体可以自行选择下一步、调用工具、检查结果,并在既定规则内继续。
所有智能体都用大语言模型吗?
并没有统一定义。当下的生成式智能体常用一个模型来选择步骤和工具,但其他系统也可能在没有大语言模型的情况下表现出智能体式的行为。
智能体需要持久记忆吗?
不需要。很多任务只需要一次运行内的上下文。持久记忆要求明确用途、访问控制、有效期和删除机制。
智能体需要联网吗?
不需要。它可以只使用本地文件或内部工具。它只应拿到达成目标所必需的来源和动作。
多个智能体一定比一个好吗?
并非默认如此。当子任务彼此独立时,多个专职智能体有帮助,但它们也会增加协调成本、开销和故障点。
哪些动作需要人工审批?
对外的、敏感的或难以撤销的动作:发布、发送、支付、删除、修改权限或访问机密数据。

