什么是 AI 智能体?定义、示例与局限
AI 智能体是一种语言模型,它会自主逐步决定调用哪些工具来实现给定目标,而不是像聊天机器人那样回答一次就停止:它会观察每次操作的结果,并重复这一过程,直到任务完成或放弃。
AI 智能体是一种程序,其中的语言模型会自主决定采取哪些行动来实现目标:选择工具、观察结果,并重复这一过程,直到完成任务。这就是它与聊天机器人的区别,后者回答后就会停止。“智能体式 AI”一词指的就是这种构建系统的方式。截至 2026 年 9 月 20 日,最实用的智能体是编写代码和开展研究的智能体。本页提供清晰的定义、真实示例、局限性,以及在您自己的电脑上运行一个智能体所需的条件。
#什么是 AI 智能体?
最实用的定义可以用一句话概括:智能体是在循环中使用工具的语言模型。您给它一个目标,例如“找出这个测试失败的原因并修复它”。它读取代码、运行测试、读取错误信息、修改一个文件、重新运行测试,并继续下去,直到测试通过或它放弃。没有人事先写好这套步骤:模型会根据观察到的情况,一步步决定下一步操作。
这个词太流行,反而被滥用了。许多打着“智能体”旗号销售的产品,其实只是有个名字的普通聊天机器人,或是传统的自动化流程,其中模型只在脚本的某个固定步骤撰写文本。判断的关键在于:谁决定下一步?如果是预先编写的程序决定,而且调用顺序固定,那么它就不是智能体,即使流程中的某个环节使用了语言模型。
#聊天机器人、工作流、智能体:三者的区别
在你的机器上执行操作的智能体:具备智能体能力的 Cline、MCP、n8n + Ollama、本地自动化。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
| Chatbot | 与 AI 配合的工作流 | 智能体 | |
|---|---|---|---|
| 谁决定执行步骤 | 人物:一个问题,一个回答 | 开发者(事先) | 模型正处于开发途中 |
| 工具 | 无,或进行网络搜索 | 是的,顺序固定 | 是的,您可以自由选择 |
| 可预测性 | 较高 | 较高 | 较低 |
| 每项任务的成本 | 一次模型调用 | 少量调用 | 数十次调用,有时更多 |
| 适用场景 | 问题咨询、内容撰写 | 明确的重复性任务 | 解决步骤尚不明确的开放式任务 |
这一区分来自 Anthropic 在其设计指南中的定义:‘工作流是通过预定义的代码路径来协调大语言模型(LLM)与工具的系统’,而‘智能体是大语言模型动态控制自身处理流程和工具使用方式的系统,能够自主决定任务完成方式’。由此得出的建议适用于所有人:寻找最简单可行的解决方案,仅在必要时才增加复杂性。一个设计良好的工作流在大多数企业需求上优于智能体,因为它具有可预测性和较低的成本。
#智能体的四个组成部分
- 一个模型
- 大脑。它必须能够分步推理并生成结构良好的工具调用。这是整个系统性能的瓶颈所在。
- 各类工具
- 模型可调用的功能包括:读写文件、执行命令、网络搜索、查询数据库。MCP 协议已成为连接这些功能的标准方式。
- 一个循环
- 负责依次执行以下步骤的程序:将上下文发送给模型,执行模型请求调用的工具,将结果加入上下文,然后重复这一过程。这个循环还规定了防护措施:最大步骤数、确认要求和预算。
- 记忆
- 短期记忆是上下文窗口:每一步都会往其中填入内容,执行较长任务时最终会填满。长期记忆则是笔记文件、对先前步骤的压缩摘要,或智能体在不同会话之间重新读取的数据库,以免每次开始新对话都从零开始。
#循环背后的机制:ReAct
大多数投入生产使用的智能体都在遵循 Google 和普林斯顿研究人员于2022年以 ReAct(“Reasoning and Acting”,即“推理与行动”)之名描述的模式,只是没有明确使用这一名称。模型每一轮都会给出显式推理(Thought),选择一项行动,通常是调用工具(Action),然后接收结果(Observation),再开始下一轮。让智能体在行动前用文字表达推理过程,可以使调试更容易:您能看到它为什么选择某个工具,而不只是看到它做了什么。
#真正有效的示例
- 编程智能体
- 这是发展最成熟的应用场景。Claude Code、Cline、OpenCode 或 Aider 会读取代码仓库,修改多个文件,运行测试并修正自身的错误。这个领域很适合此类应用:通过测试是否通过,就能自动验证结果。
- 研究型智能体
- 它们会发起数十次搜索、阅读网页、交叉核对来源,并撰写综合摘要。可用于信息监测或梳理某一领域的研究现状,前提是核实引用。
- 运维智能体
- 它们监控日志、诊断事件、提出或执行修复措施。在生产环境中,几乎所有操作均需在人工验证后方可执行。
- 桌面智能体
- 它们通过鼠标和键盘操控浏览器或电脑。演示效果令人印象深刻,但可靠性仍不足以支持无人监督的使用。
这些有效案例的共同点是:成功标准客观,而且能快速验证。例如,测试是否通过、文件格式是否正确、故障是否解决。当成功取决于模糊的人类判断时,例如“撰写一份有说服力的营销策略”,智能体循环相较于简单地与模型进行一次问答,带来的价值有限,因为两步之间没有可供观察的客观依据来指导下一步。
#为什么智能体会失败
第一个原因在于算术。在循环中,错误会不断叠加,而不是相互抵消。一个在每个单独步骤上可靠率为 95% 的模型,正确完成十步任务的概率只有 60%,完成二十步任务的概率更是仅有 36%,即使单看任何一个步骤,其表现都不算明显糟糕。
| 每一步的可靠性 | 5 步 | 10个步骤 | 20个步骤 |
|---|---|---|---|
| 90 % | 59 % | 35 % | 12 % |
| 95 % | 77 % | 60 % | 36 % |
| 99 % | 95 % | 90 % | 82 % |
因此,智能体在能够自行验证结果的任务中往往能取得成功,例如重新运行测试,而在其他任务中则令人失望。其他局限也由此而来:成本,因为一项任务会消耗数十次调用,而且上下文会不断增长;安全性,因为读取外部内容的智能体可能受到这些内容的操纵;以及目标偏离,即智能体误解了目标,却仍认真地持续执行。
评估实验室 METR 用一项称为“time horizon”(时间跨度)的指标衡量这一进展:当前最佳模型能够以 50% 的成功率完成的任务,若由人类执行,需要多长时间。根据 METR,这一时长呈指数增长趋势,自 2019 年以来约每七个月翻一番;METR 还测得,自 2023 年以来,翻倍周期已加快到略多于四个月。具体来说,一个智能体如果一年前无法完成一项人类需要一小时才能完成的任务,如今就很有可能成功;能力边界在移动,但并未消失。
#本地运行 AI 智能体:需要什么
智能体并不一定要使用云端。运行循环和工具已经在您的设备上运行;剩下的就是让负责控制它们的模型也在本机运行。有三项要求比普通聊天更严格,而普通聊天可以满足于更小、速度更慢的模型。
| 要求 | 为什么 | 实用提示 |
|---|---|---|
| 经过工具调用训练的模型 | 否则,调用的格式会出错,导致循环中断 | 目标参数规模达140亿及以上:Qwen 3 14B (9 GB),gpt-oss 20B (13 GB),Qwen3-Coder 30B-A3B (19 GB) |
| 大量上下文 | 每一步都会将工具的结果添加到对话中 | 至少 32 000 个 token,除模型权重外还需 4 至 8 GB 的 KV 缓存空间 |
| 速度 | 一项任务相当于数十次往返 | 30 tokens/秒及以上;MoE模型具有优势 |
实际使用中,一张配备 16 GB 显存的显卡就能让智能体在短任务中发挥作用,24 GB 则更宽裕。低于这一容量,智能体可以用于演示,但日常使用会令人失望。
一个常被忽视的问题:本地智能体的资源开销不只是模型权重占用的 VRAM。每个接入的工具都会在每一轮将自身描述添加到提示词中,而这些描述也会占用 KV 缓存,因此在整个循环期间都会占用 VRAM。使用一个 140 亿参数的模型并接入约六个描述详尽的工具时,仅工具定义就需要几百 MB 的 KV 缓存,这还没有算上对话上下文。
#从哪里开始
- 01在构建智能体之前,先使用现有的智能体在您的编辑器或终端中使用编程智能体,一周内就能了解这些系统能做什么,以及它们容易在哪些地方出错。
- 02选择一个可验证的任务一项无需您参与评估就能判断是否成功的任务:测试通过、生成的文件格式正确、计算出的总数准确。
- 03限制工具数量三个描述清楚的工具胜过三十个工具。每增加一个工具,都会增加选错工具的风险,并加重上下文负担。
- 04务必控制不可逆的操作读取操作无需确认,写入操作需要确认。发送电子邮件、删除文件、付款、发布:无论智能体显示的置信度如何,都必须在执行前获得人工明确批准。
#FAQ
智能体与 ChatGPT 之间的区别是什么?+
什么是智能体AI?+
AI 智能体能否在没有互联网的情况下运行?+
AI 智能体会取代工作岗位吗?+
创建智能体需要会编程吗?+
AI 智能体中的 ReAct 模式是什么?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。