入门 11 分钟智能体

什么是 AI 智能体?定义、示例与局限

直接回答

AI 智能体是一种语言模型,它会自主逐步决定调用哪些工具来实现给定目标,而不是像聊天机器人那样回答一次就停止:它会观察每次操作的结果,并重复这一过程,直到任务完成或放弃。

AI 智能体是一种程序,其中的语言模型会自主决定采取哪些行动来实现目标:选择工具、观察结果,并重复这一过程,直到完成任务。这就是它与聊天机器人的区别,后者回答后就会停止。“智能体式 AI”一词指的就是这种构建系统的方式。截至 2026 年 9 月 20 日,最实用的智能体是编写代码和开展研究的智能体。本页提供清晰的定义、真实示例、局限性,以及在您自己的电脑上运行一个智能体所需的条件。

作者: Mohamed Meguedmi·更新于 2026-09-28·已在 Windows、macOS 和 Linux 上测试

#什么是 AI 智能体?

最实用的定义可以用一句话概括:智能体是在循环中使用工具的语言模型。您给它一个目标,例如“找出这个测试失败的原因并修复它”。它读取代码、运行测试、读取错误信息、修改一个文件、重新运行测试,并继续下去,直到测试通过或它放弃。没有人事先写好这套步骤:模型会根据观察到的情况,一步步决定下一步操作。

这个词太流行,反而被滥用了。许多打着“智能体”旗号销售的产品,其实只是有个名字的普通聊天机器人,或是传统的自动化流程,其中模型只在脚本的某个固定步骤撰写文本。判断的关键在于:谁决定下一步?如果是预先编写的程序决定,而且调用顺序固定,那么它就不是智能体,即使流程中的某个环节使用了语言模型。

#聊天机器人、工作流、智能体:三者的区别

本地智能体套件

在你的机器上执行操作的智能体:具备智能体能力的 Cline、MCP、n8n + Ollama、本地自动化。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
Chatbot与 AI 配合的工作流智能体
谁决定执行步骤人物:一个问题,一个回答开发者(事先)模型正处于开发途中
工具无,或进行网络搜索是的,顺序固定是的,您可以自由选择
可预测性较高较高较低
每项任务的成本一次模型调用少量调用数十次调用,有时更多
适用场景问题咨询、内容撰写明确的重复性任务解决步骤尚不明确的开放式任务

这一区分来自 Anthropic 在其设计指南中的定义:‘工作流是通过预定义的代码路径来协调大语言模型(LLM)与工具的系统’,而‘智能体是大语言模型动态控制自身处理流程和工具使用方式的系统,能够自主决定任务完成方式’。由此得出的建议适用于所有人:寻找最简单可行的解决方案,仅在必要时才增加复杂性。一个设计良好的工作流在大多数企业需求上优于智能体,因为它具有可预测性和较低的成本。

#智能体的四个组成部分

一个模型
大脑。它必须能够分步推理并生成结构良好的工具调用。这是整个系统性能的瓶颈所在。
各类工具
模型可调用的功能包括:读写文件、执行命令、网络搜索、查询数据库。MCP 协议已成为连接这些功能的标准方式。
一个循环
负责依次执行以下步骤的程序:将上下文发送给模型,执行模型请求调用的工具,将结果加入上下文,然后重复这一过程。这个循环还规定了防护措施:最大步骤数、确认要求和预算。
记忆
短期记忆是上下文窗口:每一步都会往其中填入内容,执行较长任务时最终会填满。长期记忆则是笔记文件、对先前步骤的压缩摘要,或智能体在不同会话之间重新读取的数据库,以免每次开始新对话都从零开始。

#循环背后的机制:ReAct

大多数投入生产使用的智能体都在遵循 Google 和普林斯顿研究人员于2022年以 ReAct(“Reasoning and Acting”,即“推理与行动”)之名描述的模式,只是没有明确使用这一名称。模型每一轮都会给出显式推理(Thought),选择一项行动,通常是调用工具(Action),然后接收结果(Observation),再开始下一轮。让智能体在行动前用文字表达推理过程,可以使调试更容易:您能看到它为什么选择某个工具,而不只是看到它做了什么。

→
为什么这对本地模型很重要
在行动前会“把思考过程说出来”的模型,比直接调用工具的模型消耗更多上下文,因此也占用更多显存。这是在可靠性与内存开销之间的权衡,需要根据可用模型的大小作出选择。

#真正有效的示例

编程智能体
这是发展最成熟的应用场景。Claude Code、Cline、OpenCode 或 Aider 会读取代码仓库,修改多个文件,运行测试并修正自身的错误。这个领域很适合此类应用:通过测试是否通过,就能自动验证结果。
研究型智能体
它们会发起数十次搜索、阅读网页、交叉核对来源,并撰写综合摘要。可用于信息监测或梳理某一领域的研究现状,前提是核实引用。
运维智能体
它们监控日志、诊断事件、提出或执行修复措施。在生产环境中,几乎所有操作均需在人工验证后方可执行。
桌面智能体
它们通过鼠标和键盘操控浏览器或电脑。演示效果令人印象深刻,但可靠性仍不足以支持无人监督的使用。

这些有效案例的共同点是:成功标准客观,而且能快速验证。例如,测试是否通过、文件格式是否正确、故障是否解决。当成功取决于模糊的人类判断时,例如“撰写一份有说服力的营销策略”,智能体循环相较于简单地与模型进行一次问答,带来的价值有限,因为两步之间没有可供观察的客观依据来指导下一步。

#为什么智能体会失败

第一个原因在于算术。在循环中,错误会不断叠加,而不是相互抵消。一个在每个单独步骤上可靠率为 95% 的模型,正确完成十步任务的概率只有 60%,完成二十步任务的概率更是仅有 36%,即使单看任何一个步骤,其表现都不算明显糟糕。

成功完成所有步骤的概率 = 单步可靠性的步骤数次方
每一步的可靠性5 步10个步骤20个步骤
90 %59 %35 %12 %
95 %77 %60 %36 %
99 %95 %90 %82 %

因此,智能体在能够自行验证结果的任务中往往能取得成功,例如重新运行测试,而在其他任务中则令人失望。其他局限也由此而来:成本,因为一项任务会消耗数十次调用,而且上下文会不断增长;安全性,因为读取外部内容的智能体可能受到这些内容的操纵;以及目标偏离,即智能体误解了目标,却仍认真地持续执行。

评估实验室 METR 用一项称为“time horizon”(时间跨度)的指标衡量这一进展:当前最佳模型能够以 50% 的成功率完成的任务,若由人类执行,需要多长时间。根据 METR,这一时长呈指数增长趋势,自 2019 年以来约每七个月翻一番;METR 还测得,自 2023 年以来,翻倍周期已加快到略多于四个月。具体来说,一个智能体如果一年前无法完成一项人类需要一小时才能完成的任务,如今就很有可能成功;能力边界在移动,但并未消失。

#本地运行 AI 智能体:需要什么

智能体并不一定要使用云端。运行循环和工具已经在您的设备上运行;剩下的就是让负责控制它们的模型也在本机运行。有三项要求比普通聊天更严格,而普通聊天可以满足于更小、速度更慢的模型。

大小数据来自 QuelLLM 模型目录 · 模型权重采用 Q4_K_M 量化 · 20/09/2026
要求为什么实用提示
经过工具调用训练的模型否则,调用的格式会出错,导致循环中断目标参数规模达140亿及以上:Qwen 3 14B (9 GB),gpt-oss 20B (13 GB),Qwen3-Coder 30B-A3B (19 GB)
大量上下文每一步都会将工具的结果添加到对话中至少 32 000 个 token,除模型权重外还需 4 至 8 GB 的 KV 缓存空间
速度一项任务相当于数十次往返30 tokens/秒及以上;MoE模型具有优势

实际使用中,一张配备 16 GB 显存的显卡就能让智能体在短任务中发挥作用,24 GB 则更宽裕。低于这一容量,智能体可以用于演示,但日常使用会令人失望。

一个常被忽视的问题:本地智能体的资源开销不只是模型权重占用的 VRAM。每个接入的工具都会在每一轮将自身描述添加到提示词中,而这些描述也会占用 KV 缓存,因此在整个循环期间都会占用 VRAM。使用一个 140 亿参数的模型并接入约六个描述详尽的工具时,仅工具定义就需要几百 MB 的 KV 缓存,这还没有算上对话上下文。

#从哪里开始

  1. 01
    在构建智能体之前,先使用现有的智能体
    在您的编辑器或终端中使用编程智能体,一周内就能了解这些系统能做什么,以及它们容易在哪些地方出错。
  2. 02
    选择一个可验证的任务
    一项无需您参与评估就能判断是否成功的任务:测试通过、生成的文件格式正确、计算出的总数准确。
  3. 03
    限制工具数量
    三个描述清楚的工具胜过三十个工具。每增加一个工具,都会增加选错工具的风险,并加重上下文负担。
  4. 04
    务必控制不可逆的操作
    读取操作无需确认,写入操作需要确认。发送电子邮件、删除文件、付款、发布:无论智能体显示的置信度如何,都必须在执行前获得人工明确批准。

#FAQ

智能体与 ChatGPT 之间的区别是什么?+
聊天机器人回复一条消息后,会等待下一条消息。智能体则接收一个目标,并自主连续执行一系列操作来达成目标:调用工具、读取结果,并决定下一步行动。面向大众的助手如今已集成智能体模式,但简单对话仍是问答式交流。
什么是智能体AI?+
这是一种构建系统的方法,让语言模型自行主导一系列操作,而不只是根据一条消息生成文本。该术语既涵盖单个自主智能体,也涵盖多智能体系统:同一模型的多个实例分担子任务,并在给出最终回答之前协调各自的结果。
AI 智能体能否在没有互联网的情况下运行?+
可以,前提是模型在本地运行,且其工具不需要网络连接:读取文件、执行代码、访问内部数据库、检索已建立索引的文档。当处理的数据属于机密信息,或网络连接不可靠时,就会采用这种配置,例如在与网络隔离的开发工作站上。
AI 智能体会取代工作岗位吗?+
它们目前自动化的是具体任务,很少能覆盖整个岗位的工作。它们在可验证、重复性的工作上效率较高,例如部分软件开发或资料检索工作;对于耗时较长且没有明确成功标准的任务,它们仍不太可靠。人工监督的需求依然很高,尤其是任何涉及不可逆决策的工作。
创建智能体需要会编程吗?+
入门时不一定需要:n8n 或 Flowise 等可视化工具可以让您无需编写代码就构建一个智能体。不过,掌握编程有助于让智能体长期保持可靠,因为大多数问题来自工具描述不清和防护机制设置不当,而非模型本身。
AI 智能体中的 ReAct 模式是什么?+
这是谷歌和普林斯顿的研究人员在 2022 年描述的一种机制:模型先进行显式推理(Thought),再执行某个动作,例如调用工具(Action),然后读取结果(Observation),之后重复这一循环。目前大多数在生产环境中运行的智能体都遵循这一循环,即使其文档中没有明确提及它的名称。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。