AI智能体是什么?
AI智能体是什么?
2026年最热的词莫过于智能体。
在2023年到2024年上半年,大家讨论AI是围绕着"AI会聊天"展开的。
ChatGPT用一场发布会开启了一个对话式AI的时代,全世界的用户蜂拥而至,惊叹于一个机器竟然能用如此自然的语言回答他们的问题。
但慢慢地,兴奋退去,不满开始出现。
人们发现虽然这个聊天机器人"说"得头头是道,但当你说"帮我订一张下周三去上海的机票"的时候,它只能给你一堆没什么用的建议和提示,却没法实际帮你完成这个操作。
它从来不会主动去做任何事,它不会在半夜发现你的日历上有个重要会议而主动帮你订好闹钟,不会在你的云盘里翻出一张模糊的照片主动帮你修复,更不会在你忙于工作时替你跑完一个需要五步操作才能完成的流程。
它像是一个极其博学但手无寸铁的学者,脑子好使,但办不了事,除了纸上谈兵,就是纸上谈兵。
而出现这种情况,是因为这些大语言模型(LLM)本质上是一个"大脑",它没有手,没有脚,没有眼睛,也没有时间概念。它只能在对话的当下,根据你给的输入,生成一段文字输出。你让它做什么,它就在那个瞬间做什么,做完就结束,既不记得过去,也不规划未来,更不会调用外部工具去执行复杂任务。
但AI的终极形态显然不应该是这个样子。从人工智能这个学科诞生的第一天起,研究者们追求的就不是一个"问答机器",而是一个能够自主感知环境、做出决策、采取行动并从中学习的智能体。这个智能体,就是2025到2026年AI行业最重要的事情。
AI Agent。
中文翻译为"智能体"。
这个概念在2023年到2025年间曾经历了一场前所未有的爆发式增长。
从学术界到工业界,从硅谷的创业公司到中国的科技巨头,几乎所有人都在谈论Agent。OpenAI、Google、Microsoft、Meta、字节跳动、百度、阿里巴巴……每一家都在布局自己的Agent产品。
AutoGPT、BabyAGI、MetaGPT、CrewAI、LangGraph、Dify……各种Agent框架和平台如雨后春笋般涌现。业界甚至出现了一个广为流传的说法:2025年是"AI Agent元年"。
直到26年,AI Agent开始走入基层。
但热潮之下,真正理解AI Agent是什么、它为什么重要、它如何工作、以及它面临哪些挑战的人,其实并不多。
很多人把Agent简单地理解成"能联网的ChatGPT",或者"会自动执行任务的AI"。这些理解不能说错,但远远不够深入。
这章的目标,就是带你从头到尾、从内到外,真正理解AI Agent。
我们会从最基础的概念说起,深入到它的技术架构、核心组件、工作流程,再延伸到实际的应用场景和未来的发展方向。用整整一章的内容,我们来把这个话题讲透。
要理解AI Agent,我们首先需要回到一个更根本的问题:
什么是"Agent"?
Agent这个词来自拉丁语"agere",意思是**"去做"或"驱动"**。
在哲学和认知科学中,一个Agent指的是能够自主行动的实体。它有自己的目标,能够感知环境,能够基于感知做出决策,并通过行动来影响环境。
比如蜜蜂。
蜜蜂感知到花的位置和天气,基于这些信息决定去哪里采蜜,然后飞过去采蜜,最后带着花蜜回巢。在这个过程中,蜜蜂就是一个Agent,因为它在环境中自主行动,以实现自己的目标(采蜜、哺育蜂群)。
而把这个概念移植到人工智能领域,AI Agent就是一个能够自主感知环境、做出决策、采取行动以实现特定目标的人工智能系统。
先说"自主"。自主性是Agent区别于普通程序的核心特征。
一个普通程序就像一台自动售货机,你投币、按按钮,它就给你对应的商品,整个流程完全由外部输入触发,没有任何自我决策的空间。而Agent不一样,Agent可以在没有外部直接指令的情况下,主动地感知环境变化、评估当前状态、决定下一步行动。
一个垃圾邮件过滤器可以被视为一个非常简单的Agent。它自主地扫描收到的每一封邮件,判断它是否为垃圾邮件,然后自动将其移入垃圾箱或保留在收件箱中。它不需要你每次收到邮件时都告诉它"帮我看看这是不是垃圾邮件",它自己就会去做。
再说"感知环境"和"采取行动"。
Agent不是生活在真空中,它存在于某个环境中,并通过感知器和执行器与环境交互。
感知器是Agent获取环境信息的通道,对于蜜蜂来说是它的复眼和触角,对于AI Agent来说可以是文本输入、图像传感器、API数据接口、数据库查询结果等等。
执行器是Agent作用于环境的手段,对于蜜蜂来说是它的翅膀和口器,对于AI Agent来说可以是生成文本、发送邮件、调用API、操作文件系统、控制物理机器人等等。
然后是"目标"。
Agent的行为不是随机的,而是有目的性的。目标驱动着Agent的整个决策过程。一个没有目标的Agent只是一个被动的信息处理器,有了目标,Agent才真正有了"想要实现什么"的方向。在传统的符号AI中,目标通常被显式地定义为一个函数或一组规则;在基于大语言模型的现代Agent中,目标往往体现在系统提示词中对Agent角色和任务的描述中,也可以通过用户的自然语言指令动态设定——所以在用Agent的时候请写好你的prompt!
最后是"学习"。
这是Agent定义中常常被提及但容易被忽视的一点。一个真正智能的Agent应当能够从过去的经验中学习,不断改进自己的行为策略。蜜蜂通过学习记住了哪些花蜜更多、哪些路线更短;AI Agent可以通过强化学习、反馈机制、经验回放等方式,不断优化自己的决策质量。
把以上这些综合起来,我们就得到了一个完整的技术定义:
AI Agent是一个嵌入在环境中的智能系统,它通过感知器获取环境状态信息,利用自身的知识、推理能力和预设的目标来决定采取什么行动,然后通过执行器作用于环境,并从行动结果中学习以改进未来的决策。
如果这个定义如果有些抽象,不妨让我们来看看现实世界中已经存在的AI Agent例子。
一个自动驾驶汽车就是一个典型的物理AI Agent:它的感知器包括摄像头、激光雷达、毫米波雷达、GPS等,通过这些传感器感知道路、车辆、行人、交通标志等环境信息;它的"大脑"是一套复杂的决策系统,基于感知到的信息判断当前路况、规划行驶路径、决定加速还是刹车;它的执行器是方向盘、油门、刹车等,通过这些控制车辆的实际运动;它的目标是安全、高效地将乘客从起点送到目的地;并且,通过在实际驾驶中积累的数据,它的决策系统可以不断优化。
但并不是所有的AI Agent都需要在物理世界中行动。
在数字世界中,同样存在着大量的AI Agent。我们后面会详细讨论的LLM-based Agent——也就是基于大语言模型的AI Agent——就是典型的数字Agent。它们在数字环境中感知信息(通过文本、图像、代码等输入),在数字空间做出决策(通过LLM的推理能力),然后在数字世界中采取行动(通过调用API、操作数据库、发送消息等)。
好了,到这,我们已经建立了对AI Agent的基本理解。但如果我们只停留在概念层面,那就像只看了机器的说明书却从未见过机器本身。
接下来,我们深入到技术内核中去,看看一个现代AI Agent究竟由哪些部分组成,它们如何协同工作。
如果把AI Agent比作一个人类员工,那么它的工作方式和人其实有很多相似之处。
一个优秀的人类员工需要有感知能力(看到任务、听到指令)、记忆力(记住过去做过什么、知道现在进行到哪一步)、规划能力(知道先做什么后做什么、遇到问题时知道怎么调整方案)、工具使用能力(会用电脑、会用搜索引擎、会操作各种软件),以及行动能力(最终把事情做成)。
AI Agent也是同样的逻辑。
现代AI Agent的架构也可以拆解为五个核心组件:感知模块、记忆模块、规划模块、工具模块和行动模块。这五个模块协同工作,构成了一个完整的自主智能系统。
感知模块是Agent与外界交互的入口。
对于基于LLM的Agent来说,感知主要是通过自然语言进行的。用户输入的指令、系统返回的反馈、从文档或网页中读取的信息,这些都是Agent的感知输入。
但现代Agent的感知远不止于纯文本,它可以接收图像、音频、视频、结构化数据等多种模态的信息。一个Agent可以"看到"一张截图上的按钮在哪里,可以"听到"一段语音指令中的意图,可以"读懂"一个JSON文件中的数据结构。这种多模态感知能力的发展,正在极大地拓展Agent的应用边界。
OpenAI的GPT-4V和GPT-4o、Google的Gemini等模型已经能够同时理解和处理文本与图像,这让Agent在执行需要视觉理解的任务时有了质的飞跃。
但只有感知本身是不够的,如果Agent感知到一条信息后转瞬即忘,那就毫无意义。这就是记忆模块登场的原因。
记忆对于Agent来说是一个至关重要的组件,也是目前Agent研究中最活跃的方向之一。
而Agent的记忆系统通常被分为三个层次:短期记忆、长期记忆和工作记忆。
短期记忆指的是在当前对话或任务执行过程中保持的信息。比如用户刚刚说了什么、Agent上一步做了什么。在LLM-based Agent中,短期记忆通常由模型本身的上下文窗口来承载。
大语言模型的上下文窗口可以理解为它的"脑容量"。窗口越大,它能在一次对话中记住的信息就越多。GPT-4的上下文窗口从最初的8K、32K一路扩展到了128K,而Claude的上下文窗口更是达到了200K。这意味着Agent可以在一次对话中记住数百页的信息,这是人类望尘莫及的。
但无论上下文窗口多大,它终究是有限的。更重要的是,上下文窗口中的信息在对话结束后就消失了。就像我们做完一件事后,如果不刻意记录,很多细节很快就会忘记。
为了解决这个问题,Agent需要长期记忆。长期记忆让Agent能够跨对话、跨任务地保存和检索信息。它通常以向量数据库的形式存在。Agent将重要的信息转化为向量嵌入并存储起来,当需要回忆时,通过语义搜索找到相关的记忆片段。这就像我们的大脑一样,虽然不能记住每一件事,但关键的、重要的信息会被编码存储,在需要的时候可以被检索出来。
在长期记忆和短期记忆之间,还有一个"工作记忆"的概念。工作记忆可以被理解为Agent当前正在处理和操作的信息缓冲区。它不像短期记忆那样一闪即逝,也不像长期记忆那样持久存储,而是处于一个中间状态。Agent正在积极使用这些信息来完成当前任务,但任务完成后这些信息可能就不再需要了。
举个例子,如果一个Agent正在帮你规划一次旅行,它可能会在过程中临时记住你提到的航班偏好、酒店预算、行程天数等信息,这些就是工作记忆。当旅行方案最终确定后,这些中间信息可能就不再重要了,但最终的方案可能会存入长期记忆,以备将来查询。
有了感知和记忆,Agent还需要一个"大脑"来思考,而这就是规划模块要做的事情。
规划可以说是Agent最核心的智能体现。一个好的Agent不是盲目地执行指令,而是能够理解目标的含义,拆解任务的步骤,预见可能的问题,并在必要时调整策略。
在传统的AI Agent中,规划通常依赖于预设的规则、状态机或者搜索算法。比如一个扫地机器人的规划逻辑可能是:如果前方有障碍物,则转向;如果电量不足,则返回充电座;如果某个区域已经扫过,则前往下一个区域。这些规划逻辑是固定且可预测的。
但基于LLM的Agent带来了根本性的改变。大语言模型本身就是一种极其强大的"零样本规划器"。也就是说,它不需要经过专门的训练,仅仅通过提示词的引导,就能对复杂任务进行推理和规划。这种能力来自于LLM在训练过程中从海量人类语言数据中学习到的关于因果关系、逻辑推理和任务分解的知识。
在Agent的规划中,最著名的技术模式有两个:ReAct(Reasoning + Acting) 和Plan-and-Solve。
ReAct的核心思想是让Agent交替进行推理和行动。先思考当前的情况,然后决定采取什么行动,行动后观察结果,再基于结果进行下一步推理。这种"思考-行动-观察-再思考"的循环,让Agent的行为变得更加智能和可解释。
Plan-and-Solve则更进一步:Agent在开始执行之前先制定一个完整的计划,然后在执行过程中根据实际情况动态调整计划。这就像一个有经验的工程师接到一个项目后不会直接动手,而是先画出设计图纸,然后在施工过程中不断优化。
规划还有一个非常关键的子能力:反思。
一个真正智能的Agent不仅仅是向前规划,它还应该能够向后审视,比如回顾自己刚刚做了什么,评估结果是否令人满意,如果出了问题则分析原因并调整策略。
这种"自我反思"机制让Agent能够从错误中学习,不断改进自己的行为。比如一个Agent在尝试调用某个API失败后,不应该只是简单地重试,而是应该反思失败的原因。
是参数不对?是网络问题?是权限不足?
然后基于反思结果采取不同的应对策略。
有了规划能力之后,Agent面对的下一步问题是:
我如何真正改变世界?
不是通过思考,而是通过行动。但Agent的行动能力受限于它能够使用的工具。这就是工具模块的意义所在。
工具是Agent与外部世界交互的桥梁。没有工具,Agent只是一个会思考但什么都做不了的"理论家"。有了工具,Agent才能发挥真正的价值,它才能帮你写代码、查资料、发邮件、订酒店、操作数据库、控制智能家居。
Agent可以使用的工具种类极其丰富。
最基础的工具之一是搜索引擎。当Agent需要获取最新信息或者它的知识库中没有的信息时,它可以通过搜索引擎来获取。这也是为什么很多人把"能联网"误以为是Agent的全部特征,虽然这只是Agent能力的冰山一角。
代码解释器是另一个非常重要的工具。Agent可以编写Python代码、运行它、获取结果,这让它具备了强大的计算和数据处理能力。
API调用工具让Agent能够与各种外部服务交互,这让它可以通过REST API查询天气、创建日历事件、发送Slack消息、更新数据库记录。
而文件操作工具让Agent能够读写文件、处理文档、生成报表。还有一些更专业的工具,比如图像生成工具、数据分析工具、网页抓取工具等等。
在Agent的技术架构中,工具不仅仅是简单地"被调用",而是以标准化的接口形式存在。最常见的接口标准是OpenAI Function Calling格式和Anthropic的Tool Use格式。Agent通过这些标准接口"知道"有哪些工具可用、每个工具的功能是什么、需要什么参数、返回什么结果。当Agent的规划模块决定需要使用某个工具时,它会生成一个符合接口规范的调用请求,系统再负责将这个请求转化为实际的API调用。
(当然,你可能已经发现每个厂商有它自己的格式要求,是分散的、厂商绑定的,如何解决这个问题呢?就是 MCP 要解决的问题。我们或许在之后将单独补充MCP相关知识。)
回到正题。
工具的使用也带来了一个非常有趣的问题:
Agent如何知道什么时候该用什么工具?
这就是工具选择的智慧。
一个好的Agent不是每次遇到问题都尝试所有工具,而是能够根据当前的任务和上下文,智能地选择最合适的工具。
比如,当需要计算复杂数学问题时,它会选择代码解释器而不是搜索引擎;当需要查找实时信息时,它会选择搜索引擎而不是代码解释器。这种工具选择的智能也来自于LLM的推理能力——模型通过理解任务的性质和工具的功能描述,做出最合适的决策。
最后,所有的工作汇聚到行动模块。行动模块是Agent执行决策的出口,它负责将规划模块的决策转化为具体的操作指令,并将操作结果反馈给其他模块。而行动模块的输出形式可以是多种多样的:一段文本回复、一个API调用、一个文件写入操作、一个数据库更新命令、一个机器人控制信号。
但无论形式如何,行动模块的职责都是一致的:
让Agent的意图变成现实。
这五个模块(感知、记忆、规划、工具、行动)共同构成了AI Agent的完整架构。但在实际系统中,这些模块并不是独立运行的,而是在一个循环的工作流中紧密协作。我们来看看这个工作流是如何运转的。
一个AI Agent从接收任务到完成任务,通常会经历一个完整的循环过程。
理解这个循环,才能真正明白Agent是如何从"一个想法"变成"一个行动者"的。
第一步是目标接收与理解。用户的请求可能是简单的。比如"帮我查一下今天的天气"。也可能是复杂的,比如"帮我策划一次为期两周的日本旅行,包括机票、酒店、行程和签证信息"。
Agent首先需要理解这个请求的真正含义,识别出用户的意图、隐含的需求和关键约束条件。这一步看似简单,但实际非常考验Agent的理解能力。
比如用户说"帮我整理一下这份文档",Agent需要理解整理是什么意思。是归纳摘要?是纠错润色?是修改格式?还是提取关键信息?不同的理解会导向完全不同的行动路径。
在理解目标之后,Agent进入第二步——信息收集与感知。
Agent需要获取完成任务所需的信息。这些信息可能来自用户的进一步对话、来自数据库中存储的历史记录、来自联网搜索的结果、来自文件的读取、或者来自API的实时数据。总之,Agent在这个阶段会充分利用感知模块和记忆模块,尽可能全面地收集背景信息。
有了足够的信息后,Agent进入第三步——规划与任务分解。
对于简单任务,Agent可能直接跳到执行阶段;但对于复杂任务,Agent会将其分解为若干子任务,并规划出执行顺序。
比如策划日本旅行这个任务,Agent可能会将其分解为:确定旅行日期、查询航班信息、查询酒店信息、规划每日行程、收集签证要求、整理预算等子任务。每个子任务可能还有更细的分解。这个分解过程不是线性的,Agent可能会根据情况调整分解的方式和顺序。
规划完成后,Agent进入第四步——工具选择与调用。
对于每个子任务,Agent需要决定使用什么工具来完成。查询航班信息可能需要调用航空公司的API或者爬取相关网站;规划行程可能需要调用地图API和景点数据库;整理预算可能需要调用电子表格工具。Agent根据工具的描述和当前任务的需求,做出工具选择决策,然后生成调用指令并执行。
工具调用完成后,Agent收到返回结果,进入第五步——结果评估与迭代。
Agent需要判断调用结果是否符合预期。如果查询航班时没有找到合适的信息,Agent需要决定是否重试、换一个工具、或者调整查询参数。如果规划行程时发现某个景点在维修无法参观,Agent需要重新规划替代方案。这种评估-调整的循环可能会进行多次,直到Agent对结果满意为止。
当所有子任务都完成之后,Agent进入第六步——输出整合与呈现。
Agent将各个子任务的结果整合起来,以用户期望的形式呈现最终输出。对于旅行策划任务,这可能是一份结构化的旅行方案文档;对于代码编写任务,这可能是一段可直接运行的代码加上使用说明;对于数据分析任务,这可能是一份包含图表和结论的分析报告。
在输出之后,Agent会进入最后一步——记忆更新。
Agent会将这次任务的经历、学到的经验、用户的反馈等信息更新到记忆系统中。哪些尝试是成功的,哪些方法是有效的,用户对哪些结果不满意......这些信息都会被编码存储,供未来的任务参考。
这个工作循环看似线性,但实际上是高度动态和递归的。
在任何一个步骤中,Agent都可能根据情况跳回之前的步骤重新调整。比如在执行规划时发现缺少关键信息,Agent会回到信息收集步骤;在工具调用失败时,Agent可能回到规划步骤重新设计方案;在结果评估中发现新的任务线索时,Agent可能重新理解目标。这种非线性、动态的循环,正是Agent智能的体现,这意味着它不是按照固定流程执行的机器人,而是能根据实际情况灵活应变的个体。
好,现在,你已经了解完Agent这个大类了。
而接下来,理解Agent的类别,对我们把握这个领域的发展脉络非常重要。
AI Agent并不是一个单一的、同质的概念,而是涵盖了一个从简单到复杂、从被动到自主的完整谱系。
在这个谱系的最底端,是最简单的反射型Agent。
反射型Agent不维护内部状态,也不考虑历史信息,而是根据当前感知到的环境信息直接做出反应。
它的工作方式就像"如果-那么"规则:如果看到红灯就刹车,如果听到铃声就接电话。这种Agent的优势是快速、高效、可预测,但劣势也非常明显——它没有适应性,遇到从未见过的情况就会失灵。工厂中的简单机器臂、自动门控制器都属于反射型Agent。
向上走一层,是基于模型的Agent。
与反射型Agent不同,它维护一个"世界模型"。也就是对环境如何运作的内部表示。这让它能够处理部分可观察的环境,即使不能完整感知所有信息,也能通过模型推断出缺失的部分。比如一个自动驾驶汽车维护着周围环境的3D模型,即使某个传感器暂时被遮挡,它也能通过模型推断出前方物体的可能位置和运动轨迹。基于模型的Agent比反射型Agent智能得多,但它仍然是被动的——它的行为仍然是由环境触发的,而不是由自身目标驱动的。
再向上,是目标驱动型Agent。这种Agent不仅有世界模型,还有明确的目标表示。它能够主动寻找实现目标的方式,而不只是对当前环境做出反应。如果你的目标是"到达机场",目标驱动型Agent会主动规划路线、选择交通工具、设置出发时间,而不是简单地根据当前路况决定下一步。这种"向前看"的能力,让Agent的行为从"反应"变成了"行动"。
更高一层是效用驱动型Agent。有些情况下,仅仅达到目标是不够的,我们追求的是"最好地"达到目标。效用驱动型Agent引入了效用函数的概念,用来衡量不同状态或不同行动路径的"好"的程度。当一个Agent有多个方式实现目标时,效用驱动型Agent会选择效用最高的那个。比如规划路线时,有多种方式可以从A到B,但效用驱动型Agent会综合考虑时间、距离、费用、舒适度等因素,选择总体效用最高的方案。这种Agent的决策不是简单地"行或不行",而是**"在多大概率上、以多高的质量"**完成任务。
在效用驱动型Agent之上,是学习型Agent。学习型Agent有能力从经验中改进自己的行为。它包含一个"学习元素",用于分析行动的反馈信息,并更新知识库或调整策略。AlphaGo就是一个著名的学习型Agent——它通过与自己对弈数百万局,不断学习优化落子策略,最终超越了所有人类棋手。学习型Agent引入了时间维度,这让它不仅在当下做决策,而且会随着时间推移变得越来越好。
在AI Agent谱系的顶端,是自主Agent。自主Agent将以上所有Agent类型的能力整合在一起,同时具备感知、建模、目标导向、效用优化和学习能力,能够在复杂、动态、不确定的环境中独立运作,做出合理的决策并持续自我改进。自主Agent是AI Agent研究的终极目标,也是目前基于大语言模型的Agent正在努力接近的方向。
值得强调的是,这个谱系并不是按照严格的时间线,即不是从低到高依次发展的线性进程。
在实际应用中,不同类型的Agent各有适用场景。控制一个电梯只需要反射型Agent,但管理一个智能工厂的物流系统需要目标驱动型Agent,而运营一个自主的交易系统则可能需要学习型Agent。
而理解了Agent的类别谱系,我们在设计和使用Agent时就能更加有的放矢。
接下来,我们要讲回现代LLM-based Agent的崛起,了解大语言模型给Agent究竟带来了什么。
我们把时间拨回到2022年之前。
在这之前,AI Agent虽然已经有了几十年的研究历史,但始终停留在相对局限的应用范围内。传统Agent的工作流依赖于手动编写的规则和精心设计的决策树。比如一个Agent要能处理什么任务,需要人工提前把所有可能的情况都考虑到,然后编写对应的处理逻辑。这不仅工作量巨大,而且适应性极差,一旦遇到规则之外的情况,Agent就束手无策了。
但大语言模型的出现,彻底改变了这个局面。LLM给Agent带来了三个根本性的突破。
第一个突破是自然语言理解与生成能力的质的飞跃。 在LLM出现之前,Agent理解和生成自然语言的能力是非常有限的。
早期的对话Agent主要靠关键词匹配和预设模板来"理解"用户意图。比如用户说"订餐"和"我想吃饭"在Agent看来是完全不同的两件事,因此需要分别写不同的规则来处理。而LLM能够真正理解自然语言的语义和意图,无论用户用什么方式表达,LLM都能捕捉到核心需求。这种能力让Agent的交互变得前所未有的自然和友好。用户不需要学习特定的命令格式,不需要记住固定的表达方式,就像跟一个真人说话一样自然地与Agent交流。
第二个突破是推理和规划能力的实现。大语言模型之所以被称为"大",不仅仅是因为参数规模大,更是因为在海量数据上训练出来的模型展现出了令人惊叹的推理能力。Chain-of-Thought(思维链)技术的发现表明,只要在提示词中加入"让我们一步一步地思考"这样的短语,LLM就会展现出非常接近人类的分步推理能力。这种能力直接转化为了Agent的规划能力。Agent从此不再需要人工编写的规划逻辑,它可以通过自身的推理能力理解任务、分解步骤、预测结果。
第三个突破是知识的内化。传统Agent的知识来自于人工编码的知识库,其中每一条规则都是人类编写者精心设计的。这不仅效率低下,而且知识的覆盖范围非常有限。而LLM通过在互联网规模的语料上进行预训练,已经内化了关于世界的大量知识,比如它知道巴黎是法国的首都,知道光合作用的过程,知道HTTP协议的工作原理,知道Python的语法规则。这种广泛的、内化的知识让Agent具备了真正的常识推理能力。当面对一个从未见过的任务时,Agent可以利用这些内化知识进行推理和决策,而不是无助地等待人类为它添加新的规则。
这三个突破结合起来,让Agent从一个需要精心设计、手动编程的"精密仪器",变成了一个可以通过自然语言指令就可以"激活"和"引导"的智能体。你用自然语言告诉它你的目标,它自己就会想办法去实现。这在Agent的发展史上是一次质的飞跃。
正是在LLM的推动下,2023年到2025年间,涌现了大量令人瞩目的Agent项目。
AutoGPT是其中最著名的早期项目之一。AutoGPT发布后在GitHub上迅速获得了数万颗星,引发了全球范围内对自主Agent的狂热关注。虽然AutoGPT在实际应用中的效果并不完美(它的规划往往不稳定、容易陷入死循环、token消耗巨大)但它无疑是Agent领域的一个里程碑,它向世界展示了LLM-based Agent的潜力和可能性。
紧接着AutoGPT之后,MetaGPT提出了另外一种可能:既然一个Agent可以单打独斗,那为什么不让多个Agent扮演不同角色,组成一个"虚拟公司"来协作完成复杂任务呢?
在MetaGPT中,不同的Agent扮演产品经理、架构师、工程师、测试员等不同角色,每个角色有自己的职责和专业知识,通过多轮对话和文档传递来协作完成软件开发项目。这种多Agent协作的模式展现出了令人惊叹的效果:相比单个Agent,多个角色分工协作的Agent团队能够完成更复杂、更大型的任务。
在Agent框架层面,LangChain和它的后继者LangGraph成为了最受欢迎的Agent开发框架之一。LangChain提供了丰富的工具集成、记忆管理、Prompt模板等功能,极大地降低了开发Agent的门槛。LangGraph则更进一步,引入了基于图的状态管理机制,让开发者可以灵活定义Agent的工作流程。与此同时,Microsoft推出了AutoGen框架,专注于多Agent对话和协作场景。Dify作为国内团队开发的开源平台,以低代码的方式让非技术人员也能构建自己的AI应用和Agent。
OpenAI本身也在Agent领域持续发力。GPT-4的Function Calling功能给Agent提供了标准化的工具调用接口,Assistants API提供了托管式的Agent运行环境(包括代码解释器、文件检索、知识库等内置工具),而更近期的Operator和Deep Research等产品则展现了在浏览器中自主操作网页、进行深度研究等更高级的Agent能力。Google的Gemini也内置了强大的工具使用能力,并且通过Google生态的深度集成(Gmail、Calendar、Maps等),让Agent能够直接在用户的Google账号中执行操作.......
无数的Agent正在源源不断的生长当中。
Agent的发展整体态势是向上的,但在现阶段的实际应用中,LLM-based Agent仍会暴露出许多问题:
稳定性不足、token成本高昂、容易产生幻觉、缺乏长期任务的可靠性保障等等等等。
这些问题我们后面会详细讨论。但无论如何,LLM已经为Agent带来了前所未有的可能性,这个方向已经成为AI发展不可逆转的趋势。
以下是一些基于上述内容的补充知识(可跳过也可阅读):
Agent的感知能力扩展:多模态与实时信息获取
在前面我们提到Agent的工作循环中,第一步就是感知环境、获取信息。传统的LLM-based Agent主要是通过文本输入来感知世界的,但随着技术的发展,Agent的感知能力正在以惊人的速度扩展。
多模态感知是Agent感知能力最重要的进化方向。
所谓多模态,就是Agent能够同时理解和处理多种类型的信息,包括文本、图像、音频、视频、代码、结构化数据等。
想象一个Agent正在帮你修复一个网页的样式问题。传统的文本-only Agent只能看到网页的HTML代码,但通过多模态感知,Agent可以直接"看到"网页的截图,发现某个按钮的颜色和位置不对,然后结合代码分析找出问题所在。这种"看"的能力让Agent对环境的理解有了质的提升。
在实际应用中,多模态感知已经在很多场景下展现出了强大的能力。一个基于GPT-4V的Agent可以查看一张Excel表格的截图然后帮你提取和整理数据;可以查看一张电路板照片并帮你分析可能的故障点;可以查看一张户型图并根据你的需求提出装修建议。这些能力在纯文本时代是无法想象的。
但多模态感知不仅仅是"看",还包括"听"和"读"。音频理解能力让Agent能够处理语音指令、分析音频内容、识别音乐和声音事件。文档理解能力让Agent能够解析PDF、PPT、扫描件等复杂的文档格式,提取其中的文字、表格、图表等信息。这些能力共同构成了Agent对数字世界的全方位感知。
除了多模态,Agent还面临着另一个关键的感知挑战:实时信息获取。大语言模型的知识是有"截止日期"的,它的训练数据只覆盖到某个时间点之前的信息。对于这个时间点之后发生的事情模型本身是不知道的。要让Agent能够感知到最新的、实时的信息,必须引入联网能力。
Agent的联网感知主要通过两种方式实现。一种是通过搜索引擎工具。Agent在需要时发起搜索请求,从搜索结果中提取相关信息。这种方式简单直接,但搜索结果的质量和信息的相关性依赖于搜索引擎的表现以及Agent对搜索结果的分析能力。另一种是通过调用特定的数据源API。比如天气API、股票行情API、新闻API等。这种方式更加精准和高效,但需要预先集成对应的API。
在联网感知的基础上,更高级的Agent还能够进行主动的信息采集。不是简单地接收信息和搜索信息,而是主动地去"探索"。比如定期检查某个网页是否有更新、持续监控某个指标的变化、在特定条件满足时自动触发行动。这种主动感知能力让Agent从一个"应答者"变成了一个"瞭望者"。它不再是被动地等待指令,而是主动地关注环境中的变化。
多模态和实时信息获取的结合,正在让Agent的感知能力逼近甚至超越人类。人类一次只能处理有限的信息来源,而Agent可以同时监控数十个数据源、分析图像和视频流、处理音频信号,且不知疲倦。但感知能力的增强也带来了新的挑战,比如什么信息过载、数据隐私、感知延迟等等,这些问题都需要被认真对待。
Agent的规划与推理机制:从Chain-of-Thought到Tree-of-Thought
规划能力是Agent智能水平的核心衡量标准。一个Agent是否"聪明",在很大程度上取决于它能否有效地分析问题、制定计划并灵活调整。在LLM-based Agent中,这个能力的实现依赖于模型本身的推理机制以及围绕它设计的各种提示策略。
最基础的推理方式是Chain-of-Thought(CoT,思维链)。有些人大概听说过这个词。
这个技术在2022年由Google的研究人员提出,其核心思想很简单也非常有效,那就是:
在LLM被要求回答问题之前,先鼓励它"把思考过程写下来"。
实验表明,仅仅是这样一个简单的提示(比如"让我们一步一步地思考")就能显著提升LLM在复杂推理任务上的表现。
为什么会这样?
原因在于,LLM在生成文本时,每一步都基于前面已经生成的文本。如果模型直接跳到答案,它"跳"的这一步跨越了太多的不确定性,很容易出错。但如果模型先写出推理过程,每一步都建立在前一步的基础上,整个过程就更加可控和可靠。
对于Agent来说,Chain-of-Thought意味着在决定行动之前先"思考"一下。Agent不是直接输出一个行动指令,而是先分析当前情况、列出可能的行动方案、评估每个方案的优劣,然后再选择最优方案执行。这种"先想后做"的模式,让Agent的决策质量有了显著提升。
但Chain-of-Thought本质上是"直线性"的。它沿着一条推理路径往前走。现实中的问题往往不是线性的,一个方案走不通可能需要换一条路。这就需要更复杂的推理机制:
Tree-of-Thought(思维树)。
Tree-of-Thought扩展了Chain-of-Thought的思路,让Agent同时探索多条推理路径,形成一棵"思维树"。在树的每一层,Agent生成多个可能的推理分支,然后评估每个分支的可行性,剪掉不合理的分支,继续扩展有希望的分支。这个过程类似于人类做决策时的思维方式,你同时考虑多个方案,权衡利弊后选择最可行的方向继续深化。
Tree-of-Thought让Agent的规划能力得到了显著提升。当Agent面对一个复杂任务时,它可以直接生成多个不同的方案,而不是仅仅沿着第一个想到的方案往下走。
比如在制定旅行计划时,Agent可以同时考虑"飞东京进、大阪出"和"飞大阪进、东京出"两个不同的方案,分别展开各自的行程安排,最后比较两个方案的整体质量和合理性,选择更好的那个。
而在Tree-of-Thought的基础上,又进一步延伸出了Graph-of-Thought(思维图)。它不再是树形结构,而是允许不同节点之间相互连接,形成一个图状结构。在规划过程中,Agent可以从不同的方向探索问题空间,不同思路之间可以交叉影响,不同子问题的解决方案可以相互组合。这种更灵活的推理结构让Agent能够处理更加复杂和非结构化的问题。
除了这些推理机制,Agent的规划还依赖于一种叫做"子目标分解"的关键能力。
当面对一个复杂目标时,Agent需要能够将其分解为若干更小、更可操作的子目标,再逐步解决每个子目标。这个过程类似于人类项目管理中的WBS(工作分解结构)。一个优秀的Agent能够根据任务的性质和上下文,智能地确定分解的层次和粒度,太粗可能导致子任务仍然复杂难解,太细则可能导致规划过于琐碎、效率低下。
在规划的过程中,还有一个重要但常被忽视的环节:约束识别与管理。真正的任务很少是"无条件的",通常伴随着各种约束:
时间约束(什么时候必须完成)、资源约束(可以用什么工具、可以调用什么API)、质量约束(输出需要达到什么标准)、合规约束(不能做什么、不能触及什么敏感内容)......
Agent需要在规划阶段就识别出这些约束,并将其纳入决策考量。一个忽略了约束的Agent可能规划出一个理论上完美但实际上完全不可行的方案。
最后,我们必须谈到规划中的一个重要问题:
Agent应该规划得多远?
是之规划下一步行动,还是规划整个任务的全部步骤?
这就是"深度规划"与"浅度规划"的权衡。
深度规划(一次性规划所有步骤)的优势是全局最优,因为Agent能从一开始就看到整个路线图,避免局部最优导致的全局次优。但劣势也很明显,比如规划本身消耗大量的token和时间,而且如果环境发生变化或规划出错,整个规划可能需要推倒重来。
而浅度规划(只规划下一步或下几步)则相反,它更加灵活、适应性更强,但可能牺牲全局最优性。
目前的主流做法是采用"分层规划":
在高层次做全局规划,制定出阶段性的"里程碑";在每个里程碑内部,又采用动态的、实时的规划来决定具体行动。这种结合了深度和浅度的混合策略,在实际应用中表现出了最佳的效果。
Agent的长期记忆与经验积累:怎么让Agent越用越聪明
如果一个Agent每一次任务都是"从零开始",那它的能力天花板是非常低的。
真正的智能体应该能够从过去的经验中学习,越用越聪明。这就是记忆模块和持续学习机制存在的意义。
前面我们提到了短期记忆、工作记忆和长期记忆的三层架构。在这个架构中,长期记忆是最有价值但也最具有挑战性的部分。它承载着Agent的"人生经历",即过去完成的任务、学到的经验、积累的知识、形成的习惯。
Agent的长期记忆通常以向量数据库的形式存储。简单来说,向量数据库是一种专门存储和检索"向量"(也就是数据的数学表示)的数据库。在Agent的体验中,每一次重要的互动、每一个有用的信息、每一个学到的教训,都会被转化为一个向量嵌入,然后存储到向量数据库中。当Agent需要回忆相关信息时,它会将当前的问题也转化为向量,然后在数据库中搜索语义上最相似的向量,从而找到相关的记忆。
这种基于语义相似度的检索方式非常强大。它让Agent能够回忆起那些与当前任务"相似"的过去经历,即使这些经历与当前任务并非完全相同。比如一个Agent之前帮你设计过一个个人网站的布局,当你再次需要设计一个公司官网时,Agent可以通过向量检索找到之前设计个人网站的经验,将其中的设计原则和用户偏好应用到新的任务中。
但简单的存储和检索并不足以让Agent"越用越聪明"。真正的学习需要更复杂的机制。
比如经验提炼。
Agent不能把每一次互动的原始记录都完整保存,那样会导致记忆的迅速膨胀和不相关信息的堆积。Agent需要能够从原始经历中提炼出有价值的经验,去除噪音,保留本质。这种提炼过程本身也是一项高级的认知任务,需要Agent对自己的经历进行反思、总结和抽象。
再比如反馈学习。
用户的反馈,无论是直接的点赞/踩、评分、纠正,还是间接的行为信号(用户是否采纳了Agent的建议、用户是否重复执行某个操作等)都是Agent学习的宝贵资源。
Agent需要能够捕捉和解析这些反馈信号,将其转化为对自己行为的调整。比如如果用户多次纠正Agent在某个领域的表达方式,Agent应该学会在未来的相关对话中调整表达风格。
在更高级的架构中,Agent还会建立"个人知识图谱",这是一个结构化的、关系性的知识网络,记录了用户的偏好、习惯、关系网络、领域知识等信息。
如果说向量数据库是"记忆",那么知识图谱就是"理解"。它不仅仅是存储信息,更是建立信息之间的联系。知道用户"喜欢喝拿铁"和"经常去星巴克"是两条独立的信息,但如果知识图谱中记录了"用户通常在星巴克点拿铁"这个关联关系,Agent就能在合适的场景下提供更精准的服务。
但记忆的管理也是一大问题。
记忆会随着时间推移而衰减,这是人类记忆的固有特性,也是Agent记忆需要模拟的特性。
并非所有信息都值得永久保存。Agent需要有一套"遗忘机制",来判断哪些信息应该被保留、哪些信息应该被降权、哪些信息应该被删除。一个合理的遗忘策略可以防止记忆数据库的无序膨胀,同时确保最重要的信息始终可以被快速检索到。
另外记忆还有一个非常实际的问题:隐私与安全。
毕竟说白了,Agent本身是一个互联网那个工具。而把隐私交给互联网工具,是危险的。
Agent的记忆系统中存储着大量与用户相关的信息,个人偏好、通信记录、任务历史、甚至敏感数据。这些信息如果被不当访问或泄露,后果不堪设想。
因此记忆的安全管理是Agent系统设计中不可忽视的一环。
好的Agent设计应该让用户对自己的记忆数据拥有完全的控制权,可以查看、编辑、导出、删除任何记忆,可以选择哪些信息可以被Agent记住,哪些信息处理完之后就应该被遗忘。
目前,业界已经出现了不少致力于Agent记忆管理的开源项目。
Mem0(原名GPTCache)专门做Agent的记忆管理,提供了记忆的存储、检索、更新和遗忘功能(这个想必很多人听说过或者刷到过)。Chroma、Pinecone、Weaviate等向量数据库平台为Agent的记忆存储提供了基础设施。LangChain的Memory模块为对话Agent提供了多种记忆管理策略,包括Buffer Memory(短期记忆)、Summary Memory(摘要记忆)、Vector Store Memory(向量记忆)等。
但总体而言,Agent的记忆和持续学习仍然是AI领域中最不成熟的领域之一。
目前的大多数Agent,即使有了长期记忆的加持,其"学习"也更多是"记住了更多信息"而不是"从根本上改进了自己的能力"。要让Agent真正做到"越用越聪明",即不仅在记忆层面积累信息,而且在行为策略、推理方式、知识结构等深层面上持续进化,我们还有很多研究工作需要推进。
多Agent系统:当多个AI Agent协作时会发生什么
在Agent领域,最为人津津乐道的领域之一是多Agent系统。
与其打造一个"全能型"的超级Agent,不如让多个各有专长的"专业型"Agent通过协作来完成复杂任务。
这个理念的灵感来源于人类社会,世界上最高效的组织,无一不是通过分工协作来实现目标的。
那为什么多Agent系统如此有吸引力?
原因有很多。
第一个原因是专业化带来效率提升。一个Agent不可能在所有领域都做到最好。让一个Agent专注于语言理解和生成,让另一个Agent专注于代码编写和调试,让第三个Agent专注于数据分析和可视化,每个Agent在自己的领域内都能达到更高的精度和效率。当这些专业Agent协作时,整体效果往往超过一个试图"样样精通"的通用Agent。
第二个原因是复杂任务的自然分解。很多现实世界中的任务天然就是多角色的。比如软件开发需要产品经理、设计师、程序员、测试员;商业决策需要分析师、顾问、执行者;内容创作需要策划、写作、编辑、配图。多Agent系统可以将这些角色映射到不同的Agent上,让整个协作流程更加自然和高效。
第三个原因是系统鲁棒性的提升。在一个多Agent系统中,即使某个Agent出现故障或表现不佳,其他Agent仍然可以继续工作,甚至可以在一定程度上弥补出问题的Agent的功能。相比之下,一个单Agent系统的"单点故障"风险要高得多。
多Agent系统的协作模式有很多种。最常见的是"发言人模式",即多个Agent围绕一个协调者运作,通过协调者来分配任务和整合结果。这种模式的优点是架构清晰、易于管理,但缺点是协调者可能让项目卡壳。
还有一种"议会模式"。所有Agent平等地参与讨论和决策,没有单一的领导者。这种模式更加灵活,但协调成本更高,需要有效的共识机制来防止"众说纷纭、议而不决"。
在多Agent系统的实践中,MetaGPT是一个非常有代表性的案例(当然现在已经有许多新产品开始抢占市场)。在MetaGPT中,不同的Agent被赋予了不同的角色身份:产品经理Agent负责编写产品需求文档,架构师Agent负责设计系统架构,工程师Agent负责编写代码,测试员Agent负责编写和执行测试。
这些Agent通过共享一个"消息池"来沟通——每个Agent都向消息池中发布自己的工作成果,其他Agent可以读取和引用这些成果。
这种消息池机制模拟了软件开发团队中的文档流转过程。比如产品经理写完需求文档后,架构师阅读并基于它设计架构,然后工程师基于架构写代码,测试员基于代码写测试。
而在这种多Agent协作模式下,软件开发任务的质量和完整性显著高于单Agent模式。
产品经理Agent编写需求文档时,会考虑到后续各个角色的需求,避免遗漏关键信息;工程师Agent写代码时,会主动参考架构文档,确保代码符合设计规范。这种角色间的相互制衡和相互促进,让最终产出的质量有了保障。
另外需要讲一下另外一个很有意思的玩法:"辩论"模式。(谁不想看一群Agent吵架呢)
在这种模式下,多个Agent扮演不同的立场和视角,就同一个问题展开"辩论"。比如在评估一个商业决策时,一个Agent扮演"保守派"强调风险,另一个Agent扮演"激进派"强调机遇,第三个Agent扮演"中立分析者"提供数据支持。通过辩论,Agent团队能够从多个角度审视问题,避免偏颇的决策——是的朋友,玩过帝成2的人一定会享受这个玩法。
当然比起娱乐性,最重要的是,研究已经表明,多Agent辩论能够显著降低LLM常见的"确认偏误"——也就是倾向于支持与已有信息一致的结论,而忽视相反的证据。
多Agent系统还有一个极具潜力的应用方向:模拟与推演。
想象一下,你是一个城市管理者,想要了解如果实施某项交通政策,城市的交通状况会发生什么变化。在传统模式下,你需要建立复杂的数学模型来进行模拟。但在多Agent系统中,你可以创建成百上千个"市民Agent",每个Agent有自己的出行偏好、时间安排和经济约束,然后观察这些Agent在政策变化下的行为变化。这种"基于Agent的建模"方法,正在社会学、经济学、城市规划等领域展现出巨大的价值。
当然,多Agent系统也面临着独特的挑战。通信开销是最明显的问题之一。
Agent之间的每一次对话都意味着额外的API调用和token消耗(真的很贵),当Agent数量增多时,通信成本会呈指数级增长。
协调难题也同样棘手。当多个Agent有不同的意见和方案时,如何高效地达成共识?当Agent之间出现冲突时,如何仲裁?
这些问题目前还没有完美的解决方案,这是学术界和工业界正在积极探索的方向。
Agent在实际场景中的应用:真实世界中的AI Agent
理论的讨论已经足够丰富了,我们来看看AI Agent在实际世界中到底能做什么。
可能超出很多人意料的是,AI Agent在真实场景中的应用已经相当广泛和深入了,这个词远远不只是"智能聊天机器人"这么简单。
在软件开发领域,AI Agent正在重塑工程师的工作方式。
GitHub Copilot是最先出现、也最广为人知的编程助手,但它本质上是一个"补全工具。你写了前半段代码,它帮你补全后半段。而以Agent为基础的编程工具要强大得多。
比如Devin。它可以自主地接收一个软件开发任务,规划实现方案,编写代码,运行测试,修复错误,最终交付一个完整的应用程序。它不是简单地在已有的代码上补充几行,而是像一个真实的全栈工程师一样,从零开始构建功能。Cline、OpenHands(原OpenDevin)等项目也在朝着同样的方向努力,这些工具都在致力于让AI Agent能够像人类开发者一样端到端地完成软件开发任务(这一点我们会放到AI编程这一章详细讲解)。
而在数据分析领域,Agent正在把"数据驱动决策"的门槛降到了前所未有的低度。
传统的数据分析流程是:业务人员提出分析需求 -> 数据分析师编写SQL查询 -> 提取数据 -> 用Python/R进行分析 -> 制作可视化报表 -> 业务人员解读报表。这个流程涉及到多个角色,协作成本高、响应速度慢。有了AI Agent,业务人员可以直接用自然语言描述分析需求,Agent会自动完成剩下的所有工作:查询数据库、清洗数据、统计分析、生成可视化图表。Dify、Tableau的Ask Data功能、以及各种结合了LLM和BI工具的产品,都在不断简化数据分析。
而内容创作领域,Agent正在从"写作助手"进化到"创作伙伴"。传统的AI写作工具主要是"生成",你给个主题,它生成一篇文章。但Agent式的创作工具能做更多:它可以帮你策划选题(分析热点趋势、研究竞品内容)、搜集素材(搜索相关文章、提取关键信息)、撰写初稿、优化排版、配图设计、甚至发布和推广。一个内容创作的Agent可以同时管理多个内容渠道,根据每个平台的特点调整内容的格式和调性,并在内容发布后追踪表现数据,为下一轮创作提供反馈。这种"全链路"的创作Agent正在改变内容行业的运营模式。
在客户服务领域——这是被应用最广泛的领域之一,Agent正在经历从"客服机器人"到"智能服务代表"的转变。传统的客服机器人基于预定义的问答规则和知识库,遇到超出规则范围的问题就会卡壳,只能转接人工。而基于Agent的智能客服系统能够理解复杂的客户问题,通过多步骤的推理和操作来解决问题,比如它可以查询订单系统、修改订单状态、发起退款流程、安排物流重新配送等。它不再只是一个"问答工具",而是一个能够实际"办成事"的服务人员。京东、淘宝、字节跳动等公司的客服系统都已经在大规模部署基于Agent的智能客服。
在个人助理领域,Agent正在成为真正的"数字分身"。想象一个Agent助理,它知道你的日程安排(通过访问你的日历),知道你喜欢什么(通过长期记忆),知道你的工作习惯(通过观察你的行为模式),然后主动提供帮助:在重要会议前提醒你准备材料,在航班延误时帮你重新规划行程,在需要回复邮件时帮你草拟合适的回复,在周末帮你推荐附近的餐厅和活动。Google的Project Astra展示的就是这样的愿景——一个随时在线的、多模态的、主动的AI助理。相信我,没人能拒绝一个Agent助理,只要数据够多,Agent将为你带来质的改变。
以上这些只是AI Agent应用场景的一部分。
随着技术的进步,新的应用场景正在不断地涌现。但无论场景如何变化,核心的逻辑是一致的:
AI Agent的价值不在于它"知道什么",而在于它"能做什么"。
它能够自主地、面向目标地行动,在真实世界中产生实实在在的影响。
Agent面临的挑战与限制:冷静看待技术现状
如果说前面的内容让我们对AI Agent的未来充满了美好的憧憬,那么现在我得给你浇一盆冷水了。
我们有必要冷静下来,认真地审视一下Agent目前面临的实际问题和局限性。
任何技术都有它的边界和短板,AI Agent也不例外。正视这些问题,是为了让我们在设计和应用Agent时能做出更明智的判断。
Agent最大的问题之一就是可靠性问题。目前的LLM-based Agent在执行任务时,会频繁出现各种"意外"行为,比如偏离目标、陷入死循环、做出莫名其妙的决策、在简单的子任务上莫名其妙地失败。
这些问题根源于大语言模型本身的"概率性"本质:LLM不是一个逻辑引擎,而是一个基于概率的文本生成器。它在生成每一步输出时,都是在"猜下一个最可能出现的词"。大多数时候,这个"猜"的结果是对的,但在某些情况下,它会"猜"出一个完全不合理的结果。对于普通的对话场景,偶尔一次不合理的回答可能只是让人莞尔一笑,但对于正在执行重要任务的Agent来说,一次错误可能是致命的。
而可靠性则牵扯出了另外一个问题——幻觉问题。
这是大语言模型根深蒂固的问题,是它的基因病,它会编造看起来合理但事实上错误的信息。而这种"幻觉"在Agent场景中被进一步放大了,因为Agent不仅会生成文字,还会基于这些文字做出决策和行动。
一个产生了幻觉的Agent可能会基于虚假的信息调用API、做出决定、影响现实世界。比如如果一个研究型Agent在搜集竞争对手信息时产生了幻觉"编造"了竞争对手的财报数据,然后基于这个数据进行商业决策分析,那后果是不堪设想的。
除此之外规划中的"组合爆炸"问题也值得重视。当Agent面对一个包含多个步骤的复杂任务时,可能的选择方案会随着任务步骤的增加而指数级增长。即使有Tree-of-Thought这样的推理机制,Agent在最坏情况下仍然可能面临"选择太多而无法有效决策"的困境。这个问题在任务复杂度增加时会变得非常突出。
再来就是token成本和执行效率的问题。每次Agent的思考循环都需要大量的token消耗。一个看起来简单的任务,在Agent的"运行日志"中可能动辄几万甚至几十万个token。按照当前主流的API定价,这意味着每次Agent任务的成本可能是几毛钱到几十块钱不等。对于高价值的企业级应用来说,这个成本可以接受;但对于大规模、高频次的场景,成本就成了一个非常现实的约束。而且,Agent的"思考速度"远没有人类期望的那么快。
一个完整的规划、执行、评估循环可能需要几秒到几十秒,甚至更长时间,这对于需要实时响应的场景来说是不适用的。
同时长期任务的一致性和连贯性也需要解决。当一个任务需要持续数小时甚至数天,涉及到数百次工具调用和成千上万次的推理循环时,Agent很容易在长时间的运行中产生偏离——最初设定好的目标和约束条件会在漫长的执行过程中被渐渐遗忘或稀释。这个问题的解决方案之一是引入"护栏机制",即在Agent的执行过程中设置定期检查点,确保Agent仍然在正确的轨道上。但如何设计有效的护栏机制本身就是一个不小的挑战。
Agent系统当前的"知识封口"问题也很值得关注。当前大多数Agent的知识和能力被"冻结"在模型训练完成的那一刻。虽然Agent可以通过工具(如搜索引擎)获取外部实时信息,但它本身的推理能力和知识结构是不会自动更新的。要让Agent真正持续进化,需要建立更加复杂的"学习"机制——而如前所述,这个领域目前还非常不成熟。
Agent之间的交互和协作问题也不完美。在多Agent系统中,Agent之间的通信目前主要是通过自然语言进行的。比如A说了一段话,B理解这段话并做出回应。但自然语言本身具有模糊性和歧义性,Agent对同一段话的理解可能各不相同。这会导致沟通中的信息损耗和误解。而且,多个Agent同时工作时,可能出现"回声室效应"——Agent之间相互强化彼此的错误,而不是纠正对方的偏差。
还有一个极为重要但容易被技术狂热掩盖的问题:信任与安全。
当一个Agent被授权调用API、操作数据库、发送邮件、执行代码时,它就拥有了在数字世界中"搞破坏"的能力。如果Agent被恶意利用,比如通过prompt注入攻击(prompt injection),攻击者可以让Agent执行违背用户意愿的操作。哪怕Agent本身没有恶意,它的决策失误也可能造成严重的实际损失——而这现在已经有相应的案例了。如何确保Agent的行为是安全的、可预测的、可控制的,是任何Agent系统投入实际应用之前必须解决的问题。
最后,还应该提及用户的接受度和期望管理问题。
经历过"AI泡沫"数次大起大落的普通用户,对AI Agent既有期待又有怀疑。如果一个Agent在实际使用时频繁出错、反应迟钝、或者做出让人匪夷所思的决策,用户的信任很快就会消耗殆尽。过度的宣传和过高的期望可能适得其反。
当用户发现Agent并不是他们想象中那个"完美无缺的智能助手"时,失望和抵触情绪会随之而来。
但这并不意味着Agent没有价值或不值得投入。相反,正是因为存在这些挑战,这个领域才有巨大的创新空间。我们只是需要带着清醒的认知去面对它们,而不是用一个又一个美丽的幻想来掩盖现实的问题。
Agent的未来:走向自主与协作的智能体生态
站在今天的时间点展望AI Agent的未来,我们能看到几条清晰的发展脉络。
第一条脉络是自主性的持续增强。 当前的Agent虽然被冠以"自主"之名,但大多数仍然需要在人类的明确指示和频繁干预下才能工作。未来的Agent将具备更强的自主决策能力——它们能够更好地理解模糊和复杂的目标,更准确地判断什么时候需要向人类请示、什么时候可以自己做决定。这种"判断是否应该请示"的元认知能力,可能是自主性提升的关键。一个成熟的Agent应该知道自己的能力和边界,在能力范围内自主行动,在超出边界时及时求助。
第二条脉络是记忆和持续学习的真正实现。未来的Agent将不再是"做完就忘"的一次性工具,而是能够积累经验、不断进化的长期伙伴。它们的长期记忆系统将更加智能,不仅能够存储和检索信息,还能够对信息进行抽象、关联和推理,从具体的经历中提炼出通用的知识。它们将从每一次交互中学习,不断优化自己的行为模式、知识结构和推理策略。
第三条脉络是Agent间的互通与协作标准化。想象一个"Agent的互联网":不同平台、不同厂商开发的Agent能够像人类通过电子邮件和社交媒体沟通一样,通过标准化的协议相互发现、相互信任、相互协作。
一个用户可能同时拥有多个Agent,比如一个管理财务、一个管理健康、一个管理工作,这些Agent可以在用户授权的前提下相互沟通,协同工作。这种互通需要标准和协议的支持。目前,A2A(Agent-to-Agent)协议、MCP(Model Context Protocol) 等标准化尝试正在推进中,有望在未来几年内形成更成熟的Agent间通信标准。
第四条脉络是嵌入物理世界的Agent。目前的大多数Agent生活在数字世界中,但未来将有越来越多的Agent进入物理世界。具身智能是这一领域的重点发展方向。特斯拉的Optimus、Figure 01、波士顿动力的Atlas、以及国内的多家机器人公司,都在朝着这个方向努力(目前超仿生机器人伴侣U1系列已经在国内开售,10天预售4000台,定金三千块钱一台,预售总额超千万,这是一个相当震撼的数字)。虽然具身智能目前还比较初级,机器人的物理操作能力远远落后于LLM的认知能力,但这个领域的进步速度正在加快。
第五条脉络是Agent开发的门槛进一步降低。随着Agent框架和平台的成熟,未来构建一个自定义Agent将变得像今天构建一个网站一样简单。低代码/无代码的Agent平台正在将Agent的构建权从专业开发者手中扩展到更广泛的用户群体。这个趋势将进一步加速Agent的普及和应用。
但我必须坦率地说,Agent领域仍然充满了不确定性。
上述趋势中的每一条都面临着巨大的技术挑战。自主性的增强可能带来安全和可控性的问题,Agent间的互通可能面临隐私和安全的难题,具身智能的物理能力仍然远远落后于认知能力,低代码平台的灵活性是否能满足复杂场景的需求也有待验证。
也许在五到十年后回望今天,我们可能会发现,AI Agent本身的形态和我们今天设想的完全不同。
就像互联网诞生之初,人们很难想象今天的社交媒体、短视频和移动支付一样,Agent的未来形态可能也远远超出我们今天的想象。
但无论形态如何变化,一个基本的发展趋势是确定的:
AI正在从"被动响应"走向"主动行动"。Agent是这个趋势的核心载体。
结语:在AI时代,理解Agent就是理解未来
这一章终于结束了。
现在,让我们回到我们这章的起点。
AI Agent不是一个简单的技术概念,它代表着人工智能从"工具"到"伙伴"的跃迁。
一个工具需要你在每一个环节告诉它做什么。而一个Agent只需要你告诉它你想达成什么目标,然后它自己去想办法,自己去执行,自己去优化。
如果说大语言模型让我们看到了AI的"智慧",那么Agent让我们看到了AI的"能力"。不仅仅是思考和回答的能力,而且是行动和改变世界的能力。当Agent开始调用API、操作软件、管理数据、控制硬件时,它已经不再是一个被动的信息提供者,而是一个主动的行动参与者。
这也意味着,无论你是AI行业的从业者、科技产品的使用者还是刚刚开始了解AI的普通用户,理解AI Agent都非常重要。
因为它正在改变软件的工作方式、改变人机交互的范式、改变"计算机能做什么"的定义。软件开发将从"编写固定逻辑的程序"变成"设计自主行动的智能体";用户交互将从"点击按钮和填写表单"变成"用自然语言表达目标和约束";系统设计将从"确保程序按照预期执行"变成"确保Agent在自主行动中不偏离目标的轨道"。
这是一次正在发生的科技革命。因此不要等到Agent已经无处不在的那一天才去理解它。
在AI入门手册中,AI Agent这一篇我们花了相当长的篇幅来系统地讲述。但坦率地说,这个领域的发展速度如此之快,以至于我估计这篇文章在完稿的时候就已经开始“落后”。
新的Agent框架在涌现、新的应用场景在被发现、新的技术突破在被取得。
对于刚刚开始学习AI的你来说,最重要的不是掌握某一个具体的Agent框架或者工具,而是理解Agent背后的核心思想——什么是自主性、为什么规划很重要、为什么记忆是智能的基础、为什么工具使用是Agent的分水岭。
理解了这些核心思想,无论技术如何迭代和演化,你都会站在正确的位置去理解和把握这个日新月异的领域。而这也是我们想要做的事情:过时的技术细节不如给你一套持久生效的理解框架。
AI Agent的故事才刚刚开始。未来还有太多的可能性等待被探索。但未来的事情未来再说,现在,你需要先把你的思维搭建起来。
互动讨论区
0 条记录No data in communication log.
从小白到入门的路线图
**在一本AI入门手册里,这一章可能是最特殊的一篇。** 前面十七章,我们从"什么是AI"讲到了全球产业格局,从机器学
AI时代的人才与职业
当人工智能从实验室里的论文走进每一个人的日常工作流,当一行自然语言就能生成可运行的程序,当一段语音描述就能产出一段堪比专
中国AI产业基础解读
在全球AI产业的棋盘上,中国毫无疑问是最值得深入观察的变量之一。 如果只看原创基础研究和技术突破的"首发"数量,中国与
全球AI产业格局:中美欧的角力
如果你在2022年底(也就是ChatGPT刚刚发布的那段时间)去参加任何一场科技行业的会议,你会发现所有人都在讨论同一个