最近,AI Agent(智能体)几乎成了整个 AI 行业最热的关键词。从能自动操作浏览器,到能调用工具、读文件、执行代码,再到能协同多个模型完成复杂任务,越来越多公司开始押注同一个方向:AI 不再只是"回答问题",而是开始"替人做事"。但 AI Agent 到底是什么?它从哪里来,经历了什么,现在走到哪一步了?今天这篇文章,我们以斯坦福和微软研究院联合发表的综述论文 *Agent AI: Surveying the Horizons of Multimodal Interaction*(2024)为主线,结合近两年的行业发展,把这件事讲清楚。
到底什么是 AI Agent?
很多人第一次听到 Agent,会以为它只是"会调用工具的大模型"。
但实际上,Agent 的核心并不只是工具调用。
学术界有一个比较清晰的定义:
Agent AI 是一类能够感知视觉、语言和其他环境信息,并据此产生有意义的 实体行动的交互系统。
真正的关键在于:
它具备"感知—决策—行动"的闭环。
传统聊天机器人:
输入 → 输出
Agent:
感知环境 → 理解目标 → 规划步骤 → 执行动作 → 观察结果 → 继续调整
它不只是"生成文本",而是在理解环境、做决策、执行动作、根据反馈继续行动。
本文是《通俗视角读论文🔗》系列第 11 篇。在这个系列中,我们尝试尽量跳出复杂公式和严格数学推导,用更直观的例子和通俗语言,理解 AI 论文背后的核心思想,帮助读者更轻松地看懂这个飞速变化的 AI 时代。
一个直观例子
假设你说:
"帮我整理最近三个月的销售数据,并生成汇报 PPT。"
普通大模型 Chatbox 可能会:
告诉你怎么做
给你一个 PPT 大纲
写几段分析文字
而一个真正的 Agent 会:
1. 打开数据文件2. 分析 Excel3. 统计指标4. 生成图表5. 制作 PPT6. 导出文件7. 发给你
区别在于:
前者"提供建议",后者"完成任务"。
这里需要说明一点:早期的大模型产品(如最初的 ChatGPT)确实只是"问答机器"。
但随着模型能力的快速进化,现在的 ChatGPT、Claude 等已经内置了网页搜索、代码执行、文件处理、工具调用等能力,它们本身就在从"聊天机器人"向"Agent"演化。
所以今天我们讨论的 Agent,不一定是独立于大模型之外的新产品——大模型本身正在长出 Agent 的能力。
同时也有 OpenAI 的 ChatGPT Agent、Anthropic 的 Claude Code、Cognition 的 Devin 等专门的 Agent 产品在此基础上走得更远。
Agent 其实是 AI 最早的梦想
很多人以为 Agent 是大模型时代的新概念。
其实恰恰相反——Agent 才是 AI 最原始的目标。
1956:AI 的起点
这个故事要从 1956 年的达特茅斯会议说起——那是被普遍认为 AI 诞生的时刻。
当时研究者的目标,并不是做聊天机器人。而是希望创造一种:
能从环境中收集信息并与之交互的人工生命
也就是说:AI 从一开始,目标就是"Agent"。
为什么后来变成了"单点模型"?
因为真正做起来太难了。
要做一个完整的 Agent,需要同时解决:
视觉(看世界)
语言(理解指令)
推理(制定计划)
记忆(保存状态)
控制(执行动作)
但过去几十年的 AI,每个方向都很弱。
于是研究开始"拆分":
整个 AI 领域进入了"模块化时代"。大家都在解决局部问题,但没人能把它们真正整合起来。
正如亚里士多德在两千多年前就说过的:
整体大于部分之和。
过去几十年,AI 的各个子领域各自为战;而今天,大语言模型和视觉语言模型的出现,终于让重新整合成为可能。
大模型为什么突然让 Agent 成为现实?
因为过去缺少的那个"大脑",终于出现了。
以 GPT-4、Claude、Gemini 为代表的大模型,第一次同时具备了多项能力:
过去:AI 像一堆分开的器官——一个负责语言,一个负责视觉,一个负责控制,彼此之间很难协作。
而大模型出现后:
第一次有了一个统一的"中央大脑"。
能够在统一框架下完成感知、推理和行动。更重要的是,模型学习的目标正在从"预测下一个词"扩展到"预测下一步行动"。它不仅要理解输入,还要根据环境状态决定接下来该做什么。
这意味着 AI 正从"会回答问题"走向"会完成任务"。某种意义上,这正是 Agent 快速发展的核心原因。
Agent 的核心能力:不是"聊天",而是"行动闭环"
关键在于:Agent 的本质不是"大模型外挂工具",而是一个闭环系统。

一个完整的 Agent 系统通常包含:
任务规划(Planning) —— 把目标拆成步骤记忆系统(Memory) —— 记住做过什么工具调用(Tools) —— 接入外部能力环境交互(Environment)—— 感知和操作结果反馈(Feedback) —— 根据结果调整重新规划(Re-Planning)—— 修正行动路径
这里面最关键的是:
它不是"一次性生成答案",而是"持续循环"。
规划(Planning)
这是 Agent 和普通大模型最大的区别。
普通模型:
输入 → 一次性输出
Agent:
目标 → 拆步骤 → 执行 → 观察反馈 → 再调整
比如 ReAct 等方法:让 Agent 在行动过程中不断"反思"——哪些步骤成功了,哪些失败了,下一步该怎么调整。
记忆(Memory)
没有记忆,就没有真正的 Agent。
Agent 必须记住:
当前做到哪一步
哪些任务已完成
哪些结果失败了
用户偏好是什么
Agent 的记忆其实分好几个层次:
很多 Agent 框架本质上都在解决一个问题:
如何让系统"记住自己做过什么"。
工具调用(Tool Use)
以前模型只能"生成文本"。现在模型开始:
调 API
查数据库
执行代码
操作浏览器
使用搜索引擎
于是 AI 第一次真正获得了"外部行动能力"。
Agent 的主要研究方向
目前 Agent 的研究大致集中在几个方向。我们挑成果最丰富的展开讲,其他的简要带过。
具身智能与机器人(成果最密集的领域之一)
这是 Agent AI 最"硬核"也最有实际价值的方向。
核心问题:让机器人在真实物理世界中完成任务。
目前有几条关键的技术路径:
视觉运动控制:机器人通过摄像头"看到"环境,再调整自己的动作。
语言条件化操控:用户用自然语言下指令("把桌上的红苹果拿起来"),机器人理解后执行
技能优化:抓取一个物体需要精确的接触点和手臂姿态——这些信息很难用语言描述清楚,需要从大量数据中学习。
代表性工作包括 Google 的 RT-2,它把大模型的语义理解能力直接迁移到了机器人控制上。还有 RoboGen——一个能自主提出任务、生成训练环境、学习技能的闭环流水线。
还有一个关键方向叫 Sim-to-Real(仿真到现实):先在虚拟环境中训练机器人(又快又安全),再把学到的技能迁移到真实世界。
游戏 Agent(最容易测试的领域)
游戏可以说是 Agent 的天然试验场。
这里既有明确规则和奖励机制,又允许低成本、大规模试错。大模型驱动的 NPC已能展现更自然的行为,多 Agent 系统能够协同完成复杂任务,而 Generative Agents甚至让 AI 角色在虚拟小镇中自主社交、组织活动,形成类似微型社会的涌现现象。
很多今天 Agent 的前沿探索,最早都在游戏世界里得到验证。
医疗健康 Agent
医疗是 Agent 应用中潜力最大也最需要谨慎的领域。
诊断 Agent:作为医疗对话系统,帮助患者进行初步分诊。这对全球数亿缺乏医疗服务的人群尤其有价值。
知识检索 Agent:医疗领域的"幻觉"特别危险——误诊可能导致严重后果。一个可行思路是将诊断 Agent 与医学知识库检索 Agent 配合,大幅减少幻觉。
远程医疗:Agent 可以帮助分拣患者信息、协调医患沟通、提高远程问诊效率。
其他方向(简要)
多模态 Agent:让 Agent 同时理解文字、图像、视频,具备更完整的环境感知能力
生成式 Agent 与虚拟现实:用 AI 自动创建虚拟世界和角色,用户可以用一句话生成 3D 场景
知识与推理 Agent:从海量信息中检索知识、进行多步骤逻辑推理,目前偏早期但很关键
Agent 怎么学习?三种核心方法
训练 Agent 主要有三种方法:
强化学习(RL)
让 Agent 在环境中不断试错,做对了奖励,做错了惩罚,慢慢学会最优策略。
就像训练宠物:坐下给零食,乱咬就训斥。
模仿学习(IL)
让 Agent 观察专家的操作,然后模仿他们的行为。
就像徒弟跟着师傅学手艺——直接学习成熟经验,不需要从头摸索。
有个思路值得一提:不是简单地模仿专家的每一步动作,而是学习一个隐式奖励函数来捕捉专家行为的关键特征。这样 Agent 在遇到新场景时,也能做出合理决策。
上下文学习(In-context Learning)
大模型时代的新方法——不需要修改模型参数,只需在输入中给出几个示例,模型就能"理解"该做什么。
就像给新员工看几个工作范本,他就能依葫芦画瓢完成任务。
实际中,最好的 Agent 系统,往往是这些方法的组合。
从理论到现实:Agent 爆发的这两年
2024 年以来,Agent 领域经历了爆发式发展。
但这次爆发不是偶然的——规划、工具调用、多模态感知等能力在过去两年先后成熟,构成了 Agent 爆发的基础条件:
大模型推理能力终于够用了。早期 GPT-3 时代的 AutoGPT、BabyAGI 就有人尝试,但经常忘记目标、步骤混乱、无限循环。GPT-4 之后的模型才真正具备多步推理和长链条规划能力。
工具调用标准化了。OpenAI function calling、Claude tool use、Gemini function calling 让模型第一次具备了"结构化调用外部系统"的能力。现实世界由 API、数据库、浏览器、文件系统组成,Agent 必须能接入这些系统。
多模态成熟了。过去模型只能读文字,现在能看图、看屏幕、理解 GUI、理解视频。Agent 开始具备"观察环境"的能力——而这正是 Agent 的起点。
关键节点
2023 年——开源先驱探路
AutoGPT 和 BabyAGI 率先展示了“让大模型自主规划与执行任务”的可能性,尽管系统仍较粗糙,但为 Agent 方向提供了重要启发
MetaGPT 引入多角色协作机制,让不同 Agent 分别扮演产品经理、架构师与工程师,在一定程度上模拟软件开发团队的分工流程
2024 年——大厂正式入场
Cognition AI 推出 Devin,引发广泛关注,推动“AI 软件工程 Agent”成为行业热点之一,展示了从规划到编码与执行的端到端尝试
Anthropic 推出 Claude Computer Use,使模型能够直接操作图形界面(如点击、输入、浏览屏幕),推动 GUI Agent 方向的发展
Google 持续推进 Gemini 系列多模态模型,并探索面向 Agent 的浏览与任务执行能力(如 Project Mariner 等方向)
Microsoft 推出 Copilot Studio,使企业能够通过低代码方式构建自定义 Agent,并接入企业内部系统与工具链
2025 年——Agent 走向更广泛应用
OpenAI 持续强化 ChatGPT 中的 Agent 能力,探索结合浏览、研究与工具调用的自动化任务执行形态(如 Operator 与 Deep Research 等方向)
编程 Agent 能力进一步增强,逐步具备在沙箱环境中进行代码生成、调试与迭代的能力
企业侧 Agent 应用快速扩展,越来越多组织在 Copilot 等平台上构建面向内部流程的自动化 Agent 系统
这些系统形态虽然各不相同,但底层逻辑逐渐收敛为统一范式:感知环境 → 理解目标 → 任务规划 → 工具调用 → 行动执行 → 反馈迭代。
为什么 Agent 还远远没成熟?
虽然发展很快,但 Agent 仍面临几个根本性挑战。有些在改善,有些反而更严峻了:
1. 幻觉问题:越强,越可能“编”
聊天机器人幻觉通常只是答错,但 Agent 幻觉可能直接导致错误执行,例如调用不存在的工具、参数错误或误判任务状态。研究表明,随着推理能力增强,工具幻觉问题并未同步下降,在部分情况下甚至更容易生成“合理但不存在”的工具调用。
2. 安全问题:从理论走向现实
当 Agent 能访问系统并执行操作后,安全风险显著扩大,包括 Prompt Injection、权限滥用和数据泄露等问题。目前安全治理框架正在快速发展,但整体防护能力仍落后于 Agent 能力的增长速度。
3. 泛化能力:专用强,通用弱
Agent 在代码、客服、分析等垂直任务中已具备实用价值,但在跨领域迁移与复杂长期任务中仍不稳定。如何提升跨场景泛化能力,仍是通向通用智能的重要挑战。
4. 评估体系:从缺失到失效
过去几年涌现了大量 Agent Benchmark,但模型在刷分提升的同时,真实环境表现并未同步提升。行业正在从结果指标转向过程与轨迹评估,以衡量稳定性、成本与长期可靠性。
Agent 会走向何方?
综合来看,Agent 的发展呈现出几个主要趋势:
多 Agent 协作:复杂任务不再依赖单一 Agent,而是多个 Agent 分工协作完成。
从虚拟到物理:能力从数字世界扩展到机器人、自动驾驶等现实场景,Sim-to-Real 与具身智能是关键路径。
从工具到伙伴:Agent 从执行指令转向理解目标并自主规划执行流程。
持续学习与进化:通过人类反馈、合成数据与环境交互,实现能力的持续提升。
写在最后
回到开头提到的那段历史——
1956 年,达特茅斯会议定义 AI 为"能从环境中收集信息并与之交互的人工生命"。
70 年后,这个定义终于有了落地的可能。
Agent 不是某一个技术突破的产物,而是多项能力(语言、视觉、推理、规划、控制)经过几十年各自发展后,终于在大模型时代汇合的结果。
它代表的,是 AI 从"能说话"到"能做事"的关键一跃。
而现在,这场跳跃才刚刚开始。
夜雨聆风