乐于分享
好东西不私藏

AI Agent:从"被动回答"到"主动行动",智能体的前世今生

AI Agent:从"被动回答"到"主动行动",智能体的前世今生
INTRODUCTION

最近,AI Agent(智能体)几乎成了整个 AI 行业最热的关键词。从能自动操作浏览器,到能调用工具、读文件、执行代码,再到能协同多个模型完成复杂任务,越来越多公司开始押注同一个方向:AI 不再只是"回答问题",而是开始"替人做事"。但 AI Agent 到底是什么?它从哪里来,经历了什么,现在走到哪一步了?今天这篇文章,我们以斯坦福和微软研究院联合发表的综述论文 *Agent AI: Surveying the Horizons of Multimodal Interaction*(2024)为主线,结合近两年的行业发展,把这件事讲清楚。

CHAPTER 01

到底什么是 AI Agent?

很多人第一次听到 Agent,会以为它只是"会调用工具的大模型"。

但实际上,Agent 的核心并不只是工具调用。

学术界有一个比较清晰的定义:

Agent AI 是一类能够感知视觉、语言和其他环境信息,并据此产生有意义的 实体行动的交互系统。

真正的关键在于:

它具备"感知—决策—行动"的闭环。

传统聊天机器人:

输入 → 输出

Agent:

感知环境 → 理解目标 → 规划步骤 → 执行动作 → 观察结果 → 继续调整

它不只是"生成文本",而是在理解环境、做决策、执行动作、根据反馈继续行动

本文是通俗视角读论文🔗系列第 11 篇。在这个系列中,我们尝试尽量跳出复杂公式和严格数学推导,用更直观的例子和通俗语言,理解 AI 论文背后的核心思想,帮助读者更轻松地看懂这个飞速变化的 AI 时代。

一个直观例子

假设你说:

"帮我整理最近三个月的销售数据,并生成汇报 PPT。"

普通大模型 Chatbox 可能会:

1

告诉你怎么做

2

给你一个 PPT 大纲

3

写几段分析文字

而一个真正的 Agent 会:

1. 打开数据文件2. 分析 Excel3. 统计指标4. 生成图表5. 制作 PPT6. 导出文件7. 发给你

区别在于:

前者"提供建议",后者"完成任务"。

这里需要说明一点:早期的大模型产品(如最初的 ChatGPT)确实只是"问答机器"。

但随着模型能力的快速进化,现在的 ChatGPT、Claude 等已经内置了网页搜索、代码执行、文件处理、工具调用等能力,它们本身就在从"聊天机器人"向"Agent"演化。

所以今天我们讨论的 Agent,不一定是独立于大模型之外的新产品——大模型本身正在长出 Agent 的能力

同时也有 OpenAI 的 ChatGPT Agent、Anthropic 的 Claude Code、Cognition 的 Devin 等专门的 Agent 产品在此基础上走得更远。

CHAPTER 02

Agent 其实是 AI 最早的梦想

很多人以为 Agent 是大模型时代的新概念。

其实恰恰相反——Agent 才是 AI 最原始的目标。

1956:AI 的起点

这个故事要从 1956 年的达特茅斯会议说起——那是被普遍认为 AI 诞生的时刻。

当时研究者的目标,并不是做聊天机器人。而是希望创造一种:

能从环境中收集信息并与之交互的人工生命

也就是说:AI 从一开始,目标就是"Agent"。

为什么后来变成了"单点模型"?

因为真正做起来太难了。

要做一个完整的 Agent,需要同时解决:

1

视觉(看世界)

2

语言(理解指令)

3

推理(制定计划)

4

记忆(保存状态)

5

控制(执行动作)

但过去几十年的 AI,每个方向都很弱。

于是研究开始"拆分":

领域
解决的问题
计算机视觉
看图
自然语言处理
理解语言
强化学习
学习行动策略
机器人学
控制机器人

整个 AI 领域进入了"模块化时代"。大家都在解决局部问题,但没人能把它们真正整合起来。

正如亚里士多德在两千多年前就说过的:

整体大于部分之和。

过去几十年,AI 的各个子领域各自为战;而今天,大语言模型和视觉语言模型的出现,终于让重新整合成为可能。

CHAPTER 03

大模型为什么突然让 Agent 成为现实?

因为过去缺少的那个"大脑",终于出现了。

以 GPT-4、Claude、Gemini 为代表的大模型,第一次同时具备了多项能力:

能力
过去
现在
语言理解
更强
推理能力
明显提升
多轮上下文
有限
长上下文
工具调用
几乎没有
原生支持
多模态感知
分裂
开始统一

过去:AI 像一堆分开的器官——一个负责语言,一个负责视觉,一个负责控制,彼此之间很难协作。

而大模型出现后:

第一次有了一个统一的"中央大脑"。

能够在统一框架下完成感知、推理和行动。更重要的是,模型学习的目标正在从"预测下一个词"扩展到"预测下一步行动"。它不仅要理解输入,还要根据环境状态决定接下来该做什么。

这意味着 AI 正从"会回答问题"走向"会完成任务"。某种意义上,这正是 Agent 快速发展的核心原因。

CHAPTER 04

Agent 的核心能力:不是"聊天",而是"行动闭环"

关键在于:Agent 的本质不是"大模型外挂工具",而是一个闭环系统

一个完整的 Agent 系统通常包含:

任务规划(Planning)  —— 把目标拆成步骤记忆系统(Memory)    —— 记住做过什么工具调用(Tools)     —— 接入外部能力环境交互(Environment)—— 感知和操作结果反馈(Feedback)   —— 根据结果调整重新规划(Re-Planning)—— 修正行动路径

这里面最关键的是:

它不是"一次性生成答案",而是"持续循环"。

规划(Planning)

这是 Agent 和普通大模型最大的区别。

普通模型:

输入 → 一次性输出

Agent:

目标 → 拆步骤 → 执行 → 观察反馈 → 再调整

比如 ReAct 等方法:让 Agent 在行动过程中不断"反思"——哪些步骤成功了,哪些失败了,下一步该怎么调整。

记忆(Memory)

没有记忆,就没有真正的 Agent。

Agent 必须记住:

1

当前做到哪一步

2

哪些任务已完成

3

哪些结果失败了

4

用户偏好是什么

Agent 的记忆其实分好几个层次:

类型
类比
Context Window(上下文窗口)
工作记忆
外部存储 / RAG
长期记忆
Task State(任务状态)
当前进度

很多 Agent 框架本质上都在解决一个问题:

如何让系统"记住自己做过什么"。

工具调用(Tool Use)

以前模型只能"生成文本"。现在模型开始:

1

调 API

2

查数据库

3

执行代码

4

操作浏览器

5

使用搜索引擎

于是 AI 第一次真正获得了"外部行动能力"。

CHAPTER 05

Agent 的主要研究方向

目前 Agent 的研究大致集中在几个方向。我们挑成果最丰富的展开讲,其他的简要带过。

具身智能与机器人(成果最密集的领域之一)

这是 Agent AI 最"硬核"也最有实际价值的方向。

核心问题:让机器人在真实物理世界中完成任务。

目前有几条关键的技术路径:

1

视觉运动控制:机器人通过摄像头"看到"环境,再调整自己的动作。

2

语言条件化操控:用户用自然语言下指令("把桌上的红苹果拿起来"),机器人理解后执行

3

技能优化:抓取一个物体需要精确的接触点和手臂姿态——这些信息很难用语言描述清楚,需要从大量数据中学习。

代表性工作包括 Google 的 RT-2,它把大模型的语义理解能力直接迁移到了机器人控制上。还有 RoboGen——一个能自主提出任务、生成训练环境、学习技能的闭环流水线。

还有一个关键方向叫 Sim-to-Real(仿真到现实):先在虚拟环境中训练机器人(又快又安全),再把学到的技能迁移到真实世界。

游戏 Agent(最容易测试的领域)

游戏可以说是 Agent 的天然试验场

这里既有明确规则和奖励机制,又允许低成本、大规模试错。大模型驱动的 NPC已能展现更自然的行为,多 Agent 系统能够协同完成复杂任务,而 Generative Agents甚至让 AI 角色在虚拟小镇中自主社交、组织活动,形成类似微型社会的涌现现象。

很多今天 Agent 的前沿探索,最早都在游戏世界里得到验证。

医疗健康 Agent

医疗是 Agent 应用中潜力最大也最需要谨慎的领域。

1

诊断 Agent:作为医疗对话系统,帮助患者进行初步分诊。这对全球数亿缺乏医疗服务的人群尤其有价值。

2

知识检索 Agent:医疗领域的"幻觉"特别危险——误诊可能导致严重后果。一个可行思路是将诊断 Agent 与医学知识库检索 Agent 配合,大幅减少幻觉。

3

远程医疗:Agent 可以帮助分拣患者信息、协调医患沟通、提高远程问诊效率。

其他方向(简要)

1

多模态 Agent:让 Agent 同时理解文字、图像、视频,具备更完整的环境感知能力

2

生成式 Agent 与虚拟现实:用 AI 自动创建虚拟世界和角色,用户可以用一句话生成 3D 场景

3

知识与推理 Agent:从海量信息中检索知识、进行多步骤逻辑推理,目前偏早期但很关键

CHAPTER 06

Agent 怎么学习?三种核心方法

训练 Agent 主要有三种方法:

强化学习(RL)

让 Agent 在环境中不断试错,做对了奖励,做错了惩罚,慢慢学会最优策略。

就像训练宠物:坐下给零食,乱咬就训斥。

模仿学习(IL)

让 Agent 观察专家的操作,然后模仿他们的行为。

就像徒弟跟着师傅学手艺——直接学习成熟经验,不需要从头摸索。

有个思路值得一提:不是简单地模仿专家的每一步动作,而是学习一个隐式奖励函数来捕捉专家行为的关键特征。这样 Agent 在遇到新场景时,也能做出合理决策。

上下文学习(In-context Learning)

大模型时代的新方法——不需要修改模型参数,只需在输入中给出几个示例,模型就能"理解"该做什么。

就像给新员工看几个工作范本,他就能依葫芦画瓢完成任务。

实际中,最好的 Agent 系统,往往是这些方法的组合。

CHAPTER 07

从理论到现实:Agent 爆发的这两年

2024 年以来,Agent 领域经历了爆发式发展。

但这次爆发不是偶然的——规划、工具调用、多模态感知等能力在过去两年先后成熟,构成了 Agent 爆发的基础条件:

大模型推理能力终于够用了。早期 GPT-3 时代的 AutoGPT、BabyAGI 就有人尝试,但经常忘记目标、步骤混乱、无限循环。GPT-4 之后的模型才真正具备多步推理和长链条规划能力。

工具调用标准化了。OpenAI function calling、Claude tool use、Gemini function calling 让模型第一次具备了"结构化调用外部系统"的能力。现实世界由 API、数据库、浏览器、文件系统组成,Agent 必须能接入这些系统。

多模态成熟了。过去模型只能读文字,现在能看图、看屏幕、理解 GUI、理解视频。Agent 开始具备"观察环境"的能力——而这正是 Agent 的起点。

关键节点

2023 年——开源先驱探路

1

AutoGPT 和 BabyAGI 率先展示了“让大模型自主规划与执行任务”的可能性,尽管系统仍较粗糙,但为 Agent 方向提供了重要启发

2

MetaGPT 引入多角色协作机制,让不同 Agent 分别扮演产品经理、架构师与工程师,在一定程度上模拟软件开发团队的分工流程

2024 年——大厂正式入场

1

Cognition AI 推出 Devin,引发广泛关注,推动“AI 软件工程 Agent”成为行业热点之一,展示了从规划到编码与执行的端到端尝试

2

Anthropic 推出 Claude Computer Use,使模型能够直接操作图形界面(如点击、输入、浏览屏幕),推动 GUI Agent 方向的发展

3

Google 持续推进 Gemini 系列多模态模型,并探索面向 Agent 的浏览与任务执行能力(如 Project Mariner 等方向)

4

Microsoft 推出 Copilot Studio,使企业能够通过低代码方式构建自定义 Agent,并接入企业内部系统与工具链

2025 年——Agent 走向更广泛应用

1

OpenAI 持续强化 ChatGPT 中的 Agent 能力,探索结合浏览、研究与工具调用的自动化任务执行形态(如 Operator 与 Deep Research 等方向)

2

编程 Agent 能力进一步增强,逐步具备在沙箱环境中进行代码生成、调试与迭代的能力

3

企业侧 Agent 应用快速扩展,越来越多组织在 Copilot 等平台上构建面向内部流程的自动化 Agent 系统

这些系统形态虽然各不相同,但底层逻辑逐渐收敛为统一范式:感知环境 → 理解目标 → 任务规划 → 工具调用 → 行动执行 → 反馈迭代

CHAPTER 08

为什么 Agent 还远远没成熟?

虽然发展很快,但 Agent 仍面临几个根本性挑战。有些在改善,有些反而更严峻了:

1. 幻觉问题:越强,越可能“编”

聊天机器人幻觉通常只是答错,但 Agent 幻觉可能直接导致错误执行,例如调用不存在的工具、参数错误或误判任务状态。研究表明,随着推理能力增强,工具幻觉问题并未同步下降,在部分情况下甚至更容易生成“合理但不存在”的工具调用。

2. 安全问题:从理论走向现实

当 Agent 能访问系统并执行操作后,安全风险显著扩大,包括 Prompt Injection、权限滥用和数据泄露等问题。目前安全治理框架正在快速发展,但整体防护能力仍落后于 Agent 能力的增长速度。

3. 泛化能力:专用强,通用弱

Agent 在代码、客服、分析等垂直任务中已具备实用价值,但在跨领域迁移与复杂长期任务中仍不稳定。如何提升跨场景泛化能力,仍是通向通用智能的重要挑战。

4. 评估体系:从缺失到失效

过去几年涌现了大量 Agent Benchmark,但模型在刷分提升的同时,真实环境表现并未同步提升。行业正在从结果指标转向过程与轨迹评估,以衡量稳定性、成本与长期可靠性。

CHAPTER 09

Agent 会走向何方?

综合来看,Agent 的发展呈现出几个主要趋势:

多 Agent 协作:复杂任务不再依赖单一 Agent,而是多个 Agent 分工协作完成。

从虚拟到物理:能力从数字世界扩展到机器人、自动驾驶等现实场景,Sim-to-Real 与具身智能是关键路径。

从工具到伙伴:Agent 从执行指令转向理解目标并自主规划执行流程。

持续学习与进化:通过人类反馈、合成数据与环境交互,实现能力的持续提升。

CHAPTER 10

写在最后

回到开头提到的那段历史——

1956 年,达特茅斯会议定义 AI 为"能从环境中收集信息并与之交互的人工生命"。

70 年后,这个定义终于有了落地的可能。

Agent 不是某一个技术突破的产物,而是多项能力(语言、视觉、推理、规划、控制)经过几十年各自发展后,终于在大模型时代汇合的结果。

它代表的,是 AI 从"能说话"到"能做事"的关键一跃。

而现在,这场跳跃才刚刚开始。