乐于分享
好东西不私藏

吴恩达Agentic AI 课程第三章学习笔记-AI 能自己动手了,工具使用

吴恩达Agentic AI 课程第三章学习笔记-AI 能自己动手了,工具使用
> 你用的生成式AI,本质上是个只会说话的嘴。
> 它知道"现在几点"需要调时钟——但它调不了。
> 工具使用(Tool Use)就是给这张嘴配一双手。
> 从此,AI 不只动口,还能动手。

前情回顾

吴恩达的《Agentic AI》课程把 Agent 工作流拆成四种设计模式:
  • 反思(Reflection) ✅ AI 写完→自己审→自己改
  • 工具使用(Tool Use) 👈 本篇
  • 规划(Planning):AI 自己拆解任务、编排步骤
  • 多智能体(Multi-Agent):多个 AI 角色分工协作
上一章证明了反思的威力——同一个模型,加一步"自我审阅",正确率从 48% 飙到 95%。
这章介绍工具让 AI 接入外部世界。
先上图
---

一、工具使用到底在干什么?

核心思想:工具就是函数,模型自主决策何时调用哪个函数。
把这句话拆开:
"工具就是函数"
——你写的 `get_current_time()`、`web_search(query)`、`query_database(sql)` 这些代码,就是 AI 的工具。
"模型自主决策"
——不是你在代码里硬写"遇到时间问题就调 get_current_time"。你自己决定要不要调、调哪一个。
以"现在几点?"为例,完整流程是这样的:
  1. 用户问:"What time is it?"
  2. LLM 意识到:我不知道现在几点,这不是我的训练数据能回答的问题 → 决定调用 `get_current_time()` 工具
  3. 系统执行这个函数,返回 `15:20:45`
  4. 结果喂回给 LLM
  5. LLM 回复:"现在是下午 3 点 20。"
整个过程的关键点:
  • LLM 不是直接调用函数——它只是输出一段文本说"我想用这个工具"
  • 开发者的代码解析这个请求,实际执行函数,再把结果传回去
  • 这个"请求→执行→反馈"的闭环,就是工具使用的全部
---

LLM 到底有多聪明?——条件性调用的例子

工具使用最有意思的一点是:模型能判断哪些问题需要工具,哪些不需要。
| 用户问题 | LLM 的判断 | 是否调用工具 |
|---------|-----------|------------|
| "现在几点?" | 需要实时数据,我的训练数据里没有 | ✅ 调用 `get_current_time()` |
| "绿茶有多少咖啡因?" | 这是静态知识,我知道答案 | ❌ 不调用,直接回答 |
| "找到附近的意大利餐厅" | 需要地理位置和实时信息 | ✅ 调用 `web_search()` |
| "用 Python 算 2 的平方根" | 我能直接生成代码或计算 | ⚠️ 可以调用代码执行工具,也可以不调 |
这种"选择性调用"才是真正的智能——它不会对所有问题都盲目触发工具,而是像人类一样思考:"这个事我能直接回答吗?不能的话,我需要什么外部帮助?"
---

多工具协作:真正的"AI 助手"

工具使用不止是单次调用。模型可以串联多个工具,形成工作流。
例子:一个日历助手 App——
用户说:"请周四帮我找个空档,和 Alice 约个会。"
模型手里有三把工具:
  • check_calendar() → 查出周四有空档:3pm、4pm、6pm
  • make_appointment(time, person) → 创建一个日程
  • delete_appointment() → 如果选错了可以取消
实际执行:
  1. 先调 check_calendar() → 收到 {3pm, 4pm, 6pm}
  2. 基于结果决定:选 3pm
  3. 再调 make_appointment(time="3pm", person="Alice") → 收到 "Meeting created!"
  4. 最终回复用户:"周四下午 3 点,和 Alice 约好了。"
这一个例子就展示了工具使用的完整形态:自主决策 + 多步推理 + 动态反馈。
---

二、怎么把工具交给 LLM?

工具使用有一个关键认知:LLM 从不真正"调用"函数。它只是"请求"调用。
从技术实现上,这经历了两个阶段:
早期方法:手动提示工程
在 LLM 还没被训练成"原生理解工具"的年代,开发者要做的是:
  1. 写一个系统提示词:"如果你需要知道时间,请输出 FUNCTION: get_current_time()"
  2. LLM 输出这段文本
  3. 开发者的代码识别 FUNCTION: 关键字 → 解析函数名 → 执行 → 返回结果
这时候的 LLM 就像一个只能说话的人——你告诉他"如果你想去买咖啡,就说'我要买一杯美式'",你听到这句话后自己去帮他买。
现在方法:原生工具调用
今天的主流 LLM(GPT-4、Claude 等)都经过了直接训练,能原生理解"有哪些工具可用"以及"什么时候该用哪个"。
你不再需要在提示词里写 `FUNCTION:` 这种硬编码触发词。你只需要:
  1. 写好函数
  2. 把函数列表传给模型
  3. 模型自己决定何时调用
比如用 AI Suite 库(吴恩达团队开发的工具),几行代码就够了:
```python
import aisuite as ai
client = ai.Client()
response = client.chat.completions.create(
model="openai:gpt-4o",
messages=messages,
tools=[get_current_time, web_search, query_database],

就这一行

max_turns=5
)
```
AI Suite 会自动读取你的函数名、docstring、参数类型,生成 LLM 能理解的 JSON Schema,然后 LLM 自行决定什么时候调用哪个。开发者只需要写工具函数——剩下的由库和模型协作完成。
---

三、终极工具:让 AI 自己写代码

工具使用的天花板在哪?代码执行。
前面讲的 `get_current_time()`、`web_search()` 都是你预定义的固定工具。但如果用户问的是"用 Python 算菲波那契数列第 100 项",你不可能为每个计算需求都写一个工具。
代码执行工具的思路是:把"执行任意代码的能力"作为唯一的工具交给 LLM。
流程:
  1. LLM 生成一段 Python 代码(比如 print(math.sqrt(2)))
  2. 系统在安全沙盒里执行这段代码
  3. 捕获结果 → 喂回 LLM
  4. LLM 格式化回复
这等于告诉 AI:"你不需要我帮你写工具,你自己写代码就行。"
但必须强调安全:永远在沙盒里运行 LLM 生成的代码。
课程里分享了一个真实事故——有个开发者的 AI Agent 在无人看管的情况下执行了 `rm *.py`,删光了项目里所有 Python 文件。幸好有备份。所以吴恩达反复嘱咐:用 Docker 或 E2B 这类沙盒,代码执行必须隔离。
而且代码执行 + 反思的组合极强:
  1. LLM 生成代码 → 沙盒执行 → 报错 SyntaxError
  2. 报错信息喂回 LLM → LLM 反思 → 生成修正版
  3. 再执行 → 通过
这就是第二章反思模式 + 第三章工具使用的完美结合。
---

四、MCP:让工具生态大一统

理解了工具使用之后,你会发现一个问题:
每个开发者如果要让 AI 接入 Slack、GitHub、Google Drive,都得自己写一遍封装代码。如果有 m 个应用、n 个工具,全社区的工作量是m × n。
MCP(Model Context Protocol,模型上下文协议)
就是来解决这个问题的——它是由 Anthropic 提出的行业标准协议。
核心架构:客户端(你的 App)← → MCP 服务器(工具封装)
  • Slack 有一个 MCP 服务器,写好怎么调 Slack API
  • GitHub 有一个 MCP 服务器,写好怎么访问仓库
  • 你的 App 只需要对接 MCP 协议,就能调用所有已存在的 MCP 服务器上的工具
工作量从m × n降到m + n。社区里已经积累了大量现成的 MCP 服务器——你不需要自己写 GitHub 的封装了,直接连上就行。
实际演示:Claude Desktop 通过 GitHub MCP 服务器,可以让 AI 直接读 GitHub 仓库的 README、列出最近 PR、查看 Issue——不需要开发者写一行额外的调用代码。AI 自己判断要用哪个 MCP 工具,自己发起请求。
MCP 标志着工具使用从"开发者手写工具"进入了"标准化工具生态"时代。
---

五、工具使用 vs 反思 vs 原生调用

| 维度 | 原生调用 | +反思 | +工具使用 |
|------|---------|------|----------|
|能做什么| 基于训练数据的文本生成 | 自我审阅、纠正错误 | 访问实时数据、执行代码、操作外部系统 |
|信息来源| 模型内部知识 | 模型内部知识 |外部世界(API、数据库、文件系统)|
|正确性保证| 靠提示词质量 | 靠审阅循环 |靠真实数据反馈|
|典型场景| 闲聊、简单问答 | 文案、代码审阅 | 日历、搜索、数据库查询、代码执行 |
三者不是互斥的,是叠加的——最好的 Agent 工作流 = 反思 + 工具使用 + 外部反馈。
---

六、现在就试:两个立刻能做的实验

实验 A:让它自己查天气
  1. 打开 ChatGPT(或任何支持 function calling 的工具,比如 Cursor、Claude)
  2. 问:"你帮我查一下上海今天的天气"
  3. 看它怎么回答——大多数模型会告诉你"我无法获取实时信息"
  4. 如果你用的是 Cursor 或 Claude Desktop with MCP,它会
自动调搜索工具
去查
实验 B:让它写代码然后跑
  1. 在 Cursor 或任何支持代码执行的 AI 工具里
  2. 输入:"用 Python 生成一个随机密码,长度 16 位,包含大小写字母、数字和特殊字符,并打印出来"
  3. 看它会不会直接执行并给你结果
两个实验坐下来,你对"AI 能不能动手"会有全新的感受。
---
参考资源:
  • Andrew Ng《Agentic AI》课程:deeplearning.ai/courses/agentic-ai
  • AI Suite 工具库:github.com/andrewng/aisuite
  • MCP 协议文档:modelcontextprotocol.io
  • Datawhale 中文翻译:github.com/datawhalechina/agentic-ai
下一篇预告: 规划(Planning)设计模式——AI 自己拆任务、排步骤、定顺序
---
在做「AI 的一百个实验」,用 AI 重新做一百件事。
试完那两个实验,回来留言说说 AI 第一次帮你"动手"是什么感觉 👋
-------------

相关学习资料