夜雨聆风学习资料网

ARTICLE · 1143276

AI的“工具调用”是什么:它凭什么能自己上网查、算数、发消息,而不是只回你一段话

AI的“工具调用”是什么:它凭什么能自己上网查、算数、发消息,而不是只回你一段话

一、先说个你多半遇到过的事

我问手机上的AI一个问题:今天出门要不要带伞。它回我一句“我无法获取实时信息”。

可同一天下午,我跟另一个AI管家说:帮我把那几篇文章的阅读数据抓下来。它真去把网页打开,把数字一行一行抄回来,还告诉我哪儿对不上。

都是“AI”,怎么一个只能干坐着,一个能真动手。

后来我才弄明白,这里头有个词,叫“工具调用”。前面我拆过 Agent(智能体)为什么能替我干活,这一篇专门拆它干活的那一下——手是怎么伸出去的。

二、一句话点破:工具调用,就是给AI配一双手

先得说清一件事:模型本身只会干一样活——看着前面的字,猜下一个字该是什么。这东西前面几篇讲过,《上下文窗口》《KV缓存》讲的,都是这个“猜字”是怎么跑起来的。

它会查天气吗?不会。它会算账吗?不会。它连今天几号都不知道,因为它的“脑子”里没有今天的字。

所谓工具调用,行话也叫“函数调用”,就是让它多一样本事:能开口点名要用哪样工具、把条件填好,交给外面的程序去办,再把办完的结果拿回来,接着往下说。

打个比方。它像一位坐在屋里、见识极广的先生,天文地理都懂,就是离不开那把椅子。你给他装一部电话、配一支笔、摆一台计算器,他立马就能替你办真事了。工具调用,就是那部电话。

三、拆解一:它是怎么把“话”变成“事”的

DeepSeek 官方文档里有个查天气的例子,把一次来回写得最清楚,我照着说一遍。

你问:杭州今天天气怎么样。

模型回你的第一句话,不是人话,是一张单子:get_weather,地点写“杭州”。

然后由外面的程序拿着这张单子,真去查,查到 24 度,再交回给模型。

模型这时候才用人话告诉你:杭州现在是 24 度。

官方文档在这段代码后面特意写了一句提醒,我把它抄下来:“The model itself does not execute specific functions.”翻成大白话就是——具体那件活,模型自己不动手,得由外面写好的程序来干。

这句话值钱。分清“开口点单”和“动手干活”是两件事,后面好多事就顺了。

四、拆解二:为什么非得分两步走

有人要问:既然都能干,为啥不让它自己一把干完,中间还隔着个程序?

第一个原因是安全。如果模型能自己动手,它就能自己删文件、自己付钱、自己把消息发出去。隔开一道,等于在“想”和“做”中间留了一扇门,门口能站个人看着。我的管家帮我把稿子整理好,可要真发出去,得我先点一下头——这道门就是这儿来的。

第二个原因是可靠。模型填的单子可能填错。Gorilla 那篇论文(2023 年)说得很直白:像 GPT-4 这类顶尖模型,写 API 调用时经常把参数写错,或者索性凭空编一个用法出来。所以让外面的程序先验一遍再执行,比让它闭着眼干要稳当。

五、拆解三:这本事,是怎么被“教”出来的

工具调用不是哪个模型一生下来就会的。这几年是一篇一篇论文把它磨出来的,我挑三篇说。

ReAct,2022 年。它让模型“边想边做”:一边推理一边去查,而不是光坐着想。论文里让模型去查维基百科的接口,结果在答题上比只靠自己想的少胡说;在两个要动手的任务里,成功率比原来的办法分别高出 34% 和 10%。

Toolformer,2023 年。这篇更进一步,让模型自己学会什么时候该调工具、调哪个、传什么条件,只给几个示范就够。论文里给它配了计算器、问答系统、两个搜索引擎、一个翻译、一本日历。

Gorilla,2023 年。这是专门练“写 API 调用”的模型,成绩超过了当年的 GPT-4。它还配了一样本事:去查最新文档。接口改了,它照样能跟上——这正是现在大家都爱用 MCP 那把“插头”的原因,前面《MCP协议是什么》那篇讲过。

六、一张表:聊天、会调工具、Agent 差在哪

比一比
只会聊天
会调工具
Agent(智能体)
干的事
说给你听
说给你听,也能动手查、动笔算
自己定步骤,一步步干完
谁动手
谁也不动
外面的程序动手
外面的程序动手,一遍不成再来一遍
典型样子
早期的聊天框
语音助手报天气
帮你做一份材料

七、我自己是怎么用的

我手机上装了十个 AI 软件,常用的就三个。这半年真让我省事的,是那个能动手的管家。

我说一句“帮我把这几天的数据核一遍”,它去打开网页、把数字抓下来、跟旧的对一遍,再回来告诉我哪儿对不上。这中间它得调好几样工具:读文件是一样,抓网页是一样,发消息给我又是另一样。这些活它自己不会,是我给它配好了工具,它才会用。

反过来,那些只会聊天的,也不是不聪明,是没人给它配手。同一个模型,接到工具上就能查天气,只接一个聊天框,就只好说“我不知道”。

还有一条我自己划的线:花钱的、要发出去的、要动我电脑设置的,我都要求它先问我一句。这不代表我不信它,是这类事得让能担事的人点这个头。工具再好用,钥匙还是攥在自己手里踏实。

八、三个坑,我提醒你一句

第一,它不是忽然变聪明了。还是那个会猜字的模型,手上多了几样家伙而已。别把工具的能耐,当成它的能耐。

第二,工具会失灵。网页改版了、接口变了、网站把你拦了,它抓回来的东西就可能不对。所以它交回来的结果,尤其是带数字的,我自己还要扫一眼。

第三,权限别一步给到底。给得太小,它干不成活;给得太大,它可能办了你不想要的事。宁可一样一样加。

九、结论:给它一双手,钥匙还在你手里

工具调用,就是把“只会说”变成“能上手”。它的规矩其实简单:模型开口点单,外面的程序动手,事完了再把结果交回来。

想明白这一层,好多新闻就不容易唬住你了。某天冒出个说法,某个AI“会自己订票了”“会自己写代码了”,你心里能问一句:它是自己会的,还是背后有人给它配了手、又给它划了线。

我是老刘,一个正在从零学习 AI 的 70 后普通人。


资料来源说明(每条都对着原文核过,核的是公开文档和公开论文,核实日期 2026-10-05)

· 查天气的完整来回、以及“模型自己不执行具体函数”:DeepSeek 官方 API 文档《Tool Calls》,原文 “The execution flow of this example is as follows: User: Asks about the current weather in Hangzhou / Model: Returns the function get_weather({location: 'Hangzhou'}) / User: Calls the function get_weather({location: 'Hangzhou'}) and provides the result to the model / Model: Returns in natural language, 'The current temperature in Hangzhou is 24°C.'” 与 “Note: In the above code, the functionality of the get_weather function needs to be provided by the user. The model itself does not execute specific functions.”,https://api-docs.deepseek.com/guides/tool_calls,核实日期 2026-10-05。

· “模型回一段结构化调用、外面的程序执行、再把结果发回去”,以及客户端工具与服务端工具的分法:Anthropic 官方文档《Tool use with Claude》,原文 “Tool use (also called function calling) lets Claude call functions that you define or that Anthropic provides. Claude determines when to call a tool based on the user's request and the tool's description. It then returns a structured call that your application executes (client tools) or that Anthropic executes (server tools).”,https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview,核实日期 2026-10-05。

· “边想边做、让模型去查维基百科接口、在动手指令上成功率分别高出 34% 和 10%”:论文《ReAct: Synergizing Reasoning and Acting in Language Models》(Yao 等,arXiv:2210.03629,2022-10-06 提交,ICLR 2023),原文 “on question answering (HotpotQA) and fact verification (Fever), ReAct overcomes issues of hallucination and error propagation prevalent in chain-of-thought reasoning by interacting with a simple Wikipedia API” 与 “On two interactive decision making benchmarks (ALFWorld and WebShop), ReAct outperforms imitation and reinforcement learning methods by an absolute success rate of 34% and 10% respectively, while being prompted with only one or two in-context examples.”,https://arxiv.org/abs/2210.03629,核实日期 2026-10-05。

· “模型自己学会调哪个工具、什么时候调、传什么参数,只给几个示范就够”:论文《Toolformer: Language Models Can Teach Themselves to Use Tools》(Schick 等,arXiv:2302.04761,2023-02-09 提交),原文 “we show that LMs can teach themselves to use external tools via simple APIs and achieve the best of both worlds. We introduce Toolformer, a model trained to decide which APIs to call, when to call them, what arguments to pass, and how to best incorporate the results into future token prediction. This is done in a self-supervised way, requiring nothing more than a handful of demonstrations for each API.” 与 “We incorporate a range of tools, including a calculator, a Q&A system, two different search engines, a translation system, and a calendar.”,https://arxiv.org/abs/2302.04761,核实日期 2026-10-05。

· “写 API 调用超过 GPT-4、顶尖模型也会把参数写错或凭空编用法”:论文《Gorilla: Large Language Model Connected with Massive APIs》(Patil 等,arXiv:2305.15334,2023-05-24 提交),原文 “However, their potential to effectively use tools via API calls remains unfulfilled. This is a challenging task even for today's state-of-the-art LLMs such as GPT-4, largely due to their inability to generate accurate input arguments and their tendency to hallucinate the wrong usage of an API call. We release Gorilla, a finetuned LLaMA-based model, that surpasses the performance of GPT-4 on writing API calls.” 与 “When combined with a document retriever, Gorilla demonstrates a strong capability to adapt to test-time document changes”,https://arxiv.org/abs/2305.15334,核实日期 2026-10-05。

· “工具调用已经单独有了排行榜”:Berkeley Function Calling Leaderboard(BFCL V4,Gorilla LLM Team,配套论文见 ICML 2025,页面最后更新 2026-04-12),https://gorilla.cs.berkeley.edu/leaderboard.html,核实日期 2026-10-05。

· 本人说法的边界:本机是 i5-10400F、16G 内存、AMD Radeon R5 220。我没有训练过模型,也没写过任何一家模型的训练代码;上面这些数字全部取自官方文档与论文原文,属于查资料求证,不是我的实测。第七节里我自己的用法,还有那条“先问一句”的线,是我的实情。

AI 技术更新快,具体以各家官方最新公布为准。本文是老刘的普通学习笔记,不构成推荐建议。

相关学习资料