从 Tools(工具)到 Skills(技能):AI 不是突然会干活的

从 Tools(工具)到 Skills(技能)
AI 不是突然会干活的
它是一步步长出手脚和方法的


最近想认真写一个三篇小连载,把 AI 这几年是怎么一步步从”会说话”走到”能干活”的,尽量用人话讲清楚。
不讲模型算法,不讲参数竞赛,也不讲那些离普通人太远的技术细节。 我更关心的是:AI 到底是怎么一步步变成生产力的。 所以我准备分三篇写:




这是这个系列的第二篇。
上一篇我主要讲的是:大语言模型出来之后,为什么最早看到的生产力爆发,是发生在编程世界。
简单说,就是因为代码这件事太适合 AI 先切进去:它结构化、可验证、能执行、能快速拿反馈。但如果你继续往后看,就会发现,只会写代码还不够。
AI 想真的进入现实工作,光会回答、会生成、会给建议是不够的,它得有手脚、有方法、有流程、能识别任务、还能接入真实系统。
所以这一篇,我想讲的是:
Tools(工具)、Agent(智能体)、Workflow(工作流)、MCP(面向模型的上下文协议)、Skill(技能)这些词,到底是怎么一步步长出来的。
如果说大语言模型解决的是“AI 终于能听懂人话了”,
那接下来所有技术和产品形态的演化,基本都在解决另一个问题:
因为“说”是单步的,
“做”通常是多步的。
“说”停留在文本里,
“做”要进入现实系统。
“说”更多靠模型本身,
“做”则需要模型之外的一整套结构。
所以随着 AI 越来越深入生产场景,大家开始把“让它干活”这件事拆解得越来越细。
于是你就看见了一大堆新词:
-
Prompt(提示词) -
RAG(检索增强生成) -
Memory(记忆) -
Tools(工具) -
Function Calling(函数调用) -
MCP(面向模型的上下文协议) -
Agent(智能体) -
Workflow(工作流) -
Intent Recognition(意图识别) -
Multi-modal(多模态) -
Skills(技能) -
Multi-agent(多智能体)
很多人看到这里会头大。
但如果换一种角度,你会发现这些东西其实不是黑话,而是 AI 从“单步输出”走向“多步执行”过程中,一层一层长出来的结构。
也就是你怎么对模型说话,怎么描述任务,怎么限定格式,怎么给上下文。
因为那时候模型虽然已经很强了,但输出并不稳定。你换一种说法,它可能就给你完全不同的结果。于是很多人开始研究提示词怎么写、上下文怎么给、步骤怎么拆、语气怎么引导。这件事当然有用,但如果说实话,我一直不太觉得“Prompt Engineering(提示词工程)”是什么真正意义上的技术突破。它更像一个过渡期技巧。
本质上是在模型还不够稳的时候,人类用语言技巧去驯化它、哄它、引导它。它有现实价值,但很难说有多少长期技术价值。所以在我看来,提示词工程更像 AI 早期的手工艺,而不是 AI 未来的工业基础。
接下来,大家很快又发现另一个问题:
模型虽然很会说,但它并不知道你手里的资料,不知道你私有知识库里有什么,也不知道你这段时间具体在做什么。
RAG 解决的是“模型知识不够新、不够专、不够私有”的问题。
简单说,就是先帮 AI 检索资料,再让它基于这些资料来回答。
这样它就不只是基于训练时学到的那些通识,而是开始接触具体信息。
Memory(记忆)则更进一步。
它让系统不至于每次都从零开始,而是能在一个更长的时间线上保留上下文,记住之前发生过什么、你偏好什么、事情做到哪一步了。
到这里,AI 已经不只是会说,它开始能接入资料和上下文。
但它依然还有一个很大的问题:
它还是不能动。
Tool(工具)本质上就是给 AI 接外部能力。
比如读文件、写文件、搜网页、发消息、查数据库、执行命令、操作浏览器、获取系统状态。
这一步非常关键。
因为从这里开始,AI 不再只是一个活在文字世界里的解释器,
它开始有机会真的接入现实系统。
你可以把它理解成:
一个原本很聪明、很会说话的人,终于长出了手和脚。
没有 Tool(工具),再强的模型也主要只是顾问;
有了 Tool(工具),它才开始有机会成为执行者。
但问题也很快来了。
工具一多,系统反而容易乱。
工具定义不清,模型就会误用;
接口不一致,系统就会混乱;
边界不清楚,调用就会失控。
于是大家开始探索更规范的工具调用方式。
这时候就出现了 Function Calling(函数调用),后来进一步发展出像 MCP(面向模型的上下文协议) 这样的东西。
你可以不用把 MCP 理解成多么神秘的概念。
如果用最容易懂的话来说,它更像是一种 更适合 AI 去理解、发现和调用能力的接口组织方式。
它的价值不只是封装,而是把原来零散、模糊、难以统一的工具层,变成了更像标准件的能力层。
以前是“给 AI 一堆工具,看它能不能用明白”;
后来慢慢变成“给 AI 一套更像工业标准的能力接口”。
这一步特别重要。
因为它意味着 AI 不再只是在试验状态下碰运气调用工具,而是开始向工程化的调用能力靠近。
再往后,当工具、上下文、资料慢慢都有了之后,AI 又往前迈了一步。
这时候,Agent(智能体)、Workflow(工作流)、Intent Recognition(意图识别) 这些词就开始密集出现了。
这是最容易被低估的一层。
因为人说出来的话,不等于真正的任务。
一句“帮我看一下这个文档”,可能是要你总结,也可能是要你润色,也可能是让你判断能不能发客户。
如果系统一开始理解错了,后面调用再多工具也没用。
所以意图识别做的,其实是入口分流。
它在判断:
-
用户是在问问题,还是在下任务 -
是要解释,还是要执行 -
是闲聊,还是要一个可交付结果 -
是一般请求,还是有风险边界的操作
当任务不再是单步完成,而是需要查、读、写、改、执行、反馈、再修正的时候,工作流就自然出现了。
如果说 Tool(工具)是零件,Workflow(工作流)是链路,
那 Agent(智能体)更像一个围绕目标调度这些能力的执行体。
它不只是回答你,而是会判断下一步该不该调用工具、要不要继续执行、是否需要确认、要不要根据结果回头修正。
到了这里,AI 已经不像单纯的聊天对象了。
它开始像一个能组织任务的东西。
不过,即使到了这个阶段,AI 依然大多还是在“临场做事”。
它可以调用工具、可以跑流程、可以根据反馈调整,但很多时候还是很依赖当下的上下文。
能跑起来,不代表能复用;
能完成一次,不代表能沉淀成稳定的方法。
如果 Tool(工具)是工具,
那 Skill(技能)就是经验封装。
如果 Tool(工具)是扳手,
那 Skill(技能)更像一套成熟的维修方案。
它不是在告诉 AI “你手里有哪些能力”,
而是在更高一层告诉它:
-
什么情况下该进入这个场景 -
进入之后按什么顺序做 -
要用哪些工具 -
要遵守什么风格和约束 -
最终结果应该长什么样
而它真正带来质变的一点在于:
它可以开始用自然语言、真正的人话来编写。
以前你想把经验固化下来,往往要写程序、写脚本、写规则引擎。
现在很多经验、方法、流程,开始可以直接被用自然语言描述出来,并参与系统运行。
当然,这里也有边界。
自然语言写出来的 Skill(技能),稳定性和确定性肯定没法和传统程序相比。
它不是严密语法,也不是绝对可预测的逻辑。
过去只有程序员能写规则。
现在很多业务方法、内容方法、操作方法,也开始能被整理成 Skill(技能),保存下来、复用起来、组合起来。
这意味着 AI 开始不只是“会用工具”,
而是“会沿着一种方法做事”。
从 Prompt(提示词)到 RAG(检索增强生成),从 Memory(记忆)到 Tools(工具),从 MCP(面向模型的上下文协议)到 Agent(智能体)、Workflow(工作流
),再到 Skill(技能),
你其实能看见一条很清楚的进化链:
如果一个系统不仅能理解、能规划、能调用、能执行,
还能在真实环境里把这些动作跑起来,并且把经验继续沉淀和复用,那会发生什么?

END
夜雨聆风