乐于分享
好东西不私藏

从 Tools(工具)到 Skills(技能):AI 不是突然会干活的

从 Tools(工具)到 Skills(技能):AI 不是突然会干活的

从 Tools(工具)到 Skills(技能)

AI 不是突然会干活的

它是一步步长出手脚和方法的

最近想认真写一个三篇小连载,把 AI    这几年是怎么一步步从”会说话”走到”能干活”的,尽量用人话讲清楚。

    不讲模型算法,不讲参数竞赛,也不讲那些离普通人太远的技术细节。    我更关心的是:AI 到底是怎么一步步变成生产力的。    所以我准备分三篇写:

第一篇讲,大语言模型出来以后,为什么最先被改变的是编程;
第二篇讲,tools、agent、workflow、MCP、skill 这些东西是怎么一步步长出来的;
第三篇讲,OpenClaw 到底改变了什么,为什么它让 AI 第一次更像一个“行动主体”。

这是这个系列的第二篇。

上一篇我主要讲的是:大语言模型出来之后,为什么最早看到的生产力爆发,是发生在编程世界。

简单说,就是因为代码这件事太适合 AI 先切进去:它结构化、可验证、能执行、能快速拿反馈。但如果你继续往后看,就会发现,只会写代码还不够。

AI 想真的进入现实工作,光会回答、会生成、会给建议是不够的,它得有手脚、有方法、有流程、能识别任务、还能接入真实系统。

所以这一篇,我想讲的是:

Tools(工具)、Agent(智能体)、Workflow(工作流)、MCP(面向模型的上下文协议)、Skill(技能)这些词,到底是怎么一步步长出来的。

如果说大语言模型解决的是“AI 终于能听懂人话了”,

那接下来所有技术和产品形态的演化,基本都在解决另一个问题:

AI 听懂之后,怎么真正开始做事?
这其实是一个比“会不会说”更难的问题。

因为“说”是单步的,

“做”通常是多步的。

“说”停留在文本里,

“做”要进入现实系统。

“说”更多靠模型本身,

“做”则需要模型之外的一整套结构。

所以随着 AI 越来越深入生产场景,大家开始把“让它干活”这件事拆解得越来越细。

于是你就看见了一大堆新词:

  • Prompt(提示词)
  • RAG(检索增强生成)
  • Memory(记忆)
  • Tools(工具)
  • Function Calling(函数调用)
  • MCP(面向模型的上下文协议)
  • Agent(智能体)
  • Workflow(工作流)
  • Intent Recognition(意图识别)
  • Multi-modal(多模态)
  • Skills(技能)
  • Multi-agent(多智能体)

很多人看到这里会头大。

但如果换一种角度,你会发现这些东西其实不是黑话,而是 AI 从“单步输出”走向“多步执行”过程中,一层一层长出来的结构。

先从最早的说起。
最早大家最在意的是 Prompt(提示词)。

也就是你怎么对模型说话,怎么描述任务,怎么限定格式,怎么给上下文。

因为那时候模型虽然已经很强了,但输出并不稳定。你换一种说法,它可能就给你完全不同的结果。于是很多人开始研究提示词怎么写、上下文怎么给、步骤怎么拆、语气怎么引导。这件事当然有用,但如果说实话,我一直不太觉得“Prompt Engineering(提示词工程)”是什么真正意义上的技术突破。它更像一个过渡期技巧。

本质上是在模型还不够稳的时候,人类用语言技巧去驯化它、哄它、引导它。它有现实价值,但很难说有多少长期技术价值。所以在我看来,提示词工程更像 AI 早期的手工艺,而不是 AI 未来的工业基础。

接下来,大家很快又发现另一个问题:

模型虽然很会说,但它并不知道你手里的资料,不知道你私有知识库里有什么,也不知道你这段时间具体在做什么。

于是就有了 RAG(检索增强生成) 和 Memory(记忆)

RAG 解决的是“模型知识不够新、不够专、不够私有”的问题。

简单说,就是先帮 AI 检索资料,再让它基于这些资料来回答。

这样它就不只是基于训练时学到的那些通识,而是开始接触具体信息。

Memory(记忆)则更进一步。

它让系统不至于每次都从零开始,而是能在一个更长的时间线上保留上下文,记住之前发生过什么、你偏好什么、事情做到哪一步了。

到这里,AI 已经不只是会说,它开始能接入资料和上下文。

但它依然还有一个很大的问题:

它还是不能动。

这就是为什么 Tools(工具) 会变得越来越重要。

Tool(工具)本质上就是给 AI 接外部能力。

比如读文件、写文件、搜网页、发消息、查数据库、执行命令、操作浏览器、获取系统状态。

这一步非常关键。

因为从这里开始,AI 不再只是一个活在文字世界里的解释器,

它开始有机会真的接入现实系统。

你可以把它理解成:

一个原本很聪明、很会说话的人,终于长出了手和脚。

没有 Tool(工具),再强的模型也主要只是顾问;

有了 Tool(工具),它才开始有机会成为执行者。

但问题也很快来了。

工具一多,系统反而容易乱。

工具定义不清,模型就会误用;

接口不一致,系统就会混乱;

边界不清楚,调用就会失控。

于是大家开始探索更规范的工具调用方式。

这时候就出现了 Function Calling(函数调用),后来进一步发展出像 MCP(面向模型的上下文协议) 这样的东西。

你可以不用把 MCP 理解成多么神秘的概念。

如果用最容易懂的话来说,它更像是一种 更适合 AI 去理解、发现和调用能力的接口组织方式

它的价值不只是封装,而是把原来零散、模糊、难以统一的工具层,变成了更像标准件的能力层。

以前是“给 AI 一堆工具,看它能不能用明白”;

后来慢慢变成“给 AI 一套更像工业标准的能力接口”。

这一步特别重要。

因为它意味着 AI 不再只是在试验状态下碰运气调用工具,而是开始向工程化的调用能力靠近。

再往后,当工具、上下文、资料慢慢都有了之后,AI 又往前迈了一步。

这时候,Agent(智能体)、Workflow(工作流)、Intent Recognition(意图识别) 这些词就开始密集出现了。

它们虽然名字不同,但本质上都在解决同一类问题:
如果 AI 不只是回答,而是真的要做事,那它该怎么组织自己?
先说 Intent Recognition(意图识别)

这是最容易被低估的一层。

因为人说出来的话,不等于真正的任务。

一句“帮我看一下这个文档”,可能是要你总结,也可能是要你润色,也可能是让你判断能不能发客户。

如果系统一开始理解错了,后面调用再多工具也没用。

所以意图识别做的,其实是入口分流。

它在判断:

  • 用户是在问问题,还是在下任务
  • 是要解释,还是要执行
  • 是闲聊,还是要一个可交付结果
  • 是一般请求,还是有风险边界的操作
然后是 Workflow(工作流)

当任务不再是单步完成,而是需要查、读、写、改、执行、反馈、再修正的时候,工作流就自然出现了。

这个词听起来很专业,但说白了就是一件事:
把一件事拆成多步,并且把这些步骤串起来。
最后是 Agent(智能体)

如果说 Tool(工具)是零件,Workflow(工作流)是链路,

那 Agent(智能体)更像一个围绕目标调度这些能力的执行体。

它不只是回答你,而是会判断下一步该不该调用工具、要不要继续执行、是否需要确认、要不要根据结果回头修正。

到了这里,AI 已经不像单纯的聊天对象了。

它开始像一个能组织任务的东西。

不过,即使到了这个阶段,AI 依然大多还是在“临场做事”。

它可以调用工具、可以跑流程、可以根据反馈调整,但很多时候还是很依赖当下的上下文。

能跑起来,不代表能复用;

能完成一次,不代表能沉淀成稳定的方法。

所以接下来,才会有真正很重要的一步:Skill(技能)
我一直觉得,Skill(技能)的出现,是这一轮 AI 演化里特别关键的节点。

如果 Tool(工具)是工具,

那 Skill(技能)就是经验封装。

如果 Tool(工具)是扳手,

那 Skill(技能)更像一套成熟的维修方案。

它不是在告诉 AI “你手里有哪些能力”,

而是在更高一层告诉它:

  • 什么情况下该进入这个场景
  • 进入之后按什么顺序做
  • 要用哪些工具
  • 要遵守什么风格和约束
  • 最终结果应该长什么样
也就是说,Skill(技能)不是单点能力,而是“做事方法”的沉淀。

而它真正带来质变的一点在于:

它可以开始用自然语言、真正的人话来编写。

这件事特别重要。

以前你想把经验固化下来,往往要写程序、写脚本、写规则引擎。

现在很多经验、方法、流程,开始可以直接被用自然语言描述出来,并参与系统运行。

当然,这里也有边界。

自然语言写出来的 Skill(技能),稳定性和确定性肯定没法和传统程序相比。

它不是严密语法,也不是绝对可预测的逻辑。

但它换来了另一个巨大的价值:
经验封装的门槛大幅下降了。

过去只有程序员能写规则。

现在很多业务方法、内容方法、操作方法,也开始能被整理成 Skill(技能),保存下来、复用起来、组合起来。

这意味着 AI 开始不只是“会用工具”,

而是“会沿着一种方法做事”。

从 Prompt(提示词)到 RAG(检索增强生成),从 Memory(记忆)到 Tools(工具),从 MCP(面向模型的上下文协议)到 Agent(智能体)、Workflow工作流

),再到 Skill(技能),

你其实能看见一条很清楚的进化链:

AI 不是突然会干活的,它是一步步长出了信息来源、上下文、手脚、接口、任务分流、执行链路和方法沉淀。
而当这些东西慢慢都具备之后,离“行动主体”其实就只差最后一层了:

如果一个系统不仅能理解、能规划、能调用、能执行,

还能在真实环境里把这些动作跑起来,并且把经验继续沉淀和复用,那会发生什么?

下一篇,也就是这个系列的最后一篇,我想讲的就是这个问题:
OpenClaw 到底改变了什么?为什么它会让很多人第一次真正感觉到,AI 不只是聊天,它真的开始行动了。

END

本站文章均为手工撰写未经允许谢绝转载:夜雨聆风 » 从 Tools(工具)到 Skills(技能):AI 不是突然会干活的

猜你喜欢

  • 暂无文章