乐于分享
好东西不私藏

扫盲之后,AI才真正开始为你所用:AI工具科普扫盲课回顾

扫盲之后,AI才真正开始为你所用:AI工具科普扫盲课回顾

7月10日晚,花猫社区「AI工具科普扫盲课」如期开讲。

这次我们不炫技术,只用一晚上时间,把那些大家在各种文章和视频里经常听到、但一直没搞明白的词——大语言模型、提示词、上下文、Agent、RAG、MCP、Skill、Vibe Coding——拆开揉碎讲了一遍。

以下是本场活动的完整回顾,约5000字,阅读时间约15分钟。没来现场的朋友可以跟着走一遍,内容比较干,建议收藏慢慢看。

01 / WHAT IS LLM

大语言模型到底是什么?

先问一个问题:ChatGPT、Claude、Gemini、DeepSeek、豆包、Kimi、通义千问……这些你都认识吗?

如果你都能认出来,恭喜,你已经比大多数人强了。但我们今天不聊名字,聊它们底层的本质。

大语言模型的本质,就是把人类所有的文字资料吃进去,总结出规律:某一段文字后面,大概率会出现哪些字、哪些词。然后根据你给它的输入,把这些字一个一个「蒙」出来。

举个例子。你在微信里打「AI花猫社区」,它大概率能猜出你下一句想说什么——因为模型见过足够多的中文语料,知道这几个词后面通常接什么内容。它就是用各种算法算出来的,算概率。

那「大」在哪里?

量变引发质变。当数据量足够大、规律足够多的时候,传统语言模型就变成了「大」语言模型。在英语里,为了区分传统的、很笨的语言模型和这种新的、能力更强的模型,就在「Language Model」前面加了一个「Large」——大语言模型。

GPT-3.5是第一个让大家真正感受到这种质变的产品。

02 / PROMPT & CONTEXT

提示词、上下文、记忆系统,其实是一回事

大语言模型最开始只能做单轮对话——你问一句,它答一句。

比如你问:「团建经费只有10块钱,年底前必须花完,请给我一个天津一日游方案。」你发给大模型的内容,就是提示词(Prompt)

但如果你想让它理解得更清楚,可以把问题拆开:

背景:今年团建经费只有10块钱,年底前必须花完。

问题:请给我一个天津一日游方案。

上面的背景信息,就叫上下文(Context)。提示词+上下文,共同构成了模型的输入。

后来为了能连续对话,技术实现上就是把每一次的问答都存下来,下次一起发给模型。所谓的「记忆系统(Memory)」就是这个——本质还是上下文那一套。模型本身没有真正的「记忆」,它只是把你们之前聊过的内容又重新读了一遍而已。

各种营销号天天说的「记忆系统」,听起来高大上,其实就这个意思。

理解了这个,你就已经明白大模型对话最底层的逻辑了。

03 / FROM CHATBOT TO AGENT

从Chatbot到Agent:让AI不再只是「聊天」

上面说的所有模式,都是人问→模型答,一轮对话就结束了。

但如果你想让AI做更复杂的事情,比如:「帮我整理一下今天最劲爆的新闻。」

问题来了——大模型的知识是有截止时间的。比如GPT-3.5的知识截止到2023年,它不知道「今天」发生了什么。你问它今天的新闻,它会胡说八道,这就是所谓的「幻觉」。

那怎么办?给它加一个工具。你写一段程序,专门去网上抓取当天的实时新闻。然后你把这段程序和你的大模型对接起来。流程变成了:

人提出任务→大模型理解任务→调用程序抓取实时信息→把抓取到的信息作为上下文返回给大模型→大模型整理后回答用户。

大语言模型+可以调用外部工具的程序=Agent(智能体)。

这就是Agent的本质。不是多高级的东西,就是大模型加了一段程序。那下面几个经常听到的词,也就好理解了:

— RAG(检索增强生成)

上面说的是「网上的信息」。那如果信息不在网上,在你的电脑本地呢?比如一份会议录音、一份PDF文件、一份Excel报表?同样可以用一段程序连接到你的电脑本地文件,把里面的内容提取出来,作为上下文喂给大模型。这个技术就叫RAG。

— Web Search

抓取网上实时信息的功能,其实就是RAG对应在「线上」的那一面。一个抓本地,一个抓网络。你会发现,Web Search和RAG本质上是一回事——把外部信息变成大模型的上下文。只不过为了让营销号有东西可写,给它起了不同的名字而已。

— Function Calling

你可能还听过这个词。上面提到的「写一段程序」,在技术实现上有一个关键问题:大模型的输出是不可控的。你让它把PDF转成Markdown,它可能给你输出俄语。而程序是机械的——你给程序传参数,格式必须精确。大模型输出格式不对,程序就没法工作。于是你就要求大模型按照固定格式输出,比如JSON格式。这个格式化的过程,在技术圈被称为Function Calling。听起来高级,本质就是「让AI按固定格式说话」。

04 / SKILL & MCP

Skill和MCP:让AI更稳定地干活

有了Agent之后,大家发现类似的需求越来越多——有人要转PDF、有人要转Word、有人要生成PPT。每次都要重新写程序、重新做对接,效率很低。于是有了两个重要的概念:

— Skill=程序+说明文档

说明文档里写清楚:这个程序是干什么用的、什么时候应该调用、调用时需要传哪些参数。大模型每次执行任务前,会先读一下这个说明书,然后判断「这个任务是不是该用这个程序」。就像你给一个助理布置任务:你告诉ta——「每当我开会时,杯子里没水了,你就帮我倒水。」这里,「倒水」这个动作是程序,「每当有人开会且杯子里没水」这个触发条件是说明书。程序和说明书合在一起,就是一个完整的Skill。

— MCP=标准化接口协议

最近大家可能经常听到MCP这个词,也被炒得很热。它就像电灯泡——不管是什么牌子的灯泡,只要螺口是E27的,就能拧进任何E27的灯座。MCP就是大模型和外部工具之间的「标准螺口」。它规定了「程序应该长什么样、大模型应该怎么调用它」,只要双方都遵守这个标准,就能直接对接,不需要每换一个工具就重新写一遍代码。

用最简单的比喻:Skill=一个助理+一份工作说明(告诉助理什么场景下该做什么);MCP=一把万能钥匙,可以打开所有装了统一锁芯的门,让你不用为每一扇门单独配钥匙。

所以你在社交媒体上看到的各种炫酷效果——有人用AI控制电脑、有人用AI自动做PPT、有人用AI发邮件——背后的原理都是这套组合:大模型理解任务→通过MCP协议调用对应的Skill→Skill执行具体动作→结果返回给大模型→大模型整理后输出给用户。Skill决定「能做什么」,MCP决定「怎么对接」。这就是最近很火的OpenClaw、WorkBuddy这类产品的本质——它们就是把大语言模型和各种Skill、各种MCP接口打包在一起的产品。

05 / WORKFLOW & LOOP

Workflow、Subagent、Loop……一个例子讲清楚

先把前面所有概念串起来,用一个场景走一遍:假设你想写一个微信小程序,让员工进公司自动打卡。

第一步,大语言模型:你告诉大模型你的想法,它理解你的需求。

第二步,提示词+上下文:你给它背景「我们是50人的公司,有门禁系统」,再给它问题「帮我设计打卡方案」。背景是上下文,问题是提示词。

第三步,Agent:大模型需要知道「如何实现GPS围栏」,于是调用程序去查资料,这就是Agent的工作。

第四步,RAG:大模型读取你上传的公司平面图、门禁位置图,这些本地文件通过RAG技术变成上下文。

第五步,Function Calling:大模型把「生成需求文档」的请求,按固定格式传给程序。

这时候你会发现,大模型自己没法一步到位写出完整的小程序。它需要把大任务拆成小任务——先写需求文档,再写前端代码,再写后端逻辑,再测试。于是有了后面几个概念:

— Subagent(子智能体)

把「写打卡小程序」这个大任务拆成几个小任务,每个小任务交给一个专门的子Agent去处理,再把结果汇总。本质是任务的拆分与并行

— Workflow(工作流)

如果用可视化工具(比如字节跳动的扣子),你可以把「需求分析→代码生成→测试→部署」这几个节点拖拽连接起来,形成一个自动化的流程。这就是Workflow。

— Loop

前段时间很火的概念,被说成「AI的下一个时代」。其实它就是一个定时任务+触发条件——「一旦员工进入GPS围栏,自动触发打卡程序」。就是一个带触发器的自动化程序,仅此而已。

你会发现,所有概念都在解决同一个问题:如何让AI更稳定、更自动化地完成复杂任务。名字一个比一个花哨,底层逻辑却一脉相承。

06 / WHEN AI FAILS

那些看起来离谱的AI翻车现场

概念讲完了,来看点好玩的。

博主想证明自己去过世界杯现场看球,于是用AI生成了一个视频。但因为没有给足上下文和限制条件,结果AI把博主直接生成在了球场内的教练席上,裁判在旁边跑来跑去。

于是她加了限制:「不要在替补席上看」——结果AI把画面调整到了替补席后面的看台。她又加限制:「坐在看台上,不是球员,是球迷」——最终才生成了一段相对合理的、在观众席看球的视频。

这个过程的本质是什么?和教小孩做事一模一样。你让一个小朋友去倒杯水,他可能倒回来一杯冷水,也可能是一杯热水,还可能只倒了半杯——因为他对「倒杯水」这个任务的理解还不够具体。你告诉他「倒温水、倒七分满」,他就越来越接近你的预期。

大模型也是一样。你给它的限制越多、上下文越丰富、对任务的描述越具体,它的输出就越接近你想要的答案。不是说大模型「笨」,是它需要你用它能理解的方式沟通。很多人用AI觉得不好用,不是模型不行,是你没给它足够的上下文和规则

07 / WHICH MODEL

主流模型怎么选?一次性讲清楚

国内主流模型

DeepSeek

最大的优点是性价比极高。同样做一件事,用DeepSeek花的钱可能是GPT的几分之一。编码能力不错,对中文的理解也还行。但它没有特别突出的单项,属于「啥都能干、啥都不顶尖」的类型。如果预算有限,或者要本地部署(出于安全考虑),优先选它。

豆包(字节跳动)

中文理解最强。全模态——文生图、文生视频、语音对话,什么都有。但它和Gemini一个问题:能力全面但不突出。日常中文应用拿起来就用,不需要复杂任务的时候,豆包非常顺手。

Kimi(月之暗面)

这是一个被很多人忽视的好模型。它的上下文在目前所有主流模型中是最长的——你和他聊很久,他也很少忘记你最开始说的限制条件。加上它有自己的搜索引擎,信息检索能力很强。如果你要做深度调研报告、长文档处理、跨多个资料的信息整合,Kimi是首选。

通义千问(阿里)

国产开源第一大模型,在各大排行榜上评分很高。但实际用下来,文字理解偏弱,日常对话能力比较一般。它真正擅长的是写代码——写出来的程序完整度好、bug少。

国外闭源三巨头
GPT系列(OpenAI)
综合能力最强。Agent自动化部署、代码审核、复杂推理——不管什么任务,它都能拿出第一档的表现。不知道选谁的时候就选它。但它的中文细微表达不如国产模型,上下文也比较短,处理长文档容易遗忘。而且如果你不是重度付费用户,性价比其实一般。
Claude系列(Anthropic)
这家公司本来就是做软件开发工具的,训练数据里大量的代码和软件文档。所以在代码审查、软件开发这件事上——它就是最强,没有之一。写程序、写代码、做技术方案,首选Claude。但中文理解深度一般,如果你用它做中文内容创作,效果不一定比国产模型好。
Gemini(Google)
多模态是它的标签——文生图、文生视频、语音对话,什么都能干。但也正因为什么都能干,单项能力不够突出。
有一个被很多人忽视的模型叫Grok(xAI)。它是马斯克做的,借助X平台(原推特)的海量实时数据,能抓取到网上最新的舆论动态、用户情绪、政策变化。如果你做海外市场,想抓客户情绪和市场趋势,Grok是首选。

一句话总结选型策略:

选对模型,事半功倍。千万不要听说GPT强就所有场景都用它——让GPT做长文档,它会遗忘;让Kimi写代码,不如Claude顺手。

08 / BUILD YOUR SKILL

实操:如何沉淀你自己的Skill

概念讲清楚了,模型选好了,接下来讲具体怎么用。分享会上司海成用Kimi现场演示了如何沉淀一个Skill:

第一步,收集素材:把你过去写过的日报、周报、随笔、会议纪要、工作邮件,全部归档。越多越好。

第二步,喂给AI:把这些文字材料发给大模型,让它分析你的语言风格——你喜欢用短句还是长句、喜欢用哪些高频词汇、语气的正式程度如何。

第三步,生成说明书:大模型会帮你生成一份Skill说明文档(.md格式)。里面记录了你的语言特征、写作习惯。

第四步,日常使用:以后你只需要用口语描述「今天干了啥」,AI就会自动调用这个Skill,把它转化成符合你风格的正式日报。

现场的对比演示很直观:同样一句「我今天看了一本书,没看进去,但忽然觉得人就应该多看书」——不加Skill的时候,AI会写出一段逻辑通顺但很「AI味」的文字;调用Skill之后,输出的文字短句更多、语气更自然,像真人写的。

复杂一点的Skill也是一样的逻辑。如果你想让AI帮你把Word文档自动转成Markdown格式,可以让AI帮你写一段Python程序,然后把程序+使用说明打包成一个Skill。以后每次你要做格式转换,只要告诉AI「调用那个转格式的Skill」,它就自己完成了。

核心就一句话:把你反复要做的事情,沉淀成一个AI能自动执行的模板。

09 / VIBE CODING

Vibe Coding:不会写代码,也能做小程序

这是当天实操环节最受关注的部分。分享人司海成演示了两条路径:

路径一:用Meoo(秒悟)零门槛开发

Meoo是阿里旗下的AI编程工具,最大的优势是直接打通微信小程序生态。你只需要用自然语言描述需求——比如「做一个员工上下班自动打卡的小程序」——它会和你一起细化需求:用GPS围栏还是用门禁联动?短暂离开算不算下班?多个办公地点怎么处理?你只需要做选择题。需求明确之后,它会自动帮你写代码、调试、生成预览。你只需要把微信小程序的AppID复制过去,就能一键配置、提交审核、发布上线。

我们直接现场演示了一个贪吃蛇小游戏的开发过程:第一轮,用自然语言说「帮我写一个贪吃蛇小游戏」,AI生成了一个可玩的版本。第二轮,说「每吃一个食物增加两个障碍物」,AI自动修改代码。第三轮,发现bug「蛇吃食物之后身体没有变长」,用自然语言描述bug,AI自动修复。第四轮,继续提需求「把蛇的颜色改成蓝色」,AI照做。整个过程,没有写一行代码。

路径二:用Codex的Plan+Go模式

Codex是OpenAI 开发的‌AI 编程与自动化代理工具‌,这次现场演示了Plan和Go的两种模式。

Plan模式:你给一个模糊的需求(比如「我要做一个贪吃蛇游戏」),它会用提问的方式帮你把需求细化——做成微信小程序还是抖音小程序?经典模式还是穿墙模式?要不要计分?要不要广告?你做选择题,它自动生成完整的产品需求文档。

Go模式:需求文档确认后,切换到Go模式。你告诉它「按照这份文档去开发」,然后就可以关电脑睡觉了。它会自动拆解任务、自己调用工具、自己写代码、自己调试。第二天早上起来验收就行。司海成说自己经常这么做——晚上12点给AI定个目标「帮我把这批跨境电商的产品上架」,第二天早上来看结果。

这两条路径的共同逻辑是:你在做产品经理的工作,AI在做程序员和测试工程师的工作。你负责「想清楚要什么」,AI负责「做出来」。

∞ / EPILOGUE

写在最后

从大语言模型到Agent,从RAG到Skill,从Vibe Coding到一键部署——所有看起来很高级的名词,本质上都是同一个逻辑在不同层面上的延伸:你给AI一个任务,AI帮你调用合适的工具,把它完成。

不要把AI想得太复杂,也不要把自己想得太小白。就像司海成说的:「学英语很痛苦,但AI学语言不痛苦——它只是把人类所有的文字资料吃进去,总结规律,然后替你干活。」

AI能帮你做的事情,比你想象的多。而你离「用起来」,只差一个周五晚上的距离。

下一次,来量子猫阁,带上你的问题,我们一起把它做成产品。

END
这里是【AI花猫社区
这里每周都有好玩的AI创意点在发生
长按上方二维码关注我们