乐于分享
好东西不私藏

MCP 是 USB,Skill 是 App,Memory 是云盘:一个 AI 助手真正的「操作系统」长什么样

MCP 是 USB,Skill 是 App,Memory 是云盘:一个 AI 助手真正的「操作系统」长什么样

你花几千块升级显卡,充值顶配会员,以为这就买到了最聪明的AI。

错了。

你每天用的那个AI助手,最值钱的能力,跟你那块显卡半毛钱关系都没有。

我最近一直在折腾一个叫 WorkBuddy 的AI助手,越玩越觉得,有意思的压根不是它肚子里的模型有多大。真正让它像个活人一样,是另一套功夫。

它每次开口前,都悄悄干了一件事。

把对的信息,在对的时刻,喂给模型。

这事听着简单,做起来要命。模型是傻的,它不会自己挑信息,得有人,或者有一套系统,替它想好这一刻该看什么、不该看什么。干这活的,就是上下文工程。

行内管这叫上下文工程(Context Engineering)。今天我想跟你拆开一个真实Agent的肚子,看看它到底是怎么拼起来的。

你肯定遇到过这种事。

前一秒你跟AI助手说,我不吃香菜,我对芒果过敏。后一秒你让它帮你点份外卖,它给你推荐了香菜芒果沙拉。

你当场就???

不是它坏,是它压根没记住你。每一次对话,对它来说都是一张白纸。你烦不烦。

我以前也以为,这是因为模型不够聪明。后来才搞明白,聪明不聪明是一回事,记不记得住是另一回事。而记不记得住,才是一个AI助手像不像人的分水岭。

你想想看,真人之间为啥能越聊越深。不是因为你多聪明,是因为你们共享了一段历史。AI要是每次都从零开始,你们永远是一对陌生人。

先说个特别形象的比方。

Karpathy,就是那个把深度学习带火的大佬,他说过一句我特别服的话。

上下文工程,是一门精致的艺术和科学,它为下一步,往上下文窗口里,填上刚好对的信息。

他把整个LLM比作一台电脑。模型是CPU,上下文窗口是内存(RAM)。你也知道,内存就那么大,装不下所有东西,所以操作系统得聪明地决定,这一刻把哪些数据搬进内存。

上下文工程,干的就是操作系统那个活。

模型再强,你往它脑子里塞一堆没用的东西,它也懵。模型再普通,你每次都恰好把最关键的那几行喂给它,它也能超常发挥。

所以才有了那句狠话。

模型决定下限,上下文决定上限。

你可能会想,那我往模型里塞越多资料,不就越好。

恰恰相反。

Anthropic那帮人早就发现一个反直觉的事,上下文越长,模型反而越容易犯晕。因为模型看字和字之间的关系,是平方级增长的,资料一多,它找重点找着找着就找丢了。这毛病圈内叫上下文腐烂。

所以上下文工程的真理不是往里加,是往里减。用最少的字,装最对的信息。

这也是为啥你用的AI,有时候灵得不行,有时候蠢得想笑。不是它模型变了,是那一次,上下文工程刚好没做对。

好,那上下文窗口这个有限的内存里,到底都装了些啥。

我把它拆成三块拼图,你一听就懂。

第一块,Skill,技能。

你手机上是不是装了一堆App。微信、地图、备忘录、修图软件。平时它们乖乖躺在桌面上,你点一下才打开,不点它就不占你脑子。

Skill就是AI助手里的App。

比如我在 WorkBuddy 里写文章,它有一套叫 khazix-writer 的写作技能。平时它不吭声,一旦我让它写稿子,这套技能啪一下就被唤醒,把写作的章法、格式、金句套路全塞进上下文。

Anthropic自己给Skill下过定义,说它是模块化的能力,每个Skill打包了指令、说明,还有可选的脚本和模板,模型在相关的时候会自动用起来。

关键在这四个字,自动用。

你不用每次都跟它说,请用写作技能。它自己认得出来。

这听着不起眼,其实是质变。以前你要用个功能,得先翻菜单、点进去、再操作。现在它看你一句话的语气,就晓得该请哪位专家出马。你甚至感觉不到它在调技能,只觉得它懂你。

这就跟你手机一样,你点外卖,它不会先弹个对话框问你要不要用美团,它直接就开了。

这里头有个特聪明的地方。你手机App装多了会卡,因为都占内存。Skill偏不。它的说明书平时只在系统里留个名字,真用到才把正文读进来,连脚本都不占上下文,只把跑出来的结果给你。所以它能装成百上千个技能,也不拖累模型。

我这个助手里,不光有写作技能。要配图了,它有专门生图的技能。要查股票,它有金融数据的技能。每个技能都是个独立的小App,平时睡着,用的时候醒。

你不需要知道它背后挂了多少技能,你只管提需求,剩下的它自己调度。

第二块,MCP,模型上下文协议。

这个名字听着吓人,我换个说法你就懂了。

它是AI世界里的USB口。

你回想一下USB出现之前有多痛苦。打印机一种接口,鼠标一种接口,相机又一种,每台设备一根专属线,插错就废。USB一出,世界清净了,一个口通吃。

MCP干的就是这个。

在MCP之前,AI想连你的网盘、你的文档、你的代码仓库,每连一个就得专门写一套对接代码。Anthropic自己都承认,每个新数据源都要定制实现,搞得真正连通的系统很难规模化。

MCP一出,统一成一个协议。AI助手后面挂了一排USB口,百度网盘插一个,飞书插一个,腾讯文档插一个,GitHub插一个。要用哪个,插上就行,不用再造一根专属线。你根本不用懂技术,点一下连接器,你的网盘就进去了,模型下一句就能引用里面的文件。

Anthropic在2024年11月把这个协议开源了,那帮人当初就是想解决连接问题,让前沿模型能拿到更好更相关的数据。开源第一天,它就顺手给了好几个现成的口,Google Drive、Slack、GitHub、Git、Postgres、Puppeteer,连上就能用。

这协议最狠的,不是方便,是它让整个生态活了。以前每家AI厂商各搞各的接口,百度网盘的对接代码跟腾讯文档的没法通用。现在大家都认MCP这一个口,网盘厂商写一次,所有助手都能用。你今天给WorkBuddy插上百度网盘,明天换个别的助手,还是这个口,不用重来。

第三块,Memory,记忆。

这个最扎心。

大模型本身是个健忘症患者。每一次会话都是独立的,它不记得你上次会话说了啥,更别说上星期的。上下文窗口一满,它就忘。

所以一个没有记忆的Agent,每次聊天都像初次见面。你烦不烦。

Memory就是给AI配一块云盘。

学术点说,分短期记忆和长期记忆。短期记忆管当前这轮会话,比如你刚说的三句话。长期记忆管跨会话的,比如你爱用红色标注重点,比如你这个项目用的是Python不是Java。

在 WorkBuddy 里,这个云盘还分了好几层。有一层是跟着你这个人走的,你所有项目它都记得你的习惯。有一层是跟着单个项目走的,这个项目的技术栈、约定、踩过的坑,它记在一个专门的本子里。还有一层更玄,是服务器那头自动生成的你的画像,每次开聊悄悄塞进上下文。比如你跟它说过你不爱看长文,它记下了,下次默认给你短版。你没重新说一遍,它却已经懂了。

AWS那帮人写过一篇长文讲Agent记忆,一句话特到位,没有记忆的Agent,每次对话都是初次见面。

学界现在为这事疯了。Mem0把记忆拆成工作、事实、情景、语义好几层,Letta干脆借了操作系统的虚拟内存思路,对话框满了就自动压成摘要归档。说到底,大家都在解同一道题,怎么让AI既记得住,又不撑爆脑子。

还有个更骚的,记忆本身现在也能当成USB口来用。AWS那边把记忆封装成一个工具,模型聊到一半,觉得该回忆点啥,就自己插上记忆这个口,把过去的偏好捞出来。到这会儿,记忆和连接就合流了,都是同一个套路,把外面的东西按需搬进脑子。

三块拼图摆在这了。

Skill是预装的App,MCP是通用的USB口,Memory是跨会话的云盘。

那谁来决定,这一刻该开哪个App,插哪个口,翻云盘里哪段记忆。

上下文工程。

它就是那个调度长。

你给它一句话,它背后已经跑了一整套判断。该回忆什么,该唤醒哪个技能,该插哪个口拉数据,哪些信息这轮用不上得先挪出去。这套判断每秒都在发生,你看得见的就是它回你的那句话,看不见的,是底下那套上下文工程在飞快运转。

AWS的说法我很喜欢,记忆是信息仓库,上下文工程是智能调度员,它决定从仓库里捞哪些信息,怎么组织,再喂给模型。

Anthropic那边更狠,说好的上下文工程,就是找到尽可能小的高信号信息集合,用最少的token,换最好的结果。

越少越好,越准越好。

打个比方,上下文工程就像饭店后厨的配菜师傅。模型是大厨,本事再大,你一股脑把一吨食材堆他面前,他也炒不出好菜。配菜师傅的活,是从满仓库里挑出刚好的那几样,洗好切好递到大厨手上。上下文工程,就是那个配菜师傅。

回到我开头说的 WorkBuddy。

它其实就是把这三块拼图,加上那个调度长,组装成了一个会自己管理上下文的Agent。

你给它一个任务,它先翻自己的记忆本,看这个项目以前干过啥,你这个人有啥偏好。然后它判断,这事得用哪套技能,啪,把技能唤醒。中间要查外部数据了,它走到那排USB口面前,插上对应的连接器,把数据拉进来。每一步推理前,它都把云端画像、用户记忆、项目记忆、匹配到的技能、可用的连接器,按需拼成一包,喂给模型。

最厉害的一点是,它自己还会记。

干完一件大事,它自动在记忆本里写一笔,哪天你忘了,它翻出来就能接上。这不就是AWS说的,事件触发,自动写记忆。

所以你才会觉得,它越用越懂你。

不是它变聪明了,是它把关于你的上下文,攒得越来越全,喂得越来越准。

当然,它也知道啥时候该忘。上下文窗口就那么大,一直塞会撑爆。所以干完一段,它会把不用的东西清出去,只留关键结论,就像你写长文档,写到后面把前面的草稿收进归档,桌面只留当前这页。这叫压缩。该记的记,该扔的扔,才是真懂事。

你回头看,这三块拼图加上那个调度长,其实就是把一个AI助手,从一台只会复读的机器,变成了一个有点像人的搭档。它记得你,连得通你的世界,还懂得在什么场合请什么专家。这套组合拳,行内叫Agent。而把Agent真正跑顺的,从来不是最大的模型,是这套上下文工程。

下次你再感叹某个AI好用,别先夸它模型大。先想想,它是不是默默把这三件事做对了。

聊到这,我想说点更大的。

这两年大家都在卷模型,谁的参数量大,谁的训练数据多,谁的基准测试高。

可越往下走我越觉得,模型会趋同。

今天最强的模型和半年后的最强模型,差距会越来越小。但同样一个模型,配不同的上下文工程,出来的东西能差出十条街。

我拿同一个模型试过,上下文喂得乱七八糟时,它答非所问。同样的问题,把相关背景、历史偏好、工具结果按顺序摆好,它一下就通透了。模型没换,换的是喂法。

如果说 Prompt 是语言的编程,那么上下文工程就是系统级调度与资源管理,决定了模型能否发挥巨大的潜力。

这句话不是我说的,是圈子里早就形成的共识。

Karpathy那套CPU和内存的比方,其实点破了一件事。未来AI团队里,会多出一种人,不写模型,不训数据,就专门负责把对的信息,在对的时刻,喂给模型。

有人管这角色叫上下文设计师(Context Architect)。

我觉得这名字起得挺好。

回头看历史,你就懂这事儿有多大了。当年个人电脑也是一团乱麻,每家接口都不一样,插个鼠标都要对半天。直到USB和操作系统把标准定下来,电脑才真正普及到每家每户。上下文工程干的事一模一样,它正在给AI世界定规矩,决定信息怎么流动。谁先把这套规矩玩明白,谁的AI就先像人。

这事跟你也有关。你不用懂技术,但你得知道,挑AI助手别光看它吹模型多大,得看它记不记得你、连不连得通你的世界。这三点,才是它真聪明的证据。

所以下次再有人跟你说,我那个AI助手特别聪明,因为它用的模型特别大。

你可以笑笑,跟他说,兄弟,模型决定下限,上下文决定上限。

所以我一直觉得,以后你挑AI助手,别再问它模型多大。你就问三句话,它记不记得你,它能不能连上你的网盘和文档,它有没有一键就能用的专业技能。这三样,才是上下文工程有没有做对的标尺。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐。

顺便问一句,你平时用的AI助手,它记得你吗。还是每次都像初次见面。评论区聊聊,我看看到底有多少助手,真的把上下文工程这活干明白了。