前面五篇都在讲模型本身。这一篇往上走一层,讲最热闹的应用层——agent、MCP、skills、工具调用这些词到底是什么。
先把最想说的一句话放这儿:智能在模型里,手脚在循环里,魔法没有魔法。 你看到的所有"自主 AI",底层都是同一件事——模型看着上下文窗口里的一切,续写下一个 token;剩下的全是外面那圈胶水代码在起作用。
一、一切的前提:上下文窗口的边界
模型的视野,被死锁在本次的上下文窗口里:系统提示词 + 你的输入 + 本次已经生成的内容。窗口之外的东西,物理上不参与计算——上一次对话(已经结束、cache 蒸发了)、训练时读过的原文(已经冲成参数,不再是 token)、别人的会话(cache 严格隔离)、被截断的开头,全都不在。
这就引出模型的两种记忆,值得摆在一起看。一种是参数记忆(主要在 FFN 里):训练时冲进权重的学养,范围是训练截止前的整个互联网,读取靠乘法激发、模糊、会记错,写入极慢极贵(要重训),但几乎不忘。另一种是上下文记忆(靠 attention):窗口里的明文 token,范围只有本次几万到百万 token,读取靠 K/V 精确匹配、可以逐字引用,写入即时且免费(塞进去就行),但会话一结束就蒸发。内化的学养快而模糊,现查的资料准而易逝——现代 AI 应用的架构,本质就是在这两种知识之间做配比。

二、无状态真相:多轮对话,是每次重读全文
这是一个几乎所有人都会误解的点:模型没有跨请求的记忆。
你以为的多轮对话,是模型"记得"你前面说过什么。真相是——每一轮,客户端都把全部历史加上你的新消息打包重发,模型从头 prefill 读一遍。它不是记得,是每次重读。 KV cache 只是单次生成的草稿纸,会话结束就没了(prompt caching 是个优化例外)。
两个推论很硬。第一,对话越长,每一轮越贵,多轮成本是平方级累积的(caching 打折但不免单)——这是"按 token 计费"水面下的成本结构。第二,那些"长期记忆"产品(ChatGPT、Claude 的 memory),全都是工程外挂:把信息存进一个普通数据库,下次开场再塞进窗口开头。记忆不在模型里,在窗口开头那几百个 token 里。
三、工具调用:只是特殊格式的续写
Agent 最"神奇"的能力是调用工具。祛魅一下,它其实平平无奇,四步:
第一,系统提示词里写明有哪些工具、以及调用的格式(比如一段 JSON 或标签)。第二,模型"决定用工具"——其实就是续写出那段格式的文本,和它写诗的机制没有任何区别,只是后训练教会了它何时该这么写。第三,外面一段几十行的胶水代码(一个 while 循环)盯着模型的输出,看到那个标签就暂停,解析出来,真的去调用外部 API,把结果作为新的 token 塞回上下文。第四,模型看到结果,继续续写人话。
看明白了吗?模型自始至终只是在预测下一个 token,是那段毫无智能的胶水代码,把它的某些输出"当真"并执行了。
四、Agent Loop:循环够多、工具够全、每步够准
把上面这个循环自动化、跑很多轮,就是 agent。
while 任务未完成:
模型看上下文 → 续写(思考 / 调工具 / 给答案)
if 调工具:执行,把结果塞回上下文
if 给答案:退出
Claude Code 就是工业级的版本:读文件、改代码、跑测试,每一步都是"格式化输出 → 执行 → 塞回结果";报错信息塞回去,模型看着报错续写下一步。所谓"自主性",就是循环够多、工具够全、每步续写够准,此外无他。
顺着这个循环,几个热词都能归位:MCP 是第一步"工具介绍"的标准化协议(Anthropic 提出,2025 年底已捐给 Linux 基金会,OpenAI、Google、微软都已支持,生态里公开的工具服务器已上万)——它本身没有智能,但统一了"怎么向模型描述工具、怎么传结果",接口一统生态才长得起来,MCP 之于 agent,约等于 USB 之于外设。Skills 连协议都不是,就是预先写好的方法论文档加脚本,按需塞进上下文("干这类活,读这份 SOP、调这个脚本")。一句话收拢:loop 决定上下文怎么循环生长,工具和 MCP 决定什么信息能进出上下文,skills 决定预先注入什么方法论——而模型始终只做一件事。
这里要回答一个关键问题:为什么 agent 是 2024 年之后才突然能用的?两个原因。一是上一篇讲的 RLVR——工具调用每一步都可验证(代码跑通没、文件改对没),正是 RL 飞轮转得最快的场景。二是一个残酷的可靠性算术:一个十步的任务,每步 90% 成功率,整体只有 35%(0.9 的十次方);每步 99%,整体才 90%。能力差一点点,可靠性差一个世界。 这就是 agent 从玩具变生产力的门槛机制——不是模型突然会了新东西,是单步准确率跨过了那道让长链条不崩的坎。

五、应用层的护城河:在涨潮的水位边盖房
模型在商品化,而那圈循环代码又只有几十行、高度同质化。那应用层的护城河到底在哪?三处,由软到硬:
第一层,上下文质量。同一个模型,你往窗口里塞进什么信息,决定了输出的上限——私有数据、检索精度、SOP 的沉淀。一个亲身的例子:同一个 Claude,有没有一套 CLAUDE.md 的规则体系,产出天差地别。
第二层,验证与回路设计。每一步的结果能不能自动检验(能跑测试、能编译、能校验)——能验证的地方 agent 才可靠,不能验证的地方就得人盯着。功力,就在于把不可验证的任务,拆成一步步可验证的步骤(这正是那条"可验证性锯齿"在应用层的样子)。
第三层,也是最硬的,分发与工作流占位。嵌进真实的工作流才有价值,占住入口(IDE、办公套件、企业系统)的人才能收租。
但有个关键的张力必须点破:上下文工程的护城河,正在被模型能力本身侵蚀。窗口越变越长、agentic search 越来越强,昨天还要精巧设计 RAG 管道才能干的事,今天模型自己翻文档就干了。
所以这一篇的题眼是:应用层,是在一片不断上涨的水位边盖房子。 盖在"模型永远不会做"的高地上(私有数据、物理世界的接口、责任兜底)才安全;盖在"模型暂时不会做"的滩涂上,涨潮就淹。这是评估任何一家 AI 应用公司故事时,第一块该拿出来的试金石。

六、投资视角:水位线,和盖在哪
把这一篇压成一句话:应用层没有魔法,全是上下文工程;而上下文工程的价值,取决于它盖在水位线的哪一侧。
从这里长出两层判断。
第一,agent 是推理需求的放大器,这重塑硬件账单。agent 的窗口就是它的工作记忆——跑得越久,上下文越长、cache 越厚、每一轮 prefill 越贵。长任务 agent = token 无底洞,这是"agent 时代推理需求暴涨"的微观机制。它烧的又是最贵的那段(decode),所以 agent 的普及,直接把需求推向持续吞噬带宽的方向——这条线,一路通回硬件系列的 HBM 与推理芯片。
第二,给应用层公司估值,第一件事是量水位、看盖在哪。市场容易为"今天很好用"的 AI 应用付高溢价,但很多功能盖在滩涂上——模型下一个版本变长、变强,就把它淹了。真正能持续收租的,是那些占住了"模型不会做"的高地的:独家的私有数据、物理世界的接口、需要担责兜底的环节、以及嵌进真实工作流的分发入口。别问这个应用现在多惊艳,问它盖在水位线的哪一侧。
不构成投资建议。
关键数据速查表
| 概念 | 关键事实 |
|---|---|
| 上下文窗口 | 模型视野死锁在本窗口;窗口外物理上不参与计算 |
| 两种记忆 | 参数学养(慢/模糊/不忘)vs 窗口资料(即时/精确/易逝) |
| 无状态 | 多轮对话=每次重读全文;长期记忆是工程外挂 |
| 工具调用 | 只是特殊格式的续写;胶水代码把输出「当真」并执行 |
| MCP / Skills | MCP=工具接口标准(≈USB);Skills=预注入的方法论 |
| 可靠性算术 | 每步 90%×10 步=35%;每步 99%=90%——差一点差一个世界 |
| 应用护城河 | 上下文质量→验证回路→分发占位;盖在「模型不会做」的高地才安全 |
数据为公开资料整理,发布前以官方口径核对。
夜雨聆风