乐于分享
好东西不私藏

AI应用的五个时代:从软件工程到Loop工程

AI应用的五个时代:从软件工程到Loop工程

前两天我用 Claude Code 改一个项目。

它在终端里自己读文件、自己改代码、自己跑测试,测试挂了它自己看报错、自己重试,跑通了自己提交。

我就在旁边看着。

那一刻我突然意识到,这件事离我们两年前熟悉的“写 prompt”已经隔了十万八千里了。

如果你还停留在“怎么把提示词写好”的认知里,你大概率会觉得这两年 AI 的发展完全看不懂。

因为 AI 应用的工程方法,这五年 quietly 换了五代。

从软件工程,到提示工程,到上下文工程,到 harness 工程,再到 loop 工程。

每一代都不是推翻前一代,而是把前一代包进去,再往外多一圈。

今天我想把这五个阶段一次讲清楚。讲完你就明白,为什么现在最值钱的能力,已经不是“写提示词”了。

一、软件工程:人写代码

这是大家最熟悉的阶段,玩了几十年。

人是执行者。人把需求拆成逻辑,用代码一行行写出来,机器负责跑。

它的特点是确定。写一行就是一行,bug 是 bug,跑通是跑通。出了问题,顺着逻辑 debug 就行。

这套方法成熟稳定,可以预测。所以它能撑起整个互联网行业几十年。

但它的瓶颈也在人。人写得慢,人改得慢,人懂一个系统的成本越来越高。

直到有一天,模型能写代码了。

二、提示工程:怎么问

2022 年底 ChatGPT 出来,所有人发现的第一个事实是:同一个模型,你怎么问它,决定了它回答得有多好。

于是有了提示工程。

few-shot 举例、思维链(CoT)、角色设定、“请一步一步思考”、各种魔法咒语。

核心关注点就一件事:how you ask(你怎么问)。

2023 年这是最火的方向,甚至催生了一个叫“提示工程师”的岗位,年薪开得很高。

它确实有用。把一个问题换种问法,输出质量可以从不及格跳到优秀。

但它的天花板很快就到了。

因为 prompt 写得再花,模型只知道你嘴里说的那几句话。它不知道你公司的数据,不知道最新的新闻,不知道你那个庞大代码库里的上下文。

你问它“帮我总结一下这个季度的销售情况”,你不说数据,它就瞎编。

于是大家发现,光研究“怎么问”是不够的。更关键的是“你到底喂给它了什么”。

三、上下文工程:给什么信息

2025 年 6 月,Andrej Karpathy 在 X 上发了一条推文。

他说:别再提 prompt engineering 了,应该叫 context engineering。紧接着他补了一句很关键的话:上下文工程只是协调每一次 LLM 调用的那一厚层非平凡软件中的一个小角落。

注意他用的词:“一厚层非平凡软件”。他的意思是,prompt 只是冰山一角,底下还有一大坨围绕模型搭出来的工程系统。

Shopify 的 CEO Tobi Lütke 紧跟着站队,他给的定义更直白:上下文工程就是为任务提供所有必要上下文,使其能被 LLM 合理地解决。

关注点从“怎么问”,正式变成了"what you feed the model"(你喂给模型什么)。

RAG 检索来的资料、历史对话、工具调用的结果、记忆系统、系统提示,所有这些塞进上下文窗口的东西,都成了工程对象。

你要决定:什么信息进、什么时候进、以什么格式进、怎么压缩、怎么淘汰。

2025 年 7 月,Gartner 直接宣布“prompt engineering 已死,context engineering 当立”,并预测它会嵌进 80% 的 AI 开发里。

我用一句话帮你理解它:LLM 的本质是开卷考试,上下文工程就是在帮它准备那个开卷包。包里装什么,比它答题的技巧重要得多。

但上下文工程做到一定程度,又有人发现一个问题。

光把信息塞进去还不够。模型要干活,还得有工具、有环境、有约束、有反馈。

于是下一层出现了。

软件工程→提示工程→上下文工程的关注点迁移

四、Harness 工程:给模型套上挽具

这一层现在最热。

LangChain 前不久发了一篇文章,标题叫《The Anatomy of an Agent Harness》。它开篇就甩出一个公式:Agent = Model + Harness(模型 + 挽具)。

后面还跟了一句更狠的:If you’re not the model, you’re the harness. 不是模型的那部分,都是挽具。

Harness 这个词本意是马的“挽具”——套在马身上,让它能拉车、犁地、被人驾驭的那一套。

放到 AI 里,模型是那匹马,harness 就是套在它外面的一切:工具、文件系统、沙箱、记忆、编排逻辑、安全约束、钩子(hooks)。

LangChain 那篇文章里还有一句特别清醒的话:模型负责聪明,harness 负责让这份聪明真正派上用场。

Martin Fowler(软件工程界的元老)也写了一篇。他把 harness 拆得更细,说它本质上就是两样东西的组合:

  • Feedforward guides(前馈引导): 在模型动手之前,告诉它怎么干。比如 AGENTS.md、规范文档、bootstrap 脚本。
  • Feedback sensors(反馈传感器): 在模型动手之后,检查它干得对不对。比如 linter、类型检查、测试、代码审查。

前者提高它一次做对的概率,后者给它一个自我纠错的回路。

OpenAI 一个用 Codex 的工程团队写了一句话,我觉得特别能说明问题:他们现在最难的挑战,已经变成怎么设计环境、反馈循环和控制系统。

注意这句话,他们没说“我们最难的挑战是写 prompt”。最难的是设计环境和反馈循环。

Addy Osmani(Google Chrome 团队)说得更直白:一个还行的模型配一个好 harness,能打赢一个好模型配差 harness。

换句话说,harness 的好坏,比模型本身的好坏更要紧。

有意思的是,LangChain 还点破了一层窗户纸:今天的 harness,很大程度上就是上下文工程的交付机制。

所以你看,这一层是在把上一层的活儿做扎实、做成系统。

那 harness 搭好了,就够了吗?

还不够。因为 harness 是静态的。真正让 agent 干活的,是让它转起来。

五、Loop 工程:让它自己跑下去

这一层最新,也最前沿。

最有说服力的一句话,来自 Boris Cherny。他是 Claude Code 的负责人。他说:我不再 prompt Claude 了,我有一堆 loop 在 prompt Claude、在决定该做什么,我的工作就是写 loop。

Claude Code 的负责人,日常工作已经不写 prompt 了,是在写 loop。这句话分量很重,建议你停下来想一想。

一个 agent 要完成一个复杂任务,它必须能在一个循环里持续运转:执行、检查、修正、再执行,直到搞定。

但这件事远比想象的难。模型天然有两个毛病:一是“早停”,干到一半说“剩下的你来吧”就退出了;二是“context rot”,上下文越塞越满,模型越来越糊涂。

LangChain 在文章里提到了一个叫 Ralph Loop 的模式。这个设计很巧妙:用一个 hook 拦截模型想退出的动作,把原始指令重新注入一个干净的上下文,强制它接着干。因为之前的工作都沉淀在文件系统和 git 里,所以它每次重启都能接着上次的进度继续。

这就是 loop 工程要解决的核心问题:让 agent 跨越单次对话、单个 context 窗口,长时间自主地把活干完

除了 Ralph Loop,还有几种 loop 在被实践:

  • Self-verification loop(自检循环): 执行完一步,自己跑测试验证,失败就把报错塞回去重来。
  • Steering loop(驾驶循环): Martin Fowler 提的,人不断迭代 harness 本身。agent 这次没干好,就改 guides 和 sensors,让它下次别再犯。
  • 自改进 loop: 这是最前沿的方向,让 agent 分析自己的执行 trace,找出 harness 哪里设计得不好,自己改。Adaline Labs 甚至说 self-improving agent 已经是生产级模式了,不只是想象。

Addy Osmani 给 loop 工程下过一个很准的定义:loop 工程就是把你“那个去 prompt agent 的人”替换掉,改成你去设计一个系统,让它去 prompt。

我前面说的 Claude Code 在终端里自己跑测试、自己重试,就是一个 self-verification loop。

这一层的工程才刚刚开始,谁也说不清它最后会长成什么样。但方向已经清晰了:从“人写代码”,到“人设计一个让 AI 自己跑下去的系统”。

Harness 的构成与 Loop 的运转

这五个阶段,到底是什么关系

讲完了。我想给你一个判断。

这五个阶段之间的关系,是层层包裹。

提示工程没有消失,它变成了上下文工程的一部分,写 prompt 还在,只是它不再是主角。

上下文工程没有消失,它变成了 harness 工程的核心。LangChain 自己都说,harness 本质是上下文工程的交付机制。

harness 工程也没到顶,它必须在 loop 里转起来才有意义。

就像俄罗斯套娃。每一层都在前一层外面多包一圈。

五层套娃:从 prompt 到 loop

那我们现在在哪?

我的判断是,行业主流在上下文工程和 harness 工程之间。RAG、MCP、Agent 框架这些热词,本质上都在这两层里打转。

真正在做 loop 工程的团队,全世界也没几个。它太新,太难,而且不便宜。

但方向已经在那儿了。

所以如果你还在纠结“提示词怎么写”,我的建议是,把视角往上抬两层。

提示词只是冰山最尖上那一丁点。水下面是上下文管理、是工具环境、是反馈回路、是让整个系统转起来的设计。

这些才是现在 AI 应用工程师真正在啃的硬骨头。

也是未来两三年最值钱的能力。

以上,既然看到这里了,

如果觉得不错,随手点个赞、在看、转发三连吧,

如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章