
大家好,我是老七。这是《AI Agent开发:从小白到大神》系列第5篇。上一篇讲了Agent的三代演化史。这一篇聊一个正在发生的思维转变——AI开发的核心竞争力,正在从"模型"转移到"系统"。
这篇聊一件事:为什么2023年大家在卷Prompt,2026年大家在搭系统——这三年发生了什么,以及你现在应该把精力花在哪。
开头·你的厨房比你的锅更重要
想象你要开一家餐厅。你花三万块买了一口顶级铁锅——导热均匀、不粘底、颠勺手感一流。然后你把锅放在一个没通燃气的灶台上,用电磁炉凑合着。水池没通热水,切菜在膝盖高的茶几上,调料罐散落在三个不同的柜子里。
你的锅是三万块的神器。但你的厨房是一团糟。你做出来的菜,不会比一个用普通铁锅但厨房整整齐齐的厨师好。
这就是AI开发正在经历的转变。2023年,所有人都在追"最好的模型"——GPT-4比GPT-3.5聪明多少,Claude比GPT强在哪,谁的Prompt工程更精妙。2026年,最有竞争力的AI开发者不再问"哪个模型最好"——他们问"我的系统还缺什么"。
从"模型中心"到"系统中心",这是AI开发三年来最重要的范式转移。不是你不需要好模型了——是你终于明白了,一口好锅解决不了厨房的问题。
讲到这里,你应该理解的第一件事:模型中心思维 = 一切问题都是模型的问题。系统中心思维 = 模型只是系统中的一个组件,做好它该做的,做不好的交给其他组件。
模型中心时代·2023
2023年是"模型中心"的巅峰。
GPT-4发布后,全世界陷入了一种狂热的信念:只要模型足够强,一切问题都能通过"更好的Prompt"解决。 写作不好?调Prompt。推理不行?调Prompt。幻觉太多?还是调Prompt。
当时有一篇爆火的文章叫《Prompt Engineering Is All You Need》——标题本身就是一种宣言。整个2023年的AI社区,就像一个巨大的厨王争霸赛——所有人都在比谁的锅更好,没有人在管厨房。你的Prompt是"Chain-of-Thought"我是"Tree-of-Thought",你用了3个示例我用了5个。我们都在同一口锅上雕花。
模型中心思维有三个隐含假设,后来被逐一证伪:
假设一:模型会一直指数级变强。 GPT-3到GPT-4的跃升让所有人以为下一个版本的GPT会更炸裂。但2024-2025年的事实是——模型进步的斜率在放缓。不是模型不进步了,是"每花十亿美元训练,能力的边际提升在递减"。
假设二:模型够强,就不需要额外组件。 "GPT-5出来,RAG就可以扔了"——这话2023年到处都在说。但GPT-5出来了吗?出来了。RAG被扔了吗?没有。因为模型再强,训练数据的截止日期是固定的。它不知道今天的新闻、你公司的内部手册、你用户的隐私偏好。这些"模型之外的知识",永远需要外部组件。
假设三:Prompt优化可以解决一切。 2023年,Prompt长短、措辞、Few-shot示例数量——都可以被精心调优。但你会发现,同一个Prompt在同一模型的不同版本上效果天差地别。你花了三个月优化的Prompt,GPT-4.5一出——废了。Prompt是你跟模型之间的"暗号",但模型在变,暗号就得重设。
模型中心思维的终结,不是因为模型不够强——是因为"只靠模型"这条路的天花板,比所有人预想的都低。

系统中心时代·2024-2026
2024年开始,风向变了。越来越多的人意识到一个反直觉的事实:一个"够用"的模型 + 一个"好的系统",效果远超"最好"的模型裸用。
这就好比——你不需要一口三万块的神锅。一口两千块的锅,配上通燃气的灶台、通热水的洗菜池、高度合适的操作台、分门别类的调料架——你炒出来的菜,比那个只有神锅没有厨房的人好得多。
系统中心思维的核心公式:
AI产品力 = 模型能力 × 系统能力
模型能力是乘法的一边。但如果系统能力是零——模型再强,乘出来还是零。系统能力才是那个让模型能力被"放大"的杠杆。
那么一个"系统"到底包含什么?五个关键组件:
① RAG(检索增强生成)= 知识外挂。 模型不知道你公司的退货政策?没关系。RAG组件在用户提问时实时检索你的知识库,把相关文档塞进上下文。模型不需要"记住"——它只需要"读懂你塞给它的东西"。
② 工具调用 = 行动能力。 模型只会说,不会做。工具组件让它能查数据库、调API、发邮件、改订单。你问"我的订单到哪了",Agent不只是回你一句"请去XX查"——它直接帮你查了。
③ 记忆系统 = 连贯性。 模型每次对话都是独立的。记忆组件让它能"记住"你的偏好、历史对话、上次问题的上下文。你不是在跟一个失忆的人聊天。
④ 多Agent协作 = 复杂任务处理。 单个模型处理不了"同时查物流、核实库存、通知客户"这种多线程任务。多Agent架构让不同Agent各司其职——一个查、一个核、一个发。
⑤ 安全护栏 = 不闯祸。 模型有时候会乱说、乱做。安全组件在模型输出之前做最后一道检查——"这个回复有没有法律风险?这个操作会不会造成数据泄露?有没有超出权限?"挡住不该做的事。
这五个组件——RAG、工具、记忆、协作、护栏——它们不是"锦上添花"。它们是让一个"够用"的模型变得"能用"的关键。最好的模型裸用,不如够用的模型装在系统里。

讲到这里,你应该理解的第二件事:2023年的AI开发者在卷Prompt。2026年的AI开发者卷的是工程能力、系统设计、工具集成。前者卷模型,后者卷架构——卷的不是一个维度的东西。
为什么这个转变如此重要
这不是"趋势"。这是必然。四个原因:
一、模型进步的边际效益在递减。 GPT-3到GPT-4是质的飞跃。GPT-4到GPT-5是量的提升。下一个版本变强的幅度,远不如从RAG、工具、记忆三个维度做系统优化带来的提升。你把调Prompt的时间花在搭一个好用的RAG组件上,收益更大。
二、企业需要的是"能用的方案",不是"更聪明的模型"。 一个100分的模型,99%准确率——客户问了一个问题,它答对99次,答错1次。客户只记住那次错的。企业不需要"更聪明的模型"——它需要"一个模型+一个能查到准确信息的RAG+一个能执行操作的工具系统"。100分的模型不如80分的系统。
三、系统组件在精进,模型在趋同。 2023年,模型的差距巨大——GPT-4碾压一切。2025年,头部模型的差距在缩小——Claude、DeepSeek、Qwen在大多数基准上各有胜负。模型不再是护城河——系统才是。
四、iPhone打败的不是诺基亚的抗摔能力——是诺基亚的"手机范式"。 诺基亚在"怎么把手机做得更扛摔"上卷到极致。iPhone说:"手机不应该只是一个电话。"同样,2026年的AI开发者不是在卷"怎么让模型多答对一个数学题"——他们在重新定义AI产品应该长什么样。
讲到这里,你应该理解的第三件事:别再问"哪个模型最好"了。问"我的系统还缺什么"。模型之间的差距在缩小,系统之间的差距在拉大。

总结·给你的三个思维转变建议
如果你是一个正在做AI产品的人——不管是独立开发者、创业者、还是企业内的AI负责人——三个建议:
① 把"选哪个模型"的优先级从第一降到第三。 2023年这是你最重要的决策。2026年——DeepSeek、Qwen、Claude——它们之间的差距远小于你的系统设计差距。选一个"够用"的,把精力花在系统上。
② 问自己三个问题。 你的用户问了一个模型训练数据里没有、但你的知识库里有答案的问题——你的系统能回答吗?你的用户说"帮我做这件事"——你的系统能动起来执行吗?你的用户三天后再来找你——你的系统还记得他是谁吗?这三个问题对应RAG、工具、记忆。缺哪个,补哪个。
③ 把"Prompt工程"升级为"系统架构"。 不是让你别写Prompt了。是把你的思维方式从"怎么写Prompt让模型更准"升级为"怎么设计系统让模型发挥最大价值"。Prompt调优是单变量优化。系统架构是多变量协同。后者才是2026年的核心竞争力。
讲到这里,你应该理解的最后一件事:2023年拼的是"谁的Prompt写得更好"。2026年拼的是"谁的系统搭得更聪明"。前者在锅里雕花,后者在盖厨房。厨房盖好了,换口锅只是拧个螺丝的事。
下一篇预告:一文讲透认知架构——Agent的大脑是怎么工作的。
关注老七聊AI,《AI Agent开发:从小白到大神》系列99篇持续更新中。 🧠
夜雨聆风