ARTICLE · 1009908
你的 AI 编码助手为什么总写出「原型级」代码?两年 Agent 工程化演进给了答案
你让 AI 写个功能,它 30 秒给你一段能跑的代码。你一 review:没有单元测试、边界不处理、错误直接吞掉、命名像猜谜。你让它补测试,它说「好」,然后塞了三个永远通过的假测试。你以为装了几个 skill、写了段系统提示词就算「工程化」了,结果 AI 还是走它的最短路径——能跑就行,质量后面再说。
这不是你一个人的体感。问题不在模型不够聪明,在于「工程纪律」从来没被编码进工作流。
过去两年 Agent 工程化真正在解决的,就是这件事。我把它拆成一条时间线:2024 年大家在谈「设计模式」,2025 年出现了「技能机制」,到 2026 年,重点已经变成「质量门禁」。一句话说,就是从「知道怎么做」,走到「能分发怎么做」,再走到「确保分发的真的好」。
2024:设计模式元年——「简单可组合」战胜「复杂框架」
Anthropic 在 2024-12-19 发了《Building Effective Agents》(Erik Schluntz & Barry Zhang)。这篇文档到今天还在被反复引用,原因很简单:它把「Agent 该怎么搭」讲清楚了。
Workflow vs Agent 的区分:Workflow 是用预定义代码路径编排 LLM 与工具;Agent 是 LLM 动态决定自己的流程与工具。区别只在一个问题:下一步谁来决定,代码还是模型。
5 种 Workflow 模式:Prompt chaining(提示链,中间加 gate 检查)、Routing(路由)、Parallelization(并行化)、Orchestrator-workers(编排者-工作者)、Evaluator-optimizer(评估者-优化者)。
首次提出 MCP(Model Context Protocol):把检索 / 工具 / 记忆接入第三方的标准方式。
它的反直觉结论是:成功不是建最复杂的系统,而是建对的系统。很多模式几行代码就能实现,框架反而多一层抽象、更难调试。这在当年直接打脸了「上框架才专业」的风气。
2025:Skills 机制——从「模式」到「可复用资产」
这一年出现了真正的转折:方法论变成了可分发、可版本化、跨平台的资产。
Anthropic 在 2025-10-16 于 Claude 中推出 Agent Skills,2025-12-18 开放为开放标准(agentskills.io)。一个 skill = 一个含 SKILL.md 的目录,关键设计是三层渐进式披露(progressive disclosure):
Level 1 元数据(启动时始终加载,~100 token/个,
name+description)Level 2 说明文档(触发时才读
SKILL.md正文)Level 3 资源 / 脚本(按需读取,脚本执行后只返回结果,几乎不占上下文)
它被称作「AI 的 Dockerfile」,微软、OpenAI、Cursor、GitHub、Figma 等都已采纳。
不过真正让 Skills 火起来的不是 Anthropic,而是社区——一群人把资深工程师的判断打包成了可复用的纪律:
Matt Pocock(
mattpocock/skills,MIT,约 3 万 star,173k+ 安装)主流程是grill-me → to-prd → to-issues → tdd:先对齐,再实现,坚决反对 vibe coding。Addy Osmani(
addyosmani/agent-skills,2026-02 开源,39K+ star,24 个 skill +/spec /plan /build /test /review /ship)三大哲学:Process not prose:skill 是 Agent 遵循的工作流,不是参考文档。
Anti-rationalization:每个 skill 内置「Agent 想跳过步骤的借口,加一条反驳」。比如「测试后面再加」,反驳是「没测试的代码不算完成」。
Verification non-negotiable:每个 skill 以证据要求收尾,测试通过、构建输出、运行时数据,「看起来对了」永远不够。
2026:开放标准与质量危机——普及之后的两面
到 2026 年初,公开可用的 Agent Skills 超过 10 万个,覆盖约 27 家平台(微软 Azure AI Studio、GitHub Copilot、Cursor、企业微信 OpenClaw 等)。SKILL.md 格式完全统一,各家只是存放路径不同,互操作这件事是真落地了。
不过数量上去了,麻烦也跟着来了:
数量爆炸,质量良莠不齐。官方精选的
anthropics/skills、openai/skills靠谱,社区聚合站就得慎用了。vibe coding 换皮。很多人把 skill 当成「更多提示词」,AI 该走最短路径还是走最短路径,spec、测试、审查照样跳。你开头被坑的那个痛点,根子就在这。
质量门禁缺失。Osmani 在《Agentic Code Quality》里说得很直白:人肉 code review 在 agent 时代已经撑不住了(每天几十万次变更),质量必须靠 harness、环境甚至 OS 层的 quality gates——单测、属性测试、变异测试、复杂度指标这些约束,由它们决定一段代码能不能跨过生产边界。
所以 2026 年大家聊的已经不是「怎么建 skill」,而是「怎么筛 skill、怎么给 skill 装上门禁」。我的一个判断:工程化成熟度看的是你的 skill 库质量加质量门禁,不是模型版本号。
回到开头的痛点。你的 AI 写出原型级代码,不是因为它笨,是因为你只给了它「更多提示词」,没给它「质量门禁」。先对齐,再实现,以验证收尾,这套 2025 年就该有的纪律,到 2026 年才被真正当回事。
你想看什么?
GO FUNNY 的选题,由你来定。
你平时用 AI 编码助手时,最常被「原型级代码」坑在哪一步?或者你有没有自己封装过好用的 skill 想分享?在评论区留言,或者直接发消息告诉我:
📌 你在用的 AI 编码工具 / Agent 框架
📌 你踩过的「代码能跑但质量稀碎」的坑
📌 你封装过、觉得真香的一个 skill
点赞最高的留言,下期就帮你拆解。