夜雨聆风学习资料网

ARTICLE · 1049320

AI搭建 落地的软件工厂,完整搭建教程

AI搭建 落地的软件工厂,完整搭建教程

3 秒速读

总结 软件工厂就是让你用 AI 智能体真正交付软件,像工厂流水线一样构建软件。到本期结束,观众会了解如何自己搭建自己的软件工厂。讲者说这比想象容易得多,而且绝对与模型和工具链无关,不需要买不同产品。

工具 软件工厂不是一个产品,也不是特殊框架,不是“这家公司做了一个软件”;它实际上就是一堆 Markdown 文件。;讲者说这比想象容易得多,且绝对与模型和工具链无关,不需要购买不同的产品来拥有软件工厂。;

深度详解

软件工厂不是产品,是一堆 Markdown 文件:一套能落地的搭建教程

一个反常识的判断:软件工厂跟模型无关,也跟工具链无关。罗斯·迈克(Ross Mike)在格雷格的播客里说,他那套能同时跑十几个功能的系统,本体就是五六个 Markdown 文件,免费公开。

整期节目只做一件事,把它搭给你看。

核心动作就一件:把"隔离、构建、证明、发布"四步写进 agents.md。剩下都是细节。

这个视频到底讲了什么

格雷格提问,罗斯·迈克讲解并现场演示。他试图回答的问题是:怎么让智能体交付的软件不粗糙,而是像流水线一样稳定产出。

他先给定义。软件工厂与封装框架(harness)无关,也与模型无关,换任何模型、任何工具都应该能跑。它的本体是工作流、技能和领域知识,被写进开发过程使用的文件里。

然后他打开自己的电脑演示。他的工厂由大约五六个文件组成,其中一个是 agents.md——每次你跟智能体说话,这个文件都会先被送进对话。

他说大多数人的 agents.md 毫无用处,因为里面写的是代码长什么样,而那些信息智能体本来就能从代码库里知道。

他的文件里写的是智能体原生不具备的工作流。整条流程四步:隔离、构建、证明、发布。他现场开着四个终端标签页,在同一个应用上同时做四个不同功能。

演示的核心是一个由智能体提交的 PR。里面有修改前后的截图,还有外部审查服务给出的分数。第一轮 3 分(满分 5 分),智能体自己回到构建环节,再证明,再发布,直到拿到 5 分,他才点合并。

他的结论是:软件工厂不是一个产品,不是特殊框架,就是一堆 Markdown 文件。他还顺带提到,现在有些初创公司,就是一个智能体加几个 Markdown 文件。

软件工厂 = 把干活方式写成文件的流水线

把它想成汽车装配线。订单进来先分一个独立工位,免得几辆车挤在一起;然后是装配;装配完必须过质检,不合格退回重装;最后出厂。区别只在于,这里的产品是软件,工人是智能体。

软件工厂这个词听上去像一套要花钱买的系统。视频的判断相反:它不是一个可以购买的产品,而是一份把"怎么干活"写下来的文档。

视频给出的做法 = 四步,别在 main 上动手

先说前提。整套东西的载体是大约五六个文件,最关键的 agents.md 会在每次对话前被注入上下文。判断门槛只有一条:里面写的必须是智能体自己不知道的事。

第一步,隔离。 技能名叫"新功能",规则是一句话:每个新功能都从 main 分支分出一个全新的 git 工作树(worktree),永远不要在 main 上构建。

这样多个智能体可以同时改代码而不互相覆盖。演示里他在同一个应用上并行跑了四个功能,其中一个还在给智能体开一个 Linux 环境。

第二步,构建。 这一步用的技能叫"代码结构",写法是服务层架构。理由很直接:模型能把事情做完,但不一定用好的方式——重复代码、函数到处散落、死代码。

视频里的原话是,仅仅因为它能运行,并不意味着它写得好。这份技能给智能体一套怎么写代码的指南,目标是人类开发者,或者另一个没有上下文的智能体,接手时能看懂。

第三步,证明。 这一步有两项技能。一项叫证据驱动测试,先记录功能实现前或 bug 发生时的状态,修好后再记录一份正常工作的版本。另一项叫前后对比,直接输出前后截图。

他展示了一个智能体提交的 PR:管理员邮箱页面,"之前"根本不存在,"之后"已经能用。这段设计的目的,是防止智能体只是口头告诉你它做完了。

第四步,发布。 技能叫 GP loop,依赖第三方代码审查服务 Greptile,同类工具还有 CodeRabbit、Macroscope。

审查服务会留下反馈,并给出一个满分 5 分的置信度分数。3 分意味着还有遗漏,智能体自动回到构建,走完证明和发布,再等下一个分数。循环到 5 分,他才点合并。

补充理解 = 从视频延伸出的知识点

以下不是视频原话。git 工作树(worktree)指同一个仓库同时检出多个工作目录,各自独立,这就是"隔离"能成立的技术底子。

封装框架(harness)指调用模型、管理工具和上下文的那一层运行代码。视频只强调工厂不依赖它,没有展开。

至于 Greptile 那类服务的置信度分数是怎么算出来的,视频没有解释,只演示了它的用法。

视频还提到"有些初创公司就是一个智能体加几个 Markdown 文件",但没有展开,这里也不替它补。

常见坑 = 视频点名的四种翻车方式

第一,让多个智能体在同一个分支上开发不同功能。视频说这几乎是他见过"智能体删掉一堆东西"的全部原因。格雷格补了一句,非技术背景的人自己动手做应用,遇到这种情况的概率高达 95%。

第二,agents.md 里写智能体本来就知道的信息,比如代码长什么样。这份文件的唯一价值,是写它不知道的东西。

第三,相信智能体的一句"我做完了"。视频说它会认为代码有效,但从没测过。所以要用前后证据逼它自证。

第四,不装代码审查代理。他的态度很硬:如果你认真做软件,想不出不用它的理由。

收尾

四个步骤今天就能照抄进你自己的 agents.md。视频里更值钱的一句提醒是:别盲目照搬,理解过程,再自己应用。

觉得有用?点个 在看 和 关注 支持一下

相关学习资料