ARTICLE · 1094633
OpenClaw 把「AI 修 AI」跑成了流水线
🩹 审出来没人修,等于没审:OpenClaw 把「AI 修 AI」跑成了流水线
🪁 从审查者的尽头说起

系列上一篇我们拆了 Codex Guardian:审查者有证据法、有授权评分卡、有熔断器,严谨得像个内务部门。但拆到最后留了一个问题没回答——审出问题之后呢?
Guardian 的答案是:报告给人。这没问题,也很正确。但把镜头拉远一点看,整条流水线的尽头依然站着人:agent 写代码,agent 审代码,然后——人修代码。生成端的吞吐每周都在涨,修复端还是人的速度。审查自动化解决了「发现问题」的瓶颈,「解决问题」的瓶颈原样不动,只是往后挪了一格。
OpenClaw 把这一格也拆了。它的做法用一个词说完:闭环——agent 审出问题,不等人,派另一个 agent 直接修在 PR 上。这不是 PPT 里的愿景,是它自己仓库里天天在跑的维护流水线。这篇文章拆开这条流水线的两个阶段:一个攒了 2,500 条评论的疯狂起点,和一套闸门焊死的制度化现状。
🌱 起点:一条 2,500 条评论的 PR
故事起点是 OpenClaw 仓库的一条 PR:#68936,标题很直白——「Autofix: add PR review autofix pipeline + Windows daemon」。作者用 Claude Agent SDK 写了一条 PR 自动修复流水线:核心的 autofix.py 约 785 行,做的事是一根筋的四步——拉取 PR 的 review 评论,生成最小修复,把补丁打到 PR 的 head 分支上,然后逐条回复对应的 review 评论。
这条 PR 最终没有按原样合并,但它关闭时攒下了 2,500 条评论——OpenClaw 全仓库评论数最高的记录之一。2,500 条评论意味着什么?意味着一整场持续数月的公开辩论:每一行「让 agent 修 PR」的代码,都被社区翻来覆去地审。一条「自动修复」的流水线,本身被人工审查了几个月——这大概是这条 PR 最讽刺也最合理的命运。
更重要的是,它把「自动修复」这个想法的所有危险处都趟了一遍。PR 描述里列的安全不变量,今天读起来像一份「autofix 陷阱清单」:
Ping-pong guard(乒乓守卫):如果最后一条评论是修复 bot 自己发的,拒绝再发——防止 bot 自己跟自己对话的死循环。这是所有自指系统的第一课——agent 修 agent 的评论,评论又触发修复,修复又产生评论:循环必须有刹车,而刹车不能依赖系统的自觉。
Fork-aware push:修复推到拥有分支的 fork,不是基础仓库——bot 不能越权写别人的地盘。
SHA-pinned clone:克隆时钉死 SHA,而不是拉分支头——封住「补丁生成和克隆之间分支又前进了」的竞态。你修的必须是你审过的那个版本,这句话在并发世界要靠机制保证,不是靠运气。
逐条对应:每条修复回复对应的 review 评论——修复是可追溯的,谁提的问题,答在哪里。
🏭 制度化:ClawSweeper,一个有宪章的维护 bot
那条 PR 是草稿,真正跑在生产里的版本叫 ClawSweeper——今天 OpenClaw 仓库里的 AI 审查与维护 bot,它的操作手册(SKILL.md)就躺在仓库里,任何人可以读。这份手册读起来不像 bot 文档,更像一部「bot 宪法」。挑几条硬的:
闸门默认关闭。 ClawSweeper 的每一条危险能力——执行写入、修分支、合并、自动合并——各对应一个环境变量闸门(ALLOW_EXECUTE / ALLOW_FIX_PR / ALLOW_MERGE / ALLOW_AUTOMERGE),默认全部关闭。开启需要维护者在授权窗口内显式设置,还要记录原状态、约定恢复时间。手册里甚至专门警告:「不要把重置所有闸门当作日常清理」——因为另一个维护者的授权窗口可能故意保持开启。
修复有硬上限。 每个 PR 最多修 10 轮,每个 head commit 最多修 1 轮。数字不大,但方向重要:自动修复的预算是声明出来的,不是「修到好为止」。没有预算的修复循环,和没有刹车的下坡是同一样东西。
automerge 要过五道独立条件。 agent 审查通过,可以自动合并吗?ClawSweeper 的答案是把 merge 权拆碎:ClawSweeper 必须对当前这个确切的 head SHA 审查通过、CI 全绿、GitHub 判定可合并、没有人审标签、PR 不是草稿——五个条件缺一不可,外加两个 merge 闸门都开着。agent 的结论只是其中一道门,不是通行证本身。
审查通过 ≠ 批准。 官方的 PR review flow 文档写得更直白:「ClawSweeper 的正面结果是支持性证据,不是维护者批准」。甚至专门有一段:如果人类已经在动手处理这个 PR,不要召唤 ClawSweeper,让人先干完。自动化有让路的义务——这条写在文档里,比任何算法细节都更能说明这套系统的成熟度。
有些事明确不自动化。 安全类发现——漏洞、泄漏的密钥、SSRF、提权——一律不进自动修复,直接转人工安全处理通道。即便 PR 明确选择了 autofix,安全类发现可以触发有界修复,但合并照样被挡住,直到后续对确切 head 的一次干净审查通过。闭环的范围是画出来的,不是越大越好。
@clawsweeper stop。 维护者一条评论就能给 PR 打上「人审」标签,全流程停下。退出按钮永远在人手里。
⚖️ 审而不修,与审而能修
把上一篇和这一篇并排放,系列的全貌出来了:
🛡️ Codex Guardian——审而不修。 核心信念:审查是判断,判断要独立,修复是另一个决定。机制:证据法、授权评分卡、熔断器,产出是报告。
🐶 OpenClaw ClawSweeper——审而能修。 核心信念:审出的问题不修,审查的价值就蒸发在队列里。机制:有界修复循环、闸门默认关、五条件 automerge、修复预算。
注意一个容易看错的点:OpenClaw 敢让 agent 一直修到 merge,不是因为相信 agent,而是因为不相信。修复预算是对 agent 耐心的不信任,五道 merge 条件是对 agent 结论的不信任,闸门默认关是对整个自动化层的不信任。信任不是这套系统的前提,是这套系统的产出——每一道闸门、每一个上限、每一次「人类优先」的让路,都在把「敢让 agent 碰生产仓库」从一句口号变成一个可以审计的架构事实。
Guardian 和 ClawSweeper 也不互斥,它们是同一道防线的两段:审查段问「这有问题吗」,修复段问「修它值得冒多大的险」。前者管发现的质量,后者管行动的代价。一个团队真要落地「agent 审查 agent」,两段都得有——只有前段,问题堆成山没人搬;只有后段,没有审查的修复就是盲修。
📊 放回这周的生态坐标
这条流水线不是孤立事件。按我们 9 月 15 日的 submodule 周报,「agent 审查 agent」当周被正式标记为新范式信号:Codex 把 Guardian 体系收敛为 extension 架构,OpenClaw 的 autofix issue 关闭收官——同一趋势的两个实现,一个管审查的制度,一个管修复的闭环。
两周后的 9 月 22 日周报里还有个耐人寻味的细节:OpenClaw 的根 AGENTS.md 出现了「Codex sibling runtime hard gate」——任何涉及 Codex 协议的改动,agent 必须亲自检查 ../codex 源码才能下结论,官方文档明文规定「subagent 的报告不满足此 gate」。连「审查另一个运行时」这件事本身,也被写进了 agent 的协作宪法。治理的密度,在往 every corner 蔓延。
顺带一提,OpenClaw 的 CI 里还躺着一个 pr-ci-sweeper:每小时巡一遍,发现被丢掉的 CI 检查就用 close/reopen 的方式修复,还专门用 GitHub App token 而不是 GITHUB_TOKEN——因为后者触发的事件不会再触发 CI。你看,连「修 CI 的 bot」都要懂 GitHub Actions 的事件语义。自动化的深度,就藏在这种没人写进发布会的地方。
🎯 Takeaway:搭你自己的 autofix 闭环前,问四个问题
① 循环有刹车吗? agent 修复的评论会再次触发审查和修复——你的系统靠什么终止这个循环?Ping-pong guard、每 PR 修复上限、每 head 修复次数,至少要有一样,而且要像 ClawSweeper 那样是硬编码的预算,不是提示词里的「请适度」。
② 权限有闸门吗?默认关吗? 写入、修分支、合并,是三种不同的危险等级,就该有三道独立的闸门。默认全开,然后指望 agent 自律,等于没有闸门。开启要有授权窗口,要有恢复约定。
③ agent 的结论是唯一条件吗? 如果「agent 说可以」就能 merge,你的闭环是裸奔的。参照五条件:确切 head 的干净审查、CI 绿、平台判定可合并、无人审标记、非草稿——agent 只占其一。审计数据的第一个用途,是让「谁批准的」有多个独立答案。
④ 哪些事明确不自动化? 每套闭环都要有负清单。OpenClaw 的答案是安全类发现全部转人工;你的答案可能不同,但「没有负清单」本身就是最大的危险信号。闭环的价值不在于它覆盖了多少,在于它清楚地知道自己不覆盖什么。
四个问题过完,你会发现自己真正在评估的不是一个 bot,是一套治理结构:谁授权、谁刹车、谁兜底。OpenClaw 用一条 2,500 评论的 PR 和一部 bot 宪法证明的是——「AI 修 AI」的工程难点从来不在修复的质量,而在闭环的边界。边界画对了,修复质量只是时间问题;边界画错了,修复质量越高,翻车越快。
🔗 资源
• 起点 PR:openclaw/openclaw #68936「Autofix: add PR review autofix pipeline + Windows daemon」(2,500 条评论,已关闭) • 生产系统:OpenClaw 仓库 ClawSweeper skill(.agents/skills/clawsweeper/SKILL.md)与官方 PR review flow 文档(docs/reference/pull-request-review-flow.md) • 本周生态数据:AllClaws submodule 周报 2026-09-15 / 2026-09-22(docs/reports/weekly/) • AllClaws 持续追踪 35 个 AI Agent 平台,周报每周二发布
💬 AllClaws 持续跟踪 35 个 AI Agent 平台的每周动态,把散落在 29 个仓库里的架构信号整理成你能用的判断。这是「Agent 审查 Agent」系列第 3 篇——第 1 篇看了四家答卷,第 2 篇拆了 Codex Guardian 的审查制度,这一篇走完闭环的最后一公里:修复。审 + 修都齐了,系列下一篇我们聊聊闭环跑起来之后的新问题:当 agent 修得比人快,人还剩哪些必须亲自看的角落。关注不迷路。