乐于分享
好东西不私藏

我给4个AI编程助手写了同一份行为准则,结果差距惊人

我给4个AI编程助手写了同一份行为准则,结果差距惊人

我同时用Claude Code、Codex、WorkBuddy、CodeArts四个AI编程助手干活,花了一周给它们写了一套统一的行为准则。本文分享完整配置和踩坑经验,帮你少走弯路。

为什么需要给AI写行为准则?

你有没有遇到过这些情况:

  • 改好一个bug,另一个地方又坏了
  • AI自作主张加了一堆注释和"优化"
  • 同一个错误反复犯,说了三遍还是不改
  • 代码跑都没跑就说"已完成"

这些都是因为AI没有行为准则。就像新员工入职没有培训,只能靠猜。

我的4个AI助手

助手
模型
特点
Claude Code
Claude Sonnet 4
代码准确率最高,技能生态最丰富
Codex
GPT-5.5
全栈能力强,浏览器自动化好
WorkBuddy(贾维斯)
Deepseek-V4-Pro
自主性最强,有SOUL灵魂档案
CodeArts
GLM-5.1
华为云出品,中文理解好

行为准则的核心:11个模块

我最终沉淀了11个模块,覆盖从写代码到调试到审查的全流程。

1. 先理解再动手(8条铁律)

改代码前必须先读完整文件读完相关依赖文件,理解调用链改之前列出影响范围一次只改一个逻辑点改完必须跑 lint / test / typecheck不自作主张加注释和功能改之前追踪影响点,改完逐一验证新代码必写测试

踩坑:我最开始没写"改之前追踪影响点"这条,结果AI改A功能时把B功能改坏了。量化交易系统尤其怕这个——改好一个策略参数,另一个策略崩了。

2. 调试铁律:无根因不修bug

从Claude Code的systematic-debugging技能迁移:

看到bug → 先建反馈循环(能复现的测试/脚本) → 再假设 → 再修

绝对禁止"先试试改X看看"——这是最大的时间浪费。

3次修复失败 → 停下来质疑架构,不要继续打补丁。

诊断四阶段

  1. 建反馈循环 — 能一条命令复现bug的脚本
  2. 复现+最小化 — 缩到最小仍能复现的场景
  3. 3-5个可证伪假设 — "如果X是根因,改Y会让bug消失"
  4. 修复+回归测试 — 先写failing test,再修

3. 设计原则:深模块 + 设计两次

  • 深模块
     = 小接口 + 大实现(好)
  • 浅模块
     = 大接口 + 小实现(坏,pass-through)
  • 设计两次
    :第一个方案通常不是最好的,用3+子Agent并行设计不同方案

4. 并行执行

2+独立任务 → 一个任务一个Agent,并行派发。

Agent指令要点:聚焦、自包含、明确输出、约束范围

5. 代码质量检查清单

  • 无分散的timeout/retry逻辑(集中到装饰器)
  • 无双重重试(应用层+基础设施层都retry)
  • 无硬编码配置和密钥
  • 不暴露内部类型(ORM模型不直接返回API)
  • 不混I/O和业务逻辑
  • 不裸catch except Exception: pass
  • 批量操作不停在第一个错误
  • 输入在边界验证(Pydantic)
  • 资源用context manager
  • async里不阻塞

6. 自我改进系统

从WorkBuddy的self-improving技能迁移:

  • 用户纠正 → 立即记录
  • 同一纠正3次 → 确认为永久规则
  • 用户编辑我的输出 → 记录为暂定模式

不触发学习的:沉默、单次指令、假设性讨论

7. 自主执行原则

从WorkBuddy的SOUL.md迁移:

  • 先动手再开口
     — 能查的自己查,卡住了再问
  • 完全自主
     — 遇到问题找替代方案,不推回给用户
  • 反安全借口铁律
     — 只有3种合法拒绝:①违法 ②不可逆破坏 ③他人隐私

8. Windows编码规范

# PowerShell执行前必须加[Console]::OutputEncoding = [System.Text.Encoding]::UTF8$OutputEncoding = [System.Text.Encoding]::UTF8chcp 65001

常见陷阱:Windows中文版默认GBK、chcp 65001不是万能的、文件读写必须显式encoding='utf-8'

9-11. 代码审查、回测框架、执行策略

(篇幅原因不再展开,完整版见我的GitHub)

完整AGENTS.md结构

AGENTS.md├── 自我进化系统(5条)├── 核心原则:先理解再动手(8条)├── 执行策略(5条,源自涂津豪框架)├── 调试铁律(4阶段+红旗信号)├── 设计原则(深模块+设计两次+可测试性)├── 并行执行(何时并行+Agent指令要点)├── 代码质量检查清单(10项反模式+5项错误处理)├── 代码审查(4阶段+反馈原则)├── 自我改进系统(学习信号+纠正分类+自我反思)├── 自主执行原则(先动手+完全自主+反安全借口)├── Windows编码规范(PowerShell+Python+常见陷阱)└── 用户偏好

效果对比

指标
有行为准则前
有行为准则后
改代码引入新bug
经常
几乎没有
同一错误重复犯
3-5次
1次(记录后不再犯)
交付代码未验证
偶尔
从不
调试耗时
2-3小时猜
15-30分钟系统化
AI自作主张加功能
经常
从不

如何开始

  1. 创建AGENTS.md文件,写入你自己的规则
  2. 创建EVOLUTION.md文件,记录错误和纠正
  3. 每次对话开始时让AI读取这两个文件
  4. 犯错/被纠正时更新EVOLUTION.md
  5. 同一纠正3次后,将规则升级到AGENTS.md

关键:行为准则不是一次写完的,是踩坑踩出来的。每次AI犯错,就是完善规则的机会。


如果觉得有用,点赞收藏👍下篇分享:如何给AI写SOUL灵魂档案,让它真正有个性、有主见、能自主干活