
8 月 23 日下午,我连着毙了 AI 军师的三版规则文件。
军师是我的 AI 总架构师,管着我所有数字员工的配置,包括一个量化交易项目的 AGENTS.md。AGENTS.md 就是每次开工自动塞给 AI 的章程,它写什么,AI 就信什么。
第一版我看完整个人都不对。第二版我怀疑它对我有意见。第三版我才明白,问题不在它,在我俩一直没把一件事说清:规则文件不是文档,是工程。
第一版翻车:我的口语,它原样抄进了章程
下午一开始,我给军师下了一条指令:机械的活让便宜模型跑,策略决策用顶级模型跑。
下午我翻开 AGENTS.md,规则里写着:"机械批量活用低配模型(Kimi 256K 档),重判断活用顶配模型(K3 档)"。
我当时就火了。"256K 档"是我嘴里随口说的,它有义务把这句话翻译成具体模型 ID 和调用命令。规则里写"档",执行的时候谁来定哪个模型算哪个档?今天我在场能解释,换个会话、换个子代理,就是自由发挥。
更打脸的在后面。军师去查了官方文档,发现"256K"根本不是低配模型,是旗舰模型 K3 的半价小上下文版,能力一样,只是上下文窗口小。真正的低价模型是另一个 ID。我的口语从一开始就是错的,它照抄了一个错误答案。
第二版翻车:模型绑死了,模糊词还活着
军师改出第二版,模型 ID、调用命令全绑死了。我以为这局翻篇了,结果往里再看一眼,血压又上来了:
应急档仅当周/月额度非常紧张且任务积压到完不成时启用,须军师判定并记录启用原因。
我直接问它:"非常紧张"是什么概念?是 95% 还是 80%?怎么裁定?
一条需要人来裁定"紧不紧张"的规则,等于把判断成本永远挂在人身上。每次执行都要找人问一句,这就是臃肿,就是低效。规则文件的读者是 AI 和未来的我,两边都不该做阅读理解。
第三版定稿:条件全部量化,机器自己能判
第三版,应急档的启用条件变成了三条硬阈值,同时满足就自动启用,不用问任何人:
周额度已用百分比 ≥ 时间进度 +20 个百分点(数据来自额度查询脚本,每日例行采集); 距周额度重置 >24 小时; 分析层任务触发条件达成后,积压未执行 ≥24 小时。
模型分层也从"档"变成了查表,执行端没有任何裁量空间:
L0 执行层:纯脚本,零模型调用。回测、闸门判定、归档、日报,全是代码硬判定,跑一千个组合也不烧一分额度; L1 分析层:固定 kimi-code/k3-256k,K3 同质量半价,命令kimi -m kimi-code/k3-256k -p "<任务>";L2 决策层:固定 kimi-code/k3,1M 上下文旗舰,只做候选终审和实盘决策包,由军师触发;应急档: kimi-code/kimi-for-coding-highspeed,锁在柜子里,满足上面三条才启用,启用事实进日报。
同一天,这份文件里所有"(2026-08-23 本人裁定)"式的日期批注也被清掉了。裁定出处进 git 提交信息和更新历史,正文只留可执行规则。章程不是日记。
顺带的收获:一条不停工的研究队列
这场规则整顿的背景,是当天下午我刚给量化项目立了条规矩:策略研究不许停,一个策略死了,下一个自动接上,不许等我每天手动启动。
军师当天就把队列建出来了。114 个因子参数组合排队,9 个因子族,跑数器挂在每晚的自动任务里,判定一个归档一个,全程纯脚本。过线闸门有 6 道,其中一道是多重检验修正:同一个因子族试的次数越多,过线门槛自动上调,只升不降。这是防"刷一千个组合、总有一个回测漂亮"的过拟合陷阱,那种假信号上实盘就是送钱。
冒烟实测跑了 4 个组合,全灭归档,另有 2 个按夜批口径自动接续跑通。有一个可转债组合样本外年化 13.7%,最大回撤 8.8%,放以前我会觉得还行,现在修正后的门槛是 46.6%,直接归档。闸门宁可错杀,因为放过一个假信号的代价是真金白银。
写给同样在养 AI 团队的人:规则文件自检 8 条
这一天的学费,收成一张清单。每次改 AI 的规则文件,逐条过:
全文搜一遍模糊词:非常、尽量、必要时、差不多,有一个毙一个,全部换成数字阈值; 每条规则自问:这条机器能自己判定吗?要人来裁定的,要么量化,要么删; 所有模型、工具、路径绑定到具体 ID 和命令,禁"档""类""系列"这种筐; 口语指令先术语化再入库,原话只进提交信息; 日期、裁定出处、作者情绪,一律不进规则正文,进 git log 和台账; 每条阈值写清数据从哪个脚本、哪个文件取; 改完贴出全文给相关方过目,别让人自己翻 diff; 每次修订后自查长度,文件膨胀就拆分,细节推到引用文档。
经验总结
规则文件按代码的标准验收:可执行、无歧义、可复现。这次全部量化到阈值之后,执行端再没来问过我一次。 我的口语是需求,不是规格。军师的第一道工序是把需求翻译成规格,照抄口语等于没干活。 我以为模型分层是省钱问题,结果是质量问题:k3-256k 质量等同旗舰、价格一半,批量分析活用它反而是升配。
FAQ
Q:AGENTS.md 写多长合适? 我的体检标准是:每次会话都自动注入的文件,只放高层规则,细节推到引用文档按需加载。文件越长,每轮对话白烧的上下文越多,规则之间还互相稀释。膨胀即拆分。
Q:多重检验修正的公式是什么? 同族第 k 次尝试,收益门槛 ×(1+0.25·log₂k),t 值门槛 ≥√(2·ln20k),族历史尝试数计入先验。公式、闸门细则和整份规则文件全文,我都公开在 CSDN 专栏了(搜"野生码农"进主页翻),直接抄。
Q:为什么应急档启用不让军师判定? 因为它判"紧不紧张"和我判一样主观,还多一道沟通成本。三条阈值全是脚本可查的数,满足就启用,启用记日报,事后我能审计,这就够了。
Q:规则文件多久改一次? 犯错才改,不预写。每条新规则背后要有一次真实的翻车记录,没有证据的规则是口号。
我是野生码农,AI 实战派。自研 AI 本地知识库系统、AI 数字员工团队、软考 AI 备考系统、量化交易系统,全程公开复盘。
本公众号所有文章内容均为本人 AI 实战的过程和结果内容,经 AI 整理后发布,无任何瞎编虚构内容。
这篇是《AI员工团队》第 10 篇。文中这份规则文件的全文(脱敏版)我直接公开了,放在 CSDN 专栏,搜"野生码农"或去主页翻,随便抄。下一篇是 8 月 30 日月报:AI 团队第一个月,涨粉、阅读、token 成本,真实数据全公开,难看也报。
关注我,看真的。
野生码农AI实战 · 全网同名 · AI 数字员工实战复盘,数据只报真实实测内容
夜雨聆风