组织AI化最缺的不是工具,是最佳实践
巨头都在开源框架了,你公司真正的护城河到底在哪?
模型在趋同,工具在开源——真正值钱的,是没人抄得走的判断力
大家好,我是老谭。
上一篇,我跟各位老板说了一句话:别追热点,先打地基,自己动手去用一遍Codex和Claude Code,你才知道AI的能力边界在哪。
有老板私信我:老谭,我照你说的试了,确实震撼。可我还是没搞明白——这些工具凭什么这么强?我怎么才能让AI在我自己公司里也这么强?
这个问题问到点子上了。
今天这篇,我就接着上一篇往深了讲。因为这两天又出了两件大事,正好能把这个问题彻底讲透。
01
PART
两件大事:巨头们开始"互相调用"了
MODELS CONVERGE, HARNESS OPENS UP
第一件事:DeepSeek Harness最新版本,能直接把Claude Code和Codex当"下属"来调用了。
这不是社区搞的野路子插件。是DeepSeek官方仓库里内置的、有名有姓的两个模块——你可以让DeepSeek的主智能体接一个活,然后把其中一部分子任务"派"给Claude Code或者Codex去干,干完把结果收回来。
第二件事:8月19号,OpenAI把Codex的Harness整个开源了。
什么意思?就是OpenAI把驱动Codex的那套"执行系统"完全公开,谁都可以拿去用、拿去改、拿去嵌进自己的产品。

你把这两件事连起来看,会发现一个信号:
这些巨头,不再藏着掖着自己的框架了,反而主动把它开源、主动让竞争对手的工具接进来。
为什么?
因为他们心里都清楚一件事:模型层面的差距,正在快速缩小。
DeepSeek、GPT、Claude、GLM……这些模型的能力已经越来越接近。既然模型拉不开差距了,那真正值钱的东西是什么?
是Harness。是包在模型外面那层"执行系统"。
02
PART
一个让人睡不着觉的数据
SAME MODEL, 3X SCORE
我给你看一个数字,这是OpenAI自己公布的。
在一个叫ARC-AGI-3的能力测试上,GPT这个模型权重一个字节都没改,OpenAI只是把外面那层Harness优化了一下——
得分从13.3%,直接干到了38.3%。
差不多翻了三倍。而且更狠的是,消耗的成本(token)还降到了原来的六分之一。

你品品这个数据。
同一个模型,同一个脑子,什么都没变。只是把"它怎么干活的那套流程"重新设计了一遍,效果就翻了三倍,成本还降到零头。
这说明什么?
真正决定AI好不好用的,不是模型有多聪明,而是你有没有把"最佳实践"固化进它的工作流里。
价值不在模型里。价值在最佳实践里。
03
PART
Harness里到底固化了什么"最佳实践"
CRAFTSMANSHIP, HARD-CODED
我们再往里看一层。这些顶级的Harness,到底把什么东西固化进去了?
说白了,就是一整套原本靠资深工程师的经验和自觉才能维持的工作纪律,被硬编码成了AI的默认行为。
举几个例子你就懂了:
"改代码前,先把代码读一遍。" 固化成:AI必须先收集上下文、先探索,才能动手。
"危险操作,动手前先问一句。" 固化成:删库、上线这种事,AI必须先请示、得到批准才能做。
"别在生产环境里乱试。" 固化成:所有操作先在沙箱里跑,跑通了再说。
"每一步干了啥,都得留痕、能回滚。" 固化成:全程日志、随时可追溯、可撤销。
"能力不够就报错,别硬撑着装没事。" 固化成:干不了的活直接大声报错,绝不悄悄糊弄过去。

看明白了吗?
这些东西,每一条都是好工程师身上最宝贵的"职业素养"和"判断力"。
以前,这些东西只活在老师傅的脑子里,靠传帮带、靠踩坑、靠多年经验。现在,它们被一条条掏出来,写成了AI雷打不动的行为准则。
最佳实践的力量:把最顶尖那批人的判断力,变成人人都能继承、AI每次都会执行的默认动作。
04
PART
但是——这套最佳实践,不是你公司的
GENERIC vs PROPRIETARY
讲到这,你可能已经很兴奋了:那我直接把Codex、Claude Code这套Harness搬进我公司,不就完了吗?
打住。这里有个天大的误会,我必须给你说清楚。
Codex和Claude Code里固化的最佳实践,是"一个好工程师该怎么写代码"的最佳实践。
它是通用的。是全世界所有程序员都通用的那套职业素养。可你公司真正值钱的东西,是这个吗?
不是。
你公司值钱的,是那些只有你们才懂的判断:
• 什么样的客户能给账期,什么样的绝对不能?
• 这个报价单,什么情况下能让利,什么情况下宁可不做?
• 这批货出了质量问题,什么程度该召回,什么程度内部消化?
• 这个供应商报低价,是真便宜还是有坑?

这些判断,通用大模型不懂,Codex的Harness里也没有。
因为它们不是通用常识,是你这家公司在市场里摸爬滚打多年、交了无数学费才沉淀下来的独家判断力。
它们现在在哪?在你几个老师傅、老销售、老采购的脑子里。人一走,判断力就跟着走了。
05
PART
核心:把你的最佳实践也固化出来
GUIDELINE ENGINEERING
现在,答案已经浮出水面了。
Codex和Claude Code证明了一件事:最佳实践是可以被"固化"下来的,而且固化之后价值巨大——三倍效果、六分之一成本。
那组织AI化真正要干的,就是把这套逻辑用到你自己的业务上:把你公司那套独家的判断力,也一条条掏出来、固化下来,让AI每一次干活,执行的都是你的标准。
这件事,就是我一直在讲的——Guideline Engineering(准则工程)。
上一代人写代码,这一代人写准则。
准则工程干的,就是把老师傅脑子里那套"什么情况该怎么办"的隐性判断,一条条掏出来、写成公司人人可继承、AI可执行的结构化准则。
Codex的Harness,固化的是"好工程师的通用素养"。你的准则工程,固化的是"你这家公司独一无二的判断力"。
前者你可以直接买、直接下载、开源免费。后者,全世界只有你有,谁也抄不走。
06
PART
为什么说它是最佳实践的"核心"
GUIDELINE, NOT GENIUS
我把这个逻辑再收一下口。
第一,AI时代,模型在趋同,工具在开源、在互相调用。DeepSeek能调Claude Code,OpenAI把Codex开源——这些"通用的最佳实践"正在变成人人都能拿到的公共品。它们很重要,是地基。但地基是公共的,拉不开你和对手的差距。
第二,真正拉开差距的,是你公司那套没人抄得走的判断力。而把这套判断力从人脑里搬出来、固化成AI能执行的准则,这就是准则工程。
第三,准则不是建个知识库、买套RAG就能解决的。
我在之前的文章里说过,RAG靠"猜相似"去捞信息,捞回来的是缺了前提条件的碎片。AI看到"可以给客户打折",却看不到"只有续约三年以上的老客户才能打折"这个关键前提。
准则工程的另一半,就是要让AI查得准、还证明得了——每一条准则的来龙去脉、适用边界,都得清清楚楚。这样AI做的每一个决定,才不是"猜的",而是"有据可依的"。
组织AI化最需要的,从来不是最新的工具、最热的框架。是最佳实践。
而最佳实践的核心,就是把你这家公司独一无二的判断力,固化成AI能执行的准则。
准则,而非天才(Guideline, not Genius)。

一家公司真正的护城河,不是你请到了多牛的天才,而是天才走了之后,他的判断力还能留下来、还能被AI一遍遍精准执行。
这,才是AI时代最难被复制的核心竞争力。
老谭
只谈能落地的AI,和能分钱的商业
如果今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见
夜雨聆风