乐于分享
好东西不私藏

组织AI化最缺的不是工具,是最佳实践

组织AI化最缺的不是工具,是最佳实践
组织AI化指南2026.08.21

组织AI化最缺的不是工具,是最佳实践

巨头都在开源框架了,你公司真正的护城河到底在哪?

DOODLE

模型在趋同,工具在开源——真正值钱的,是没人抄得走的判断力

Harness准则工程

大家好,我是老谭。

上一篇,我跟各位老板说了一句话:别追热点,先打地基,自己动手去用一遍CodexClaude Code,你才知道AI的能力边界在哪。

有老板私信我:老谭,我照你说的试了,确实震撼。可我还是没搞明白——这些工具凭什么这么强?我怎么才能让AI在我自己公司里也这么强?

这个问题问到点子上了。

今天这篇,我就接着上一篇往深了讲。因为这两天又出了两件大事,正好能把这个问题彻底讲透。

01

PART

两件大事:巨头们开始"互相调用"了

MODELS CONVERGE, HARNESS OPENS UP

第一件事:DeepSeek Harness最新版本,能直接把Claude Code和Codex当"下属"来调用了。

这不是社区搞的野路子插件。是DeepSeek官方仓库里内置的、有名有姓的两个模块——你可以让DeepSeek的主智能体接一个活,然后把其中一部分子任务"派"给Claude Code或者Codex去干,干完把结果收回来。

第二件事:8月19号,OpenAI把Codex的Harness整个开源了。

什么意思?就是OpenAI把驱动Codex的那套"执行系统"完全公开,谁都可以拿去用、拿去改、拿去嵌进自己的产品。

巨头不再藏着框架,反而主动开源、互相调用

你把这两件事连起来看,会发现一个信号:

这些巨头,不再藏着掖着自己的框架了,反而主动把它开源、主动让竞争对手的工具接进来。

为什么?

因为他们心里都清楚一件事:模型层面的差距,正在快速缩小。

DeepSeek、GPT、Claude、GLM……这些模型的能力已经越来越接近。既然模型拉不开差距了,那真正值钱的东西是什么?

是Harness。是包在模型外面那层"执行系统"。

02

PART

一个让人睡不着觉的数据

SAME MODEL, 3X SCORE

我给你看一个数字,这是OpenAI自己公布的。

在一个叫ARC-AGI-3的能力测试上,GPT这个模型权重一个字节都没改,OpenAI只是把外面那层Harness优化了一下——

得分从13.3%,直接干到了38.3%。

差不多翻了三倍。而且更狠的是,消耗的成本(token)还降到了原来的六分之一。

同一个模型,只改Harness:得分近3倍,成本降到1/6

你品品这个数据。

同一个模型,同一个脑子,什么都没变。只是把"它怎么干活的那套流程"重新设计了一遍,效果就翻了三倍,成本还降到零头。

这说明什么?

真正决定AI好不好用的,不是模型有多聪明,而是你有没有把"最佳实践"固化进它的工作流里。

价值不在模型里。价值在最佳实践里。

03

PART

Harness里到底固化了什么"最佳实践"

CRAFTSMANSHIP, HARD-CODED

我们再往里看一层。这些顶级的Harness,到底把什么东西固化进去了?

说白了,就是一整套原本靠资深工程师的经验和自觉才能维持的工作纪律,被硬编码成了AI的默认行为。

举几个例子你就懂了:

"改代码前,先把代码读一遍。" 固化成:AI必须先收集上下文、先探索,才能动手。

"危险操作,动手前先问一句。" 固化成:删库、上线这种事,AI必须先请示、得到批准才能做。

"别在生产环境里乱试。" 固化成:所有操作先在沙箱里跑,跑通了再说。

"每一步干了啥,都得留痕、能回滚。" 固化成:全程日志、随时可追溯、可撤销。

"能力不够就报错,别硬撑着装没事。" 固化成:干不了的活直接大声报错,绝不悄悄糊弄过去。

老师傅的职业素养,被硬编码成AI的默认行为

看明白了吗?

这些东西,每一条都是好工程师身上最宝贵的"职业素养"和"判断力"。

以前,这些东西只活在老师傅的脑子里,靠传帮带、靠踩坑、靠多年经验。现在,它们被一条条掏出来,写成了AI雷打不动的行为准则。

最佳实践的力量:把最顶尖那批人的判断力,变成人人都能继承、AI每次都会执行的默认动作。

04

PART

但是——这套最佳实践,不是你公司的

GENERIC vs PROPRIETARY

讲到这,你可能已经很兴奋了:那我直接把Codex、Claude Code这套Harness搬进我公司,不就完了吗?

打住。这里有个天大的误会,我必须给你说清楚。

Codex和Claude Code里固化的最佳实践,是"一个好工程师该怎么写代码"的最佳实践。

它是通用的。是全世界所有程序员都通用的那套职业素养。可你公司真正值钱的东西,是这个吗?

不是。

你公司值钱的,是那些只有你们才懂的判断

• 什么样的客户能给账期,什么样的绝对不能?

• 这个报价单,什么情况下能让利,什么情况下宁可不做?

• 这批货出了质量问题,什么程度该召回,什么程度内部消化?

• 这个供应商报低价,是真便宜还是有坑?

通用最佳实践是公共品,独家判断力才是护城河

这些判断,通用大模型不懂,Codex的Harness里也没有。

因为它们不是通用常识,是你这家公司在市场里摸爬滚打多年、交了无数学费才沉淀下来的独家判断力。

它们现在在哪?在你几个老师傅、老销售、老采购的脑子里。人一走,判断力就跟着走了。

05

PART

核心:把你的最佳实践也固化出来

GUIDELINE ENGINEERING

现在,答案已经浮出水面了。

Codex和Claude Code证明了一件事:最佳实践是可以被"固化"下来的,而且固化之后价值巨大——三倍效果、六分之一成本。

那组织AI化真正要干的,就是把这套逻辑用到你自己的业务上:把你公司那套独家的判断力,也一条条掏出来、固化下来,让AI每一次干活,执行的都是你的标准。

这件事,就是我一直在讲的——Guideline Engineering(准则工程)

上一代人写代码,这一代人写准则。

准则工程干的,就是把老师傅脑子里那套"什么情况该怎么办"的隐性判断,一条条掏出来、写成公司人人可继承、AI可执行的结构化准则。

Codex的Harness,固化的是"好工程师的通用素养"。你的准则工程,固化的是"你这家公司独一无二的判断力"。

前者你可以直接买、直接下载、开源免费。后者,全世界只有你有,谁也抄不走。

06

PART

为什么说它是最佳实践的"核心"

GUIDELINE, NOT GENIUS

我把这个逻辑再收一下口。

第一,AI时代,模型在趋同,工具在开源、在互相调用。DeepSeek能调Claude Code,OpenAI把Codex开源——这些"通用的最佳实践"正在变成人人都能拿到的公共品。它们很重要,是地基。但地基是公共的,拉不开你和对手的差距。

第二,真正拉开差距的,是你公司那套没人抄得走的判断力。而把这套判断力从人脑里搬出来、固化成AI能执行的准则,这就是准则工程。

第三,准则不是建个知识库、买套RAG就能解决的。

我在之前的文章里说过,RAG靠"猜相似"去捞信息,捞回来的是缺了前提条件的碎片。AI看到"可以给客户打折",却看不到"只有续约三年以上的老客户才能打折"这个关键前提。

准则工程的另一半,就是要让AI查得准、还证明得了——每一条准则的来龙去脉、适用边界,都得清清楚楚。这样AI做的每一个决定,才不是"猜的",而是"有据可依的"。

组织AI化最需要的,从来不是最新的工具、最热的框架。是最佳实践

而最佳实践的核心,就是把你这家公司独一无二的判断力,固化成AI能执行的准则。

准则,而非天才(Guideline, not Genius)。

天才走了,判断力也走了;准则留下,AI一遍遍精准执行

一家公司真正的护城河,不是你请到了多牛的天才,而是天才走了之后,他的判断力还能留下来、还能被AI一遍遍精准执行。

这,才是AI时代最难被复制的核心竞争力。


老谭

只谈能落地的AI,和能分钱的商业

如果今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见