乐于分享
好东西不私藏

AI项目值不值,你只看了第一层——老板问的是第三层

AI项目值不值,你只看了第一层——老板问的是第三层

法篇 · 大制不割 · 第九期(总113期)


 上德不德,是以有德;下德不失德,是以无德。——《道德经》第三十八章 

一、一个让所有CIO头疼的问题

"这个AI项目,ROI是多少?"

这个问题,我在过去三年里被问了不下五十次。每一次被问到,我都想起老子《道德经》第三十八章中的那句话——"上德不德,是以有德"。

先讲一个真实的故事。

2025年初,一家制造企业找到我,希望评估他们刚上线的AI质检系统。"我们花了300万,"CIO说,"但老板问效果怎么样,我不知道怎么回答。"

"你们是怎么衡量效果的?"我问。

"我们统计了AI质检的准确率——从上线时的87%提升到了现在的94%。这个数字很不错。"

"那产线上的缺陷率下降了吗?"

CIO愣了一下。"这个……我们没有直接对比。准确率94%意味着漏检率6%,但我们没有跟踪这6%的漏检产品在后道工序被拦截的比例。"

我接着说:"客户投诉率有变化吗?退货率呢?你们AI质检替代了几个质检员,这些人转岗后的产出是多少?"

CIO的表情从不耐烦变成了困惑,最后变成了茫然。

这就是AI评估中最常见的陷阱——用技术指标(准确率、召回率、F1值)替代了业务指标(退货率、客户投诉率、人力效率),然后困惑为什么老板觉得AI"没用"。

 图 1 · 技术指标好看 ≠ 业务有价值 —— 单维度评估陷阱

方法论溯源:这个问题在管理学中有成熟的解答。罗伯特·卡普兰(Robert Kaplan)和戴维·诺顿(David Norton)在1992年发表于《哈佛商业评论》的经典论文《The Balanced Scorecard—Measures That Drive Performance》中提出了平衡计分卡(BSC)框架,将组织绩效分为四个维度:财务、客户、内部流程、学习与成长。卡普兰和诺顿的核心洞见是:单一维度的指标(尤其是纯财务指标)会误导决策,只有多维度的指标体系才能反映真实的组织健康状况。 

我将平衡计分卡的思想迁移到AI项目评估中,形成了"三级指标体系"。

图 2 · 三级指标体系金字塔(效能 → 体验 → 战略)

二、三级指标体系的逐层拆解

2.1 第一级:效能层指标("省了多少")

效能层是最直接、最容易量化的层次。它回答的问题是:这个AI项目,用多少资源替代了多少人类劳动或传统工具?

效能层有三个核心子指标:

(1)时间效率

AI帮你省了多少时间?但注意——不是"理论节省时间",而是"净节省时间"。什么叫净节省?很多人算账只算AI帮你干的活省了多少时间,却不算你"调试AI"花了多少时间、"验证AI输出"花了多少时间、"修正AI错误"花了多少时间。

方法论溯源:时间效率评估的方法论基础可以追溯到弗雷德里克·泰勒(Frederick Taylor)的科学管理原理(《The Principles of Scientific Management》, 1911)。泰勒的核心方法是"工时研究"(Time Study)——将一项工作分解为最小操作单元,测量每个单元的标准时间。在AI评估中,"工时研究"的思想同样适用:你需要把AI介入后的整个工作流程的时间消耗做端到端测量,而不是只看AI执行的那一个片段。 

一个我在某头部车企的真实数据:我们用AI辅助生成售后工单的故障描述,AI生成一段描述的时间是3秒。但在实际工作流程中,服务顾问还需要花平均15秒读取和修改AI生成的描述,另外花8秒等待系统响应。所以"净节省时间"需要减去验证和等待时间。最终的实际时间效率提升是——不是97%,而是大约40%。这个数字虽然不够华丽,但它是真实的。

(2)人力效率

AI替代了多少人力?但"替代"这个词本身就是有问题的。更好的问法是:AI释放了多少人的精力,让他们能去做更有价值的事?

丰田生产系统(Toyota Production System)中有一个经典概念叫"自働化"(Jidoka,不是自动化Automation,而是"赋予机器人的智慧")。大野耐一在《丰田生产方式》(1978)中强调:自働化的目的不是用机器替代人,而是让人从重复性劳动中解放出来,去做需要人类判断力的工作。AI的效率评估应该遵循同样的逻辑。

在某线索跟进AI外呼项目中,我没有用"AI替代了多少人工外呼"来衡量效果,而是问:"原来一个顾问每天打30个电话,现在AI帮他处理了重复性的初步筛选,他每天能深度跟进15个真正有意向的线索——这个15,跟之前的30,哪个更有价值?"

(3)成本效率

AI的直接成本和间接成本是多少?直接成本包括:API调用费、算力租赁费、模型训练费。间接成本包括:AI系统的运维人力成本、员工学习AI工具的时间成本、因AI错误导致的返工成本。

方法论溯源:成本效率的分析框架可以追溯到迈克尔·波特(Michael Porter)的价值链分析(《Competitive Advantage》, 1985)。波特将企业活动分为主要活动(进料物流、生产、出料物流、营销销售、服务)和辅助活动(基础设施、人力资源管理、技术开发、采购)。AI的成本不应该只在"技术开发"这一项里计算,而是要追踪它对整个价值链的成本影响。 

效能层的诊断自检清单:

  1. 你的AI项目有"净节省时间"的端到端测量数据吗?还是只在测量AI执行的那一个片段?
  2. 你计算人力效率时,是问"替代了多少人"还是"释放了多少创造力"?
  3. 你的成本核算包含了AI出错的返工成本吗?

2.2 第二级:体验层指标("感受到了什么")

效能层测的是"省了多少",体验层测的是"感受到了什么"。它回答的问题是:使用这个AI系统的人——无论是内部员工还是外部客户——他们的体验发生了什么样的变化?

我常常观察到一种现象:AI项目的效能指标很好看——"节省了30%的时间""替代了5个人力"——但员工和客户的反馈是负面的。你省了时间,但员工觉得工作变得更累了(因为要和AI反复"沟通");你省了人力,但客户觉得服务质量下降了(因为AI回答不够人性化)。

这就是"下德不失德,是以无德"——你盯着指标不放(不失德),反而失去了真正的价值(无德)。

方法论溯源:体验层的方法论基础有两个来源。其一是NPS(Net Promoter Score)——由Fred Reichheld在2003年发表于《哈佛商业评论》的《The One Number You Need to Grow》中提出。NPS的核心思想是:客户的忠诚度——他们会向朋友推荐你的程度——是衡量产品或服务价值的最终标准。其二是约瑟夫·派恩(Joseph Pine)和詹姆斯·吉尔摩(James Gilmore)在1999年提出的"体验经济"理论(《The Experience Economy》)。他们的核心观点是:当产品和服务趋于同质化时,体验成为唯一的差异化因素。 

在AI评估中,体验层有三个子指标:

(1)易用性体验

用户在使用AI系统时遇到摩擦的频率和强度。一个关键测量方法是Frustration Score(挫折分数)——用户在完成一个任务的过程中,有多少次表露出了困惑、反复尝试、最终放弃的行为。

在某头部车企的服务顾问AI助手项目中,我们不仅测量了AI诊断建议的准确率,还记录了服务顾问"覆盖AI建议"的频率——也就是说,AI给了一个建议,但服务顾问看都不看就自己做了判断。这个"覆盖率"最初高达62%。这说明什么呢?说明AI的建议虽然准确,但服务顾问不信任它。信任度的缺失是效能指标测不出来的——它必须在体验层被测量和解决。

(2)信任度体验

用户对AI系统的信任程度。注意:信任不是自然产生的,它是被"设计"出来的。斯坦福大学人机交互实验室的研究表明,用户对AI的信任水平受三个因素影响:AI输出的透明度(用户能不能看到AI的推理过程)、错误率的一致性(偶尔的错误比随机性错误更容易被容忍)、以及用户对AI的"可控感"(用户能不能在关键决策上覆盖AI的判断)。

(3)净推荐值(NPS)

"你会把这个AI工具推荐给同事吗?"这个问题虽然简单,但经过二十多年的研究验证,它是衡量用户满意度最有效的单问题指标。在AI评估中,NPS应该按角色分层测量——一线员工的NPS、中层管理者的NPS、最终客户的NPS——三者往往不重合。

体验层的诊断自检清单:

  1. 你的AI评估报告中,有没有用户体验的定性反馈?还是只有数字?
  2. 你测量过用户"覆盖AI建议"的频率吗?这个数字是上升还是下降?
  3. 你的NPS数据是按角色分层的吗?

2.3 第三级:战略层指标("改变了什么")

这是三级指标的最顶层,也是最难量化的一层。它回答的问题是:这个AI项目,对组织的业务模式、竞争地位、核心能力产生了什么样的结构性变化?

大部分企业的AI评估止步于效能层和体验层。不是说这两层不对——而是说如果你只停留在"省了多少时间""用户满不满意"这个层面,你无法回答一个根本性的问题:这个AI项目值得做吗?不是在"省钱"的意义上值得,而是在"改变游戏规则"的意义上值得。

方法论溯源:战略层评估的框架源自迈克尔·波特的竞争战略理论(《Competitive Strategy》, 1980)和W.钱·金与勒妮·莫博涅的蓝海战略理论(《Blue Ocean Strategy》, 2005)。波特关注的是"在现有市场中获得竞争优势",金和莫博涅关注的是"创造新的市场空间"。AI的战略价值需要从这两个维度同时评估:它是否强化了你在现有市场中的竞争地位(波特视角)?它是否让你能做以前做不到的事(蓝海视角)? 

战略层有三个子指标:

(1)业务模式的结构性变化

AI有没有改变你创造价值或获取价值的方式?一个经典的例子是Netflix——从DVD租赁到流媒体再到内容制作,每一次业务模式的变化都是数据能力和AI能力的结构性升级。如果你的AI项目只是"让现有业务做得更快一点",那它就不是战略性的。

(2)核心能力的不可复制性

AI是否形成了一道"能力护城河"?沃伦·巴菲特在1999年伯克希尔·哈撒韦股东大会上说:"护城河的本质是你做的事情别人很难复制。"(Buffett, 1999 Berkshire Hathaway Annual Meeting)。如果你的AI项目只是用了一个公开的API,任何竞争对手都能在几天内复制,那不是护城河,那是"标配"。

我在汽车行业的观察:每个车企都在做"智能客服",用的是同一家厂商的大模型API,训练的是一套相似的数据。三年后,谁的智能客服能成为护城河?答案是:没有人的。因为"使用AI"本身不构成差异化——差异化的来源是"你独有的数据"和"你对业务的独特理解"。

(3)组织学习能力的积累

AI项目是否让组织变得更"聪明"?这里的"聪明"不是指多了几个会写Prompt的人,而是指组织是否建立了一种机制——每次AI的失败都会变成组织知识的积累,而不是被遗忘在项目的废墟里。

方法论溯源:组织学习的概念由彼得·圣吉(Peter Senge)在1990年的经典著作《第五项修炼》(The Fifth Discipline)中系统阐述。圣吉提出,学习型组织的五项修炼是:自我超越、心智模式、共同愿景、团队学习、系统思考。AI项目最容易被忽视的战略价值,恰恰是它在推动组织学习方面的作用——每一个AI项目的迭代过程,都是在训练组织"系统性思考"的能力。 

战略层的诊断自检清单:

  1. 如果明天你的竞争对手也做了同样的AI项目,你的优势还在吗?
  2. 你的AI项目有没有让你能做一些"以前根本不敢想"的事情?
  3. 每次AI项目的失败,团队有没有做"事后复盘"并将教训沉淀为组织知识?

    图 3 · 方法论思想源流(1911 泰勒 → 2005 蓝海战略)

三、三级指标的动态关系:并非"越高越好"

这三个层级不是并列的评估维度,而是一层驱动一层的因果链。

图 4 · 三层动态因果链(含反直觉洞见)

效能指标是必要条件——如果你的AI项目连时间都省不了,后面的体验和战略都是空谈。

体验指标是中间变量——好的效能不一定带来好的体验(高准确率的AI可能因为交互体验差而导致用户抵触),但好的体验几乎一定需要好的效能作为基础。

战略指标是最终目的——如果你做了三年的AI,效能提升了,体验改善了,但业务模式没有发生任何结构性改变,那说明你的AI项目一直在"改进现状"而非"创造未来"。

但这里有一个反直觉的洞见:对于尚在探索阶段的AI项目,战略层的权重应该远高于效能层。原因是——如果一个AI项目的效能很好(省了时间、减了成本),但战略价值为零(你的竞争对手能轻松复制),那它只是一个"高效率的错误方向"。

四、结语:真正的好项目,不需要包装

回到开头那位制造企业的CIO。

我们在他的AI质检系统上建立了三级评估体系:

  • 效能层:
    不仅测量AI质检的准确率(94%),还追踪了它对接续工序的影响。一个关键发现是:AI替代了两个质检工位,但这两个员工转岗后,在数据标注和异常复核两个新岗位上创造的价值,超过了他们原来做人工质检的价值。 
  • 体验层:
    我们对质检主管做了深度访谈。他说了一句我觉得比任何统计数字都有价值的话:"以前每天下班前看质检报告,我心跳都会加速——不知道今天又漏了什么。现在虽然偶尔也会漏,但我知道AI漏检是有规律的,我可以预测和控制。" 
  • 战略层:
    AI质检系统积累的数据,正在成为一个新的战略资产——它让这家企业第一次拥有了"哪个供应商的哪个零部件最容易出问题"的历史数据库。这个数据库一旦建立,它是一种"滚雪球"式的竞争优势——每多一天的运行,累计的数据就让它比竞争对手更难被追赶。 

我把这份三级评估报告交给他。他看了很久,然后说了一句让我至今记忆犹新的话:

"我终于知道该怎么跟老板汇报了。不只告诉他省了多少钱,而是告诉他——我们正在建立一种别人三年之内追不上的能力。"

这,就是三级指标体系的核心价值。它不是教你"包装"AI项目的价值,而是帮你"看到"AI项目的真正价值。

《道德经》第三十八章的全文是:「上德不德,是以有德;下德不失德,是以无德。上德无为而无以为,下德为之而有以为。」

翻译成AI项目评估的语言:真正有价值的AI项目,不刻意追求指标的好看——但因为底层逻辑是对的,所以最终所有指标都会好看。而那些整天追逐KPI的AI项目——因为从一开始方向就偏了——所以即使指标数据再漂亮,最终也不会创造真正的价值。


下期预告:第十期·治大国若烹小鲜

——AI转型的诗外功夫。为什么AI转型最怕的不是"不改",而是"乱改"?


长按识别二维码,关注「飞龙AI知行录」

 飞龙 | 企业AI转型架构师 | 重庆