乐于分享
好东西不私藏

AI 战略的关键,不是零错误,而是设计不确定性

AI 战略的关键,不是零错误,而是设计不确定性

这两年,几乎每家公司都在谈 AI。

有人谈大模型,有人谈智能体,有人谈平台、算力、工作流重构,听起来热火朝天。可真到了落地现场,很多项目最后不是卡在模型能力不够,也不是卡在预算不够,而是卡在一个更朴素、也更少被正面讨论的问题上:这件事,到底允许错到什么程度?

出了错,谁来发现?谁来兜底?代价有多大?

这几个问题听起来不性感,甚至有点像在给 AI 泼冷水。但说实话,真正做过项目的人都知道,AI 能不能用,常常就卡在这里。

因为现实里的大多数工作,本来就不是“绝对正确”和“完全不能用”之间的选择题。真实业务更像一片灰区:信息不完整,判断会摇摆,流程有噪音,经验说不成标准答案,但事情还是得继续推进。

很多白领工作长期没法被传统软件彻底自动化,不是因为它们有多高深,而是因为它们本来就建立在“差不多对”“先做再改”“边做边判断”这些逻辑之上。

也正因为如此,AI 真正有价值的地方,从来不是造出一个“永不出错”的系统,而是帮组织重新看清三件事:

  • 哪些任务本来就是在概率上运行的
  • 哪些错误其实是可接受、可测量、可补救的
  • 工作流该怎么重构,才能让人和 AI 分工得更合理

真正能落地的 AI,不是从“怎么做到零错误”开始,而是从“哪些错误可以接受,出了问题怎么收场”开始。

如果你把这个问题想明白,很多看似复杂的 AI 战略问题,反而会变得清楚。

下面,我们就从几个最容易被忽略、却最决定成败的角度,重新聊一遍 AI。


一、传统软件,其实只覆盖了工作世界里很小的一块

很多人默认一种想法:只要流程够清楚,软件总能把事情解决。

但真相是,传统软件真正擅长的,只是非常窄的一类任务:输入明确、输出固定、错误几乎不能容忍。

比如财务系统里的记账规则、库存系统里的扣减逻辑、订单流转里的状态变更。这些任务很适合确定性软件:条件清楚,规则固定,结果容易验证,错了就报错,或者直接回退。

可只要你把视线从系统流程图里挪开,放回企业每天的真实工作现场,就会发现大量任务根本不是这样。

销售要判断客户意向,客服要理解用户情绪,运营要归纳问题原因,审核人员要识别异常,工厂老师傅要从一堆材料里看出哪个有风险。它们都不是简单的输入输出映射,而是高度依赖上下文、经验和取舍。

过去 IT 行业最厉害的地方,不只是把代码写出来,而是先把原本混乱的工作,压缩成“能写进代码”的形式:统一字段、强制填表、重做流程、拆分步骤,让系统只碰标准化部分,把真正复杂的判断留给人。

这意味着一个很重要的事实:

软件不是天然适用于所有工作,它只适用于那些已经被改造得足够规整的工作。

这也解释了为什么很多组织一上 AI 就容易误判。他们还沿用过去做 IT 项目的思路,以为流程梳理清楚了,剩下只是模型精度的问题。

但 AI 面对的,恰恰是那些过去没法被完全规整化的工作。

换句话说,AI 进入的不是“代码能力的延长线”,而是另一块地形。


二、大多数白领工作,本来就不是“绝对正确”,而是“多数情况下够用”

这句话听上去可能不太讨喜,但它非常接近现实。

很多白领工作的运转方式,本来就不是“永远精确”,而是在不确定里做出一个足够合理的判断,然后再快速修正。

写报告、做客服、跟进项目、审核信息、做市场分析、处理投诉、整理需求、筛选候选人,这些任务难,不是因为它们要求 100% 正确,而是因为它们总是在信息不完整、时间有限、场景复杂的情况下,持续给出“当下最合理”的决定。

这类工作的共同点通常是:

  • 没有唯一正确答案
  • 输入经常不完整,甚至混乱
  • 输出往往得“像人话”
  • 判断标准高度依赖经验和语境
  • 出错并不少见,但必须能被发现、被纠正

说得更直白一点,很多组织嘴上说“不能错”,可流程设计里其实早就默认错误会发生,所以才会有复核、抽检、追踪、返工、升级处理、经验兜底这些机制。

很多办公室里的高水平工作,不是从不出错,而是出了错也能很快看出来,并且补得回来。

这恰恰就是 AI 的机会。

当你承认很多工作本来就是在“概率正确”里运行,就没必要再拿“绝对不能错”的幻想去卡住自动化,而是应该换个问题来问:这项任务的人类基线到底是什么?AI 如果已经接近,甚至略好于人类平均表现,是不是就已经足够有价值了?

这一步,会直接改变企业看 AI 的方式。


三、AI 战略的第一步,不是上模型,而是先测量“人”自己到底有多不一致

很多企业在评估 AI 时,有一个默认前提:现有人工流程是稳定的、正确的、标准一致的,只是效率还不够高。

可一旦真的开始测量,情况常常完全不是这么回事。

人和人之间,本来就不一致。

这件事在几乎所有行业都成立。客服对同一类问题的归因会不同,审核员对同一份材料的判断会不同,资深现场人员对同一批工业原料的估值也可能差很多,管理者对同一条用户反馈的理解也未必一样。

如果不先把这种“人类波动”量出来,就很容易掉进一个特别别扭的局面:一边是人工结果本来就有分歧,另一边却要求 AI 必须给出唯一正确答案。

这种目标,从一开始就不现实。

更合理的做法,是在 AI 项目启动之前,先把人工现状摆到台面上:

  • 同一任务交给多位有经验的人独立判断
  • 统计他们的一致率和差异范围
  • 看看哪些错误可以补救,哪些错误代价特别高
  • 搞清楚业务真正依赖的是“绝对正确”,还是“总体可控”

在一些工业视觉判断场景里,如果多位资深专家对同一批物料的估值差异接近 20 个百分点,这个结果本身就足以改变整个项目的讨论方向。

它提醒所有人,问题从来不是“AI 能不能达到想象中的完美”,而是“AI 能不能达到现实里的人类水平,甚至帮人逐步拉齐标准”。

如果连人都没有统一答案,就别要求 AI 证明自己像神谕一样正确。

这一步一旦做对,AI 项目就不再是理念之争,而会变成一个可以量化、可以经营、可以落地的现实问题。


四、评估 AI,不该问“会不会犯错”,而该问“犯错到底值不值得”

企业谈 AI,最常见的误区之一,就是用一种过于理想化的方式看技术:只要可能出错,就觉得不能上;只要不是 100% 准确,就觉得不可靠。

但业务不是论文答辩。

真正该问的问题其实是:如果这套 AI 出错,损失是什么?发生频率高不高?能不能被发现?修复成本高不高?和人工比,到底谁更划算?

这其实是 AI 战略里最关键、也最现实的一条线:把“正确性”翻译成“经济性”来讨论。

比如,一个客服摘要系统偶尔漏掉细节,只要它能把人工复盘时间从 30 分钟压到 5 分钟,而且关键错误还能被坐席或主管发现,那它依然可能很有价值。

一个推荐模型不一定每次都给出最优结果,但只要整体转化率提高,错误推荐也不会带来灾难性后果,它就值得上线。

一个工业检测模型即便不能完全替代专家,只要它能先筛掉 80% 的明显正常样本,把专家精力集中到高风险对象上,也已经是在创造价值。

所以,决定 AI 能不能用的,不该是抽象的“容错焦虑”,而该是一个更实际的计算:

  • AI 的错误率是多少?
  • 每次错误平均会带来多大损失?
  • 系统建设和运行成本是多少?
  • 和现有人工方式相比,整体收益是不是更好?

AI 值不值得部署,不取决于它完不完美,而取决于它是不是比现在的做法更划算。

这背后其实会带来一个很重要的认知变化:不是所有任务都该追求最高精度,很多任务真正需要的,其实只是“合适的精度”。

一旦你理解了这一点,也就更容易明白,为什么这一波生成式 AI 会让这么多人突然觉得“好像什么都能做了”。


五、生成式 AI 真正颠覆的,不是内容生成,而是“非结构化工作”第一次变得可处理

这一波 AI 为什么让人震动?

不是因为机器第一次会写字,而是因为它第一次大规模进入了过去最难自动化的一类工作:输入是乱的,输出也得像人写出来的一样。

传统机器学习更擅长处理表格数据、评分预测、分类判断。深度学习擅长图像、语音这些感知型任务。生成式 AI 则把能力往前推了一大步,进入了语言理解、语义抽取、总结归纳、上下文推理、文本重写这些更接近白领工作的区域。

这意味着,很多过去需要人先读懂、再提炼的事情,现在 AI 可以先帮你做第一轮。

比如:

  • 从杂乱的会议记录里提取重点
  • 从客服对话里识别用户抱怨
  • 从文档里抽取结构化字段
  • 把模糊需求整理成任务草案
  • 从成百上千条意见里聚类出主要问题

尤其是在客服中心或客户联络中心这样的场景里,这种价值特别明显。

电话录音转成文字以后,内容往往并不好看:口语断裂、语义跳跃、夹着情绪,还伴随着语音识别误差。过去用关键词、规则和情感词典做分析,往往只能抓到表层。现在用大语言模型,不仅更容易抽出“客户到底在抱怨什么”,还能继续往下区分眼前的联系原因,和更深一层的客户之声(VoC)。

这里有个特别关键的区别:

  • 联系原因(Contact Reason)
     是“客户为什么联系你”
  • 客户之声(VoC)
     是“客户真正不满、困惑、期待的是什么”

前者可以帮助你优化常见问题、自助语音菜单分流和客服培训;后者则可能让你看到产品设计问题、流程障碍、服务缺口,甚至新的业务机会。

这时候,AI 的价值就不只是“更快处理文本”了,它开始接近管理层真正关心的问题:它能不能帮助组织看见以前看不见的模式?

不过,这里也最容易被夸大。


六、AI 给你的,通常不是答案,而是线索

很多人看到 AI 能提取、分类、聚类、总结,就会顺手把“洞察”也算进去。

其实不是这么回事。

AI 可以帮你从一大堆杂音里捞出信号,但信号不等于洞察,洞察更不等于决策。

拿客服数据来说,AI 的确可以做很多事:

  • 从录音文本里抽取关键评论
  • 判断这是抱怨、需求还是咨询
  • 给出主题分类
  • 把相近反馈聚成几类
  • 自动总结某一类反馈的共性

这些能力已经很强,也足够大幅降低分析成本。

但接下来真正重要的问题,仍然需要人来回答:

  • 这些聚类里,哪个问题最值得优先解决?
  • 它是产品缺陷、流程设计问题,还是用户教育不足?
  • 这是偶发抱怨,还是会影响留存的核心摩擦?
  • 该交给产品、运营、客服培训,还是系统团队处理?
  • 如果流程改了,后面又该怎么持续追踪变化?

AI 可以先把沙子分成几堆,但哪一堆里真有金子,还得人来判断。

这也是为什么,很多 AI 项目明明输出看上去很聪明,最后却没带来业务结果。问题不一定是输出没用,而是组织把输出当成了终点,没有设计出后续的人类行动链路。

真正高效的工作方式,往往是一个不断迭代的回路:

  1. 人先提出业务问题
  2. AI 帮忙压缩信息、提取线索
  3. 人再据此形成假设
  4. 用新的假设去重筛、重跑、重看数据
  5. 最后把结论变成业务动作

所以,别把 AI 当成“自动生成价值”的机器。它更像一个高效的线索发现器、分析助手、问题放大器。

真正的价值,不在它吐出的那几段文字里,而在它让组织更快看见问题、讨论问题、推动问题被解决。

如果说上面的案例更多发生在信息密集型岗位,那么到了工业现场,这个逻辑只会更明显。


七、在高专业度场景里,AI 最难的常常不是建模,而是把经验变成知识

很多工业场景一提 AI,大家第一反应都是图像模型、传感器、识别精度。

可真做深了以后,你会发现最难的部分常常不在算法,而在标签从哪来、标准怎么定、专家到底凭什么做出判断。

比如废钢回收、工业废弃物估算、危险异物识别这类任务,看上去像“拍照识别”就能解决,实际上背后靠的是大量现场经验:形态、厚度、材质特征、风险征兆、行业语言、历史事故、操作习惯……

很多资深人员看得懂,但说不清。他们的知识在脑子里、眼力里、手感里,却不在文档里。

这就带来一个根本问题:如果组织没法把这些隐性知识转成机器可用的知识,模型就没有真正扎实的学习基础。

很多企业低估了这一点,于是把标注工作当成低价值外包。结果是,成本也许压下来了,但知识没有留下来。标出来的是表面标签,不是可持续复用的专业认知。

更聪明的做法,是把标注和知识管理一起当成战略能力来建设:

  • 让标注团队深入现场,理解真实工况
  • 让行业专家和 AI 工程师一起定义判断标准
  • 把“怎么看出来”的依据写成可复用规则
  • 建立面向视觉识别和业务判断的知识目录
  • 持续更新,让新经验不断沉淀成组织资产

这个过程,说到底,就是把个人经验转成组织知识,再转成模型能力。

在高门槛行业里,真正的护城河往往不是模型本身,而是组织能不能持续把现场经验变成可训练、可复用的知识资产。

这也解释了为什么有些行业适合做专有模型:不是为了“自己造轮子”而造,而是因为你的数据、标签和领域语言本身就是优势。

但有意思的是,AI 做得越深,越会发现一个有点反直觉的结论:有时候,最好的产品策略,反而是让 AI 退后一点。


八、并不是所有 AI 产品,都应该把 AI 放在舞台中央

这是一个特别值得反复提醒的观点:

不要硬把 AI 变成产品唯一的价值来源。

很多团队做 AI 产品时,一开始总想让模型直接给出最终答案。比如通过图片精确估算工业废弃物的数量、重量、体积,好像用户真正要的,就是一个机器给出的高精度结论。

但一到现场你就会发现,真实工作根本不是这么运转的。

比如销售或现场人员在做废弃物报价时,他们往往并不需要绝对精确值,原因很简单:

  • 报价本来就是估值,不是最终结算
  • 客户更关心的是一个大致费用区间
  • 实务里通常更怕低估,不是高估
  • 前期根本没人会逐件精确清点所有物品

这时候,如果产品还执着于把 AI 做成“绝对精准的估算器”,就很可能在错误方向上耗掉大量资源。

更符合业务的设计,往往是把 AI 变成一个辅助判断的参照物:

  • 给出建议区间,而不是唯一答案
  • 帮用户校准直觉,而不是替用户拍板
  • 在界面上让用户很容易采纳、调整或忽略建议
  • 把“人类偏保守的判断”纳入产品机制,而不是试图消灭它

这种设计看上去像是“降低了 AI 的存在感”,但反而更容易被市场接受。因为它尊重了真实工作的结构,也把 AI 放到了更合适的位置上。

有时候,好的 AI 设计不是让机器替人做决定,而是让人做决定时更快、更稳,也更有把握。

这背后其实指向一个更大的结论:AI 项目成不成功,很多时候不取决于模型有多炫,而取决于工作流有没有被重新设计。


九、Human-in-the-loop 不是妥协,而是很多场景下最优的系统设计

一提“人参与审核”,不少人会觉得这是 AI 还不成熟时的权宜之计。

但在很多现实业务里,Human-in-the-loop 并不是临时补丁,而是更合理的责任架构。

尤其是在错误后果很大、责任必须可追溯的任务里,把人放在 AI 后面,往往反而是最优解:

  1. AI 先做高速度、高覆盖率的初步处理
  2. 系统把结果整理成容易检查、容易修正的形式
  3. 人在关键节点确认或者兜底
  4. 反馈再回到模型和流程里,继续改进

这种模式有几个非常实际的好处。

第一,它保留了责任归属。很多行业不是不能接受机器参与,而是不能接受责任说不清。

第二,它能拿到 AI 最大的效率红利。人不必从零开始处理全量任务,而是只看 AI 标出来的重点、边界和异常。

第三,它能形成双向提升。AI 会在更多反馈里变好,人也会在对照和复盘中逐渐统一标准。

这在工业检验、客服分析、合规审核、医疗辅助、法务检索这些场景里都很明显。真正高效的系统,往往不是“机器取代人”,而是“机器先跑一遍,人做最后判断并承担责任”。

未来,随着 AI 智能体越来越深地进入系统和工具,工作流设计还会继续变化。

但有一个原则,大概率不会变:

越是高风险动作,越要让错误可以撤销、可以隔离、可以补救。

内部系统的误修改,和面向外部客户的错误行为,不是一个等级的风险。前者可以回滚,后者可能造成不可逆的损害。

所以,面向未来的系统设计重点之一,不是幻想智能体永不犯错,而是提前设计好:

  • 哪些动作必须人工确认
  • 哪些错误可以自动回滚
  • 哪些风险只能先在内部环境试行
  • 哪些流程要默认“机器偶尔会做错”

说到底,这又回到了本文最核心的那个词:不确定性


结语:真正成熟的 AI 观,不是消灭不确定性,而是学会设计它

如果要把整篇文章压成一句话,我会这样说:

AI 时代最重要的管理能力,不是追求完美自动化,而是把不确定性变成可以测量、可以吸收、也可以利用的系统条件。

很多企业对 AI 的焦虑,说到底还是一种旧思路:总想像过去做 IT 一样,把工作彻底标准化、程序化、确定化。

可 AI 带来的真正机会,不只是把这条路继续走下去,而是让我们第一次有能力处理那些过去只能靠人类在模糊里硬撑着推进的任务。

这要求组织完成几次很根本的认知转变:

  • 从“AI 不能犯错”转向“错误能不能被控制和恢复”
  • 从“先假设人工是标准答案”转向“先测量人工本来有多不稳定”
  • 从“只盯着模型输出”转向“关注输出怎么进入人的判断链路”
  • 从“把领域知识当背景”转向“把它当成最关键的资产”
  • 从“让 AI 替代人”转向“重新定义人和 AI 各自该负责什么”

真正有效的 AI 战略,从来不是技术部门单独就能做完的项目,也不是一句“全面拥抱 AI”的口号。它更像一场组织层面的重新设计:你得重新理解工作,重新理解错误,重新理解责任,也重新理解价值到底在哪里发生。

当一个组织开始认真回答这些问题时,AI 才不再只是演示里的奇迹,而会慢慢变成业务里的能力。

所以下一次,当你准备讨论一个 AI 项目时,不妨先别问“模型够不够强”,而是先问这三个问题:

  1. 这项工作现在真的像我们以为的那样稳定无误吗?
  2. 如果引入 AI,哪些错误是可以接受、可以发现、可以补救的?
  3. 我们有没有设计好让人和 AI 各自发挥长处的工作流?

如果这些问题没有答案,再强的模型也只会制造新的幻觉。

如果这些问题想清楚了,即使模型并不完美,AI 也可能已经足够有用。

而这,才是多数企业真正需要的成熟起点。