乐于分享
好东西不私藏

95%的企业AI试点都失败了,问题到底出在哪?

95%的企业AI试点都失败了,问题到底出在哪?
技术深潜 第1期
一、一个扎心的数字
你有没有这种感觉——公司搞了半年AI,demo看着挺炫,回头一看业务数据,啥也没变?
不是你的错觉。
MIT最近公布了一个数字:约95%的企业AI试点,无法产生可测量的商业影响。这些企业前前后后已经砸进去了300到400亿美元。
说白了,几百亿美元,几乎全打了水漂。
什么叫"可测量的商业影响"?就是你能拿出数据说:用了AI之后,成本降了百分之多少,效率提了百分之多少,收入涨了百分之多少。不是PPT上的预测数字,是财务报表上真实出现的数字。
95%的企业,拿不出来。
更扎心的是Gartner的预测——到2027年末,超过40%的代理型AI项目将被取消。不是暂停优化,是直接砍掉。
我最近接触了不少企业,有个场景特别典型。老板在行业大会上听了几个AI故事,回来就拉着市场部说:"咱们也搞个AI,不用找IT,你们自己弄弄就行。"
周二我会写一个真实的故事,讲的就是这么一家公司——老板绕开IT部门自己搞AI,一周后发生了什么。今天先不剧透,咱们先聊聊一个更根本的问题:为什么95%的企业AI试点,会失败?
二、失败原因一:MVP幻觉
"用ChatGPT写文案,效率提升10倍!"
这话你一定听过。听起来很厉害,但这是MVP,不是企业级AI。
咱们翻译一下。MVP就像在游泳池里学游泳——水温恒定、没有风浪、救生员就在旁边看着。你在这个池子里游得再好,也不代表你能跳进太平洋。
企业级AI就是太平洋。有数据隐私的风暴,有系统集成的暗礁,有用户习惯变化的洋流,还有合规审查的鲨鱼。
从MVP到生产级,中间横着四道鸿沟:
●  数据管道——demo用的是精心清洗过的样本数据,生产环境的数据是脏的、散的、随时在变的
●  模型评估——demo靠人肉看几条觉得"不错",生产环境需要系统化的指标体系
●  系统集成——demo是个独立网页,生产环境要跟ERP、CRM、OA几十个系统打通
●  运维保障——demo挂了刷新一下就行,生产环境挂了就是生产事故
很多企业的AI试点,就死在以为游过游泳池就能横渡太平洋这个幻觉上。
demo阶段你看到的一切美好——响应快、效果好、成本低——都是建立在精心准备的数据、小范围测试、没有真实用户压力的前提下的。一旦上了生产环境,这些前提全部消失,裸泳的人马上就露馅了。
三、失败原因二:绕开专业团队
"老板让市场部自己搞AI。"
这句话我听了不下二十次。不是市场部不努力,是这件事的底层逻辑就不对。
Gartner的数据显示,75%的影子IT使用,发生在业务部门自行采购或免费使用SaaS工具的时候。什么意思呢?就是业务部门绕开IT,自己找工具、自己接API、自己跑流程。
听起来挺高效,对吧?但问题在于——
没有架构设计,系统就是一坨意大利面,改一个地方崩三个地方。没有风险评估,数据往第三方API一传,合规雷就埋下了。没有数据治理,各家口径不统一,最后AI给出的结果是"薛定谔的答案"——对不对全看运气。
更麻烦的是安全问题。业务部门自己接的API,用的什么密钥、传了什么数据、存在哪、谁能看,IT部门一概不知。等数据泄露了,才发现整个公司最敏感的客户信息,在三个月前就已经通过一个免费API传出去了。
说白了,绕开IT搞AI,等于蒙着眼开高速。短期可能跑得快,长期一定出事。
四、失败原因三:数据基础设施跟不上
很多人觉得搞AI就是"接入一个API"。找个大模型,调几个接口,齐活。
但AI真正的工作量,80%发生在API调用之前。你得先回答四个问题:
数据在哪?散在十几个系统里,有的在本地服务器,有的在云端,有的还在某人的Excel附件里。
格式统一吗?同一个客户名,A系统叫"北京XX科技有限公司",B系统叫"北京XX",C系统叫"XX科技"。
能实时获取吗?demo的时候手动导一份CSV就行,生产环境需要实时数据流,延迟超过两秒用户就骂娘了。
质量过关吗?缺失值、重复值、错误值——这些问题在demo里不存在,在生产环境里无处不在。
工业AI领域有个数据更触目惊心:87%的工业AI项目从未进入生产环境,其中60%死在了数据采集阶段。连数据都没采集利索,模型再先进也白搭。
打个比方。你给一辆F1赛车的引擎,装在拖拉机的底盘上。引擎再猛,跑起来也是散架。
AI就是那个引擎,数据基础设施就是底盘。底盘不行,引擎再好也跑不起来。
五、失败原因四:没有评估体系
"AI上线了,效果怎么样?"
"挺好的!大家都说不错。"
这不是评估,这是感觉。企业级AI不能靠感觉吃饭。
我见过太多团队,花了几个月开发AI功能,上线之后问效果,负责人支支吾吾说"用户反馈还行"。再追问具体数据,就卡壳了。上线前没有记录基线,上线后没有对照组,连"还行"这两个字都无从验证。
专业的评估体系至少要包括四样东西:基线指标(上线前是什么水平)、A/B测试(用了AI和没用AI到底差多少)、hallucination率监控(AI一本正经胡说八道的频率有多高)、人工审核流程(出了错谁能兜底)。
我列个表你直观感受一下差距:
维度
野路子评估
专业评估
指标定义
"感觉变快了"
处理时长从15分钟降到4分钟,误差率控制在3%以内
测试方法
挑几条看看
对照组 vs 实验组,连续跑两周以上
质量监控
用户投诉了才知道
自动化hallucination检测 + 抽样人工审核
兜底机制
出了事再说
预设降级方案,AI不确定时自动转人工
没有评估体系的AI,就是一台没有仪表盘的车。你不知道速度多快,不知道油还剩多少,不知道引擎有没有过热。直到它突然停下来,你才知道出了问题。
六、那5%成功的人做对了什么
说了这么多失败的,那成功的5%到底做对了什么?我观察下来,有三个共性。
第一,IT全程参与架构设计。不是IT来"配合"业务部门,是从第一天就坐在一起。业务说需求,IT说约束,两边一起画架构图。AI从来不是市场部一个人的事,也不是IT部一个人的事,是两个人的事。
第二,从数据治理开始,而不是从模型开始。成功的团队第一周不碰大模型,先花时间理清楚数据在哪、格式什么样、质量怎么样。地基打好了,上面盖楼才稳。
第三,先解决一个具体场景,再谈扩展。不是一上来就喊"全面AI转型",而是找一个最痛的场景,做透、做深、做出可量化的结果,然后把经验复制到下一个场景。贪多嚼不烂,一个场景跑通了,后面十个才有可能。
这三条听起来平淡无奇,甚至有点 boring。但成功的团队跟失败的团队之间的差距,恰恰不在于谁用了更先进的模型,而在于谁把这些"无聊"的基本功做扎实了。
Klarna就是个很有意思的反转案例。这家公司曾经高调宣布AI替代了700名客服,股价蹭蹭涨。结果2025年自己承认"走得太远",用户体验不升反降,重新开始招人。
从"AI替代一切"到"走得太远",Klarna踩的坑就是——把MVP阶段的效率,当成了生产环境的标准。demo里AI能处理80%的工单,但剩下那20%处理不了的,恰恰是最需要人、最影响口碑的部分。
七、AI不是魔法,是工程
写到最后,我想说一句可能不太讨喜的话。
大多数企业搞AI失败,不是因为技术不行,不是因为模型不够强,甚至不是因为钱不够。投了几百亿美元,模型一代比一代强,工具一年比一年多,失败率还是95%。
问题出在哪?出在思路。
AI试点的失败,90%发生在技术选型之前——发生在那个"我们不需要IT,自己就能搞"的决定里。
AI不是魔法,不是你接个API就能变身科技公司。它是一项工程,需要架构、需要数据、需要评估、需要运维、需要人和流程的配合。
95%的失败率不是AI的问题,是我们对待AI的方式有问题。技术已经准备好了,但大部分企业的组织方式、数据基础、工程能力,还远远没跟上。
把AI当魔法,它就用95%的失败率教你做人。把AI当工程,它才可能给你那5%的回报。
明天周二,会开始一个以个人经历(随时可能追上正在进行时)为背景的连载故事(做了艺术加工,以免对号入座)——某公司老板绕开IT部门搞AI,一周后发生了什么。看完今天这篇,你大概能猜到结局,但过程比你想的更魔幻。
——岚,于山下
这是「技术深潜」的第1篇。每周一、三、五更新。