ARTICLE · 1079043
为什么企业 AI 项目总是死在 Demo 之后?

我这两年做企业 AI 项目,有个挺扎心的感受:项目最后没做成,很多时候真不是模型太差,而是公司还没想好,怎么用一个会出错的东西。
你可能也见过这种场面:技术团队把 demo 做得特别漂亮,老板看完觉得“可以上”。结果过了三个月,没人用了。
问题出在哪儿?我差点把两个项目做黄之后,才慢慢想明白。
先说验收。
以前做后端,大家习惯了输入 A,就得给我输出 B。测试没过,那就查 bug、改代码。这套办法用了很多年,没毛病。
但 AI 不是这么工作的。同一个问题,它这次答对了,下次也可能跑偏。可有些公司验收的时候,还是按“每一条都得对”来:拿几个月的业务数据跑一遍,看到二十条分错了,第一反应就是“这东西不行”。
分错了当然要处理。但更该问的是:这些错误会不会被发现?发现以后谁来改?哪些结果可以直接用,哪些必须有人看一眼?
我给市场部做过评论打标工具,第一版就卡在这儿。后来我们从历史数据里整理了 800 条人工标注的样本。每次改提示词、换模型、调检索,先跑这批样本,看看是变好了还是变差了。没这套评测,大家只能凭感觉说“好像更聪明了”。
光知道它会错还不够,还得给错误留个出口。拿不准的结果进人工复核,不直接往外发。机器先处理大部分,剩下的由人把关。做到这一步,业务部门才敢用。
再说一件更麻烦的:工具做出来了,原来的工作怎么变?
那个评论打标的活,以前市场部同事每天要花 40 分钟看 200 条评论。工具做完,可能 6 分钟就跑完了。听起来很美,对吧?可同事马上会问:分错了算谁的?我还要不要逐条检查?工作汇报怎么写?主管又按什么来考核?
这些问题不说清楚,省下来的 34 分钟,根本不会变成真正的效率。大家只会多一份担心:活还是我的活,出错还得我背锅。
后来我们把规矩定明白:AI 给的是建议,人工确认后才算定稿;有问题怎么退回、怎么修改,也写进流程。业务同事知道自己该看什么、负责什么,才愿意把它放进每天的工作里。
还有一种情况特别可惜:系统跑了一个月,整体效果不错,却因为一条明显答错的内容被截图传开,第二天整个项目就停了。
错误被客户看到,当然不能轻描淡写。该暂停对外输出、查原因、补措施,都得做。但如果一个项目出一次错就直接判死刑,那它从一开始就没有试错和改进的空间。
我现在更愿意把 AI 当成一个刚上手的新同事来安排工作:先做有人复核的任务;涉及客户、合同、钱的事,不能让它自己拍板;犯过的错记下来,变成下一轮评测的题。用得稳了,再慢慢扩大它能处理的范围。
所以我觉得,企业 AI 项目真正难的地方,不只是把模型接进来,而是把几件事说清楚:效果怎么测,错误怎么拦,出了问题谁处理,做对了以后怎么逐步放开。
模型会越来越强。但企业不会因为模型强,就自动知道怎么验收、怎么改流程、怎么承担责任。这些事,还是得有人一件件做出来。
对做后端的人来说,这恰好是我们熟悉的活。测试、监控、兜底、灰度上线,过去是为了让系统稳定运行;现在是为了让一个偶尔会答错的系统,也能在业务里稳稳当当地干活。
能做个漂亮 demo 的人已经不少了。能把它真正用起来、出错时也接得住,我觉得这才是更值钱的本事。