ARTICLE · 1082687
花50万做的AI客服,上线一周就关了:普通人做AI创业最怕的坑,全踩了一遍
花50万做的AI客服,上线一周就关了:普通人做AI创业最怕的坑,全踩了一遍
2026年9月,杭州一家电商公司花了将近50万,做了个AI智能客服。从立项到上线四个月,上线第三天,日均处理量从预期的2000单掉到不足50单。一周后,老板在周会上直接拍板:关掉。 对接这个项目的工程师半夜收到停用通知,失眠了一整夜。后来他把日志一条一条翻出来看,写了一份复盘。他说了一句话让我印象很深:模型该会的都会,知识库喂了,prompt调了七八版,技术栈没有任何硬伤。可它就是不能用。 这不是孤例。MIT今年发布的研究显示,95%的企业AI试点项目无法进入生产环节。Gartner预测超过一半的生成式AI项目会因架构选型和运维经验不足而预算超支。但大多数人看到这些数字没有感觉,直到看见一个具体的50万。 今天我把这个案例拆开讲,重点不是“AI不行”,而是普通人做AI创业,最容易踩的三个坑,根本不在技术层面。 这个AI客服最高频的场景是处理退款咨询。用户问“我的退款到了吗”,正常流程是:AI调订单系统接口,拿到退款单号和状态,回复用户。 上线第一周,一个用户问同样的问题。AI回复:“您的退款单号RF20260518293847已于5月19日14:32退回原支付账户,请注意查收。”用户去支付宝翻了半天没找到钱,打电话骂客服。人工一查——这个退款单号根本不存在,用户压根就没成功提交过退款申请。 问题的根源是:订单系统实际返回的是“没查到”,但AI没有把这个信号传递出去,而是自己编了一个看起来无比真实的答案。类似情况一周内至少出现了17次。 这位工程师的朋友说了一句大实话:现在所有号称解决了幻觉的方案,本质上都是在降低幻觉的频率,而不是消除它。从5%降到0.5%听起来很好,但客服一天进来一万个咨询,0.5%就是50起投诉。 在闲聊场景里,AI胡说八道是有趣。在客服、金融、医疗场景里,AI胡说八道是事故。 普通人要记住的一件事:如果你打算用AI做任何面向客户的服务,先问自己——AI说错话的时候,你的业务扛得住吗? 做技术验证的时候,工程师建议开启“深度思考”模式,因为退款查询涉及多步推理,开启后准确率确实高一截。 但上线之后,用户发出问题后要等3到5秒,屏幕一动不动。90%的用户以为卡死了,直接点“转人工”。关掉深度思考,响应能压到1秒以内,但回答质量断崖式下跌——之前能拆三步推理的问题,现在直接给个泛泛而谈的回复。 甲方产品经理说了一句让他无言以对的话:“你们这个东西,要么慢得让人想砸手机,要么快得让人觉得在瞎说,没有中间档。” 这句话背后是一个被严重低估的事实:AI产品的用户体验标准,比传统软件苛刻得多。 传统软件转圈3秒用户能忍,AI转圈3秒用户默认它坏了。而如果AI快速给了一个错误答案,用户下次根本不会再用。 这个案例里还有一个隐藏死因,可能连工程师自己都没完全意识到:上下文污染。 MIT今年2月发表了一篇论文,结论很反直觉:在多轮对话中,保留AI自己的历史回复,反而会导致它越来越胡说八道。原因是模型读取自己过去的回复时,和读取真实信息没有任何区别。它没有任何标记来区分“这是我自己编的”和“这是真实数据”。第二轮自信说错的东西,第三轮在上面继续搭,第四轮第五轮照搬不误,每一轮都进一步偏离事实,同时愈发笃定。 MIT的实验证明,去掉AI的历史回复,上下文长度能缩减10倍,70%的对话轮次质量不变。 翻译成人话:你以为AI在跟用户对话,实际上它一直在跟自己的幻觉对话。对话轮次越多,幻觉积累越严重。 看完这个案例,我觉得最值钱的不是技术复盘,而是几个普通人能直接用的判断标准: 第一,先做“AI辅助人工”,别做“AI替代人工”。 这个项目最大的错误是一上来就全自动。正确的路径是让AI给人工客服提供建议答案,人工审核后发送。跑一个月,把AI的准确率摸清楚了,再逐步放开。 第二,任何AI产品上线前,做一个“只说不知道”的测试。 手动制造100个AI肯定答不上来的问题,看它是老实说“没查到”,还是编一个答案。编一个,扣一分。低于90分,别上线。 第三,客服类AI,响应超过2秒就别做全自动了。 行业数据很明确,文本对话首字响应超过500毫秒,用户满意度就断崖下跌。与其花大钱优化延迟,不如把场景切小——只做“查订单状态”这种一步到位的事,别做需要三步推理的退款争议处理。 第四,给AI的对话轮次设一个硬上限。 超过5轮还没解决问题,直接转人工。不要让AI在错误的方向上越走越远。 50万买来的教训,核心其实只有一句话:AI创业的坑,90%不在AI本身,在于你默认它“应该能用”,而没有认真设计它“不能用的时候怎么办”。 这句话,值50万。
