ARTICLE · 1096923
企业上AI,别从买工具开始:一份 0-1 落地清单
企业上AI,别从买工具开始:一份 0-1 落地清单
花了几十万上AI,最后没人用——问题往往不在技术,在第一步。
过去两年,我见过太多企业的 AI 项目死在同一个地方。
有的公司花了上百万搭 AI 中台,半年后登录后台一看,日活个位数; 有的 IT 部门闭门三个月做出了"智能助手",业务同事打开一次就再没打开过; 还有的老板在年会上喊"全面 AI 化",下面几百号人面面相觑——不知道从哪下手。
这些项目的钱没少花,技术也不算差。真正的病灶只有一个:把 AI 落地当成了技术项目,而它其实是个管理项目。
真正把 0-1 跑通的公司,做的都是同一件事:先找到一个小到不能再小的场景,把它做出可衡量的结果,然后再谈第二、第三个。
下面这七步,是从一堆真实项目里扒出来的最小可行路径。顺序不能跳。
第一步:先别买工具,先定义"痛在哪"
绝大多数企业上 AI 的第一反应是:选哪家模型?买哪套平台?
错。先选场景,再选工具。
一个值得做 AI 的场景,要同时满足三个条件:
高频 —— 每周至少发生几十次。一年做两次的事,AI 帮不上什么忙,人也记不住怎么用。 输入输出明确 —— 你能说清"喂进去什么、吐出来什么"。说不清的,模型也说不清。 有容错空间 —— AI 万一错了,有人兜得住,不会出大事。
给你一个粗算公式,用来给场景排序:
场景价值 = 发生频次 × 单次耗时 × 人力单价 × 可 AI 化程度
第一批适合做的场景(低风险、见效快):
客服 / 售前问答(有现成知识库和历史工单) 会议纪要 + 待办自动提取 文档、标书、方案、合同的初稿生成 数据报表的自动解读与摘要 电商商品文案、详情页批量生成 内部制度 / 产品知识的问答助手 研发侧的代码辅助
第一批千万别碰的:
直接对客的自动决策(自动定价、自动审批放款) 强合规对外输出(法律文书终稿、对外财报) 核心交易链路的改造
原因很简单:第一批的目标不是省钱,是跑通流程、建立信心。出一次事故,整个项目就停摆了。
第二步:盘数据——80% 的项目卡死在这里
场景定下来,立刻做一件事:盘数据。
只需要回答四个问题:
数据在哪? 在系统里?散落在 Excel?还是只在几个老员工的脑子里? 能不能拿到? 权限归谁管?跨不跨部门?有没有合规风险? 干不干净? 格式统一吗?有没有好几套互相矛盾的版本?过期了吗? 有没有"标准答案"? 历史工单的正确回复、过往的成稿、专家的判定记录——这些是后面评测的黄金素材。
最小可行数据量:一个垂直场景,100–500 条高质量样本,足够跑通 MVP。 不用等大数据平台建好,那是后话。
⚠️ 一个必须正视的信号:如果答案是"数据都在几个老员工脑子里",那你的第一件事不是上模型,是知识萃取——把隐性经验变成文档、表格、问答对。这件事不做,后面全是空转。
第三步:两周做一个能用的东西,别做平台
MVP 阶段有三条铁律:
① 别自研,别训模型,先用现成的大模型 API。 自研和微调是成本高、周期长的事,留给第六步之后再考虑。
② 技术路径按优先级选,从低到高:
大多数团队的毛病是反着来的:一上来就要微调,结果数据没标注、评测没有,三个月白干。
③ MVP 的验收标准只有一条:业务同事愿意每天主动打开用一次。
不是"演示效果好",不是"领导看了很满意"。是真实用户在没有监督的情况下,还愿意用。
关键点:第一阶段做人机协作,不做全自动。 AI 出初稿,人来审、来改。这既保证质量,又能顺手积累反馈数据。
第四步:建评测集——最容易被跳过、也最容易埋雷的一步
没有评测集的 AI 项目,等于在雾里开车。
怎么做:
从真实业务里抽 50–200 条 case 每条写清三件事:输入 + 期望输出 + 判定标准 每次改提示词、换模型,就跑一遍评测集,看分数变化
有了它,"这个版本好还是上个版本好"这种吵架就可以结束了,看数字。
指标别只看准确率,重点看这三个:
采纳率(最重要) —— AI 输出被直接采用或只需小幅修改的比例。低于 60% 说明离上线还远。 单次耗时下降 —— 原来要多久,现在要多久。这是业务同事唯一真正关心的。 兜底率 —— 需要人工推倒重来的比例。超过 20%,说明还不到放量的时候。
第五步:小范围灰度,人在回路
找 5–20 个真实用户,其中一定要有爱挑刺的。
每个 AI 输出旁边都留反馈入口:好 / 不好 / 哪里不好 每周固定开一次 30 分钟的 bad case 复盘会,雷打不动 反馈要闭环——用户提了意见,下周能看到改进,他才会继续提
迭代的优先级顺序(很多人搞反了):
补知识库 → 改业务流程 → 改提示词 → 最后才考虑换模型 / 微调
大部分"模型不够聪明"的抱怨,其实是知识没给够。
第六步:算清楚账,决定这个项目是活还是停
上线一个季度后,必须拿出三个数:
省了多少时间 —— 频次 × 单次节省时长 × 人力成本 提升了多少收入 —— 转化率、客单价、响应速度带来的增量 花了多少钱 —— API 调用 + 人力投入 + 运维
判断线:如果 AI 相关成本 > 节省下来的人力成本,就该停下来复盘,而不是继续加码。
也别忽略隐性收益:响应速度快了、新人上手周期短了、知识不再随着员工离职而流失。这些短期内不算钱,长期比省钱更值钱。
第七步:把第一个场景变成"可复制的样板"
跑通一个,比规划十个有用。
沉淀三样东西:
一份场景落地 SOP(选场景 → 盘数据 → MVP → 评测 → 灰度 → 算账) 一套评测集模板 一份踩坑清单(哪些坑我们踩过,下个别踩)
组织上固定一个小队,四个角色缺一不可:
业务负责人(对结果负责,是甲方) 落地负责人(懂 AI、能把需求变成实现) IT / 数据(开权限、保安全、做集成) 高管 Sponsor(跨部门协调资源、改考核)
⚠️ 必须强调:业务负责人是甲方,IT 只是支撑。 AI 项目失败,至少一半是因为业务不参与需求、不参与验收、最后也不用。
三个最常见的死法
① 一把手工程没有一把手 只喊口号,不给资源、不改考核、不容忍试错。这种项目从立项那天就死了。
② 交给 IT 部门单干 业务部门不提需求、不验收、不用,做出来的东西永远"差点意思"。
③ 一上来就做平台 半年过去,平台上线了,场景一个没跑通。
一份 90 天时间表
第 1–2 周:选场景、定指标、成立小组 第 3–4 周:盘数据、建评测集(50–200 条) 第 5–8 周:做 MVP、内部试用、收集 bad case 第 9–12 周:灰度放量、算账、决定扩场景还是停下来复盘
三个月,足够把一个场景从 0 做到 1。至于"全面 AI 化",那是第 12 个月之后才该讨论的事。
最后
AI 落地最反直觉的一点是:起点越小,跑得越远。
不要问"我们要不要全面 AI 化",先问一句更实在的:
下周一,哪个岗位能因为 AI 少加班一小时?
从那个岗位开始。
你们公司的第一个 AI 场景,会选哪一个?欢迎在评论区聊聊,或者说说你现在卡在哪一步。