乐于分享
好东西不私藏

AI越容易做,越容易做错

AI越容易做,越容易做错

深度观察

AI越容易做,越容易做错

做出来太容易了,容易到所有人跳过了最重要的一步

下午拜访了一家科创板上市公司的老板,和他交流AI合作事宜。他在公司内推AI转型,态度很硬。但坐在会议室里,我看到的是这样一幅画面。

开会拉了一群人,七八上十个。开到最后,才发现会议主题跟其中一半人没关系,但老板一叫,他们就都来了。来了以后做什么?不是特别清楚。负责AI+CRM的产品经理,做了一个demo,但老板要的东西跟做的其实不是一个级别。我追问细节,通过对话我发现很多需求细节还没搞清楚。

老板知道AI重要,他研究理论,但没有时间自己落地实践,所以他不知道AI已经强到什么程度了。底下的人呢?不反对,不反驳,但也没预期那么积极。

这是AI转型最典型的现场:老板推,员工动,产品经理交差,需求边界模糊不清。所有人都在"做",但没人搞清楚做的是什么。

AI转型最大的风险,就是对边界的误判,被放大成商业承诺。

这不是孤例。最近我密集接触了好几个AI项目,看到的都是同一个病根——Demo做出来太容易了,容易到所有人跳过了最重要的一步:搞清楚到底要做什么。

做出来的快感,让人跳过了验证

有个词前段时间很火——Vibe Coding。脑子里面有一个想法,打开AI编程工具,说清楚需求,看着AI写代码,几个小时就能有一个能跑的demo。整个过程像呼吸一样轻松自然,你不需要会写代码,只需要会说话。

这种感觉会上瘾。因为在AI出现之前,从想法到能跑的原型,快的话几周、几个月,甚至大半年。现在一个下午就够了。

但CB Insights有个数据让人后背发凉:

42%的创业公司失败,原因不是技术不行、资金不够,而是做了没人想要的东西。

Anthropic在《创始人手册》里也引用了这个数据,并判断现在这个比例只会更高。

为什么?因为过去开发的高成本,本身就是一道天然的筛选门槛。你不得不在投入真金白银之前,认真想清楚这东西到底有没有人用。现在门槛消失了,做一个demo不需要几个月和几十万,一个下午就够了。

于是所有人直接冲进了深水区。

手册里有个判断说得很准:一个能跑的原型,很容易被误认为你在解决真实问题,但它不是——它只是验证的道具。真正的证据,来自你和用户真实的对话。

回到我下午那个客户现场。产品经理做了一个demo,能跑,能演示。但老板要的跟做的完全不是一回事。为什么?因为做demo太容易了,容易到他都没意识到自己跳过了最重要的一步——搞清楚老板到底要解决什么问题。

不是AI不够强导致项目跑偏。恰恰相反。是AI太容易让人动手,导致所有人跳过了最重要的那一步。

AI没有降低做对事的概率,它只是把"做错"的速度加快了。过去花三个月做错一个产品,现在花三天就够了。

那做错的起点在哪?不是技术选型,不是模型参数,而是更上游——需求本身就是模糊的。

"更人性化"不是需求,是幻觉

前段时间,有一位产品经理做了一堆demo,我问他:老板到底要解决什么问题?他说:让系统更人性化。

"更人性化"——这三个字,就是AI项目最常见的死法。

一位大厂AI产品总监,第一次参加Prompt评审会,业务方提了个需求:"我们想让AI更懂用户,能不能把回复做得更人性化一点?"

她没急着接话。沉默几秒,只问了三个问题:

"更人性化"具体指什么?用户抱怨最多的是什么?

边界在哪?出了问题谁兜底?

业务方直接愣住了。

听起来像需求,其实是幻觉。你把它当需求往下推,推到一半发现根本无法落地,再回头改,成本已经沉进去了。

这位产品总监沉淀了一套方法,叫Prompt需求四层漏斗。核心就一个字:抽脂。把"更好""更自然""更聪明"这类水分词全部抽掉,只留下输入输出边界最清晰、错误模式最可复现的问题内核。

第一层:伪需求过滤

听到"更智能""更自然"必须追问——当前最致命的硬伤是什么?只有信息缺失、逻辑错误、格式混乱这些硬伤,才是AI真能解的。用AI做信息提取是真需求,用AI"让产品更有感情"而不定义何为"有感情",是伪需求。

第二层:真问题量化

"回复体验差"不行,得变成"用户追问率高达X%,其中Y%是因为首轮未覆盖关键参数"。把"感觉"翻译成可衡量的缺口。

第三层:方案权衡

绝大部分决策,是在"多写几条示例优化效果"和"多加一层校验提升稳定性"之间做平衡。

第四层:成功预演与风险备案

启动前明确:成功标准是什么?失败信号是什么?出了问题怎么降级?

四层漏斗走完,需求才从"感觉"变成"可以动手的东西"。

那怎么判断需求是不是真的被验证了?有个很朴素但很管用的测试——Sean Ellis测试。问你的活跃用户一个问题:如果再也不能使用这个产品,你会有什么感觉?如果超过40%的人回答"非常失望",你才算找到了真正的问题。

更直观的信号:找到真需求之前,用户留存靠的是你不停地推、催、激励、人工跟进。找到之后,用户自己就来了。

从"推用户用"变成"用户主动来"——这个转变,才是你做对了的证据。

没有驾驭层的AI,就是即兴表演

需求搞清楚了,是不是就万事大吉了?

不是。还有一道坎:AI本身不记事、不守边界、不知停。

这不是bug,这是大模型的底层设计。从产品视角看,模型就是一个无状态的函数——你给它输入,它给你输出,但它不会自动保留上一次的内容,不会自动记住任务做到哪了,更不会自己判断什么时候该停下来。

所以所有记忆、进度、安全边界,都得靠外部维护。这套外部维护系统,有个名字叫Harness——驾驭层。

Harness这个词原意是套在马身上的整套装备。一匹马能跑,但如果没有缰绳、马鞍、嚼子,它跑起来就是即兴表演——能跑,但跑偏是常态。

AI也一样。没有驾驭层的AI,就是一匹没有套缰绳的野马。

驾驭

控制方向、节奏和停止时机。告诉AI该做什么、按什么顺序做、什么时候停下来问人。

约束

划定安全边界。哪些操作不允许执行?误删数据谁拦截?高风险动作谁审批?

整合

把分散的工具、记忆、子任务协同编排,形成能稳定运行的系统。

三层必须同时生效。只有引导没有约束,AI可能执行不该执行的动作。只有约束没有反馈,出错了无法修正。工具多但缺编排,长任务根本跑不完。

Harness不只是技术架构,它是一套让复杂系统不跑偏的治理逻辑。而任何组织,本质上也是一套复杂系统。

回到客户现场,老板推AI转型,但内部缺乏主动性——老板给了方向(驾驭),但团队没有建立约束机制(员工不知道边界在哪),而且部门之间没有形成合力(各部门各干各的)。组织没有自己的驾驭层,AI项目在组织里跑,跟没有缰绳的马在闹市区跑是一个效果——能跑,但跑偏是必然。

边界误判,才是最大的风险

四条线,拧成一根绳:

Vibe Coding的成瘾性——做出来的快感,让人跳过验证。

模糊需求的伪装术——"更人性化"不是需求,是幻觉。

工具人心态——老板推,员工动,需求边界模糊不清。

AI自身的无状态本性——没有驾驭层,跑偏是常态。

AI消除了"做出来"的门槛,但把"做对"的难度放大了。

过去高成本的开发本身就是筛选器。你不得不在动手之前想清楚。现在筛选器没了,所有人直接冲进深水区。做出来很快,但做错了更快。

那怎么办?

不是不用AI,不是放慢脚步,而是在按下回车键之前多做一件事——搞清楚边界

需求边界

你到底要解决什么问题?能不能量化?能不能验证?

组织边界

谁拍板?谁执行?谁验收?成果与预期有偏差的根源是没有人把"为什么做"说清楚。

技术边界

AI能做什么、不能做什么?哪些必须人工兜底?幻觉率超过多少就暂停?

搞清楚边界,比跑得快更重要。

我在客户现场做的唯一一件正确的事,就是没急着接需求。而是一个个追问,把他们自己都没想清楚的东西问出来了。问完之后,需求清晰了,成本可控了,风险可视了,先做第一期验证,再做后续。

这不是慢,这是在深水区之前先试水深。

润泽园有个方法论叫"心-道-德-事"

心是道的源泉,道是德的根本,德是事的根源。一切外在的成就与改变,皆发端于内在的起心动念。

AI项目跑偏,病根就在这四个字的顺序上——所有人都从"事"上动手,没人回到"心"上追问。做demo是事,选技术方案是事,排期交付是事。但"到底要解决什么问题"——这是心。心没想清楚,事做得越快,错得越远。

下次再有人跟产品经理说"先做个demo看看",产品经理的第一反应不是打开AI,而是问:你到底要解决什么问题?