AI 能不能帮助产品提效?
过去一年,我试过了几乎所有主流的 AI 工具。DeepSeek、Gemini、MiniMax、Claude,模型换了一个又一个。Hermes、OpenClaw 都折腾过。各种工作流、知识库、skills 调了又调,但是都不能在我的工作中起到关键作用。
不是说它没有能力。是它的能力和我的真实工作场景之间,有一道巨大的裂缝,而这道裂缝,就叫做“确定性”。如果你也是每天要产出、要做决策、要对结果负责的人,你可能跟我有一样的感受。大部分互联网中非创意类的工作场景,都是对结果确定性要求极高,大部分结果都是“Yes or no”。AI 不会对你的工作结果负责,但是你作为 AI 结果的产出者,却时时刻刻需要对结果负责。像极了现在的辅助驾驶,只要现实中自动驾驶厂商无法对“自动驾驶”的结果负责,那终端的责任人就还是司机,那驾驶永远只是辅助。

一、确定性的责任
这可能是绝大多数 AI 从业者不愿直面的真相。AI 产出内容最大的症结,并非能力短板,而是责任归属。
PRD 交付之后,文档出错,责任全部落在我的身上,我必须逐条核对 AI 给出的全部信息,核对的过程等同于独自完整梳理一遍业务逻辑。倘若数据出错,开发依照错误逻辑开发功能,上线出问题承担责罚的是我,而非 AI。一旦判断失误,整个团队沿着错误方向推进数月,事后复盘只会归结为产品判断失误,没有人会归咎于 AI 给出了错误建议。

在整个过程中,产品设计不仅依赖存档里的 PRD,还包含了各个业务线内部口口相传的“隐形知识”。同时,每个产品经理、运营或者设计的文档工具、绘图工具等等都各有差异,这些都对 agent 调用读取、知识理解都有很大阻碍。但是往往最可怕的是,很多内容 AI 写的却又那么义正言辞、结构清晰。这些又反向给“用户”造成了巨大的决策成本。
二、AI 写得很快,但我改得更久
很多人用 Agent 写 PRD 或者写各种策划类文案。这些理论上都是 AI 的强项,整理需求、结构化表达、补充边界、理清逻辑等。AI 只需要你的几句话,就能吐出一篇像模像样的文章。对于一般用户而言,大体可用。但是,一旦回到业务场景,就又不得不面对确定性的问题。

由于 AI 需要逻辑通顺,需要符合它训练的理解。它会加上自己的理解,或者逻辑的关联。比如我写「用户支付完成后推送消息」,它自动加上了「短信模板由后端调用 App Push,不是微信」。这种错误,AI 不会主动说明自身的不确定,总是带着十足的自信输出内容。并且,有时它的建议看起来很专业,但经不起业务推敲。它会罗列一堆功能,听起来合乎情理,但是放到真实业务里,例如库存预警逻辑对接三套不同系统,其中一套接口存在 120 秒延迟,这类细节 AI 完全不知情。倘若直接采纳,上线就会引发故障。
我打开 Hermes,想让它帮我分析一个竞品。第一步,我得先告诉它:我是谁、做的产品是什么、我们的目标用户是谁、竞品有哪些、我想知道什么。这些信息我每次都要重新解释一遍。因为 Agent 不记得上周讨论过的产品方向,不记得上个月敲定的产品定位,也不记得昨日和上级沟通的战略调整。每一次对话,都是一次全新的自我介绍。
然后它开始工作。有时候输出很慢,一等就是半分钟,原本连贯的思路被打断,随手刷下手机,先前的想法就遗忘了。结果出来了。格式不错,但有几处明显不对。我说「这里不对,修改一下」,它改了,却连带正确的内容一并改动。我说「只改第三段,其他保持」,它嘴上应允,往往通篇重写。反复调整两三轮,四十分钟就过去了。而我自己分析同一份竞品,在 Notion 里整理文档,只需要三十分钟。工具本意用来节省时间,现实反而在消耗时间。
说到这,有人就会说最近很火的 harness 工程,来约束 agent 这些行为,让输出结果更加准确。但是一个 harness 工程能够真正符合业务场景使用,至少需要包含构建 harness、等待生成、评审、迭代修改、再次反复修改评审、到最终编辑完成。然后 harness 只能够缩短等待生成的时间,其他所有环节时间都有可能被显著拉长。
一个真实的时间对比
如果这位 PM 对业务非常熟悉,PRD 是他的核心技能。整个过程中他不需要向任何人(或任何机器)解释上下文,因为上下文就在他脑子里。他整个PRD分布环节的耗时如下表所示:

而用 AI 路线,即使是一个“AI 最终产出了可用结果”的乐观场景。整个过程和耗时如下表所示:

如果 AI 在某个关键环节始终无法理解你的意图(比如推荐算法的分层策略),这个时间会膨胀到 5-6 小时,而且你会在中途放弃 AI、回到手写,但这时候你已经浪费了 2 小时在 Harness 上。
除了时间成本之外,经济成本同样不容忽视。高级 AI 工具的订阅费(ChatGPT Plus $20/月、Claude Pro $20/月、各种 AI 写作工具 $10-50/月),如果用 API 的话,复杂任务的 token 消耗(特别是多轮迭代+长上下文)可能单次任务就花费 $1-5。除此之外还有工具学习成本。如果你认真做 Harness 工程,你可能还需要向量数据库(Pinecone/Weaviate)、编排工具(LangChain/LlamaIndex)、评估框架(各种 LLM-as-Judge 方案)。这些工具有学习成本、集成成本和维护成本。同时,Prompt Engineering 本身是一门需要投入时间学习的技能。网上的 Prompt Engineering 指南质量参差不齐,真正有效的 Prompt 设计能力来自于大量的试错,而这些试错本身就在消耗你的工作时间。
三、专家悖论:越专业的人,Harness 越难建
这里有一个深刻的悖论:你在某个领域越专业,AI 对你的提效效果就越差。
专家的产出之所以高质量,是因为他们的大脑里有一个极其复杂的“隐性知识网络”包括行业直觉、历史经验、对组织政治的理解、对用户心理的微妙把握。这些知识大多无法被显性化,也就无法被喂给 AI。
一个刚入行的 PM 写 PRD,他的知识大多是显性的(方法论、框架、模板),AI 很容易复现甚至超越他的水平。但一个有 10 年经验的 PM 写 PRD,他的 80% 知识是隐性的。他知道某个功能在技术上看起来简单但实际上会和另一个团队的 OKR 冲突,他知道用户嘴上说想要 A 功能但行为数据显示他们其实更需要 B,他知道这个 PRD 的真正读者是 CTO 而不是开发所以需要用不同的叙事角度。
这些东西你怎么写进 Prompt?你写不进去。所以你构建的 Harness 永远是不完整的,AI 基于不完整上下文产出的内容,你需要大量的判断和修改。
结论是反直觉的:AI 提效的天花板不是 AI 的能力,而是你能否把隐性知识显性化。而隐性知识恰恰是专家之所以为专家的核心。
四、成本陷阱和维护税
Harness 工程还有一个心理学层面的陷阱,沉没成本谬误。
当你已经花了 1 小时构建 Harness、迭代了 3 轮 Prompt,AI 的产出已经有 60 分了,你会想:“我都投入这么多了,再调一调应该能到 80 分。”于是你又花了 1 小时。结果到了 70 分。你想:“差一点了,再改改。”又花了 30 分钟。到了 75 分。
这时候你已经花了 2.5 小时在 Harness 上,加上后续的编辑时间,大概率超过了自己手写的时间。因为你已经“投资”了,你舍不得放弃。是不是像极了股票加仓的你。
如果你一开始就自己写,2.5 小时你可能已经写完了,而且质量是 90 分。

这就是 Harness 工程的危险之处:它不仅消耗时间,还通过沉没成本效应锁定你继续投入,让你错过“止损”的最佳时机。
即使你成功构建了一个有效的 Harness,故事也没有结束。Harness 是有“保质期”的:
AI 模型会定期更新,你精心调试的 Prompt 可能在新版本上表现完全不同。你需要重新测试、重新调优。你的产品迭代了、组织架构调整了、用户画像变了,或者之前构建的上下文文档需要更新,否则 AI 基于过时信息产出的内容会有偏差。同时,你的团队对 PRD 的标准可能在变化,之前“够用”的 AI 产出可能现在不够用了,你需要调整评估标准和 Prompt 策略。
这意味着 Harness 不是一次性投资,而是需要持续维护的“负债”。如果你的业务变化快(这在互联网行业是常态),维护成本可能高到不值得。
五、什么场景才值得用 AI
说了这么多负面,也要公平地讲。AI在特定条件下确实能带来正 ROI。
首先就是高复用性场景。你每周要写 3 份 PRD,且格式和结构高度一致。此时一次性的 Harness 投入可以摊薄到每次任务上,边际成本趋近于零。
或者,你可以做出团队共享,AI复用。你把 Harness 做成了团队的“AI 工作流”,多个人使用同一个 Harness。投入被分摊,ROI 自然提高。
拔高新人的场景。团队中有初级员工需要完成超出其能力的任务,Harness 本质上是在“编码”资深员工的经验,帮助初级员工提升产出质量。这时候 Harness 的价值不是“提效”,而是“赋能”。
批量化生产场景。需要生成大量相似但有差异的内容(如多语言版本、多平台适配、A/B 测试变体)。这类场景的 Harness 投入可以被大量产出稀释。
六、总结
AI不是免费的。它的时间成本、经济成本、学习成本、维护成本和心理学陷阱加在一起,构成了一笔不小的“隐性税”。在大多数知识工作者的日常场景中,这笔税很可能超过了自己手动操作的总成本。
AI 行业有一种叙事:“你之所以觉得 AI 不好用,是因为你的 Harness或者工作流定义得不够好。”这在技术上可能是对的,但它回避了一个关键问题:
如果构建“足够好”的 Harness和工作流需要你投入比手动操作更多的时间和精力,那这个 Harness 或者 AI 本身就是一个伪需求。
工具的终极目的是让人更轻松。如果一个工具需要你成为这个工具的专家才能用好,那它可能不是在所有场景下都值得你投入的工具。
对于大多数 PM 和知识工作者来说,更务实的策略不是“学习如何构建完美的 Harness”,而是,快速判断哪些任务适合 AI(Harness 成本低+可复用),哪些任务直接自己干更快,然后不犹豫地在后一种场景下关掉 AI。
夜雨聆风