ARTICLE · 1089292
AI 一直给出下一步,为什么事情还是没做成?
有一次,我看着 AI 跑一组测试。
已经有不少测试项通过了。
但流程还是停在那里。因为一个前置条件不匹配,AI 接着建议继续扫描、检查和修复。

图 1|本人在搭建「Hive星图」过程中的项目对话截图。内容为当时 AI 对运行状态的描述,不代表独立验证结果。
每一步看起来都有理由。
问题是,我原本想做的,不是完成更多检查。
我想搭建一个能够跑通公众号运营核心流程的 MVP[1],先验证这件事是否可行。
一开始,AI 确实帮了我很多。
它帮我拆解任务、分析报错、编写代码,也会生成下一步需要使用的提示词。原本陌生的技术工作,慢慢变成了一个个可以执行的步骤。
我甚至有过一种轻松感:AI 在处理工作,我可以在旁边看电影,做其他事情。
终于体验到别人常说的那种痛快了。
后来,事情开始变得不一样。(前期多么快乐,后期多么痛苦)
每次看起来有了一点成功的迹象,下一步又会跳进另一个小坑。检查之后还有检查,修复之后又出现新的前提。
对我来说,整个过程开始像陷入一种“完美主义”:每一步都想做得更完整,却越来越难看清当前目标。
我花在等待、理解、核查和返工上的时间越来越多,使用 AI 的成本也不断增加。
慢慢地,我开始分不清:
好像原本沿着一条正路走着,不知不觉被带到了旁边的岔路上。
于是,我不再只是问 AI:
我开始反复提醒它:
拿到新的提示词后,我还会再问一次:
这不是因为所有检查都没有意义。
有些检查关系到安全、数据和后续能否正常运行,本来就值得做。
但我开始意识到:
如果眼前的目标是验证整个流程能不能跑通,那么继续完善一个不会影响核心结果的检查,可能只会让局部变得更完整,却没有让整体更接近完成。
在我反复把目标拉回来之后,AI 对成功标准的描述才开始收窄。
重点不再是“再完成一轮检查”,而是要给出一个能够决定下一步的结论:
现在是否已经存在可以继续执行的路径?
还剩下什么问题?
哪些问题必须处理,哪些可以暂时放下?
哪些事情应该由人工确认?

图 2-1|成功标准:从“继续完成检查”转向形成能够决定下一步的明确结论。本人项目对话截图,内容为当时 AI 的状态描述。
后来,剩余问题也被进一步收窄。
系统可以继续处理哪些工作,到了哪里必须停下,以及最后哪一步仍然需要由人决定,开始变得清楚。

图 2-2|人工发布边界:流程推进到授权节点后,最终发布仍需由人工确认。本人项目对话截图,内容为当时 AI 的状态描述。
这个变化没有自动解决所有问题。
但它让我重新看见了整个任务:已经完成了什么,还差什么,下一步为什么值得做。
对我来说,这才是 AI 开始真正帮上忙的时刻。
不是因为它的回答变得更长,也不是因为它又完成了多少项检查。
而是因为它给出的下一步,重新和我最初想完成的事情连上了。
这次经历也让我发现,我们平时说一个 AI 回答“有用”,其实可能在说三件不同的事。
有时,我们需要它提供一个让人安心的解释,帮忙整理混乱的信息,或者给出此前没有想到的角度。
有时,我们需要它替自己完成一件具体的事:写出初稿、整理资料、生成代码,做出一个能够使用的版本。
还有时,我们希望它帮助自己学会。
不是这一次拿到答案,而是下一次面对类似的问题时,自己也知道应该怎样判断和处理。
但它们不是同一种有用。
如果我只是想快速得到一份可以使用的结果,那么节省时间、提高质量,本身就是价值。
一项针对职业写作任务的实验发现,在明确的写作交付中,使用 ChatGPT 的参与者平均完成得更快,作品质量评分也更高。
这个结果不能说明所有复杂工作都能因此节省时间,但至少说明:在目标明确、结果可判断的任务里,AI 帮助人更快完成工作,本身就是一种真实价值。[2]
但“我很满意这个回答”,不一定等于事情真的得到了改善。
Anthropic 对消费者在个人、情绪和价值判断类对话中的研究发现,部分被识别为存在削弱自主判断潜在风险的互动,仍然获得了较高的用户好评。
这项研究测量的是潜在风险,不是已经确认的伤害,也不能说明满意度没有价值。
它提醒我们的只是:喜欢一个回答,与这个回答最终是否让人受益,有时需要分开判断。[3]
如果这一次的目标是学习,判断标准又会不同。
重点不只是 AI 有没有给出正确答案,还要看撤去帮助以后,我们是否更能解释问题、检查结果,或者独立处理类似情况。
如果没有 AI,我们仍然不知道刚才为什么这样做,那么这次任务可能完成了,能力却未必留下来。
反过来,有些回答不会直接替我们把事情做完,甚至会让过程变得更费力。
它要求我们补充信息、核对前提,或者重新思考自己的判断。
这样的回答未必最让人舒服,却可能更接近我们真正需要的帮助。
所以,下一次拿到一个看起来不错的 AI 回答时,也许可以先停一下。
先确认自己这一次真正需要的是什么。
是一个让我更清楚的解释?
是一份可以直接使用的结果?
还是一段让我以后能更独立处理问题的过程?
然后再问:
它具体推进了我原本想完成的什么?
我怎样知道这个推进真的发生了?
算上检查、修改和返工,这个帮助还值得吗?
这三个问题不能保证 AI 每一次都给出正确答案。
但它们可以帮助我们分清:眼前出现的究竟是真正的推进,还是一连串看起来很忙、很完整,却没有回到目标的下一步。
AI 可以让人满意,可以替人做完一件事,也可以帮助人学会。
知道自己这一次需要的是哪一种帮助,才知道眼前这段回答,究竟有没有真的帮上忙。
[1]MVP:Minimum Viable Product,通常译为“最小可行产品”。指用于验证关键假设、具备必要功能并能够获得反馈的早期产品版本。
[2]Shakked Noy、Whitney Zhang:《Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence》,《Science》,2023。DOI:10.1126/science.adh2586。
[3]Anthropic:《Disempowerment Patterns in Real-World AI Usage》,2026。