AI 答完以后,我以前的动作很简单。
看一眼,能用,复制,关掉。
下一次再遇到相似问题,我还是会漏背景、说不清目标,把一堆默认前提塞进一句话里,然后继续怪模型没有理解我。
我最近才意识到,这种用法其实只拿走了 AI 最表面的一层价值,也就是眼前这个答案。
答案当然有用。但一个任务结束以后,如果我的提问方式、判断标准和工作流程都没有留下来,那下一次仍然要从头再来。
这也是我现在重新校准「AI 第二曲线」的原因。
目前已经有一位创始成员,但真正被成员连续使用、验证过的内容资产,还是零。这个数字不好看,不过它很诚实。与其继续堆更多工具、提示词和看起来完整的文档,我更想先把一个真实流程跑通。
而我先改掉的,就是「答案出来就结束」这个习惯。
这个动作的一个灵感来自五简道。下面写的是我结合自己工作方式形成的理解,不是对方的原话。
第一层是答案。
它解决眼前的问题。写一段代码、整理一份资料、给一个方案,任务做到这里已经算有结果。
第二层是一个更好的问题。
让 AI 回头看你的输入,它往往能指出这次回答为什么绕了路。可能是背景没有说清,目标太宽,也可能是你默认了一个根本没有验证过的前提。
第三层是一套能复用的流程。
如果你把反复出现的缺口记录下来,再把有效的问法、资料入口和验收标准放进知识库,下一次就不用依赖临场发挥。

答案解决当下,更好的问题减少下一次绕路,流程才让经验真正留下来。
大多数时候,我们只拿了第一层。
这会产生一种错觉。AI 每天都在帮我干活,我也确实拿到了很多结果,但我的输入质量没有跟着变好。聊天记录越来越长,真正能复用的东西却没有增加多少。
说得再直接一点,AI 在进步,我的提问习惯可能还停在原地。
很多问题都出在任务结束得太早
很多人一提到「怎么问 AI」,马上会想到提示词模板。
我以前也存过不少模板。角色、背景、目标、格式、语气,写得很完整。真到做项目的时候,我漏掉的往往是四件更基础的事。
我没有告诉它,哪些资料是真的,哪些只是我的猜测。
我说了想做什么,却没说做到什么程度才算完成。
我把自己熟悉的上下文当成常识,默认模型也知道。
我只要求它给结果,没有要求它说明风险、缺口和无法确认的部分。
这些问题不会因为提示词变长就自动消失。相反,一段很长的提示词还可能把真正缺失的东西藏起来。
所以我现在会在任务完成以后,再补一句。
请回看我刚才的问题,不评价答案本身。
告诉我哪些背景没有交代清楚,目标哪里还很含糊,我又默认了哪些未经验证的前提。
然后保留我原来的目标,帮我重写一版更容易得到好结果的问题。
最后只挑一个最值得长期改的提问习惯,告诉我下次该怎么做。
这段追问里,我故意加了几个限制。
「不评价答案本身」,是为了避免它继续润色结果,却绕开我的输入问题。
「保留我原来的目标」,是为了防止它把问题改得很漂亮,方向却变了。
「只挑一个习惯」,是因为一次给十条建议看起来很丰富,最后通常一条也记不住。

这里不检查语句够不够漂亮,只检查任务需要的背景、目标和前提有没有缺口。
为什么不只让 AI 自己改答案
让模型检查并迭代自己的输出,并不是一个新方向。
2023 年的 Self-Refine 研究讨论过一种反馈与迭代方式,让同一个模型先生成结果,再提供反馈并继续修改。论文在多类任务上观察到了输出改善。
但我要把边界说清楚。
那项研究关注的是模型输出如何经过反馈变得更好。我这里做的,是让模型反过来检查人的输入,再把这次暴露出的习惯交还给人。两件事有相似的迭代味道,却不是同一套方法,也不能用论文结果证明我的做法对所有人有效。
我现在能确认的只有个人实践。
这套追问确实帮我发现过遗漏的背景和含糊目标,但我没有做受控实验,也没有数据证明它一定能提高学习效果或开发效率。
所以我更愿意把它当成一面镜子。
镜子不会替我决定什么是对的。它只是把我输入里的毛病照得更清楚,最后仍然要由我判断哪些建议成立,哪些建议只是模型顺着我说。
一次反思不够,重复错误得留下来
如果追问结束以后,我又把会话关掉,这套方法仍然只完成了一半。
我给自己开了一个叫「宇航的成长」的会话,专门记录反复出现的提问问题和概念问题。它不是一份漂亮的成功案例集,更像一本错题本。
例如,同一种缺口连续出现几次,我才会考虑把它写进长期规则。
如果只是偶尔一次,我就保留现场,不急着上升成方法论。
这里还有一个容易说过头的地方。我的项目工作流能够读取我明确放进当前任务的上下文、文件和知识库,并不等于 AI 可以不受限制地读取所有私人会话。哪些内容可以进入项目,仍然需要人为授权和隐私检查。
我越来越觉得,知识库的价值取决于这些内容有没有经历过真实任务、失败和再次使用。AI 一次写得多完整,反倒没那么重要。
只有写下来,不算资产。
重新用过,才开始像。
项目复杂以后,我只盯总控,但最后验收不能丢
单个问题可以靠追问改进。项目一复杂,还会遇到另一个麻烦。
一个会话里塞进需求、代码、文案、测试和资料,模型很容易把上下文混在一起。人也一样,盯着几十条对话滚动,很快就不知道哪个结论已经验证,哪个只是讨论过。
我现在的做法,是保留一个总控。
总控负责理解目标、拆分任务、说明边界,再把互相独立的工作交给不同子线程。涉及同一个代码仓库时,子任务可以进入各自的 Git worktree。Git 官方文档把 worktree 定义为同一仓库关联的多个工作树,不同分支可以在各自目录中被检出。
Codex 当前也提供多智能体并行和内置 worktree 支持。我用它,主要是为了把不同任务的上下文隔开,而不是看一群 Agent 自己跑得热闹。
最后,所有结果都要回到总控验收。

拆任务只是开始。每个结果都要带着证据回到总控,并经过人工验收后才进入知识库。
这套方式目前是我的个人工作方法。我没有对照数据证明它「效率最高」。它最实际的价值,是让我更容易看见任务属于谁、用了什么证据、哪里还没有完成。
如果没有最后的验收,多线程只会把一个模糊任务变成三份模糊结果。
这套方法最容易踩的五个坑
第一个坑,是让 AI 证明自己刚才说得对。
模型很容易沿着已经生成的答案继续解释。追问时应该把注意力拉回输入缺口,而不是请它给自己打高分。
第二个坑,是一句「帮我优化提示词」就结束。
问题太宽,得到的往往是一份教科书式模板。可以要求它分别检查背景、目标、前提和验收标准。
第三个坑,是让 AI 擅自改目标。
问题看起来更专业了,真正想做的事却被换掉。因此要明确「保留原目标」,如果原目标本身有问题,就让它单独指出,别偷偷修改。
第四个坑,是收集太多建议。
一口气记十个习惯,通常等于没有习惯。每次只留一个,下次任务再检查有没有重犯。
第五个坑,是把模型建议当成事实。
AI 指出的缺口也可能不准确。涉及产品能力、新闻、比赛、价格、法律或真实人物时,仍然要回到官方资料和一手证据。
你今天就可以跑一次的小闭环
不用先搭复杂系统。
找一条你今天刚问过的问题,尽量选择答案已经完成、结果也能检查的。
先保留原问题和原答案,不要覆盖。
把上面的追问发给 AI,看它指出了什么缺口。你只选一个确实影响结果的地方。
然后让它重写问题,再重新执行一次。对比两次结果,不看文字是不是更高级,只看它有没有更贴近目标、更容易验收。
最后,把这一个缺口记下来。
如果同一个问题以后重复出现,再把它升级成你的长期提问规则。没有重复,就别急着发明方法论。
这个过程真正想留下的,不是一条包打天下的提示词。
它留下的是一条证据链。
原问题是什么,模型发现了什么,我接受了哪条建议,新问题有没有带来更可验收的结果。
这比单纯保存一段「神级提示词」麻烦一点,但它更接近真实成长。
我接下来会怎么验证
回到「AI 第二曲线」当前的真实进度。
首位创始成员已经出现,但已选真实工作流仍是零,连续运行记录是零,经过成员使用验证的内容资产也是零。
所以下一步不是继续写更多概念。
我要陪第一位成员选一个每周会重复发生的真实流程,先记录基线,再连续运行三次。每次都保存输入、输出、失败点、人工修改和最终反馈。
如果这套「答案之后再问一句」真的有用,它应该能在三次运行里留下可比较的变化。
如果没有,也应该老老实实记录它在哪里失效。
我现在更在意这个。
因为 AI 给出的答案会很快过期,工具也会变。但一个人能不能看见自己问题里的缺口,能不能把一次任务变成下一次更清楚的问法,这件事会留下来。
AI 答完以后,先别急着关。
把问题拿回来,再看一眼。
可直接复制的追问
请回看我刚才的提问,不评价答案本身。
告诉我哪些背景没有交代清楚,目标哪里还很含糊,我又默认了哪些未经验证的前提。
然后保留我原来的目标,帮我重写一版更容易得到好结果的问题。
最后只挑一个最值得长期改的提问习惯,告诉我下次该怎么做。
参考资料
- • Self-Refine: Iterative Refinement with Self-Feedback[1]
- • Git 官方文档|git-worktree[2]
- • OpenAI|Codex[3]
本文中的提问复盘、成长会话和总控工作流均为作者个人实践,不代表已经完成受控验证。正文插图与封面均为本期原创概念图,不是真实产品界面、后台数据或实验结果。
引用链接
[1] Self-Refine: Iterative Refinement with Self-Feedback: https://arxiv.org/abs/2303.17651
[2] Git 官方文档|git-worktree: https://git-scm.com/docs/git-worktree.html
[3] OpenAI|Codex: https://openai.com/codex/
夜雨聆风