ARTICLE · 1075082
AI 帮我做完了,可我好像什么都没学会
做出一个东西很兴奋,但真正属于你的,是理解它、判断它、继续改进它的能力。
小周在公司做项目管理,没学过编程。
他一直想要一个小工具:上传几份项目资料,自动识别项目名称和金额,按类别汇总,最后导出一张表。以前这个想法只能停在"哪天有空找技术同事聊聊"。
现在他打开 AI,把需求说了一遍。接下来就是跟着指引安装环境、运行程序,报错了就把错误信息复制回去,来回折腾几轮,网页居然真的打开了。文件能上传,表格能导出,连按钮颜色都能按自己的喜好改。
那种兴奋你可能也体会过:一个原本够不着的想法,突然变成了能点、能用的东西。
第二天,同事换了一批文件,结果少了几行。小周把问题丢给 AI,修好了。第三天,重复文件处理出了错,还是 AI 修好的。
直到有人问他:"它现在是怎么判断重复的?同一个项目换了个名字,会不会被算成两个?"
小周愣了一下,发现自己说不清楚。
工具变强了,不等于你变强了。
这不是在笑话"外行写代码"。写报告、做分析、整理合同、设计培训课,用 AI 的每个人都可能遇到同样的时刻:事情做成了,可自己到底会了什么,心里没底。
一、做出来了,不等于会了
"我会了"这三个字,其实藏着好几层意思。
第一层,能在 AI 帮助下把事情做完。第二层,能看出结果哪里不对,比如发现汇总表的总金额比原始材料少了十万。第三层,知道问题可能出在哪,比如想到可能是重复记录被误删了,而不只是对 AI 说"你再检查一遍"。
第一层本身就是真本事,不必看轻。但它不会自动带出后面两层。
术语|「我会了」的三层意思
第一层
能在 AI 帮助下把事情做完
第二层
能看出结果哪里不对,比如发现汇总表的总金额比原始材料少了十万
第三层
知道问题可能出在哪,比如想到可能是重复记录被误删了
以前亲手做事时,细节会硬塞到你面前:这两个项目为什么同名?这笔钱为什么不能相加?附件和主表为什么对不上?你被迫去想,想着想着就懂了。
现在,一份整整齐齐的结果先摆在眼前,那些藏在过程里的问题,很可能根本没机会被你看见。
当然,这不是说要回到什么都亲手做的年代。会计不用心算每一笔账,写书的人不用自己排版印刷,小周也不需要从零写出整个程序。
真正要想清楚的是:哪些可以放心交出去,哪些一旦交出去,你就没法判断结果对不对了。
二、差别不在用不用 AI,而在怎么用
有研究者做过一个实验[1]:找来一批会用 Python、但没接触过某个新工具库的程序员,让他们完成一项新任务,一半人可以用 AI,一半人不能。任务结束后考一考他们对这个库的理解。
结果,用 AI 的那组测验分数明显更低,而完成任务的速度并没有快出多少。
更有意思的是研究者回看了大家使用 AI 的录像[2]:同样用 AI,那些会追问"这是什么原理"、会试着读懂生成代码的人,学得明显更好;而一路"帮我写""还是报错,继续改"的人,学到的最少。
另一项在高中数学课上做的实验[3]也很能说明问题。一组学生用普通的 AI 聊天助手,另一组用老师设计过提示的 AI 辅导,这种辅导不直接给答案,而是一步步引导。练习时两组成绩都提高了;可一旦撤掉 AI 考试,用普通助手的那组反而比从没用过 AI 的学生考得更差,而用引导式辅导的那组没有出现这种下滑。
还有一项大学物理课的研究[4]发现,精心设计过的 AI 辅导,能让学生学得比传统课堂更好。
把这些放在一起看,结论其实很朴素:AI 替你做掉的是哪一部分,决定了你还在练习什么。
如果它帮你找例子、解释生词、把难题拆小,你就能把精力留给真正关键的地方。如果它连判断、选择、纠错都包了,你剩下的就只有"看一眼,点确认"。
十次"还是不行,继续修",不如一次"我猜问题出在这里,怎么验证"。
还有一点值得安慰:照着 AI 的建议做,并不一定妨碍学习。一项关于客服人员使用 AI 助手的研究[5]发现,客服在采纳 AI 建议的过程中,自己的能力也在提升。原因不难理解,客服用了某句话术,马上就能看到客户是不是说清楚了、问题是不是解决了。
所以,比"答案是谁写的"更重要的是:你有没有看到这个答案带来的后果,有没有办法验证它。
三、最该警惕的,是半懂不懂的地方
我常分享一个观点:我不反对年轻同事用 AI,但不能让它替你思考和判断。
在我看来,有两类工作特别适合交给 AI。
一类是你已经很熟、但很耗时间的重复劳动。 让 AI 提高效率,把精力留给更有价值的事。
另一类是你完全不懂的领域。 让 AI 领着你入门,帮你搞清楚基本概念、该问什么问题、从哪里下手。
真正要警惕的,是那些你半懂不懂的地方。
完全外行的时候,你会本能地怀疑;真正熟悉的时候,错误一眼就能看出来。最危险的是那个中间地带:你懂的那一点,刚好够让你觉得 AI 说得对,却不够让你发现它哪里错了。
所以我给团队定了两条底线:不能让 AI 替你下一个你自己无法验证的结论;也不能把 AI 的回答原样当成工作成果交上来。
这三类工作,其实只有一条分界线:你能不能验证它。
熟悉的工作,你知道对的结果长什么样,AI 错了你能看出来。完全陌生的领域,你用 AI 是为了学,产出的是你自己的理解,而不是交给别人的结论。只有半懂不懂的时候,你既判断不了,又以为自己判断得了。
对照|三类工作,一条分界线
A
熟悉的工作
B
放心交出去,AI 错了你能看出来
A
完全不懂的领域
B
用 AI 是为了学,产出自己的理解,而不是交给别人的结论
A
半懂不懂的地方
B
既判断不了,又以为自己判断得了
回头看小周,去重规则就是他半懂不懂的地方。他知道要去重,却说不清怎样才算重复。AI 说"已经修好了",他看着输出正常,就信了。
还要提醒一句:"完全不懂"迟早会变成"半懂不懂"。 AI 领你入门,走几步就到了半懂的阶段。这不是某一类工作的问题,而是每个人学新东西都必经的一段路。也正是在这个时候,人最容易拿着 AI 的结论去交差。
怎么知道自己是不是在这个区域?有几个信号:
•说不出"什么情况下这个答案是错的"
•接受它的理由是"听起来很有道理"
•同事追问一句"为什么",就只能回去再问 AI
发现自己在这里,有两条路可以走。一是退回入门模式,把 AI 的回答当作学习的线索,而不是拿去用的结论。二是找一个独立的验证来源,比如原始资料、懂行的同事,或者实际跑一次测试。
那要懂到什么程度才算走出来?不必全懂,但要懂到能验收。可以盯住三个地方:
入口:我到底要解决什么问题?手上的材料够不够支撑它?
变化:换一种文件、多一个例外、少一个条件,结果应该怎么变?
出口:看到什么证据,我才敢用这个结果?出现什么情况,我该停下来找人?
术语|懂到能验收,盯住三个地方
入口
我到底要解决什么问题?手上的材料够不够支撑它
变化
换一种文件、多一个例外、少一个条件,结果应该怎么变
出口
看到什么证据才敢用这个结果?出现什么情况该停下来找人
比如小周,他可以不会写代码,但他应该能清楚地提出:"文件同名不一定就是重复""缺失的金额不能自动补成零""解析失败的材料必须列出来,不能悄悄消失"。说出这几句话,靠的不是技术,而是对业务的理解。
如果工具要给很多人用、要接入重要系统,那就需要请懂技术的人一起把关。知道自己哪里需要别人,本身也是一种判断力。
四、四个小动作,把半懂变成真懂
做完工作再额外上两小时课,不现实。更可行的办法是在几个关键节点上,给自己的判断留个位置。还是拿小周的工具举例。
第一步:先写下你期待的结果,再让 AI 动手。
让 AI 加去重功能之前,小周先写了三个例子:同一份文件换了名字,应该只算一次;标题相同但内容不同,两份都要保留;同一项目的两份材料内容冲突,要提示出来,而不是擅自删掉一份。
这一步的意义在于,"对"的标准由你先定下来。否则程序输出什么,你很容易就顺着它觉得"好像也说得通"。
第二步:让 AI 讲清楚它的判断依据。
不需要逐行读代码。直接问:"你是根据什么判断两份材料相同的?为什么不只比较文件名?"然后拿刚才写的例子去验证。AI 的解释和程序实际做的事不一定完全一致,结果以实际运行为准,拿不准就请懂的同事看一眼。
第三步:故意改一个条件。
两份内容完全一样的文件,只改其中一个金额,结果变不变?如果没变,是你的预期错了、规则不合理,还是程序有问题?这样问一次,往往比再让 AI 加十个新功能,更能看清你对这个工具懂多少。
第四步:过几天,换一批新材料,自己先想再运行。
先别翻之前的聊天记录,写下你打算检查哪几个地方,再运行。不用记住所有细节,但要能说出为什么检查这些。
如果愿意,顺手记一条笔记。不用抄 AI 的长篇解释,记一句自己的话就够:
"我原来以为同名就是重复,这次发现同名报告可能属于不同月份。以后判断重复,要同时看内容和业务含义。"
这句话把一次错误、它的原因和下一次该怎么做串在了一起,比收藏十篇教程都管用。
当然,不是调个颜色都要走一遍这四步。把力气花在反复出现、影响结果、而你又还没弄懂的地方就好。
步骤|把半懂变成真懂的四个动作
1先写下期待的结果
同一文件换名只算一次、同名不同内容都保留、冲突要提示而不是擅自删掉一份
2让 AI 讲清判断依据
根据什么判断两份材料相同?拿自己写的例子去验证
3故意改一个条件
只改一个金额,看结果变不变;没变就追问是预期错了、规则不合理还是程序有问题
4换批新材料先想再运行
不翻之前的聊天记录,先写下要检查哪几个地方,再运行
五、团队也要给判断力留个位置
个人可以调整习惯,但有些问题光靠自觉解决不了。
设想一个团队引入 AI 后,新人写初稿从两天缩到半天,于是每周任务量翻了一倍。产出确实多了,资深同事也还在最后把关。短期看,一切顺利。
但时间长了呢?新人有没有机会知道初稿哪里被改了、为什么改?资深同事哪天离开,谁来接住那道把关?
其实不需要很大的投入。比如挑一份有代表性的材料,让新人先列出自己的疑问,AI 处理完再对照;资深同事只讲最关键的一两处判断,不用全部重来。省下来的时间里拿出一小部分,确认人是真的懂了。
我们总说"人要去做更高级的判断",但判断力不会凭空长出来。不能一边取消了练出判断力的机会,一边指望"人工复核"永远可靠。
六、留下来的,不只是一个工具
几个月后,小周可能还是写不出一个完整的程序。
但他已经能清楚地说出:什么材料适合交给工具处理,哪些字段不能让它自己猜,什么时候必须回到原文核对,怎么判断一次修改有没有带来新的遗漏。他开始能和技术同事讨论具体问题,而不只是说一句"它又坏了"。
他从半懂不懂,走到了能验收、能判断的地方。这比"是不是亲手写了每一行代码"更能说明他成长了。
AI 给了我们一个难得的机会:更早地参与那些以前没条件参与的事。不懂的地方随时能问,想法很快能变成样品,失败了也可以低成本重来。这些条件,本来就是学习最好的土壤。
但土壤要有人耕。
下次 AI 帮你做完一件重要的事,先别急着做下一件。问自己一个问题:
这个结果如果错了,我能发现吗?
能问出这个问题,并且慢慢能回答它,你收获的就不只是眼前这件事了。
用 AI 做完一件事后,可以问自己三个问题:
1.这件事,我是熟悉、完全不懂,还是半懂不懂?
2.换一批材料或改一个条件,我知道结果该怎么变吗?
3.如果它错了,我能发现吗?
参考资料
[1] Anthropic 研究团队关于 AI 辅助与编程技能形成的随机实验,arXiv:2601.20245,2026。 arxiv.org/html/2601.20245v1
[2] Anthropic,How AI assistance impacts the formation of coding skills(研究解读与交互方式分析)。 anthropic.com/research/AI-assistance-coding-skills
[3] Bastani 等,Generative AI Can Harm Learning(高中数学实验)。 hamsabastani.github.io/education_llm.pdf
[4] Kestin 等,AI tutoring outperforms in-class active learning,Scientific Reports,2025。 nature.com/articles/s41598-025-97652-6
[5] Brynjolfsson, Li, Raymond,Generative AI at Work,Quarterly Journal of Economics,2025。 danielle.li/assets/docs/GenerativeAIatWork.pdf
关于本文的说明
•文中小周和团队的例子是为了说明问题而设想的场景。
•研究[1][2]测量的是完成一次短任务后的理解程度,不代表长期能力变化。交互方式的分析属于观察性结果,"主动追问学得更好"是相关关系,不是因果结论。
•研究[3]中,引导式辅导组避免了成绩下滑,但也没有显著超过从未使用 AI 的学生。
•研究[4]中的 AI 辅导包含预先设计的解题依据、分步活动和针对性反馈,不同于随手打开聊天窗口自由提问,研究也没有证明它能替代整门课程。
•研究[5]中关于"客服能力提升"的证据来自系统偶发中断期间的表现,样本有限,并非专门的长期学习实验。
•"熟悉、完全不懂、半懂不懂"的划分来自作者的管理实践,是经验总结,而非研究结论。
•资料核对截至 2026 年 9 月 22 日。