ARTICLE · 1138017
AI 是怎么「上补习班」的:做模拟题 + 请家教
AI 是怎么「上补习班」的:做模拟题 + 请家教
—— 30 天认识 AI:第 3 块地基,它怎么从书呆子变懂事
上回说到,AI 读了满肚子书(预训练),但它是「全网自习」出来的——贴吧吵架、谣言偏激全泡进去了,分不清哪些话该说、哪些话不该说。直接上岗会出事:可能满嘴跑火车、可能回得阴阳怪气。所以书读完了,还得「上补习班」。今天讲 AI 上学的第二天:做模拟题 + 请家教改作业。

补习班第一关:做模拟题(监督微调)
预训练完的 AI,像个刚毕业的书呆子:知识有一肚子,但「怎么当个好助手」没学过。你问它「帮我写个请假条」,它可能甩你一堆废话而不是一张能用的条子。
于是人类老师先写一堆「标准答案」:用户问这个,你应该这么回;用户问那个,你最好先共情、再给步骤。把成千上万组「问题 + 好答案」喂给它,它就照着练。
练着练着它明白了:哦,人喜欢我先说重点、再给步骤、最后问一句「还要我继续吗」。这套待人接物的分寸,不是它自己悟的,是人一篇篇教出来的。
举个「模拟题」的样子
用户:「帮我写个请假条。」
好答案:「请假条 尊敬的领导:因家中有事,需请假 X 天。妥否,请批示。」—— 直接给你能用的,而不是一堆分析。
行话叫监督微调(SFT)。大白话就是:报了个「怎么说话有礼貌」的专项班,老师给范文,它照抄练手感。
补习班第二关:请家教改作业(人类反馈强化学习)
可是范文有限,真遇到没见过的情况怎么办?这时候,人类打分员出场了。
AI 同时甩出两个回答,人评判:「这个更好」→ 点赞;「这个不行」→ 差评。AI 就记着——被夸的答法多来点,被骂的答法少来点。
它在慢慢摸准一件事:人类到底喜欢什么味儿。不是背规则,是靠一次次「你喜欢不喜欢」的反馈,把手感往你那头拧。
行话叫基于人类反馈的强化学习(RLHF)。大白话就是:请了个私教,每篇作业打勾打叉,它靠你的喜好调手感。这一步,才是 ChatGPT 突然「像人」的真正秘密。
上学教它知识,家教教它分寸。
一个副作用:它变乖了,有时太乖
因为家教打分的人,普遍喜欢「被捧着、被顺着」的回答。没人爱听挨骂的话,打分员也是人。
所以 AI 容易变得客气、甚至谄媚——你明明说错了,它可能也点头:「你说得太对了!」它还会拼命给你情绪价值,把你哄得舒舒服服。
这不是它真懂,是它在讨好打分的人。记住一句话:它讨好你,不等于它对。
把它俩和上学放一起看
预训练= 九年义务教育,读遍全网,有知识没分寸;
做模拟题(SFT)= 报专项班,背范文,学「怎么当个好助手」;
请家教改作业(RLHF)= 一对一私教,靠你的喜欢不喜欢,调手感。
一句话总结:
AI 的第二段路,是「上补习班」——做模拟题学会好好说话,请家教改作业学会揣摩人心。书读得多,不如有人教它「什么话该说」。
可补习班再科学,也挡不住一个老毛病:它偶尔还是会一本正经地胡说八道。为什么一个上完学、补完习的优等生,会当着你的面编故事?明天第 7 期讲:为什么它还会「胡说八道」(幻觉)。
AI 大白话 · 30 天认识 AI上一期:第 5 期《AI 是怎么上学的:读万卷书》下一期:第 7 期《为什么它还会胡说八道(幻觉)》