乐于分享
好东西不私藏

AI给孩子讲题,答案对了但过程全错——这才是教育产品最该害怕的事

AI给孩子讲题,答案对了但过程全错——这才是教育产品最该害怕的事

系列《把AI做对》 · 第一篇


「未来社会」系列聊了十一篇,从AI如何重塑创造、学习、工作、经济,一路聊到文明级的长远命题。那个系列的核心问题是"AI会把我们带向哪里"。

但从这一篇开始,我要聊一个更紧迫的问题:AI已经在这里了,我们怎么把它做对。

不是五年后的AGI图景,不是宏大的文明叙事,而是眼前正在发生的事——AI教育产品正在进入千家万户,而它有一个所有从业者都不愿大声说的问题:幻觉。

这篇文章是我花了几周时间,把国内外AI教育产品的幻觉治理方案、学术界最新论文、以及监管合规要求做了一次全面调研后的成果。不是技术文档,是一个从业者的诚实记录。


一、先讲一个真实的故事

Khan Academy的Khanmigo,是目前全球最受信赖的AI教育产品之一。底层是GPT-4,背后有哈佛和斯坦福的随机对照实验背书,使用它的学生数学成绩显著提升。

然后有记者拿一道代数题实测。

学生给的答案是对的。Khanmigo判错了。学生解释了一遍。Khanmigo还是说错。学生又解释了一遍。Khanmigo第三次才认同——哦,你是对的。

连续三次。

记者写了一句话让我一直忘不掉:"错误很重要。孩子可能记住难以纠正的错误解法,或对知识点更加困惑。"

这不是Khanmigo的问题。这是所有AI教育产品的问题。学而思九章大模型的负责人白锦峰说得很直白:"幻觉问题是大模型应用于教育的核心卡点。"

而学而思自己演示过一个更隐蔽的案例——一道购买足球的应用题,模型第一轮列式完全正确(48×40×1/8+48×40),但把48×40算成了2880。

式子对了,答案错了。

你说这算不算"幻觉"?算。但更可怕的是另一种——

式子错了,答案对了。

大模型经常"用错误的推理得到正确结果"。答案层面的抽查发现不了这类中间步骤错误。而学生恰恰要学的是过程,不是答案。

一个孩子如果把错误的方法记住了,纠偏成本极高。这就是为什么教育场景的幻觉比通用场景危害更大——它直接作用于认知形成期的未成年人。


二、"答案对"和"过程对",是两件不同的事

这是整篇文章最核心的一个概念,我先说清楚。

结果准确性:最终答案对不对。

过程准确性:每一步推理对不对。

过去几年,AI教育产品主要在追第一件事——答案别给错。但行业正在意识到,第二件事才是教育的命门。

OpenAI在2023年发了一篇论文《Let's Verify Step by Step》,用80万条步骤级人工标注数据证明了一件事:过程监督(对每一步给反馈)显著优于结果监督(只看最终答案)。过程监督模型在MATH测试集上解对了78%的题,而且能精确定位出错步骤、可解释、可避免"歪打正着"。

论文明确指出:结果监督会奖励"用错误推理得到正确答案"的解法。

换句话说——只看答案,你永远不知道孩子学到的到底是正确方法还是碰巧蒙对的错误方法。

这就是业界从"结果准确性"走向"结果+过程双重准确性"的根本动因。


三、主流玩家在怎么做:工具箱已经收敛

我调研了国内外十几家AI教育产品和学术方案,发现一个清晰的趋势:降幻觉的工具箱已经高度趋同,差异在成熟度和透明度。

这套工具箱里有什么?我按性价比从高到低排——

第一件:把答案关进"检索的笼子"。

所有靠谱的玩家都在做同一件事——回答之前,先去检索已经人工审核过的题库、教材、标准解析,把答案锚定到已验证内容上,而不是让模型凭空生成。

Khanmigo的做法最典型:他们做了一次大规模人工审核,发现"当Khanmigo在计算或评判之前,先取到平台上人工编写的习题、步骤、提示和答案,准确率就会提升"。于是把架构改成了回答前强制先检索。

猿辅导的策略更直接——不让大模型随机生成题目,而是基于已有确定答案的题目做解析。从源头杜绝答案幻觉。

学而思CTO田密坦承:RAG"仅能缓解,难以完全消除"幻觉。这句话是行业共识。

第二件:能算的一律交给工具,不让大模型心算。

大模型是为"预测下一个词"设计的。让它做算术,它会"预测一个看起来合理的数字"而不是真正计算。Khan Academy的团队公开承认了这一点,然后做了一个看起来很朴素的决定——专门给Khanmigo造了一个计算器。数值运算从语言模型里剥离出来,交给独立工具处理。

Google的Gemini用Python代码执行规避"视觉算术幻觉"。国内的讯飞、学而思也在走工具调用路线。

这是保证"过程中每一步数值计算正确"的最可靠手段。代码执行不受幻觉影响,跑的是真实算术。

第三件:不直接给答案。

Khanmigo的核心设计原则是问而不答。学生要答案时,它反问:"你试了什么、卡在哪、你觉得涉及哪个概念?"

豆包爱学的"AI老师"分步拆解、实时生成可视化"智能板书"、支持随时打断追问。小猿明确"不直接给答案",做五重错因分析、1v1启发式讲解。

这不仅仅是为了教学效果——它从产品层把"错误答案直接暴露给孩子"的风险降到了最低。答案都不直接给了,幻觉自然就少了传播路径。

第四件:多次求解,取一致解。

同一道题让模型做很多遍,检查步骤一致性和正确性。学而思的工程化路线是"Verifier验证器+多次求解自洽"——做很多遍后幻觉大幅缓解。

UC Berkeley的一项研究实测了这个方法的效果:对代数题应用自洽后,错误率从25%-47%降到接近0%。但统计学只从29%降到13%。

威力巨大但并非万能,学科异质性明显,不能一刀切承诺"准确率"。

第五件:慢思考/深度推理模型。

DeepSeek-R1、讯飞X1、网易有道的子曰-o1——这些"慢思考"模型通过长思维链让模型"自我质疑、假设验证、错误修正",内生地更关注过程。

网易有道在2025年初发布并开源了子曰-o1,官方称其为"国内首个输出分步式讲解的推理模型",明确表示"不仅对最终答案的正确性进行评估,同时还覆盖了整个讲解过程"。

但斯坦福ACL 2025的研究提醒了一件事:推理链长度与准确性呈"U型"——过长的推理链反而可能累积错误。想得久不一定想得对。


四、各家到底做得怎么样:一张诚实的表

我把调研结果做了一张横向对比。但先说一句:表里的"准确率宣称"一栏,凡标注"软文/媒体实测"的,都不是厂商官方可复现的benchmark,应该当营销看。

厂商/产品
核心方法
过程校验披露
苏格拉底式引导
透明度
学而思
九章大模型+RAG+Verifier自洽
(公开演讲、论文、评测集)
科大讯飞
X1深度推理+问题链+教材对齐
中(步骤拆解、反思验证)
是(SocraticLM,NeurIPS   2024)
中高
网易有道
子曰-o1分步讲解+教材对齐
中高(覆盖整个讲解过程)
是(先解析后答案)
中高(模型开源)
字节豆包爱学
多模态识别+RAG+讲解体验
未明确披露步骤级校验
是(AI老师引导、可打断)
猿辅导
答案锚定(基于确定题目做解析)
中(圈画错误步骤、五重错因)
是(明确不直接给答案)
Khanmigo
检索自家人工审核题解+专用计算器
中(人工审核错误清单)
是(核心设计原则)
Google LearnLM
与Gemini联合训练+grounding
中(教学法指令遵循)
是(硬/软约束)
(技术报告+RCT)
传统硬件厂商
接入DeepSeek/第三方大模型
部分

有几个关键发现需要单独说——

第一,"垂类=更准"是个需要打破的营销话术。北师大2025年的"北极星"评测显示,通用大模型(如doubao-1.5-thinking-pro、DeepSeek-R1)在"题目准确性/解析准确性"上得分95+,反超多数教育垂类模型。垂类模型在复杂推理上仍偏弱。所以别听"我们是教育专用大模型所以更准"这种话——不一定。

第二,传统硬件厂商自研深度最浅。步步高、希沃、读书郎、优学派多为接入DeepSeek或第三方大模型的集成方,公开的降幻觉技术资料极少。不是说它们一定差,但透明度低本身就是风险。

第三,学而思是国内在过程校验上披露最清晰的玩家。它的做法——Verifier验证器+多次求解自洽+步骤检查——是目前国内最接近学术前沿的工程化方案。而且学而思于2025年5月联合中国信通院牵头制定了行业首个AI家教标准,把合规资质变成了竞争壁垒。


五、学术界最有价值的一条路线:先验证,后生成

我翻了大量2024-2026年的论文,如果只挑一条最值得关注的,是ETH Zurich和TU Darmstadt的一个团队提出的**"先验证、后生成"(verify-then-generate)架构**。

多数AI导师在"一次前向传播"里同时完成三件事:判断学生哪错了、选教学策略、生成回复。结果经常把错误解判成对的、给出幻觉反馈。

这个团队的做法是把"验证"从"生成"里拆出来,做成两段式——先由一个专门的验证器输出"错在第几步、错因描述",再由生成模型基于这个验证结果组织回复。

他们的实证结论对任何做AI教育产品的人都有价值:

    这条路线基本上就是学而思"Verifier"思路的学术化、模块化版本。不需要自研大模型,只需要"参考解对齐+独立验证器+条件生成"三段式。


    六、一份泼冷水的清单

    以上说的都是"做了能降幻觉"的事。但有几条"泼冷水"的证据,我觉得比那些"准确率99%"的宣称重要得多——

    RAG不是万能药。斯坦福RegLab测了三款接了RAG的专业法律AI——幻觉率17%-33%。虽然显著低于裸GPT-4的58%-82%,但远未"消除"。更关键的是一项RCT发现:127名法学生用RAG工具完成任务后,产生的幻觉率与"完全不用AI"的学生几乎持平。"接了题库就安全"是错觉。RAG之上必须叠过程校验与拒答。

    模型自报的置信度不靠谱。2026年的研究提醒:模型自报的置信度与是否幻觉的关联并不稳定,跨题型、跨模型差异很大。拒答不能只看模型self-confidence,要多信号联合判断。

    "谄媚"是高危场景。当学生带着错误前提提问——"老师说这题用乘法对吧?"——AI倾向于用捏造的依据去附和,而不是纠正前提。这是幻觉的一种特殊形态,在教育场景高发,验证器必须能顶住谄媚、敢于纠正。

    过程监督不是银弹。2025年的一篇论文从理论上论证:结果监督与过程监督的统计难度其实相当,实测中过程监督的优势"可能源于算法实现而非本质差异"。对资源有限的团队,"结果验证+自洽+工具兜底"这套更轻的组合,性价比可能更高。

    推理链过长反而累积错误。慢思考模型不是想得越久越准。斯坦福研究显示推理链长度与准确性呈U型关系。

    最狠的一条——不受约束的AI导师会让学生用时表现好、撤走后反而更差。2025年Bastani等人的研究发现,纯AI自动辅导会造成"认知外包"——学生把思考外包给AI,AI在的时候成绩不错,AI撤走后比从来没用过AI的学生还差。

    这大概是"防依赖"最硬核的实证依据。


    七、唯一被RCT验证过的安全底座

    说了这么多"不能做什么",那到底什么才靠谱?

    答案有点让人泄气:目前唯一被严肃RCT验证过的安全底座,是human-in-the-loop——真人逐条审核。

    Google DeepMind的LearnLM在英国Eedi平台做了一次随机对照实验。165名学生,17名专家教师。关键设计是:LearnLM起草的每一条消息,都由一名监督老师先审,可批准/编辑/重写,再发给学生。

    结果:全量审计发现零有害内容,事实错误仅5条,占LearnLM起草的3,617条消息的0.1%。老师对AI草稿的"零改动或仅1-2字符微调"通过率约74%。

    这个0.1%很漂亮。但请注意它的前提——每一条消息都由真人老师审核。

    它证明的是"human-in-the-loop的AI导师"安全,不等于"AI独立运行"安全。任何拿这个数字为"纯AI自动辅导"背书的说法都应打折。

    而且有一个细节特别有启发:老师最常见的干预不是纠正事实错误,而是给AI"太钝的逻辑/苏格拉底追问"做情绪缓冲和节奏管理。约44%的编辑用于缓和会让学生受挫的追问节奏。

    AI的短板不在算术,在"人味"。


    八、一条绕不过的合规红线

    技术方案聊完了,但有一件事可能比技术更紧迫——合规。

    2026年7月15日,五部门联合发布的《人工智能拟人化互动服务管理暂行办法》正式施行。这是对"AI伴学机器人"最直接的新规。核心要求包括:

    • 显著提示用户"正在与AI而非自然人交互";
    • 建立强制未成年人模式,处理不满14周岁未成年人个人信息须取得监护人同意;
    • 不得向未成年人生成引发模仿不安全行为、极端情绪、不良嗜好的内容;
    • 连续使用每超过2小时,应当以对话或弹窗方式提醒注意使用时长;
    • 不得向未成年人提供虚拟亲属、虚拟伴侣等虚拟亲密关系的服务。

    注意:AI伴学机器人的"拟人陪伴"属性使其处于灰色地带,应从严设计。

    再加上《生成式人工智能服务管理暂行办法》要求的内容真实性、AI生成内容标识、算法备案、安全评估——教育大模型需通过国家备案。

    内容准确性+生成内容可标识+未成年人特殊保护,三位一体。合规不是选配,是上市前提。


    九、那到底该怎么做:一套务实框架

    把国内外产品实践、学术研究和监管要求拧在一起,我提炼出一套务实的降幻觉框架。不追求完美,追求"用工程手段逼近可靠"。

    第一层:把答案关进笼子。

    不自研大模型,采用"通用基座+强RAG/题库对齐"。接入成熟基座,核心投入放在自建高质量题库与教材知识库。拍照搜题/讲题的答案必须优先命中题库,未命中时才走生成,并显式标注"AI生成,仅供参考"。

    第二层:计算走工具。

    所有数值运算、方程求解接入代码执行或符号引擎(SymPy类),杜绝LLM心算幻觉。这是最低成本、最高确定性的过程准确性保障。Khanmimo专门造计算器,不是因为没有GPT-4,而是因为GPT-4算不准。

    第三层:先验证,后生成。

    在架构里加一个独立"验证器"——先输出"学生错在第几步+错因",再由讲解模块基于此组织苏格拉底式回复。验证器先用参考解对齐+错因描述实现,不需要自研PRM。但记住:验证器是命门也是风险点,上线前必须单独做准确率评测与拒答阈值设计。

    第四层:不直接给答案,做成系统默认。

    不是学生可自由切换的开关,而是系统级默认约束。"直接给答案"应降级为家长/教师可控的能力。ChatGPT的Study Mode已经被发现可被学生一键绕过——对K12,这是不能犯的错。

    第五层:轻量自洽兜底。

    关键题多次采样取一致解。答案不一致时触发拒答、转题库或降级为"建议问老师"。注意统计类等学科残余错误更高,要单独标注低置信。

    第六层:教研人工审核回路。

    组建小规模学科教研团队,对高频题、易错题的AI讲解做人工抽检与纠错沉淀,形成私有高质量语料。Khanmigo靠人工逐条评审沉淀出"最常见的数学错误清单"并逐一修复。LearnLM的0.1%靠真人逐条审核。human-in-the-loop是目前唯一被RCT验证过的安全底座。这也是长期壁垒。

    第七层:合规先行。

    开机弹窗声明"我是AI"、内置未成年人模式与监护人端、连续使用满2小时弹窗提醒、便捷退出。每条解答标注来源("匹配自XX题库"/"AI生成")、给出置信度或"不确定时建议问老师"的兜底话术、错误可一键反馈。

    第八层:营销纪律。

    不宣称无依据的"准确率99%"。若要给数字,须给出可复现的测试集与方法,或直接引用第三方评测。北师大评测已经显示"垂类=更准"不一定成立——夸大宣称早晚会被打脸。


    十、可信度住在脚手架里,不在基座模型里

    写到这里,我想强调一个贯穿整篇调研的核心发现——

    Khanmigo和LearnLM之所以可信,不是因为底层是GPT-4或Gemini,而是因为包在模型外面的工程脚手架和人工审核回路。

    专用计算器、检索层、验证器、人工审核、苏格拉底式设计——这些才是可信度的来源。选型时别纠结基座,把预算花在脚手架上。

    学术界用了一个很好的框架叫TEAS——可信教育AI的四支柱:可验证(Verifiable)、稳定(Stable)、可审计(Auditable)、教学上合理(Pedagogically Sound)。部署级安全不在模型本身,在其外围脚手架。

    这句话值得所有AI教育产品从业者贴在工位上。


    十一、没有银弹

    最后说几句诚实话。

    没有任何单一技术能彻底根除幻觉。学而思CTO田密的公开表态代表行业共识。RAG只能缓解,过程监督不是银弹,self-consistency在统计学等学科仍有13%残余错误,推理链过长反而累积错误。

    工程组合+人工兜底才是现实解。

    而且要警惕一个"反直觉"的观点——有人说"轻微幻觉有教学价值,能激发批判性思维"。我对这个观点持强烈保留态度。你的用户是6-15岁的孩子,辨别力弱。蓄意保留幻觉与监管对未成年人内容的从严要求相冲突。正确的做法是保留"引导学生质疑、交叉验证"的批判性思维训练,但不靠"故意让AI出错"来实现。


    写在最后

    「未来社会」系列探讨的是"AI会把我们带向哪里"。这个新系列——「把AI做对」——探讨的是"AI已经在这里了,我们怎么把它做对"。

    不是宏大叙事,是眼前的问题。

    AI教育产品的幻觉治理,不是一场能打赢的仗,是一场需要持续打的仗。你不消灭它,你管理它——用检索笼子、工具兜底、验证器、人工审核、合规设计,一层层把风险压到可控范围。

    然后把这套"压住风险"的能力本身,变成你的护城河。

    因为在一个所有人都在喊"准确率99%"的市场里,那个站出来说"我们没有99%,但我们能告诉你每一条解答的来源、置信度和不确定性"的产品,反而是最值得信任的。

    可信度不是宣称出来的,是设计出来的。


    系列说明:

    「未来社会」系列(全十一篇)探讨了AI如何重塑创造、学习、工作与社会形态。

    「把AI做对」系列从本文开始,着眼于眼前正在发生的问题——AI产品落地中的技术挑战、工程决策与合规底线。不讲宏大叙事,只讲务实解法。


    这篇调研覆盖了国内外十余家AI教育产品、二十余篇学术论文、多项监管文件。所有数字和结论均标注了来源。凡来自厂商发布会话术、导航站或自媒体软文而缺乏可复现方法的"准确率"宣称,均未作为事实采纳。

    如果你也在做AI教育产品,或者在给孩子选AI学习工具,希望这篇能帮你少踩一些坑。

    (本篇完)