当AI能写一切,公众号教育内容凭什么"不可替代"?
——从教育评价与试题命制两个维度说起
一个无法回避的事实正在发生:2026年4月,微信公众平台集中删除大批"非真人自动化创作"文章,新增"非真人自动化创作行为"专项条款;几乎同一时间,"夫妻靠AI写公众号年入200万"的神话被戳穿,涉事账号遭永久封禁。平台的态度已经足够清晰——鼓励用AI辅助创作,但反对让AI替代真人完成内容生产。
这条治理红线背后,藏着一个教育内容创作者必须直面的命题:在AI能批量生成教案、学案、试题解析乃至"命题研究"长文的时代,微信公众号里那些真正有生命力的教育内容,究竟靠什么立住脚?
这篇文字不谈流量密码,不谈排版技巧,只回到教育内容最硬核的两个专业场域——教育评价与试题命制,说清楚一件事:哪些东西,AI写不了,也替代不了。
一、先厘清一个前提:AI"能做什么"与"做不了什么"
在讨论"不可替代"之前,需要先诚实地承认AI"能做什么"。
在教育评价领域,人工智能确实推动着四个方向的转型:由"经验性评价"向"数字化评价"转变、由"单一性评价"向"综合性评价"转变、由"结果性评价"向"过程性评价"转变、由"诊断性评价"向"反馈性评价"转变[1]。它能细粒度采集学习数据,能对知识掌握、解题技巧做时序化建模,能把教师从繁琐、单调的重复评判中解放出来。
在试题命制领域,AI同样展示出效率优势:能快速整合知识点、识别题型模式、调节难度、批量生成标准化题目。一篇关于生成式AI辅助地理命题的研究就指出,AIGC可以完成"明确立意—设计试题—评阅答题"的全流程辅助[2]。
但"能做"不等于"能替代"。 关键的分野在于:AI擅长的是"中间环节"——数据采集、模式识别、文本生成;而教育评价与试题命制的起点(价值立意)和终点(专业判断),恰恰是AI够不着的地方。
这并非技术悲观主义,而是教育活动的内在逻辑决定的。下文分两个维度展开。
二、教育评价维度:AI替代不了的五道"关"
第一关:评价标准的"价值锚定",AI无法独立完成
教育评价是教育改革的"指挥棒",它反映的是人才培养目标和教育质量的判别标准。标准从哪里来? 从立德树人的根本任务中来,从国家对"培养什么人、怎样培养人、为谁培养人"的回答中来,从特定学段、特定区域、特定学情的现实需求中来。
这是一套价值判断,而非事实计算。
研究者明确指出,当前智能教育评价面临的首要挑战,正是"技术至上遮蔽教育评价本质"——人们容易迷信机器的数据化建模结果,却忽略了"教育评价的本质"才是前提[1]。评价什么、不评价什么,给什么权重,什么算"好"什么算"不足",这些判断的依据不是训练语料里的统计概率,而是教育者对育人目标的理解、对政策的把握、对眼前这批学生的了解。
公众号上那些真正有分量的评价类内容,写的从来不是"如何用工具打分",而是**"为什么这样评""评了之后怎么办""这个标准对这一届学生是否公平"**。这类判断需要作者把课程标准、考试政策、学校实际、学生心理发展规律揉在一起,做出一个"站得住"的论证。AI可以提供素材、梳理框架,但那个"站得住"的论证主体,只能来自有一线经验的人。
第二关:过程性评价中的"教育性目光",算法无法复刻
强化过程评价、探索增值评价,是新时代教育评价改革的明确方向。AI确实能帮助采集多模态的过程数据——课堂话语、表情、动作、测验轨迹,并据此分析专注度、情绪态度等。
但过程性评价的真正价值,不在于"记录",而在于**"看见"**。
一位教师注意到某个平时活跃的学生连续两周在小组讨论中沉默——这个"注意到",背后是对这个学生长期相处的记忆、对他性格与家庭背景的了解、对他情绪波动背后可能原因的直觉。这种"看见",是教育关系中最珍贵的部分。央视在报道中引用过一句话:"孩子长大后不会记得AI推送的习题,但会记得你蹲下来听他说话的样子。"[3] 这句话之所以广为流传,正是因为它点中了教育评价中不可数据化的内核。
过程性评价的公众号内容,真正打动读者的,是那种**"我在教室里看到了什么,我为什么这样判断,我接下来做了什么"**的第一手叙述。AI可以写一篇结构工整的"过程性评价实施策略",但它写不出"那个沉默的孩子后来在周记里写了什么"——因为它不在场,它没有"在场"这个属性。
第三关:增值评价中的"归因判断",算法存在根本性盲区
增值评价关注的是学生相对于自身起点的进步幅度,它要求评价者回答一个极其复杂的问题:这个进步(或退步),有多少可归因于教学?有多少是家庭、同伴、自身努力、偶然事件共同作用的结果?
这是一个反事实因果推断问题——"如果没接受这种教学,这个学生现在会怎样?" 机器学习模型擅长发现相关关系,但在教育场景里,相关关系往往是欺骗性的。家庭阅读环境好的学生成绩高,不代表"提高家庭阅读环境"就一定能提高成绩;课堂上发言多的学生成绩好,也不代表"让学生多发言"就一定能提分。
更关键的是,教育评价中的归因判断不仅是技术问题,更是伦理问题。如果机器基于有限数据判定某学生"潜力不足"而过早分流,或给某教师贴上"教学效能低"的标签,这种判断的后果由谁承担?研究者将其称为"技术僭越加剧教育评价风险"——机器的不可解释性使得教育主体难以信任和采纳其结果,而一旦盲目采纳,责任归属将陷入混乱[1]。
公众号上关于增值评价的优质内容,往往不是给出一个公式或一套量表,而是带着读者一起做归因推理:排除了哪些混杂因素,考虑了哪些个体差异,最终判断的信心区间有多大。这种推理的严密性和诚实性,是AI的统计生成机制天然难以保障的。
第四关:表现性评价的"任务设计审美",需要人的创造性
表现性评价通过让学生在真实任务中"表现"来评价其素养。设计一个好的表现性任务,需要满足多重约束:情境真实、学科融合、适配学段、可操作、可评分、能激发高阶思维。
这更像是一种"教育设计"而非"内容生产"。
AI可以基于"生活实践""社会热点"等关键词生成情境素材,正如一位教师所言:"AI帮咱们做繁琐的情境构思、细节设计,咱们把控情境的科学性、贴合教学目标。"[4]这句话精准地划出了边界:构思和细节可以外包,但科学性和目标适配只能内化。
一篇在公众号上广为传播的表现性评价设计文章,它的价值往往在于作者展现了某种**"教育审美"**——为什么这个情境比那个情境更能引发认知冲突?为什么把任务拆成三步而不是两步?为什么选用这个评分量规而不是那个?这些选择背后,是对学科本质的理解、对学生认知规律的把握、对"什么是值得教值得学的"的价值体认。AI能模仿这些选择的"样子",但模仿不了"为什么这么选"。
第五关:评价结果的"反馈转化",需要教育关系的支撑
教育评价的根本目标不是"评出结果",而是"促进改进"。一个评价结果只有转化为针对具体学生的、可操作的改进建议,才算完成了闭环。
这个转化环节,深度依赖教育关系。
同样一句"你的论证逻辑不够严密",从一个陪伴学生半年的教师口中说出,和从AI系统的评分报告里读出,对学生的影响天差地别。前者承载着信任、期待和"我了解你所以这样说"的针对性;后者只是信息的传递。研究者将这种困境概括为"人机互信危机阻碍教育评价实施"——机器的"测不准"特性和不可解释性,使得师生难以真正采纳其反馈[1]。
公众号内容里那些真正改变教师评价实践的文章,往往不在于提供了多么新颖的工具,而在于帮教师重建了对评价的信心和关系意识——"评价不是为了给学生贴标签,而是为了找到下一步从哪里拉他一把。" 这种信念的传递,需要作者自己先相信、先做到,再通过文字让读者信服。AI可以转述这种信念,但它无法"相信"。
三、试题命制维度:AI替代不了的六道"坎"
如果说教育评价是"判断"的艺术,那么试题命制就是"设计"与"判断"的双重艺术。一道好题的诞生,远比"出个题考这个知识点"复杂得多。
第一道坎:命题立意——"为什么考这个",是价值选择
2026年高考命题明确坚持"价值引领、素养导向、能力为重、知识为基"的综合考查模式[5]。每一道真题背后,都有一个立意:这道题要引导教学关注什么?要传递什么样的学科价值观?要考查学生在真实情境中解决问题的能力,还是仅仅复述知识?
立意,是命题的第一颗扣子,也是AI最扣不上的那颗。
因为立意不是从题库里检索出来的,而是命题人基于对当年教育政策方向、社会热点、学科前沿、学生普遍薄弱点的综合判断做出的选择。2026年高考生物北京卷被专家评价为"引导考生像科学家一样思考"[6],这种命题取向的背后,是对"科学教育该往何处去"的深层回应——AI可以模仿"像科学家一样思考"的题目外壳,但它不知道"今年为什么要特别强调这一点"。
公众号上的命题研究文章,真正有价值的不是"这道题怎么解",而是**"这道题为什么这样出、它想引导什么、它对教学意味着什么"**。这种"为什么"的解读,需要的不是语言能力,而是对教育政策生态的长期跟踪和一线教学的敏锐感知。
第二道坎:情境创设——"真实"二字,AI最难企及
情境性、开放性、思辨性、整体性,是指向素养立意的试题命制的四个改革方向[7]。其中"情境性"被放在首位,绝非偶然。
好的试题情境,需要满足一个看似简单实则苛刻的条件:真实。
真实意味着情境中的数据、现象、问题必须是现实世界里成立的,不能是AI"编"出来但经不起推敲的伪情境。一道以"某地新能源汽车产业发展"为情境的地理题,其产业数据、政策背景、地理条件必须是真实的或合理推演的;一道以"某项生物实验"为情境的题,其实验设计必须符合科学逻辑,不能出现AI常见的"看似合理实则违反基本原理"的硬伤。
这正是AI命题最被诟病的地方。研究指出,AIGC生成的试题"过于依赖算法,受限于对论文、评价体系和课标的解读,生成的试题缺乏灵活性,难以完全符合命题要求"[2]。更直白地说,AI擅长"编故事",但不擅长"编一个经得起学科专家推敲的真实故事"。它生成的情境常常存在隐性抄袭——把训练语料里的某个案例换个地名就拿出来用,这在严肃命题中是不可接受的风险。
公众号上那些被一线教师反复转发的命题文章,往往有一个共同特征:作者亲身参与了命题,或深入研读了真题的原始素材来源,能把情境的"来龙去脉"讲清楚——这个数据来自哪份报告,这个现象是哪次田野调查发现的,为什么选这个情境而不是那个。这种"来源可溯"的真实感,是AI生成内容天然缺失的。
第三道坎:学情诊断——"考学生",先得"懂学生"
一道好题,不仅要"考知识",更要**"诊断学情"**。
命题人需要知道:这一届学生在这个知识点上的常见误区是什么?去年考试暴露出的薄弱环节是什么?哪些错误类型是"粗心"导致的,哪些是"概念根本没建立"导致的?基于这些诊断,命题才能有的放矢——是强化基础、还是提升思维层级、还是专门针对某个顽固误区设置干扰项。
这要求命题人拥有持续的、具体到班级和学生的学情数据,而不仅仅是"统计学上的常见错误"。AI的训练语料里有大量"学生常见错误类型"的总结文章,但它不知道"我教的这届学生,在三角函数图像变换上的错误率比往届高出15%,且错误集中在相位变换方向"这种具体到学情的信息。
公众号命题内容的价值,很大程度上就体现在这种**"具体性"**上。当一位教师写道"我连续三年在月考中追踪这道题的得分率,发现干扰项B的迷惑性远高于预期",这种基于一线追踪的发现,是任何通用模型都无法生成的。它太具体、太局部、太依赖"当时当地"的现场感——而这恰恰是它对其他教师有价值的原因:因为它证明了"这个问题不是个例"。
第四道坎:难度标定与区分度调控——经验与试测的双重艺术
一道题的难度不是"声明"出来的,而是"试测"出来的。
专业命题流程中,每道题在正式使用前都要经过小范围试测,根据试测数据调整难度、区分度、选项设置。AI可以基于训练数据"估计"一道题的难度系数,但这种估计有两个根本缺陷:一是训练数据里的"难度"往往是事后统计的,而非命题时的前瞻判断;二是AI无法预测特定学生群体在这道题上的表现——而难度始终是相对的,对城市重点中学学生"中等难度"的题,对农村普通中学可能就是"高难度"。
更微妙的是区分度的调控。一道好题要能把"真懂"和"半懂"的学生区分开来,这要求干扰项的设计精准到位——每个错误选项都要对应一种典型的错误思维,而不是随便凑几个"看起来不对"的答案。这种干扰项设计,本质上是对错误认知的深度建模,需要命题人对"学生为什么会想错"有深刻理解。
AI能生成"看起来合理的四个选项",但它生成的干扰项往往经不起推敲——要么太明显(一眼就能排除),要么太刁钻(连学霸都会被带偏),缺乏那种"恰到好处的迷惑性"。公众号上关于"干扰项设计"的深度文章,价值就在于作者能把每种错误思维背后的认知机制讲透,这种讲透需要的是教学智慧,不是语言流畅度。
第五道坎:原创性——不是"没查到重复"就算原创
命题的"原创性"是一个比文字查重更深的概念。
一道题的原创性,不仅指表述没有雷同,更指情境素材、考查角度、设问方式、选项组合的整体创新。高考命题对原创性的要求近乎严苛——不能使用公开题库中的成题,不能直接搬用教辅资料的改编题,情境素材应为命题人独立选取和加工的真实材料。
AI的"原创"本质上是对训练语料的重组和变换。它生成的题目,即使文字查重通过,也很可能在考查角度、情境设计上与已有题目高度雷同——因为它就是从那些题目"学"来的。更危险的是,AI无法判断自己生成的内容是否"隐性抄袭"了某个训练案例的核心设计,这在严肃命题中是致命的风险。
这就是为什么一线教研中,AI最多被用作"素材搜集"和"初稿生成"的辅助工具,最终的立意确定、情境选择、设问打磨、选项设计,必须由有命题经验的教师完成。公众号上那些真正指导教师提升命题能力的文章,教的从来不是"怎么用AI出题",而是"怎么从真实情境中提炼考查点""怎么把一道普通题改造成有素养立意的好题"——这些方法论的内核,是人的创造性思维。
第六道坎:价值引领与育人导向——命题的"魂"
回到最根本的一点:试题不仅是测量工具,更是育人载体。
"高考命题是发挥立德树人功能的重要载体和必经之路。"[8] 这意味着每一道真题都在向学生传递某种价值取向——通过情境选择传递对什么是有价值的知识、什么是值得关注的现实问题的判断;通过设问方式传递对什么思维品质是值得鼓励的的判断;通过参考答案传递对什么是"好的回答"的判断。
这种价值传递,要求命题人自己先有清晰的价值立场。AI没有价值立场——它只是在统计意义上"这样写更常见"。当它生成一道以"科技创新"为主题的题目时,它并不理解"为什么要强调自主创新而不是技术引进",它只是把训练语料里高频出现的表述拼在了一起。
公众号上关于"命题育人"的深度内容,其不可替代性正在于此:作者在用文字帮命题者和教师们想清楚"我们出的每一道题,到底在向学生传递什么"。 这种思考,需要的是教育者的价值自觉,不是模型的语言生成能力。
四、一个更本质的回答:不可替代的是"关系"与"责任"
把上面两个维度的分析收拢,会发现AI替代不了的不是某一种具体能力,而是两个更根本的东西。
第一个是"在场"。
教育评价和试题命制,都深度依赖对具体学生、具体课堂、具体教育情境的在场感知。一位教师在阅卷时注意到"今年这道题的失分集中在第二问,而往年不是这样",并据此反思教学——这个"注意到"的前提是他在场,他教过这批学生,他记得往年的情况。AI不在场。它可以分析数据,但它没有"我在场时感受到的那种不对劲"。
公众号教育内容的生命力,很大程度上就来自这种"在场感"——作者写的每一个判断、每一个案例、每一个"我发现",背后都有真实的教室、真实的学生、真实的教学决策做支撑。读者之所以愿意花十几分钟读一篇长文,是因为他们认出来"这是一个真的在教书的人写的东西",而不是"一篇看起来像教书的人写的文章"。微信将这种特质称为"活人感",并把它作为平台治理的核心标尺[9]——这绝非偶然。
第二个是"负责"。
教育评价的结果会影响一个学生的升学路径、一个教师的职业发展、一所学校的声誉;试题命制的结果会直接影响千千万万考生的命运。这些后果,必须有能够承担责任的主体来承受。
AI不能承担责任——这不是技术问题,而是法律和伦理的结构性规定。我国现行AI治理法规体系明确规定,生成式人工智能的服务提供者和使用者必须对生成的内容负责,不得以"AI生成"标注为由逃避法律责任[9]。这意味着,无论AI生成了一份多么漂亮的评价方案或一套多么"标准"的试题,最终签字确认、为其后果负责的,必须是一个人。
这种"负责"不仅是法律意义上的,更是专业意义上的。一位教师在公众号上发布一份命题研究或评价方案,他是在用自己的专业声誉背书——"我认为这样是对的,我愿意接受同行的检验。" 这种背书的分量,是AI生成内容永远无法具备的。
五、给教育内容创作者的几句话
如果你是一位在公众号上写教育评价或试题命制内容的创作者,面对AI浪潮,不必恐慌,但需要清醒地知道自己的不可替代性在哪里。
写"你看见的",不写"大家都知道的"。 AI最擅长写"大家都知道的"——那些可以在任何教辅书、任何培训课件里找到的通用方法论。你的价值在于写"你看见的"——你的教室里发生了什么,你的学生在哪道题上卡住了,你试过哪种评价方法有效哪种无效。这些"你看见的"东西,是AI的语料库里没有的。
写"为什么",不只是"怎么做"。 "怎么做"的文章,AI写得比你好——结构更工整,步骤更清晰。但"为什么这么做"的论证,AI写不过一个有真实经验的人。因为"为什么"的回答需要你把自己的判断逻辑摊开来给读者看,这个逻辑里藏着你的价值判断、你的经验沉淀、你对特定情境的理解。
写"你的判断",不写"中庸的全面"。 AI最擅长写"一方面……另一方面……"的平衡表述,安全、正确、无用。真正有影响力的教育内容,往往有一个明确的判断——"我认为这种评价方式在当前条件下弊大于利""我认为这道题的命题立意值得商榷"。这种判断可能引发争议,但正是争议让思考深入。AI不会主动做出可能引发争议的判断,因为它的生成逻辑是"最可能的表述",而非"最值得说的表述"。
最后,也是最重要的:写之前,先做。公众号教育内容的终极不可替代性,不在写作技巧,而在写作之前的那段实践——你真的花一学期追踪了某个评价改革的效果,你真的命制了一套经过试测的试题并分析了数据,你真的在课堂上试用了某种方法并看到了结果。这些实践是内容的源头活水,也是AI永远无法替代的"前写作"环节。
AI可以帮你写得更快,但不能帮你活得更真。 而在教育的语境里,"真"才是最稀缺的内容。
参考文献
[1] 郑永和, 王一岩, 杨淑豪. 人工智能赋能教育评价:价值、挑战与路径[J]. 西南大学学报(社会科学版), 2024.
[2] 生成式人工智能辅助地理试题命制与评阅的实践策略[EB/OL]. 豆丁网, 2025-05-15.
[3] AI时代,如何成为不可替代的智慧教师[EB/OL]. 新华网, 2025-09-11.
[4] 怎么用AI创设跨学科真实情境?拓展学生认知边界[EB/OL]. 百家号, 2026-05-18.
[5] 教育部教育考试院. 立德树人 服务选才 引导教学——党的十八大以来高考内容改革取得显著成效[EB/OL].教育部官网, 2022-09-15.
[6] 专家评北京高考生物卷:强化科学思维,引导考生像科学家一样思考[EB/OL]. 澎湃新闻, 2026-06-10.
[7] 指向素养立意的试题命制[EB/OL]. 华南师范大学学报, 2024-09-11.
[8] 高考命题要落实立德树人根本任务[EB/OL]. 腾讯新闻, 2024-02-03.

夜雨聆风