当GPT-5.5、Claude Fable 5、DeepSeek V4、混元3 Preview四款顶级AI一起参加高考语文考试,会发生什么?
答案是:它们写的议论文几乎一模一样,但叙事文赢了。
四款模型中,三款选了议论文,不约而同引用了"凡事预则立,不预则废",不约而同举了王羲之的例子,不约而同以"理想的彼岸"收尾。唯一选了叙事文的DeepSeek V4,反而拿了最高分。
这个结果比任何基准测试都更能说明AI的"中文能力"到底是什么水平。

01 实验设计:四款AI同写2026年北京高考作文
字母AI(Letter AI)在2026年6月11日发布了一个有趣的评测:让四款主流大模型同写2026年北京高考作文,然后让它们互相评分。
2026年北京高考作文题提供了两个选择:
议论文:"做规划与下功夫"——探讨规划与执行的关系 叙事文:"含英咀华"——以文学品鉴为主题写一篇记叙文
四款模型的选择:

三款选议论文,一款选叙事文。这个选择本身就很说明问题——大多数模型在训练数据中接触的议论文模板远多于叙事文,所以"默认安全牌"就是议论文。
02 评分结果:DeepSeek V4拿了最高分
实验设计了一个"盲评"机制:每款模型扮演阅卷老师,给所有作文打分(满分50分),然后取平均值。
| DeepSeek V4 | 46/50 | ||
DeepSeek V4的叙事文拿到了混元3 Preview给出的满分50分。这也是整个实验中唯一的满分。
但更有趣的是评分背后的"教师性格"。
03 四种"阅卷风格":AI也有偏好
每款模型在扮演阅卷老师时,展现出了截然不同的评分风格:
Claude Fable 5——最严格的老师 平均只给42.25分。它反复批评其他作文中的"套话"和"公式化表达"。对那些用了排比句和名人名言的议论文,Fable 5的评价尤其苛刻:"论据堆砌,缺乏独立思考。"
混元3 Preview——最宽容的老师 平均给出48分,是四位"老师"中最慷慨的。它对所有作文都给出了相当高的评价,包括给了DeepSeek V4一个满分。
GPT-5.5——最自省的老师 给自己的作文只打了41分,并附上了自我批评:"论据较常见,论述多停留在正面阐释和熟悉事例上。"这种自我反思能力让人印象深刻。
DeepSeek V4——最诚实的老师 对自己的叙事文也给出了批评,认为自己的比喻"略显匠气"。但它给出了最高和最低的分差(50 vs 41),说明它的评分标准最不稳定。
不同"老师"对同一篇作文的评分差距最大可达8分——这个方差本身就很有意义。它说明即便是顶级AI模型,在评估中文写作质量时也存在显著的主观性。
04 三篇议论文为何"长得一样"?
这个实验最值得深思的发现不是分数,而是内容。
三篇议论文——来自GPT-5.5、Fable 5、混元3 Preview——在结构和论据上高度趋同:
开篇都引用了"凡事预则立,不预则废" 都用了王羲之练书法的例子 都以"理想的彼岸"作为结尾升华 都采用了"提出论点→正面论证→反面论证→总结"的八股结构
为什么会这样?因为这些模式在训练数据中出现的频率最高。当模型被要求写一篇"标准"的中国议论文时,它会本能地选择统计意义上最"安全"的表达方式——也就是最常见的那些。
这暴露了当前大模型在中文写作上的一个根本性局限:它们擅长模仿"标准答案",但不擅长创造独特的表达。
DeepSeek V4之所以能脱颖而出,恰恰是因为它选了叙事文——一个模型更难套用模板的文体。在叙事文中,个人化的细节和情感体验比论证结构更重要,而这给了模型更多发挥空间。
05 中文能力的真正差距在哪里?
从这个实验可以提炼出几个关于AI中文能力的关键洞察:
1. 议论文是AI的舒适区,也是陷阱
议论文的结构高度标准化——论点、论据、论证、结论。AI可以轻松生成"合格"的议论文,但很难生成"出彩"的议论文。因为"出彩"意味着打破常规,而模型的训练目标恰恰是学习常规。
2. 叙事文更能检验真实能力
叙事文需要具体的人物、场景、情感和细节。这些元素的组合空间远大于议论文,也更难用模板覆盖。DeepSeek V4选择叙事文并拿到最高分,说明它在生成具体、生动的中文内容方面有一定优势。
3. "满分"不等于"最好"
混元3 Preview给DeepSeek V4打了满分,但它自己是最宽容的"老师"(平均48分)。这个满分更多反映了混元的评分标准偏松,而不是DeepSeek的作文真的完美无缺。
4. 模型之间的互评存在系统性偏差
每款模型都有自己的"审美偏好"。Fable 5偏好简洁犀利的表达,混元偏好华丽流畅的文风,GPT-5.5偏好逻辑严密的论证。
用任何单一模型作为"标准"来评价其他模型,都会产生偏差。
这个实验的核心启示是:AI的"中文能力"不是一个可以简单量化的指标。不同的模型在不同的文体、不同的评价维度上各有优劣。与其追求一个"最好的中文AI",不如理解每个模型的长处和短板。
06 对普通用户的选择建议
如果你日常需要AI辅助中文写作,这个实验提供了几个实用的参考:
写正式报告或方案→GPT-5.5或Fable 5 它们的议论文结构最规范,逻辑最严密,适合需要"专业感"的场景。
写创意内容或故事→DeepSeek V4 它在叙事文上的表现说明,对于需要具体细节和情感表达的场景,它可能更合适。
日常办公和对话→混元3 Preview 它的"宽容"风格意味着它更倾向于肯定和补充,而不是批评和纠正。这在日常交流中可能更讨喜。
需要精确控制和严格标准的场景→Fable 5 它作为"最严格的老师",说明它对"套话"和"低质量表达"的容忍度最低。如果你需要AI帮你把关文字质量,Fable 5可能是最好的选择。
四款AI同写高考作文,最意外的结论是:决定AI中文写作水平的不是模型大小,而是文体选择。当所有模型都在写议论文时,选择叙事文的那个赢了。

这场"AI高考"的意义不在于决出胜负,而在于它用一个所有人都能理解的场景,直观地展示了当前AI中文能力的真实状态——及格有余,出彩不足,但正在快速进步。
📎 参考来源
36氪/字母AI,"AI写高考作文,混元给DeepSeek-V4打了满分",2026年6月11日 36kr.com/p/3848495468575617 2026年北京高考语文作文题目(公开资料)
夜雨聆风