ARTICLE · 1041726
AI让我们更聪明,还是越来越像?Nature、Science系的8项最新研究

NATURE × SCIENCE/AI, CREATIVITY & HUMAN DIFFERENCE
AI让我们更聪明,还是越来越像?
Nature、Science系的8项最新研究
AI正在把“能力增强”推向一个更难回答的问题:当越来越多人借助同一类模型写作、分析、学习和创造时,我们会不会在平均意义上变得更强,却也在表达、判断和创意上变得更相似?
2026年8月,Nature Human Behaviour发表的一项研究分析了7个数据集、超过88万篇文本。结果显示,随着LLM写作助手扩散,文本的语言多样性明显下降;在模型润色与改写后,写作复杂度的方差下降约21%—50%,一些原本能够体现年龄、性别、意识形态和价值倾向的语言线索也被削弱。这个结果把“AI提升效率”的讨论,推进到了“AI是否正在改变人类表达生态”的层面。
本期选取2024—2026年Science Advances以及Nature Portfolio旗下期刊的8项研究,从学习、绩效、人机协同、动机、创造力、语言、偏见和身份八个层面,回答同一个问题:AI究竟是在增强人的能力,还是在重塑人与人之间的差异?
口径说明本文所称“Nature、Science系”包括Science Advances及Nature Portfolio旗下期刊,并不意味着8项研究均发表于旗舰刊Nature或Science。文中研究结论均按原论文适用场景解读,不将实验或特定样本结果直接外推为所有AI使用场景的普遍结论。
01先看答案:AI可能同时制造“能力上移”和“差异收敛”
8项研究共同指向的五个判断
一|AI的增强效应是真实的,但高度依赖任务。AI辅导、内容生成和部分知识工作已经显示出明显的学习或绩效提升,但“接入AI”并不自动等于“人机协同”。
二|AI最先抬高的是平均水平,而不是无限抬高能力上限。许多研究发现,原本能力较弱或经验较少的人从AI中获得的边际收益更大,因此AI具有“能力均衡器”的一面。
三|短期表现变好,不等于人的能力被永久提升。AI可以让当下任务完成得更好,却可能不形成可迁移的独立能力,甚至伴随内在动机下降和无聊感上升。
四|个体受益与集体多样性之间存在张力。一个人借助AI写得更好、更有创意,并不意味着整个群体会产生更多不同的想法;恰恰相反,大家可能同时向“更优但更像”的方向移动。
五|同质化不只发生在文字上。语言风格、文化倾向、社会判断和身份表征都可能受到模型训练数据与反馈回路的影响。未来真正稀缺的,可能从“生成能力”转向独立判断、异质经验与差异化表达。
028项研究逐篇读
从“更会学、更会做”,到“更像彼此”
01|Scientific Reports·2025年6月
AI辅导真的能让人学得更多,而且用时更少吗?
AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting
作者|Greg Kestin; Kelly Miller; Anna Klales; Timothy Milbourne; Gregorio Ponti DOI|10.1038/s41598-025-97652-6
核心发现一项真实教学场景下的随机对照试验发现,与课堂主动学习相比,AI辅导组在更短时间内获得了显著更高的学习增益;研究报告的中位学习增益超过课堂组的两倍,学生同时报告了更高的参与感与动机。
研究怎么做研究并不是简单让学生“自由问ChatGPT”,而是构建了一个按照学习科学原则设计的AI导师,使其提供分步引导、个性化反馈和主动参与机会。结果提示,AI真正有价值的地方可能不是“替学生回答”,而是把原本稀缺的一对一个性化辅导规模化。
对“更聪明”的回答AI可以显著提高学习效率,但关键不是模型本身,而是AI被嵌入了怎样的教学结构。换言之,AI的认知增益高度依赖任务设计、反馈设计和学习者是否持续参与。
管理学启发在员工培训、领导力发展和岗位再技能化中,可以比较“AI直接给答案”与“AI以导师方式追问、反馈、纠错”的长期差异,重点观察知识迁移、独立解决问题能力和后续绩效。
02|Nature Human Behaviour·2024年10月
“人+AI”一定比“人”或者“AI”更强吗?
When combinations of humans and AI are useful: A systematic review and meta-analysis
作者|Michelle Vaccaro; Abdullah Almaatouq; Thomas Malone DOI|10.1038/s41562-024-02024-1
核心发现对106项实验、370个效应量的元分析显示:人机组合平均显著优于“人单独工作”,但整体上仍显著弱于“人和AI中表现更好的那一个”;决策任务更容易出现协同损失,创造任务更容易产生互补。
研究怎么做这个结果打破了一个常见直觉:把人的判断和AI的计算能力放在一起,并不会自然产生1+1>2。真正决定结果的是任务类型、双方相对能力以及交互设计。尤其当AI本身已经明显强于人时,人的介入反而可能增加噪声;而在开放式创造任务中,人负责方向和筛选、AI负责生成与扩展,更容易形成互补。
对“更聪明”的回答AI可以增强人,但“协作”本身不是优势。组织真正需要设计的是谁先做、谁复核、谁有最终决定权,以及人在什么节点介入最有价值。
管理学启发与其继续问“使用AI是否提升绩效”,不如研究任务分工与决策权配置:AI建议、人类复核;人类先判断、AI补充;AI初筛、人类终审,哪种结构在不同任务中表现最好?
03|Scientific Reports·2025年4月
AI让你当下做得更好,会不会让你之后更不想自己做?
Human-generative AI collaboration enhances task performance but undermines human's intrinsic motivation
作者|Suqing Wu; Yukun Liu; Mengqi Ruan; Siyu Chen; et al. DOI|10.1038/s41598-025-98385-2
核心发现四项在线实验、总样本3,562人显示:与GenAI协作能够提升即时任务表现,但这一优势并未稳定迁移到随后的独立任务;从人机协作切回独立工作时,参与者的内在动机下降、无聊感上升。
研究怎么做这项研究把讨论从“AI能不能提高产出”推进到“AI会不会改变人对工作的心理体验”。如果高质量输出越来越来自人与模型共同完成,员工可能获得更强的结果,却同时降低对过程的控制感、挑战感和内在乐趣。
对“更聪明”的回答AI帮助人完成任务,不等于帮助人积累能力。短期绩效增强与长期技能成长之间,需要被明确区分。
管理学启发可进一步研究AI依赖、技能萎缩、工作意义感、心理所有权和职业身份变化:哪些任务适合持续AI协作,哪些任务必须保留“无AI训练区”,才能维持人的能力和动机?
04|Science Advances·2024年7月
AI让每个人更有创意,为什么整个群体反而可能更单一?
Generative AI enhances individual creativity but reduces the collective diversity of novel content
作者|Anil R. Doshi; Oliver P. Hauser DOI|10.1126/sciadv.adn5290
核心发现在线实验发现,获得GPT-4创意建议后,参与者写出的短篇故事被评价为更有创意、写得更好、也更有趣,尤其是原本创造力较低的参与者受益更明显;但AI辅助生成的故事彼此更相似。
研究怎么做这项研究揭示了AI时代最重要的一组张力:个人层面的优化,可能带来集体层面的收敛。每个创作者都获得了“更好的起点”,却可能因为接触类似的模型建议而向相近的叙事结构、措辞和想法靠拢。
对“越来越像”的回答AI可能同时提高平均创造力、降低群体新颖性。个体最优与生态最优并不是一回事。
管理学启发创新研究可以从“创意质量”进一步转向“创意组合的多样性”。企业采用统一AI工具后,项目方案会不会更专业却更雷同?不同模型、不同提示词和不同知识源能否成为新的“创新多样性治理”工具?
05|Nature Human Behaviour·2026年8月
当所有人都用AI润色,我们的语言会不会慢慢变成同一种声音?
The shrinking landscape of linguistic diversity in the age of large language models
作者|Zhivar Sourati; Farzan Karimi-Malekabadi; Meltem Ozcan; Colin McDaniel; et al. DOI|10.1038/s41562-026-02550-0
核心发现三项研究覆盖7个数据集、超过88万篇文本。随着LLM写作助手扩散,语言表达的差异性下降;模型润色和改写可使写作复杂度方差下降约21%—50%,并削弱文本中一些体现个体身份与心理特征的语言线索。
研究怎么做这项2026年的研究让“AI同质化”从一种直觉变成了可观察的宏观现象。AI并不是简单把错别字改掉,而是在重写过程中持续把表达拉向更高概率、更常见、更符合模型训练分布的语言形式。语义可能仍然保留,但“这个人为什么这样说”以及“他和别人有什么不同”,可能越来越难从语言中辨认。
对“越来越像”的回答当AI成为大规模写作基础设施时,同质化可能不是个人选择,而是一种系统性结果。
管理学启发招聘、绩效评价、品牌内容、组织文化研究都高度依赖语言。未来需要重新评估:当邮件、简历、汇报和社交媒体都经过AI润色,文本还能在多大程度上作为识别个人特征、组织文化和消费者偏好的可靠信号?
06|Nature Human Behaviour·2025年
AI不仅会有偏见,还可能把偏见“教回”给人类
How human–AI feedback loops alter human perceptual, emotional and social judgements
作者|Moshe Glickman; Tali Sharot DOI|10.1038/s41562-024-02077-2
核心发现一系列实验共纳入1,401名参与者,发现人与AI反复互动会形成反馈回路:AI中的偏差不仅影响当下判断,还可能改变人的后续知觉、情绪和社会判断,并进一步放大偏差;这种放大强于人—人互动。
研究怎么做传统算法偏见研究更多关心“模型输出是否公平”,这项研究把问题推进了一层:如果人不断从AI那里获得建议,AI的偏差会不会逐渐进入人的判断机制?结果提示,AI并不是外部的静态工具,它可能通过持续交互反过来塑造人的认知。
对“越来越像”的回答同质化并不只表现为措辞相似,也可能表现为判断规则被共同的算法反馈逐步校准。
管理学启发在招聘筛选、信贷审批、风险评估、绩效打分等场景中,应研究“AI建议—人类采纳—新数据回流—模型再训练”的闭环,而不是只研究单次算法决策。真正的治理对象可能是反馈系统,而不是单个模型。
07|Nature Human Behaviour·2025年6月
AI看似“全球化”,为什么换一种语言就可能换一种文化倾向?
Cultural tendencies in generative AI
作者|Jackson G. Lu; Lesley Luyang Song; Lu Doris Zhang DOI|10.1038/s41562-025-02242-1
核心发现研究围绕社会取向与认知风格等文化心理构念,比较生成式AI在不同语言环境下的回答,发现模型会呈现系统性的文化倾向;语言并不只是表达载体,也会改变模型激活和再现的文化模式。
研究怎么做这意味着,同一个模型并不存在完全中性的“全球平均人格”。它所生成的建议会受到训练数据、语言语境和文化表征方式影响。当组织把AI用于全球团队沟通、跨文化培训或国际营销时,模型可能在不被察觉的情况下,把某些文化倾向变成默认答案。
对“越来越像”的回答AI未必把全世界直接变成一种文化,但它可能把复杂文化压缩为若干稳定、可重复的语言—文化模板。
管理学启发国际商务和跨文化管理可以进一步研究:不同语言提示如何改变AI建议中的个人主义、集体主义、分析式思维和整体式思维?跨国企业使用统一AI助手,是否会无意中放大总部文化或主流语言偏好?
08|Nature Machine Intelligence·2025年2月
如果让AI“替人发声”,它会不会把不同的人压缩成几个刻板模板?
Large language models that replace human participants can harmfully misportray and flatten identity groups
作者|Angelina Wang; Jamie Morgenstern; John P. Dickerson DOI|10.1038/s42256-025-00986-z
核心发现研究比较4种LLM,并结合3,200名真实参与者、16类人口身份开展验证,发现LLM在模拟不同身份群体时存在“误表征”和“扁平化”问题:群体内部原本丰富的差异,被模型压缩成更单一的代表性形象。
研究怎么做这项研究直接挑战了一个越来越常见的方法:用“AI消费者”“AI员工”或“AI受访者”替代真实的人做调研、测试和模拟。模型也许能生成听起来合理的回答,却未必能保留真实群体内部的异质性,更可能把少数群体经验进一步压缩。
对“越来越像”的回答AI不仅可能让真实人的表达变得相似,也可能在模拟人类时直接把“不同的人”塑造成更相似的模型画像。
管理学启发使用合成消费者、数字员工或AI受访者时,必须把“群体平均准确”与“群体内部差异是否保留”分开检验。对于创新、营销和组织研究,异质性本身就是数据,不应被模型的平均化能力抹平。
03把8项研究放在一起:AI时代的四组新张力
真正值得管理学研究的,不是“AI好不好”,而是“增益与代价如何同时发生”
01|能力增强 × 能力依赖AI可以显著提高当下学习和任务表现,但人的独立能力能否同步积累并不确定。未来组织要同时管理“AI带来的生产率”与“脱离AI之后还剩下什么能力”。
02|个体优化 × 集体同质每个员工、创作者和团队都可能因为AI得到更好的平均答案,但如果所有人依赖相似模型、相似提示和相似知识源,组织层面的探索空间可能越来越窄。
03|个性化 × 标准化AI可以根据个体需求提供高度定制的辅导和支持,但模型的训练分布又会把表达、文化和身份向高概率模式拉回。个性化服务与内容标准化可能同时出现。
04|算法建议 × 人类再学习AI并非只是被人使用的工具。持续的人机互动会反过来改变人的判断、偏好和表达习惯。管理AI因此不仅是技术治理,也是认知治理与组织行为治理。
04这组研究给管理学者留下了哪些真正值得做的问题?
从“AI使用效果”走向“AI如何重构人的差异”
01 AI能力均衡效应|AI究竟是在缩小高低能力者差距,还是只在短期任务中“托底”?当AI撤出后,能力差距会重新出现,还是已经发生真正学习?
02 AI介导的同质化|团队统一使用同一模型后,战略方案、产品创意、品牌文案和研究假设的相似度是否会上升?同质化会不会降低探索式创新?
03 AI与工作动机|哪些任务交给AI后会释放人的创造力,哪些任务交给AI后反而削弱胜任感、自主感和工作意义?
04 人机反馈回路|员工长期接受AI推荐后,是否会逐渐改变风险偏好、招聘判断、道德判断和绩效评价标准?组织如何识别这种“认知漂移”?
05 AI与组织多样性|当不同背景员工的表达都经过同一套AI润色,表面沟通可能更顺畅,但深层观点差异是否更难被组织发现?
06 多模型治理|企业是否应该像管理供应商一样管理模型组合,通过不同模型、知识库和提示策略保持认知多样性,而不是把所有知识工作统一到一个AI入口?
05最后一句
AI真正改变的,可能不是“人有没有能力”,而是“能力如何分布、差异如何保存”
从这8项研究看,AI已经足以让更多人更快地达到“不错”的水平:学得更快、写得更好、做得更完整。这是非常真实的进步。
但一个组织的长期竞争力,并不只来自更高的平均水平。创新往往来自不同经验之间的碰撞,战略判断来自少数不一致的意见,真正重要的发现也常常来自偏离主流答案的人。
因此,AI时代最值得管理者和研究者警惕的,并不是“机器越来越像人”,而可能是另一个方向:当所有人都开始借助机器思考时,人会不会越来越像彼此?
未来真正稀缺的能力,也许不再只是生成答案,而是提出不同的问题、保留独立判断、识别模型边界,并有意识地维护组织内部的认知多样性。
论文索引|本期8项研究
01Kestin G, Miller K, Klales A, et al. AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 2025, 15: 17458. DOI: 10.1038/s41598-025-97652-6.
02Vaccaro M, Almaatouq A, Malone T. When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 2024, 8: 2293–2303. DOI: 10.1038/s41562-024-02024-1.
03Wu S, Liu Y, Ruan M, et al. Human-generative AI collaboration enhances task performance but undermines human's intrinsic motivation. Scientific Reports, 2025, 15: 15105. DOI: 10.1038/s41598-025-98385-2.
04Doshi A R, Hauser O P. Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 2024, 10(28): eadn5290. DOI: 10.1126/sciadv.adn5290.
05Sourati Z, Karimi-Malekabadi F, Ozcan M, et al. The shrinking landscape of linguistic diversity in the age of large language models. Nature Human Behaviour, 2026. DOI: 10.1038/s41562-026-02550-0.
06Glickman M, Sharot T. How human–AI feedback loops alter human perceptual, emotional and social judgements. Nature Human Behaviour, 2025, 9: 345–359. DOI: 10.1038/s41562-024-02077-2.
07Lu J G, Song L L, Zhang L D. Cultural tendencies in generative AI. Nature Human Behaviour, 2025, 9: 2360–2369. DOI: 10.1038/s41562-025-02242-1.
08Wang A, Morgenstern J, Dickerson J P. Large language models that replace human participants can harmfully misportray and flatten identity groups. Nature Machine Intelligence, 2025, 7: 400–411. DOI: 10.1038/s42256-025-00986-z.
顶刊观察|读顶刊 · 看前沿 · 找选题