斯坦福大学发布的《AI Index Report 2026》,足足有425页。
这份报告几乎把AI世界里最重要的变量都放在了一张巨大的仪表盘上:模型能力、算力、芯片、投资、就业、科学、医疗、教育、政策,以及公众态度。
但真正值得我们注意的,并不是又多了多少模型、又刷新了多少排行榜,而是报告里反复出现的三组反差:
AI可以获得国际数学奥赛金牌,却只能以约50%的准确率读取模拟时钟。
88%的企业已经在使用AI,但大多数业务职能中的Agent部署率仍然只有个位数。
AI提高了软件开发效率,最年轻的软件开发者却率先感受到了就业寒意。
如果说前几年的核心问题还是“AI究竟能做什么”,那么2026年真正需要回答的问题已经变成:
当AI跑得越来越快,企业和整个社会还能不能跟得上?
读完这425页报告,我把其中最重要的变化压缩成了十五个信号。
PART 01
AI能力仍在加速,但它并没有我们想象得那么“全面”
信号 01AI能力没有进入平台期,反而还在加速
过去一年,一种声音开始出现:大模型是不是已经撞上了天花板?参数不能无限增加,训练数据快被用完,模型之间的体验似乎也越来越接近。
但AI Index给出的答案很直接:AI能力并没有进入平台期。2025年,模型在数学、编程、推理和多模态理解上的表现仍然快速提升。以软件工程基准SWE-bench Verified为例,模型相对于人类基准的表现,一年内从约60%上升到接近100%。
更值得注意的是,工业界已经生产了超过90%的重要前沿模型。今天真正推动能力边界的,越来越不是大学实验室,而是拥有算力、数据和工程体系的少数大公司。
现在的问题不是AI不再进步,而是原来的评测题已经不够难了。一些原本希望使用多年的基准,几个月就被模型做到了接近饱和。我们衡量AI进步的尺子,正在比AI本身更早失效。

信号 02AI呈现出明显的“锯齿状智能”
模型越来越强,不等于它正在像人一样均匀地变聪明。
报告给出了一个很有冲击力的例子:Gemini Deep Think已经可以获得国际数学奥赛金牌,但顶尖模型读取模拟时钟的准确率只有约50.1%。与此同时,AI Agent在OSWorld真实计算机任务上的成功率从约12%跃升到66%,却仍会失败大约三分之一。
这就是所谓的“锯齿状智能”:它可以在极难的专业任务上超越人类,却会在一个小学生都能完成的常识任务上突然失灵。
这对企业尤其重要。不能因为模型在排行榜上得分很高,就推断它在自己的业务中一定可靠。真正的AI落地,必须围绕具体场景重新测试,而不是把公开榜单当成产品验收报告。
信号 03机器人距离真正理解物理世界仍然很远
数字世界里的AI已经突飞猛进,但一旦走出屏幕,进入不可预测的物理世界,情况马上变得不同。
在标准化的RLBench仿真环境里,机器人操作任务的成功率已经可以达到89.4%;但到了真实家庭环境,它们只能完成约12%的任务。
原因并不神秘。实验室里的杯子永远放在可预期的位置,家庭里的杯子可能被挡住、摔倒、沾水,旁边还有宠物和孩子。物理世界充满了训练数据之外的意外。
AI已经很会处理被整理好的世界,却还没有学会应付真实世界的混乱。自动驾驶是少数开始规模化落地的例外,但通用机器人距离真正进入家庭,仍然有一段很长的路。
PART 02
模型差距正在缩小,但AI产业的权力更加集中
信号 04中美顶尖模型的性能差距已经接近消失
2023年,美国模型还拥有明显领先优势。到了2025年初,中美模型已经开始多次交换领先位置。
2025年2月,DeepSeek-R1一度几乎追平当时领先的美国模型。截至2026年3月,报告记录的领先美国模型得分为1,503,领先中国模型为1,464,差距只有39个Arena点,大约2.7%。
但“性能接近”并不意味着双方的产业结构相同。美国仍然生产更多顶尖模型,拥有更多高影响力专利;中国则在AI论文数量、引用份额、专利产出和工业机器人安装量上领先。
中美AI竞争已经不再是一场单纯的模型考试,而是一场资本、芯片、人才、论文、专利和产业应用的系统竞争。

信号 05真正稀缺的不是模型,而是算力、芯片和数据中心
模型能力正在趋同,模型背后的基础设施却更加集中。
美国拥有5,427个数据中心,是任何其他国家的十倍以上,同时也是AI数据中心电力消耗最高的国家。更脆弱的是芯片供应链:几乎所有领先AI芯片,都依赖台积电的一家晶圆代工体系。
这意味着,全球看似有成千上万个AI应用、数百个模型品牌,底层却可能共同依赖少数几个物理节点。
软件可以复制,模型可以开源,先进制程和电力基础设施却无法通过下载获得。AI竞争越往后发展,真正的瓶颈越可能从算法转向能源、芯片、土地和供应链。
信号 06“AI主权”正在成为新的国家战略
越来越多国家发现,AI政策不能只有“如何监管”,还必须回答“自己能不能拥有”。
于是,国家AI战略开始从原则宣言走向基础设施建设:本国有没有算力、数据、人才、模型和安全可控的技术栈?一旦核心模型和云基础设施完全依赖境外服务,国家在经济、安全和公共服务中的主动权还剩多少?
报告显示,正式制定AI战略的国家继续增加,而且增长最快的恰恰是过去没有完整AI政策的新兴经济体。开源生态也在重新分配参与权,来自欧洲以外地区的开源贡献快速增加。
AI正在从一种科技产品,变成类似能源、芯片和金融系统的战略基础设施。
PART 03
AI正在创造巨大价值,但收益和成本并不平均
信号 07中美AI投资差距悬殊,美国私人投资规模达到中国的23倍
如果只看私人投资,2025年的AI资本版图几乎是一张“美国断层领先”的地图。
美国私人AI投资达到2,858.8亿美元,中国约为124.1亿美元,相差约23倍。美国当年新获得融资的AI公司达到1,953家;英国为172家,中国为161家。
这里必须加一个限定:这是私人投资数据。它不能完整反映中国政府引导基金、地方产业基金和公共资本的投入。因此,这个数字说明的是两国资本结构差异,不能简单等同于全部AI支出差距。
与此同时,美国对全球AI人才的吸引力正在减弱。流入美国的AI研究人员和开发者数量较2017年下降了89%,仅过去一年就下降约80%。
美国仍然拥有最强的资本引擎,但资本优势并不会自动转化为永久的人才优势。

信号 08生成式AI的普及速度超过了个人电脑和互联网
生成式AI用了大约三年,就实现了约53%的人口级采用。以相同的时间尺度比较,它的扩散速度明显快于个人电脑和互联网。
企业采用率也达到88%。报告估计,到2026年初,生成式AI每年为美国消费者创造的消费者剩余达到1,720亿美元,单个用户感受到的价值中位数较前一年增长了大约三倍。
但普及同样不均衡。阿联酋采用率约64%,新加坡约61%;拥有最多顶尖模型和私人投资的美国,人口采用率约28.3%,只排在第24位。
技术领先、资本领先,并不自动等于社会采用领先。真正决定扩散速度的,还有收入水平、数字基础设施、语言、本地产品和社会接受度。

信号 09生产率提高的地方,初级岗位正在率先承受压力
AI对就业的影响,并不是“某一天突然消灭一个职业”,而是先悄悄改变职业内部的任务结构。
已有研究显示,AI在客服和软件开发等任务中可以带来14%到26%的生产率提升,标准化、可验证的工作受益最明显。但报告同时发现,美国22到25岁软件开发者的就业人数从2024年开始下降近20%,年长开发者的就业却仍在增长。
这背后有一个容易被忽视的问题:初级员工过去承担的很多工作,既是企业产出,也是他们积累经验的训练场。当代码补全、资料整理、基础分析和第一版方案都被AI完成之后,年轻人靠什么完成从新手到专家的跃迁?
企业可能获得短期效率,却在无意中切断未来的人才梯队。AI带来的第一个就业难题,未必是“人还要不要工作”,而是职业成长的第一阶台阶会不会消失。

PART 04
AI正在进入科学和医疗,但“表现优秀”不等于“值得信任”
信号 10AI的环境成本正在快速上升
我们在屏幕上输入一句话,只看到几秒钟后出现一段文字,很容易把AI理解成一种轻盈的软件服务。
但它的背后是服务器、芯片、冷却系统和庞大的电网。报告估计,全球AI数据中心的电力容量已经达到29.6 GW,接近纽约州的峰值用电需求。Grok 4训练产生的碳排放估计达到72,816吨二氧化碳当量。
水资源同样惊人。报告估计,GPT-4o一年的推理用水量,可能超过120万人的年度饮用水需求。
AI并没有消除成本,而是把成本从用户面前转移到了远方的数据中心。未来每一次模型升级,都不只是算法问题,也会成为能源和环境问题。

信号 11AI开始超越部分科学家,但大模型并不总是更强
在科学领域,AI已经不只是帮研究人员查资料、写代码,而是开始参与假设生成、实验设计、蛋白质建模和完整研究流程。
前沿模型在ChemBench部分化学任务上的平均表现已经超过人类化学家。但更有意思的变化是:参数规模不再决定一切。一个1.11亿参数的蛋白质语言模型可以击败此前的领先方法,一个2亿参数的基因组模型,表现甚至超过参数规模接近其200倍的模型。
这说明,科学AI的未来未必属于最大的通用模型,更可能属于更小、更专业、数据质量更高、真正理解领域任务的模型。
但报告也泼了一盆冷水:在天体物理学论文级复现任务中,前沿Agent的得分仍低于20%。AI可以生成看起来非常像科学的内容,却不一定能完成可靠、可复现的科学工作。
信号 12医疗AI开始真正落地,但临床证据仍然不足
医疗是AI最令人期待,也最不能只看考试成绩的领域。
2025年增长最快的医疗AI应用之一,是自动生成临床记录的“环境式AI病历助手”。它不直接替医生诊断,而是在诊室里记录医患对话、整理病历。部分医院的医生报告,书写病历的时间最多减少83%,职业倦怠也有所下降。
这类工具之所以更容易成功,是因为它没有试图一步取代医生,而是嵌入医生已有的工作流,先拿走最耗时、最标准化的部分。
另一方面,对500多项临床AI研究的分析发现,近一半仍然依赖考试题或模拟场景,只有约5%使用真实临床数据。
医疗AI已经证明自己会做题,但还没有充分证明自己能在真实患者身上承担责任。
PART 05
AI跑得越快,治理、教育和社会信任的缺口越明显
信号 13负责任AI的发展速度远远落后于模型能力
几乎所有前沿模型公司都会公布能力成绩,但在安全、公平、隐私和可解释性方面,报告仍然零散甚至缺失。
2025年,记录在案的AI事故达到362起,2024年为233起。与此同时,基础模型的透明度在2025年反而出现下降,训练数据、参数规模、评测方法和安全结果越来越少被完整披露。
更麻烦的是,负责任AI不是一个可以单独调高的按钮。研究发现,提高隐私保护可能影响公平性,提高安全性可能降低准确率。不同目标之间存在真实冲突,却还没有成熟框架告诉企业如何取舍。
能力评测问的是“AI能不能做到”,负责任AI问的却是“出了问题由谁承担”。后一个问题显然更难。

信号 14学生已经全面使用AI,教育体系却还没有准备好
学生不会等学校开会讨论完毕,才开始使用AI。
超过80%的美国中学生和大学生已经使用AI完成学习任务,但只有大约一半的中学制定了AI政策,仅6%的教师认为学校的政策足够清晰。
这造成了一个熟悉的场景:学生在真实使用中迅速积累经验,老师和学校却还在争论“到底能不能用”。教育系统一边担心作弊,一边又必须培养学生未来必需的AI能力。
报告还发现,美国和加拿大新增AI博士人数从2022年到2024年增长了22%,但新增博士主要流向学术界,而不是工业界。
教育真正需要解决的,不是如何把AI挡在教室外,而是如何重新定义学习、作业和能力评价。

信号 15专家和公众看到的是两个完全不同的AI未来
当被问到AI会如何影响人们的工作时,73%的AI专家认为影响将是积极的,公众中只有23%持相同观点,差距达到50个百分点。
在AI对经济和医疗的影响上,也存在类似分歧。东南亚国家整体更加乐观,北美和欧洲则更谨慎。美国公众对本国政府有效监管AI的信任度只有31%。在全球范围内,欧盟获得的监管信任高于美国和中国。
这种分歧并不意味着公众“不懂技术”。专家看到的是能力曲线、效率和创新,普通人感受到的却是岗位风险、隐私、真假信息,以及自己无法参与决策的失控感。
AI的社会接受度,最终不取决于模型有多聪明,而取决于普通人是否相信自己能分享收益,并在出问题时得到保护。
结语
AI时代真正接受考验的,不再只是模型
把这十五个信号放在一起,可以得到三个判断。
第一,AI能力还会继续快速提升,但单纯比较模型分数的意义正在下降。当领先模型之间只差几个百分点,成本、稳定性、行业知识和能否进入真实工作流会更加重要。
第二,AI的竞争正在从模型竞争转向系统竞争。芯片、能源、人才、组织能力、监管制度和社会信任,都会决定技术最终能释放多少价值。
第三,AI时代最大的风险,不是机器突然变得无所不能,而是人类在没有准备好的情况下过快地依赖它。
AI已经完成了“证明自己能做什么”的阶段。接下来真正需要接受考验的,不再只是模型,而是企业、政府、学校,以及我们每一个人。

夜雨聆风