你知道过去一年最反常识的 AI 数据是什么吗?
不是某个模型的推理又强了多少,而是:MIT 的调研显示,95% 的企业级生成式 AI 试点项目,没换来可衡量的 ROI。
同一时间,全球 GenAI 支出冲到 6440 亿美元,同比暴涨 76.4%。钱花得越来越猛,回头率却低得吓人。
这不是我编的,是马耳他大学的 AI 讲师 Dylan Seychell,在 Medium 上一篇长文里开篇就甩出来的数据。他标题问得更狠:2026 年,是不是 AI 狂欢的终结?
太多人还在围着"魔法时刻"打转——哪个模型又爆了、哪个 Agent 又"自主"了。但真正在一线建系统的人,早就在换赛车道了。
MIT Project NANDA:95% 的生成式 AI 试点/企业项目,没有带来可衡量的 ROI 或利润影响。
先看清:这不是一个泡沫,是几千个微型泡沫同时破裂
过去我们讲泡沫,爱拿郁金香和 .com 做类比。但这次的画面完全不同。
SimpleClosure 的 2025 年创业公司关停报告显示,A 轮公司倒闭数量同比涨了 2.5 倍。其中死得最惨的,是那批"AI 套壳公司"——本质就是把 OpenAI、Google、Anthropic 的 API 包一层皮,套个好看的 UI 就出去卖。
它们的死法很一致:被巨头吞掉功能,被同行卷掉价格,客户动动手指就能平移到原模型上。零切换成本,薄如纸的毛利,一吹就塌。
更有意思的是三个"教科书式"的翻车案例:
AI 陪伴项链 The Friend,靠全天录音"治愈孤独",结果被骂成"监视告密者",隐私诉讼缠身。它证明了一件事:硬件形态不能违反社会对隐私的直觉。
Rabbit R1 和 Humane 的 AI Pin,过度依赖云端推理,延迟高到让人抓狂,反而把"手机才是 AI 最佳形态"给验证了。
物流公司 Pandion 烧了 1.25 亿美元想用 AI 挑战 UPS、FedEx,结果证明:AI 救不了资本密集型行业里已经烂掉的单位经济模型。
这些公司不是蠢。它们是掉进了同一个坑:把"功能"当"生意"来卖。
再看 Agent:技术没达标,噪声倒是先上了天
"智能体""自主数字员工"是当下最热的词。但 Gartner 的预测很冷:到 2027 年底,超过 40% 的 agentic AI 项目会被砍掉。
为什么会这样?因为真做引擎的人在陪你聊的三个硬伤:
一是"死亡循环"。 Agent 反复规划、不断精修查询,却迟迟不落地执行。它在为一个永远拿不到完美信息的随机世界,死磕一个追求确定性的目标,于是卡死。
二是上下文撑爆。 别看厂商吹"百万 token 上下文",任务一多,记忆就被噪声灌满,性能非线性滑坡。第一步 95% 准,第十步可能就剩 60%。
三是学不进去。 目前的 Agent 普遍没有持久记忆——你今天纠正它,它明天照错。错误从不写回模型或向量库。
更麻烦的是"Agent 洗白"。大批厂商把二十年的老聊天机器人、规则脚本,刷层新漆就改名"自主 AI Agent"。Gartner 说,几千家号称做 Agent 的公司里,真正有动态规划能力的只有约 130 家。
再加上被严重低估的成本:一个任务,人类花几分钱,Agent 一个循环能烧掉几十上百次推理。把概率模型硬塞给确定性任务,结局早就注定了不划算。
所以 2026 年你大概率看不到"数字员工大军",而是一波安静的取消潮——企业默默把过度承诺的 Agent 项目下架,因为 ROI 撑不住。
Gartner:数千家号称做 Agentic AI 的厂商中,只有约 130 家具备真正的动态规划与自适应能力。
硬约束不在算力,在乎"人肉防火墙"
技术之外,还有一堵文化墙。
医疗行业有个 2025 年约翰·霍普金斯的研究,点出了一个"胜任力惩罚":用 AI 辅助诊断的医生,反而被同行认为更不专业。医学圈靠的是学徒制、几千小时的临床直觉和"专业权威的表演",AI 就算统计上更准,也动摇了医生的权威感。
教育更拧巴。健康领域 AI 还能当工具用,教育里它直接被视为"人类发展的干扰者"。
我的理解是:AI 抢不走需要"信任关系"的地方。诊断、教学、判断——这些靠的是人和人之间经年累月的信任。这类领域注定是谨慎的、增量的试点,而不是什么"革命式颠覆"。
真正的新战场:谁先把每瓦性能做得更好
抛开道德叙事,AI 耗电这件事,本质是个成本问题,不是良心问题。
巨头砸钱建算力,不是喜欢烧钱,是被成本结构困住了,拼命想逃出去。所以 2025 年真正的转向是——往"小"里走:小语言模型(SLM)用几分之一的功耗,交出可比的成绩,还能在本地设备上跑。
Google 自研 TPU 而不只靠英伟达,就是为了每瓦性能,控制几十亿次每日推理的运营成本。Gemini 3 Flash 这种更小更快的模型,在关键基准上甚至反超了旗舰 Pro——这就是信号。
作者点出 2025 年还有个怪现象叫"效率洗白":厂商把"压一压就发售"的模型吹成革命性 SLM。真正有效的效率,得靠为功耗而生的专用设计,就像 Llama 4 Scout、Grok-3 Mini 那样,在体积和能力之间取平衡。
这些公司不是在做慈善。 他们是在优化利润、推付费更新、压自己的推理成本。
别听"该有护栏",先问他造过什么
文章最后一段,作者给了一个我看完想鼓掌的鉴别方法。
他说,AI 圈里讨论"护栏""偏见""公平"的声音特别多,但这三个词,每一个落到工程上都极其痛苦:
护栏不是几行代码,是从设计到部署贯穿全程的取舍活儿,永远做不到完美。
偏见不是数据脏,它嵌在模型学到的表征里,训练后想"洗掉"会连通用能力一起损伤。
公平在数学上经常就是不可能——优化了某个维度,必然牺牲另一个维度。你只是在选择"接受哪一种不公",而不是消灭不公。
他给的鉴别器很朴素,却一针见血:评判一个 AI 评论者,先问"这人实际造过什么(论文、产品、业务、项目)?" 还是只是个被大模型反复点赞、坚信世界没他不行、顺势冲浪的"放话人"。
区分 AI 进步里的信号与噪声,最干净的办法就是这一句:看他建,还是仅仅在谈。
2026 年你该盯这五件事
不是让你押注某个爆款模型,而是看这些慢变量:
一、算力成本往死里卷。 每 token 的基础设施成本,决定了大规模部署的生死,而推理效率的竞争,最终受益的是你我。
二、从横向套壳转向纵向深耕。 别再指望一个通用 AI 改造医疗,真实发生的是 AI 更深地嵌入放射科,辅助医生做更好的判断。
三、AI 素养和治理成了组织刚需。 员工私下都在用,地下使用才是失控的温床。不做素养教育,就把 AI 逼进了阴影里。
四、前沿模型和"够用就好"的差距在收窄。 依赖 API 的应用会开始迁到本地推理,带宽受限、重隐私、离线优先的场景,终于等到了机会。
五、SEO 继续走下坡,EEAT 上位。 内容平台的算法越来越懂"对人重要",拼的不再是关键词排名,而是经验、专业、权威与可信度。
AI 这场"革命",会走成任何成熟系统都走过的路:一场磨人的、烧钱的、多年的集成工程,带着温和却很真实的效率提升。
不魔法。计量。
本文基于 Medium 文章 Will 2026 see the end of the AI Hype?,作者 Dylan Seychell(马耳他大学 AI 讲师),翻译转述并加入个人理解与判断。原文链接:https://medium.com/@dylanseychell/sobering-up-about-ai-and-the-shift-from-magic-to-metrics-93d056dbcfe9
夜雨聆风