ARTICLE · 1111640
Gemini 4 Argon 很强,但 AI 真正的门槛不在模型

图1 当所有人的目光都盯着天花板,真正拉开差距的,往往在脚下。
过去两年,行业里最不缺的就是“新纪录”。2026年10月1日凌晨,谷歌发布新一代旗舰模型Gemini 4 Argon,把输出上限拉到100 万Token,在长程软件工程、企业知识工作、长视频理解等测试里接连登顶。消息一出,科技媒体集体刷屏。
但如果把镜头拉远,会发现一件更值得玩味的事:当模型的天花板还在以肉眼可见的速度抬升时,决定 AI 能不能真正跑进企业、跑进日常的,却越来越不是模型本身。
这一轮 AI 竞争的下半场,正在从“谁能做出更强的模型”,悄悄切换到“谁的模型脚下有一片站得住的地基”。
01 能力还在狂奔,但问的问题变了
Gemini 4 Argon 确实是当下“能力侧”的最强注脚之一。输出上限从此前的6.4 万Token 抬到100 万Token,意味着单次任务可以吞吐数十万甚至上百万 Token——处理大型代码库、长程研究、多步骤企业流程,第一次有了“一口气读完”的物理可能。
在 DeepSWE v1.1(衡量真实世界长程软件工程)上拿到77.9%、在覆盖金融编程法律税务的Vals Index 登顶、在AutomationBench 端到端自动化上以51.3% 领先……一串基准分背后,是谷歌在“把AI 推进更复杂、更真实的工作流”上的押注。
但真正值得注意的是另一些“非分数”的信号:彭博社援引知情人士称,部分谷歌员工认为,Argon 在行业基准测试里表现亮眼,实际工作中却并不总能达到同等水平,尤其在部分编程任务上仍比较吃力。这几乎是整个行业的缩影——榜单上的分数和真实世界的落点之间,出现了一条裂缝。
02 模型读不懂的数据,才是真正的门槛

图 2 数据只有从“给人看”变成“给机器读”,地基才算真正托住模型。
裂缝的另一端,是一个反常识的事实:很多企业不是没有数据,而是数据在“喂”给模型之前,根本没被机器读懂。
有个案例很典型:某集团花三年、几千万元做数据治理,主数据统一了、指标口径梳理了、质量看板也上了墙。第二年要做智能客服,数据交付却被业务退回三次。不是数据不准,而是字段叫“CUST_STAT_CD”、值域是“01/02/03”、注释写着“参见附录B”——人看到会去翻附录,模型只会猜,还会自信地把猜错的答案讲给用户听。
Gartner 的判断更刺眼:到2026 年底,60% 的AI 项目会因为缺乏“AI 就绪数据”而被放弃。传统数据治理的服务对象是“会质疑的人”,AI 原生数据治理的服务对象,却是“照单全收的模型”。人要的是一份准确记录,模型要的是“能正确理解、可追溯、可安全执行的决策依据”。
这正是地基的问题:模型的阅读能力越来越强,可数据如果一直停留在“给人看”的形态,再强的模型,也只是一台自信的错觉机器。
03 数据不沉淀,AI 就永远在重来
即便数据被读懂了,还有第二道坎:智能体产出的东西散落一地、无法复用。
这是字节跳动智能网盘ADrive 想解决的问题。它的口号是“连接你的AI 应用,让文件与产物持续可用”。过去网盘是“仓库”,被下载速度和付费策略定义;ADrive 试图把网盘变成 AI 的工作目录——AI 生成的报告、代码、素材、运行日志、技能记忆,自动写进明确的存储空间,人可以随时接管、继续编辑。
把 AI 从“临时打工者”变成“能积累经验的员工”,靠的正是这块存储地基。逻辑很简单:Token 不便宜,AI 一旦进入生产,数据就不能只停留在一次会话里。智能体生成的文件如果不能沉淀为可复用的资产,下一次执行任务就得从头再来。
04 繁荣的脚下,藏着财务的裂缝
但地基不止数据这一层。硅谷正在用另一种方式“透支”未来。
日本《日经亚洲》梳理 Alphabet、微软、亚马逊、Meta、甲骨文的年报后得出:这五家官方资产负债表上的债务约1.35 万亿美元,而表外负债——各种付款承诺与合同义务——估计高达1.65 万亿美元,四年内增长约八倍,几乎与AI 基建投资同步。
Meta 是最极端的样本:在路易斯安那州Hyperion 数据中心,与私募基金 Blue Owl Capital 合作成立项目公司,项目公司发债约273 亿美元,Meta 只持股约20%,通过数十年租赁来使用——这273 亿债务因法律隔离不出现在Meta 表上,但《日经》估算Meta 累计表外负债约4200 亿,几乎是官方报告债务的三倍。
利润端同样“虚胖”:Alphabet 2026 年二季度报告净利润约1120 亿美元,其中约980 亿来自SpaceX 和Anthropic 持股的账面增值,一分钱现金没进账,自由现金流反而为负59 亿美元,是2004 年上市以来首次为负。亚马逊626 亿净利中约534 亿来自对Anthropic 投资的重估。云厂商投资AI 实验室,实验室拿钱买云算力,云厂商确认收入、持股增值、再确认投资收益——一个每一步都合规、却让收入、利润、估值互相强化的循环。
这种结构最脆弱的点在于:债务期限长达二三十年,AI 硬件经济寿命可能只有三五年。一旦应用落地慢于估值预期、算力需求放缓,已签约的租赁付款不会消失,账面收益和刚性义务会同时反转。而风险已经通过私人信贷,转进了养老金和保险组合——很多最终承担风险的人,并不知道自己持有的产品底层是什么。
这不是 2008 年那种欺诈式危机,但它把技术风险转化成了金融久期风险。对普通投资者而言,AI 繁荣的财务地基,远没有财报上的利润数字那么牢固。
05 计算的下沉:从工具到生活
地基的另一面,是 AI 正在从“屏幕里的工具”,下沉成“包裹生活的环境”。
苹果过去二十年一直在做一件事:让计算无处不在——AirPods 的计算音频、Apple Watch 处理健康信息、iPhone 和Mac 承担通用计算。而下一步,苹果正计划把整个“家”都用计算连接起来。
这和我们讨论的地基是同一件事:当 AI 从数据中心、从对话框,下沉到每个人的客厅和日常场景,它考验的就不再是单点能力,而是数据是否贯通、资产能否沉淀、体验是否稳定,以及支撑这一切的基础设施是否可信。模型再强,也要落到一个个真实的生活与工作场景里,才算完成闭环。
结语:判断 AI,别只看模型
所以,2026 年判断一家公司、一项技术、甚至一次投资值不值得跟,可能得换一套框架。
表面的热闹属于模型——谁发了新旗舰、谁又登顶了榜单。但更值得盯的是三层地基:数据能不能被机器真正读懂并安全使用;AI 的产物能不能沉淀成可复用、可追溯的资产;以及支撑这场繁荣的财务与基础设施结构,是不是建立在可持续的现金流上。
模型决定了AI 能跑多快,地基决定了AI 能走多远。当所有人的目光都盯着天花板的时候,真正拉开差距的,往往在脚下。
