很多人看AI,盯着的是模型:谁更聪明,谁跑分更高,谁又发布了新版本。
但黄仁勋提出了对普通人很有启示的观点:
2025年Computex上,他把AI称为一种新的基础设施,说它会像互联网、像电力一样进入整个经济,而这种基础设施需要“工厂”。英伟达后来把“AI Factory”解释得更直白:工业时代,发电厂把能源变成电;AI时代,AI工厂把能源变成Token。
未来AI竞争,表面上争模型,底层争的却是另一件东西:谁能用更低的成本,把电、芯片和数据持续变成Token。
于是,算力开始从一种技术资源,变成一门可以“收租”的基础设施生意。
Token一爆发,算力就不够用了。
Token可以简单理解成大模型处理信息时的最小计算单位。模型读一句话、写一句话、调用一次工具,都要消耗Token,也就要消耗GPU和电力。
所以判断AI到底热不热,不能只看用户数,还要看Token到底跑了多少。
OpenRouter的数据显示:2026年6月22日至28日,平台一周模型调用产生的Token达到46.7万亿;而2025年7月7日至13日只有2.37万亿,不到一年接近20倍。
中国更夸张。2024年初,国内大模型日均Token调用量只有约1000亿;2025年底升到100万亿;2026年3月又突破140万亿。两年,增长超过千倍。
为什么突然这么快?
因为AI正在从“人问一句,机器答一句”,转向Agent自己干活。一个Agent帮你查资料、写代码、做报表、订机票,背后可能连续调用模型几十次、几百次。未来真正消耗算力的单位,不只是“用户”,而是24小时运行的无数任务。
这也是为什么模型越来越便宜,算力需求反而越来越大。越便宜,调用越多;调用越多,Token越多;Token越多,对算力的需求越大。
2026年,DeepSeek完成首轮大规模外部融资,融资规模据相关报道和投资结构测算约500亿元,投后估值超过3500亿元。几乎与此同时,它开始明显加码自己的算力基础设施。
DeepSeek把地点选在了内蒙古乌兰察布。
7月底,彭博援引知情人士称,DeepSeek计划在当地建设约1GW级别的AI数据中心,部分容量目标在2027年底或2028年初上线。
乌兰察布本身就是“东数西算”国家枢纽节点,电力资源丰富,绿电条件较好,年均气温较低,对服务器散热也有天然优势。
1GW是什么概念?
严格说,它不是“耗电量”,而是功率或电力容量。若按1GW量级持续运行,已经接近一台大型核电机组的额定输出。
换句话说,一家原本以算法效率闻名的AI公司,最终还是走向了极重的物理基础设施。
更值得注意的是梁文锋自己的表态。
今年5月的一场投资人闭门交流后来流出,《每日经济新闻》向参与投资的机构核实了会议真实性。梁文锋说得很直接:DeepSeek相信Scaling,模型规模越大仍然越有效,“阻止我们Scaling的其实就是算力”,不是不想做,而是没有那么多算力。
注:Scaling是指把模型做得更大、用更多数据。
这句话,比任何行业预测都更说明问题。
真正的大模型集群,需要GPU服务器、高速网络、交换机、存储、液冷、机房、电力接入,还要有调度软件和专业运维。更麻烦的是,高端AI芯片两三年就可能换一代。
今天花几十亿买来的机器,几年后可能已经不再是最有经济性的设备。
于是租赁出现了。
客户把一次性的资本开支,变成按月、按年支付的运营开支。需要多少租多少,不用自己养机房,也把一部分设备快速折旧的风险甩给服务商。
服务商怎么赚钱?
最常见的是2—5年的长期合同。通常,承诺制合同加权平均期限约4年,客户签约时往往还会先支付合同总价值15%—25%的预付款。另一种就是按需付费,用多少算多少,价格高一些,但灵活。
为什么GPU越造越多,租金还在涨?
因为真正稀缺的是“马上能用”的高端算力。
Ornn数据显示,Blackwell系列云端现货租金一度达到4.08美元/GPU·小时,比2月上涨48%。Semi Analysis数据显示,H100一年期租赁价格从2025年10月的1.77美元/GPU·小时,升到2026年3月的2.40美元,涨幅约35.6%。
到2026年6月,B300按月中位价格已接近7.92美元/GPU·小时,B200约6.11美元,H200约4美元。
一个模型项目如果晚三个月上线,损失可能远高于GPU每小时贵一两美元。因此,已经买到卡、已经装进机房、能稳定交付的算力,本身就有溢价。
这也是算力租赁最硬的壁垒:拿卡能力、融资能力和交付能力。
算力租赁不是互联网式轻资产生意,而更像航空、港口、电站:资本开支巨大,回报却高度依赖设备有没有持续运转。
国内已经能看到这种变化。
某公司2025年累计公告的高算力服务器采购额度不超过212亿元,2026年2月又公告拟采购不超过110亿元;到2026年一季度末,固定资产、在建工程和其他非流动资产合计约219.64亿元。与此同时,公司一季度归母净利润同比增长343.45%。
这类数字比“签了多少战略合作”更值得看。因为资产真正进场、服务器真正上架、现金真正回来,才意味着算力租赁从故事走到了生意。
中国面临的是一个很特殊的组合:Token需求增长极快,但顶级GPU供给又受到更多限制。
数据显示,2024年中国智能算力租赁规模达到377 EFlops,同比增长88.5%,预计2027年达到1346 EFlops。按另一种市场口径测算,如果国内AI服务器资源有20%—30%通过租赁对外释放,2025年国内算力租赁市场约350亿—560亿元。
今天的算力租赁,卖的是GPU小时。下一步,可能直接卖Token。
这就是黄仁勋所说“AI Factory”最关键的变化:以后衡量一座数据中心,不能只看有多少张卡,而要看每瓦电能生产多少Token、每张卡每秒能吐出多少Token、单位Token成本能不能继续下降。
一旦计价单位从“GPU小时”变成“智能产出”,算力公司就不再只是设备房东,而会向模型托管、推理服务、API甚至Token分成继续往下走。
最后真正拉开差距的,可能不是谁先做出一个更惊艳的AI产品,而是谁能长期、稳定、低成本地生产智能。
这才是算力租赁开始值钱的原因。
点击并关注下方公众号,可以收到我的更多观点分享:
更多内容:
夜雨聆风