乐于分享
好东西不私藏

2026 年 8 月 AI 前沿:大模型集体「降价提速」,算力成了能上市的资产

2026 年 8 月 AI 前沿:大模型集体「降价提速」,算力成了能上市的资产

AI 前沿

2026 年 8 月 AI 前沿:大模型集体「降价提速」,算力成了能上市的资产

这个月 AI 圈的主线很清晰——上游把「建算力」包装成可投资资产,下游把「用模型」打到水电价。NVIDIA 抛出 5000 亿美元 AI 工厂融资,DeepSeek、Gemini 把推理价格腰斩,国产开源模型下载份额首次超过美国。一场关于「谁拥有算力、谁用得起智能」的洗牌正在发生。

NVIDIA 抛出 5000 亿美元「AI 工厂」融资计划

8 月 11 日前后,NVIDIA 联合 Apollo、Blackstone、BlackRock、Brookfield、Goldman Sachs、KKR 等一众资本,抛出规模高达 5000 亿美元的「AI 工厂」融资计划。与以往卖 GPU 不同,这一次 NVIDIA 卖的是「把电变成 token 的整套产能」——从芯片、整机柜、网络到软件栈一体交付,并由金融机构把它当作可估值、可分红、可上市的基础资产来运作。这意味着算力第一次被系统性地「金融化」:它不再只是科技公司的成本项,而成了资本市场眼里的新一类基础设施。

NVIDIA 数据中心与 AI 算力集群实景

「AI 工厂」到底是什么:把电变成 token 的新工业

黄仁勋反复强调的「AI 工厂」概念,核心是把传统工厂「进料—加工—出货」的范式搬到智能生产上:输入是电力与数据,工厂里跑的是万卡集群,产出的「商品」是模型推理生成的 token。区别在于,传统工厂的产能受限于物理产线,而 AI 工厂的产能可以随模型与算法优化持续「增产」——同样的电,能产出更有价值的回答、代码与决策。这个比喻之所以重要,是因为它让投资人第一次能用「工厂估值」的逻辑去理解算力资产。

AI 工厂:算力集群作为新型生产设施

算力军备赛:谁在买卡,谁在卖电

在 NVIDIA 这笔巨额融资背后,是美系 hyperscaler 与各国「主权 AI」计划的同步扩表。一边是云厂商为训练下一代多模态模型疯狂囤卡,另一边是中东、东南亚、欧洲纷纷把 AI 算力写进国家级战略,宁可自己建厂也不把智能命脉全押在别人云上。卖电的电力公司、卖冷却的储能与液冷厂商、卖土地的园区方,都在这条链上分到了一杯羹。算力军备赛的胜负,短期看谁先点亮集群,长期看谁能源源不断把电变成便宜的 token。

全球算力扩张下的数据中心建设

DeepSeek V4 Pro 正式版上线,峰谷定价把推理打进「水电价」

8 月 13 日,DeepSeek V4 Pro 正式版上线;随后在 8 月 17 日推出「峰谷定价」:V4-Pro 输出价 13.5 / 27 元(百万 token),V4-Flash 仅 4.5 / 9 元,缓存命中更是低到 0.15 / 0.30 元。所谓峰谷定价,是仿照电网逻辑——空闲时段调用更便宜。对用户而言,这意味着「夜间跑批、白天调用」能大幅压低账单,推理成本正式进入「水电价」量级。配合此前开源的 V3 权重,DeepSeek 把「强模型 + 便宜用」的组合拳打到了极致。

开源生态:Cordis 与 Harness v0.1 把「一切皆插件」搬上台面

本月开源侧同样热闹。DeepSeek 团队放出 Harness v0.1(MIT 协议),主打「一切皆插件」的 Agent 工程化框架;由崔添翼牵头、对标 Claude Agent SDK 的 Cordis 也引发关注。这类框架的价值不在于又造一个模型,而在于把「让模型调用工具、编排多步任务」这件苦活标准化——开发者像搭乐高一样拼装能力模块,Agent 从玩具变成可维护的工程系统。开源协议友好,意味着中小企业也能低成本拥有自己的「智能流水线」。

开源 Agent 框架推动 AI 工程化落地

Gemini 3.7 Flash 半价来袭,百万上下文成标配

8 月 13 日,Google 推出 Gemini 3.7 Flash,直接把价格砍到一半——0.75 / 3.75 美元(百万 token),且优惠延续到 2026 年 12 月 31 日。更关键的是,它把 100 万 token 上下文做成默认能力,在 FrontierCode 43.6%、DeepSWE 65.3%、AutomationBench 30.4% 等工程与代码评测上表现突出。对开发者来说,「长上下文 + 低价」意味着可以一口气把整个代码库、整份文档丢进去问,而不必再做繁琐的切片检索。

国产模型包抄:Qwen3.8、GLM-5.3 与「下载份额首超美国」

国产阵营本月集中放量:Qwen3.8-27B 以 Apache 2.0 协议开源、仅 270 亿参数却能在消费级显卡上跑;Qwen3.8-2.4T-A95B 则是 2.4 万亿参数的 MoE,每次激活约 95B;智谱 GLM-5.3 拿出 743B 的开放权重。更重要的是一个拐点信号——第三方统计显示,国产模型的全球下载份额达到 41%,首次超过美国。开源 + 中文场景优化 + 本地化部署,让「国产模型包抄」从口号变成了市场份额。

国产开源大模型生态加速扩张

OpenAI GPT-5.6 Sol Ultrafast:用 Cerebras 把速度拉到 14 倍

在「又快又便宜」的赛道上,OpenAI 也交出了 GPT-5.6 Sol Ultrafast,底层接入 Cerebras 的晶圆级引擎,把推理吞吐拉到约 14 倍、达到 750 tokens/秒的量级。它的卖点不是更聪明,而是「秒回」——在客服、实时陪聊、代码补全这类对延迟极敏感的场景里,体感提升是质变的。当月的大模型竞争已经从「参数谁大」转向「单位成本能产出多少有效智能」,速度、价格、上下文三条线同时内卷。