ARTICLE · 1094294
中美AI模型竞争力评估及发展趋势
中美AI模型竞争力评估及发展趋势技术含量 · 能力 · 成本 · 壁垒 · 潜力 
图 1技术与资本的双向因果与中美传导对比 阶段一(0→1),技术初始。2017 年 Google 八位研究员发表《Attention Is All You Need》,提出 Transformer 架构; 2020 年 Kaplan 与 2022 年Chinchilla 两条 scaling law 确立。 阶段二(1→N),资本设门槛。认知一旦被验证可行,竞争就切换为规模竞赛,此时资本成为硬门槛,不够就出局。这一段证据完整且可观测:OpenAI 2015 年成立时获承诺十亿美元,到 2019 年实际到账仅约 1.3 亿美元,那四年做不出前沿模型;2019 年微软投入十亿美元后做出 GPT-3,2023 年追加一百亿美元后做出 GPT-4。同期 Meta 为单个关键研究员开出 1.5 亿美元六年期薪酬包,OpenAI 向 600 多名在职与前员工提供流动性事件,平均股权薪酬约 150 万美元。钱往哪里流,人就往哪里走。 阶段三(N→N)资本技术互相影响期。DeepSeek 的 MLA、FP8 混合精度训练、DualPipe流水线这三项被全球开源前沿普遍采用的技术,是在 H800 互联带宽被管制砍到 400GB/s(H100 为900GB/s)的条件下逼出来的。V3 单次预训练的 GPU 成本 557.6 万美元,同期 Llama 3.1 超过 6000 万美元、GPT-4o 约 1亿美元(该对比仅为单次预训练口径)。 MLA、FP8 混合精度训练、DualPipe 这三项技术此后被全球开源前沿普遍采用。在一定区间内,资本受限反而抬高了单位资本的技术产出。 人才这一环同样是教育与资本的函数。MacroPolo 全球 AI 人才追踪显示,顶尖 AI 研究者中本科阶段在中国就读的占 47%,美国仅 16% 至 18%;按 NeurIPS论文第一作者工作地统计,2025 年中国 2152 人首次超过美国 1810 人。 人才产地由教育体系决定基础,由资本进行调整, Meta以超过 2 亿美元的多年期薪酬包自苹果挖来庞若鸣,七个月后被OpenAI 挖走; 纯资本论不成立。沙特与阿联酋的主权资本规模超过任何一家美国实验室的累计融资额,α极低,至今没有前沿实验室;欧盟有资本、有一流人才(Mistral、出走后的 LeCun),γ受芯片与电力双重约束,同样没有前沿模型。资本买得到规模,买不到α和β。 2026 年 9 月 8 日的纳维-斯托克斯方程事件,是这个环形结构迄今最清晰的一次实证(见 8.6 节):约一万个智能体、88 小时、1300 亿输出 token、270 万条消息,把一个悬置二十六年的千禧年难题跑出了 Lean 形式化证明。这是资本直接兑换为并行搜索规模的胜利。 
单一框架都不够。Artificial Analysis 能告诉你哪个模型此刻性价比最高,但无法告诉你这个位置能守多久;a16z 框架能告诉你钱流向哪里,但会把 MLA 和 GQA 当成同一类事物。 以「技术与资本双向因果」为主干,吸收四个外部框架的可用部件: ·门槛层(阶段二的一级变量):资本规模与造血能力,区分外部融资与自我造血(DeepSeek 靠幻方自营利润、阿里与字节靠主业现金流、OpenAI 与 Anthropic 靠一级市场),使用第十四章的融资、估值与资本开支数据。资本在此定位为门槛变量而非产出变量——不足则出局,充足则边际收益递减 ·通道层(二级):人才密度用卡内基与 MacroPolo 双口径并列,作为 α的观测值;算力用 Epoch AI 的 H100 等效折算,作为 γ的观测值 ·产出兼起点层:自建技术归属谱系法(原创层级 × 被采用广度 × 保鲜期),这是报告的核心贡献,外部框架均无此维度;技术含量在此既是本轮资本投入的产出,也是下一轮资本配置方向的决定项 ·输出层:采用Artificial Analysis 的每任务成本口径替代单价口径 ·商业层:采用高盛token 经济学与中金泡沫四维度做交叉校验 ·潜力层:五因子加权评分,按各因子在双向因果中的实际解释力分配——技术 27%、资本 22%、算力 20%、人才 18%、生态与商业化13% 
特征一,双寡头在收入,多极在能力。OpenAI 与 Anthropic 合计占据模型层收入的绝大部分,但在能力榜单上至少有六家机构能进入前十。收入集中度远高于能力集中度,这个背离是 2026 年格局最反常的地方。 特征二,开源权重的前沿已经东移。Hugging Face 2026 春季报告:中国开源模型占全球下载量 41%,2024 年底仅 1.2%;Qwen 累计约 7 亿次下载超越 Llama,衍生版本超过 15 万个。美国 2026 年发布开源模型最多的两家已不是 Google 和 Meta,而是 AMD 和英伟达。 特征三,美国企业在实际使用中国模型。OpenRouter 数据显示,美国企业使用中国模型的 token 占比自 2026 年 2 月 8 日起每周保持 30% 以上,峰值 46%;此前 12个月均值仅 11%,2025 年上半年低至 4.5%。 特征四,竞争正在从技术层转移到规则层。美方官员倾向把中国开源模型作为国家安全问题逐一规管,财政部长公开表示开源不意味着美国知识产权可任人攫取。同时英伟达、微软、Meta、IBM、Hugging Face 等 75 家以上公司联署反对过早限制开源。这条线的走向对中国模型的海外可及性影响大于任何基准分数。 这一章回答一个问题:中美各自究竟拥有多少别人没有的东西。 
图 3技术归属谱系两层计分 图 4护城河保鲜期评估 地基层指的是那些一旦被提出,后续所有人都必须在其上工作的技术。这一层的归属高度集中。 时点:收录截至 2026-09;「年份」为技术首次公开发表年,不是采用年。 
地基层计分:美国17,中国0。这一层没有任何回避空间。中国团队在 2024 年以前对大模型地基技术的贡献接近于零。任何声称中国已在底层技术上并驾齐驱的说法,都无法通过这张表。 2024 年之后局面发生变化。当算力受限成为中国团队的默认前提,效率方向的创新集中出现。 时点:收录截至 2026-09。 
效率层计分:中国6项0→1加8项重要工程化,美国3项0→1加1项工程化。这一层的方向确实反转了。 行业习惯把技术贡献分成「原创」与「工程优化」两类,并暗含前者高贵后者次要。Muon 优化器的完整链条证明这个二分法描述不了真实世界。 
算法来自美国的个人研究者,不是任何大厂实验室。把它变成能在万亿参数规模稳定跑完 15.5 万亿 token 的东西,靠的是中国团队的稳定化工作。缺任何一半,Kimi K2 都不存在。 这个案例的推论是:技术含量应当按「谁让这件事真的能跑起来」计分,而不是只按「谁先写出这个公式」计分。报告的技术含量评分据此设计,原创与工程两项分别独立打分。 
有一组数据组合值得单独提示:中国在开源下载量上占41%、在开源参数规模上高出一个数量级,同时私人 AI 投资额仅为美国的二十三分之一。这说明中国阵营的资源效率显著更高,也说明其商业变现能力显著更弱。两件事是同一枚硬币的两面。 从下到上共八层:芯片、互联与集群、训练框架、模型架构、数据管线、后训练与 RL、推理引擎、产品。 
Google 是唯一的八层全栈,这是其潜力评分居首的根本原因。DeepSeek 的特殊性在于:在无法自研芯片的前提下,把芯片之上的每一层软件都自己写了一遍,包括通信库、矩阵库、注意力算子和文件系统。这种深度在纯软件机构中罕见。 这张表是本章最有实用价值的部分。多数被渲染成护城河的东西,实际保鲜期只有几个月。 
结论是刺耳的:目前被媒体大量渲染为护城河的技术项目,绝大多数保鲜期不超过一年。真正十年级别的壁垒只有三条,且全部不属于模型层公司本身,而属于制程厂、教育体系和电网。 Sebastian Raschka 对此有一段准确的概括:2026 年不会有任何一家公司掌握别人拿不到的技术,因为研究员频繁换工作、在实验室之间轮转;真正的差异化是预算和硬件约束,不是想法保密。 人才不生产技术含量,但决定单位时间内能产生多少次有效尝试。 
图 5顶尖研究者工作地分布变化 
斯坦福 AI Index 2026 研发章原文:迁往美国的 AI 研究者与开发者数量自 2017 年以来下降 89%,且下降在加速,仅最近一年就下降了 80%。 
中国在 α通道上已不处于劣势,部分口径甚至领先。这与地基层技术贡献为零的事实并不矛盾:人才存量反映的是未来产出潜力,地基层归属反映的是过去二十年的积累,而过去二十年的资本流向决定了那部分积累发生在美国。α已经追上,γ尚未追上,这是资本量级与芯片管制共同作用的结果,不是技术问题。 Epoch AI 的 Shapley 值分解显示,历史性能提升中 60% 到 95% 来自算力与训练数据的增长,仅 5% 到 40% 来自新算法。 
图 6芯片产能差距的三个口径 算力压低的不是最终分数,而是试错次数。同一个想法,一家能在两周内跑二十个变体,另一家只能跑两个,长期产出差异不体现在单个模型的基准分上,体现在方向选择的正确率上。 

报告采用 25 倍(H100 等效)作为主口径,并注明其他口径下为 20 至 111 倍不等。差异主要来自基准芯片选择与是否做良率调整。 
中国侧的结构性问题不只是总量,还在于其中大量为昇腾与寒武纪,单卡性能与 H100 存在代差,且高端集群交付周期为六到十二个月。 需要记住一条口径纪律:名义 EFLOPS 只在中国官方口径内自洽。国际上做中美算力对比,主流口径是芯片等效算力(H100e 或 B200e)而非名义EFLOPS——RAND 给出美国约为中国 10 倍,IFP 给出约 5 倍(集群级口径)。本报告第六章主口径仍采用 6.3 节的 H100 等效 25 倍,上表的Epoch 集群数据只作存量参照,不参与倍数结论。 算力不足的表现不是跑分低,是供给限流。可观测的实例: · 智谱在 2026 年 1 月因算力紧张把日销量砍到原来的 20%,每早 10 点放额度几分钟售罄 · Kimi K3 发布三天后因请求量逼近集群承载极限,暂停 C 端新订阅 · DeepSeek 官方承认受限于高端算力,Pro 服务吞吐十分有限 同时需要记录反向证据:DeepSeek 已将底层代码从 CUDA 迁移至华为 CANN,昇腾 CANN 官方渠道于 2026 年直播 DeepSeek V4 昇腾首发。这说明约束正在被部分绕开,但绕开的代价是适配工作量(见第七章)。 CUDA 仍是最强的软件生态壁垒,但 2026 年出现了两处松动。第一,中国头部模型开始主动迁移,DeepSeek 已将底层代码从 CUDA 迁至华为 CANN。第二,Google的 TPU 加 JAX 路线证明另一套全栈是可行的,且成本更低。 黄仁勋在 2026 年 4 月的一次深度访谈中给出了最直接的表述:如果 DeepSeek 先在华为平台上发布,对美国而言将是灾难性的。追问者指出 DeepSeek 是开源的、在英伟达 GPU 上一样能跑,他的回答暴露了真实关切:假设它是针对华为架构优化的,那就会让英伟达处于劣势。九天后,昇腾官方渠道直播了 DeepSeek V4 的昇腾首发。 这一节的数据全部来自一线工程实录,不采用厂商宣传口径。 
真实痛点(来自匿名开发者的踩坑记录):算子适配是最大障碍,且最折磨人的不是报错本身,而是报错信息的误导性。具体案例:torch.repeat_interleave 在 A100 上很快,在昇腾上性能极差,需改写为 unsqueeze 加 expand 加 reshape 的组合才解决。自写 CUDA 内核的团队迁移需至少两周学习成本。第三方库兼容性仍是开放问题。 这些评价不出现在任何视频或宣传材料里,只出现在昇腾社区和技术论坛的一线实录中。只看视频舆情会系统性低估国产算力落地的工程摩擦。 

开源小模型是端侧唯一可行路径。Qwen3 小尺寸模型 8GB 显存即可运行,Mistral 的 Ministral 3 8B 官方定位边缘部署,输入输出同价 0.15 美元。 本地部署的成本账需要修正一个流行误解。海外社区的实际测算:RTX 4090 首年总成本 2360 至 2800 美元,对比 Claude Pro 年费 240 美元。除非日均8小时以上重度使用,本地部署总成本可能更高。本地部署的真实价值是数据不出境与无限流,不是省钱。 



三套体系不矛盾,它们测的不是一件事。「追平」发生在对话层,「落后」发生在工程层。任何一句话结论都会失真。 另有两个反向证据需要记录:GLM-5.2 成为首个在 Terminal-Bench 突破 80%(82.7%)的开放权重模型;Kimi K3 在 Arena.ai 的 Frontend Code Arena 从第 17 位跃至第 1 位,Text Arena 从第 38 位升至第 9 位。开源已在部分 Agent 基准上取得单项第一。 2026 年 9 月 8 日,OpenAI 宣布其内部多智能体系统给出了纳维-斯托克斯方程存在性与光滑性问题的一个解答。这是克雷数学研究所 2000 年设立的七个千禧年大奖难题之一,悬赏 100 万美元,悬置二十余年。事件本身值得单独记录。 过程数字: 
为什么这一条印证了阶段二的资本兑换能力。需要先说清它解的是哪一个版本。克雷研究所的官方表述把该问题拆成四组:A 与 B 指向外力为零时的全局正则性,C与 D 指向允许光滑外力时的有限时间爆破。OpenAI 的结果是C与D,并公开声明不申领 100 万美元奖金。即便如此,带外力的欧拉与纳维-斯托克斯爆破同样是开放了数十年的硬问题,OpenAI 在 88 小时内完成。 真正的差异不在单个智能体的聪明程度,而在并行搜索的规模——一万条探索路径同时推进、交叉授粉(用 Codex 合并各组的中间洞见)。而并行搜索规模是钱的函数:1300 亿输出 token 按任何一家旗舰定价折算都是一笔只有极少数机构付得起的开支。该方法对主问题不可扩展,且已被独立证明。芝加哥大学数学家 Luis Silvestre 的表述是「最重要的问题仍未解决。克雷问题被解决了,但纳维-斯托克斯方程的主要问题没有」;25位菲尔兹奖得主(含陶哲轩、邓煜)联名发表《人工智能在数学中的严重错位》,警告把未解历史难题当作 AI 能力基准、而不优先增进人类理解,会损害数学研究生态。他们的核心忧虑不是 AI 太强,而是「答案来了,理解却没来」。 优先权争议也必须记录。在 OpenAI 发布前约 12 小时,纽约大学数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpöge 发表声明,称二人以传统数学方式借助 AI 工具工作约一年,已率先构造出带外力的欧拉方程崩坏解。OpenAI 否认使用其工作并承认对方在带外力欧拉问题上的优先权,同时称经调查确认Buckmaster 此前两个月的 Codex 提示不可能影响本系统。陶哲轩随后撰文祝贺二人。 对本报告的三点含义: ·能力边界已被推过「人类专家耗时」这条线,但只在搜索空间明确、可机械判定的问题族内。资本驱动的并行搜索规模已取代个体洞察速度成为约束条件,这会外溢到工程、药物发现、材料等同类问题上。 ·但「能给出答案」不等于「能产出可传承的知识」,这一条已被数学共同体以最正式的方式确认。形式化验证解决了「对不对」,没解决「懂不懂」。 ·它改变了中美对比的观察指标。如果前沿进展越来越依赖「一次调用烧掉多少 token」,那么资本与算力的权重会继续上升,β效率的对冲作用会下降。这对 DeepSeek 这类高效率、低资本的公司是不利的方向性变化。 以下价格全部来自厂商官方定价页直抓。跨币种处理规则:厂商自身以美元标价的(DeepSeek、MiniMax、智谱国际站)直接采用其官方美元价;仅以人民币标价的,按1美元= 7.1元人民币折算为美元等值,折算值只用于跨厂商排序与量级对照。必须注意,各厂商人民币价与美元价之间的隐含汇率并不一致(DeepSeek 六项恒为 6.818、MiniMax约 7.0、智谱约 6.36),与同期人民币兑美元中间价约 6.7489 也不同源,因此折算值不等于实际结算汇率,误差可达 5%。 
图 7旗舰档输出价(官方定价页核实) 
图 8单价优势的侵蚀路径 
图 9幻觉率与价格的关系 美国厂商 
中国厂商(美元为折算值) 时点:厂商官方定价页,2026-09-28 复核; 
价差最大区间:GPT-5.6 Cyber 输出 75 美元对 Hunyuan-a13b 折合 0.28 美元,相差 268 倍。在同为旗舰的口径下,Claude Fable 5.1 的 50 美元对 MiniMax-M3 的 1.20 美元,相差约 42 倍。 真实成本由三项决定:单价、每任务 token 消耗量、返工率。 

幻觉率与价格无关。最贵的模型不是最准的,最便宜的也不一定最差。这一条直接否定了「贵的更可靠」这一采购直觉。 按能力档位、可得的每任务成本证据 
最被低估的位置是 GLM-5.3-Flash 与 DeepSeek V4.1-Flash 闲时档。最被高估的是所有单价高于 50 美元输出价的型号,其溢价需要用可靠性数据证明,而目前幻觉率数据不支持这一溢价。 前面八章回答的是「谁更强、谁更贵」,这一章回答的是第三类问题:同样的电、同样的时间、同样的钱,到底能换回多少工作。效能与性能不是能力或价格的附属项,它单独决定一件事:一个模型在真实业务里能不能被用得起、等得起、规模化得起。 
图 10每度电能产多少 token:三档测量边界,互不换算 
图 11吐字速度与 effort 档延迟的权衡 
图 12价格、效能与能力的联合视图:三者能对齐的模型只有三个 供应商的影响大于模型。同一 DeepSeek V4.1 Flash 权重,榜单上 Modal 端点为 215 tok/s、DigitalOcean 端点为 61 tok/s,相差 3.5 倍。同一 MiniMax-M3 权重在 11 家供应商上输出速度差 9.8 倍、首 token 延迟差 35 倍。开源模型 gpt-oss-120b 在 8 家供应商上的中位速度从 1891 到 36 tok/s,差10.8 倍。因此不得跨供应商比较速度。 高 tokens/s 不等于任务完成快。任务级实测显示,某模型 36.8 tok/s 但单任务输出 6384 token、耗时 176 秒,而另一 131 tok/s 的模型同任务仅 15 秒。排名完全翻转——因为前者生成了远多于需要的 token。 以下为 Vals AI 在统一 mini-swe-agent 脚手架下的实测(500 题,计时从模型在任务内第一步开始,不含环境启动)。 
更长程的任务是小时级。Terminal-Bench 2.0(统一 Terminus 2 脚手架,89 任务)上,GPT 5.5 为 73.20%、每任务1.82 美元、耗时 38 分 18 秒;Claude Opus 4.8 为 70.04%、0.88 美元、7 分 52 秒;DeepSeek V4 为 56.18%、0.18 美元、13 分 48 秒。 Artificial Analysis 测得的 14 个 agent 变体平均任务墙钟时间在 7.9 分钟到 40.8 分钟之间,多数落在 15 至 25 分钟。而 Epoch AI 与 METR 合作的 MirrorCode 给出了更极端的一端:Claude Opus 4.7 重实现一个 16000 行的生物信息学工具耗时 14 小时、花费 251 美元,而四名研究者估计人类工程师需要 2 至 17 周。 按厂商官方美元定价(2026-09 核实),每 1 美元可购的输出 token 数如下。 
两点必须说明。第一,缓存命中价目比标价更重要:在反复重发系统提示词的 agent 场景里,缓存命中价才是实际账单主体,而各家折扣从 2% 到 10% 相差 5 倍。第二,中文天然吃亏:中文文本比英文产生更多token,DeepSeek 官方计费口径为 1 个汉字约 0.6 个 token,而第三方实测给出约 1.1 个 token 每汉字,两者冲突未解,但方向一致——同样语义内容,中文消耗更多 token,因此以 token 计价的成本和以 tokens/s 计的速度在中文场景下都被系统性低估。这个偏差方向对中国不利。 若改用质效联合口径(每一点智能指数所需美元,Artificial Analysis,2026-09-11),差距更为悬殊:GLM-5.3-Flash为 0.009、DeepSeek V4 Flash 为 0.025、MiniMax M3 为0.027 美元,而 Claude Fable 5 为0.806、GPT-5.5 为 0.536 美元,首尾相差约90倍。该组数据为第三方汇总,可信度中等,但方向与每美元 token 数一致。 此外,推理价格本身的下降速度极快:Epoch AI 数据显示,固定能力下的价格年降中位约 50 倍(区间 9 倍至 900 倍),2024 年之后加速至约 200 倍每年。这意味着任何基于当期标价的效率结论都有很短的保质期。 



这是使用量数据中最需要警惕的一节。调用量暴涨与价值兑现之间存在巨大缺口。 




智谱的市值轨迹值得单独记录,因为它是本轮估值锚切换的最清晰样本:上市首日约 528 亿港元、6 月 22 日盘中市值破万亿港元、7 月 13 日 7334 亿港元、9 月 3 日约 5159 亿港元、9 月 10 日约 3813 亿港元。触发 9 月回撤的直接事件是 Jefferies 将其云业务 PS 由 50 倍下调至 30 倍。 同期两家的分野同样清晰:7 月 13 日智谱市值约为 MiniMax 的 10.5 倍。 
这是 2026 年资本侧最重要的结构性变化。 
杠杆绝对水位仍然健康,但增量融资已进入私募信贷、144A与 SPV 的不透明区域。2026 年第二季度被市场称为自筹资金时代结束的季度。 英伟达 2026 年已投出超 400 亿美元:OpenAI 300 亿、SpaceX 210 亿(6 月)、Intel 约 300 亿、CoreWeave 20 亿、Nebius 20 亿、Corning 32 亿、IREN 21 亿;并牵头 5000 亿美元融资平台,参与方含 Apollo、BlackRock、Blackstone、Brookfield、高盛、KKR,公布当日英伟达市值蒸发 1300 亿美元。对 neocloud 的 vendor financing 规模估算约 1100 亿美元。 需要记录两处对冲事实:原 1000 亿美元对 10GW 的分期方案已于 2026 年2 月改为 300 亿美元纯股权、无采购义务,黄仁勋在2026-03-04 称这 300 亿可能是最后一笔;英伟达自身近 12 个月收入 3030 亿美元、毛利率约 75%,与 2000 年崩塌时已在亏损的朗讯不可同日而语。 公开署名的批评者名单:Michael Burry、Jim Chanos、Ben Thompson、Matthew Bryson(Wedbush)、Jeff Gundlach、Torsten Slok(Apollo),以及机构层面的 IMF《全球金融稳定报告》2026 年 4 月与国际清算银行总经理在 2026-09-10 孟买演讲中的点名。 



一条跨专家的共识:在「谁更强」这个问题上,产业界掌门人的表述普遍带有明确商业立场(黄仁勋担心的是 CUDA 生态位,Ball 与Sacks 的对立映射闭源与开源的收入之争),而研究者的表述普遍更保守且更一致(Raschka 与 Lambert 都否认技术保密构成壁垒)。读这些观点时,区分说话人的位置比记住结论更重要。 
这张表是本章对「差距还有多大」的直接回答。 

ARC-AGI-2 官方榜前六名全部为美国系统:GPT-6 Astra 95.0%、GPT-5.6 Sol 92.5%、Claude Opus 5 90.4%、Claude Fable 5.1 90.0%、Claude Fable 5 89.2%、Gemini 3.7 Flash 84.6%(型号名以榜单原文为准,与第七章 Google 在售清单的命名不一致,未作归并)。在「用少量经验学会新东西」这个最接近智能本义的维度上,中美差距不是单位数百分比,而是梯队之差。 但必须同时记录另一侧:同一个基准上 DeepSeek V4 Flash 以$0.042/题拿到 61.4%,是 Astra 成本的 1/27。效率维度上中国仍在领先,这一点与第二十一章 β= 1.73 的结论一致。 
按技术创造者计,六次断裂中只有一次延续(约17%);按领先机构计,六次中有三次延续(50%)。按「上一代领先公司原封不动继续领先」计,是零次——每一次技术内核都被换掉了。 这组数据给出的答案是双向的:颠覆几乎总是与上一代的技术创造者无关,但通常与上一代的领先机构有关。延续下来的不是模型,而是数据、算力、分发渠道与工程组织。如果历史重演,最可能的结局不是 OpenAI 与 Google 消失,而是它们用一条今天没在押的路线继续领先——正如 Google 从统计机器翻译切到神经机器翻译、从卷积网络切到视觉 Transformer。 







图 19发展潜力评分(技术与资本双向因果口径) 
图 20算力与技术含量的维度结构 
中美分组均值: 时点:同上表,2026-09。 
总差距 1.36 分里,算力贡献 3.44 分的单项差(权重 20%,折算 0.69)与资本贡献 2.06 分(权重 22%,折算 0.45)合计 1.14,即约84%的差距来自资本与算力两项,人才与技术两项合计只贡献约11%。 这个拆解里最需要记一笔的是技术项中美仅差0.31分(8.00 对 7.69),是五个因子中差距最小的一项;人才项也只差 0.35 分。两国在「能不能做出来」这一层已经接近持平,1.36分的差距几乎全部来自「能做多大」这一层。 Google第一的原因是它在双向因果的两个方向上都通。母公司现金流提供无限弹药(资本 10),TPU 自研使 γ不受外部供应商约束(算力 10),Gemini 与 JAX 的垂直整合压低单位算力成本;更关键的是它手里握着 Transformer 这一层地基——2017 年的那篇论文被自己搁置了五年,最终仍把它送回榜首,这是技术资产跨周期复利的直接证据。它是全表唯一在每个环节都不存在瓶颈的公司,9.65 分是结构性的而非偶然的。 DeepSeek是全表效率最高、同时也是资本最受限的公司。单位资本技术产出 1.73,为第二名月之暗面(1.23)的 1.4 倍、Meta(0.65)的 2.7 倍。但资本 5.5 分、算力3.0 分两项把它压到第 11 位。它是这套框架里最重要的一个反例与检验:如果 DeepSeek 最终进入第一梯队,说明 β可以在相当程度上对冲 C 的不足;如果它掉队,说明资本规模是硬约束,效率只能延后失败而不能避免失败。目前它不接受外部融资,等于主动放弃了提升 C 的路径,这个选择本身就是对两种世界观的一次押注。 Meta与xAI是资本效率低的两个样本。Meta 资本项 10 分满分、算力 9 分,但技术仅 6.5、人才 7.0,β为全表最低的 0.65;xAI 算力 10 分满分,β为 0.67。两家的共同特征是资本充足但α偏弱——Meta人才流失严重(Llama 4 争议后多位核心研究者出走创业,2亿美元挖来的庞若鸣七个月即被挖走),xAI 依赖马斯克个人号召力而非学术声誉招募。这证明资本买到的是「量」,买不到「质」,而质最终决定β。 阿里居中国第一、字节次之,靠的是资本与生态,不是技术。两家资本均为 9.0,生态均为 9.0,技术分别为8.0 与 7.5,差距落在技术项上。中国第一梯队的位置由持续投入能力与分发渠道决定;但技术项 0.5 分的内部差距,正是决定两家谁能进入下一轮资本正反馈的变量——因为技术是下一轮资本配置方向的决定项,不只是本轮的产出。 
两个最关键且最不确定的轴:横轴为规则环境(开放或封锁),纵轴为资本兑现(收入跟上或缺口扩大)。 
图 21四象限情景矩阵 
一年内,美国未对中国开源模型实施系统性限制,OpenRouter上中国模型份额稳定在 40% 以上;企业兑现率从 5% 改善到 15% 以上,token 调用与应用收入同步增长。三年内形成清晰分工:美国闭源占据受监管行业与最复杂 Agent 任务,中国开源占据规模化推理与成本敏感场景,混合路由成为标准架构。 驱动者是企业采购部门。他们要的从来不是最强模型,是可控成本下的够用能力。 赢家是同时具备全栈与成本优势的 Google、生态规模最大的阿里、以及所有应用层公司。输家是纯模型层的中间玩家,既无成本优势也无生态。 早期信号:美企使用中国模型的 token 占比稳定在 40% 以上;企业 AI 项目可测ROI 比例突破 15%;出现首个把中国开源模型用于核心生产流程并公开披露的标普 500 公司。 美方以国家安全为由对中国开源模型逐一规管,中方同步限制海外访问顶级模型。全球分裂为两套不互通的技术栈:CUDA 加闭源旗舰对昇腾加开源权重。 这个情景的核心特征是技术扩散停止,但两边各自的收入都还在。美国闭源在本土与盟友市场维持定价权,中国开源在国内与新兴市场维持规模。双方都活得下去,但全球总效率下降。 赢家是全栈自研的 Google 与华为体系,以及所有做适配与迁移的中间层服务商。输家是依赖单一生态的公司,以及所有跨境业务。 早期信号:出现针对具体中国模型的实体清单或使用禁令;OpenRouter上中国模型份额断崖式下降;昇腾适配率快速提升至覆盖全部国产旗舰。 这是黄仁勋公开称为「极其愚蠢」的情景,也是他判断最可能发生的情景。 规则保持开放,但企业兑现始终跟不上资本开支。推理价格年降 50 倍的通缩速度超过需求增长速度,模型层集体进入负毛利。 关键机制是 2001 年带宽的剧本重演:量在涨,价崩得更快,收入反而下降。MiniMax 上半年 17.9% 的毛利率是这个情景的先行样本。 赢家只有应用层与最终用户。输家是全部模型层公司,包括头部。芯片厂受损但可存活。 早期信号:头部模型公司毛利率跌破 20%;API 收入占比上升而毛利率同步下行;出现第一家头部模型公司被并购或关停。 规则封锁与资本缺口同时发生。GPU 折旧争议以空头胜出告终,第二家超大规模云厂缩短折旧年限,引发全行业利润重估;私募信贷违约率突破 8%;数据中心债发行失败。 这个情景下受损排序严格按第二十章 20.4:模型层纯玩家与 neocloud 股权归零,高杠杆二线云被迫重组,超大规模云杀估值但存活,应用层反而受益于算力通缩。 早期信号:见第二十章 20.5 的九个指标,其中第 4、5、6 项同时触发警戒阈值。
本报告由 Brian 编写,版权归作者所有。未经作者书面同意,不得以任何形式转载、复制、传播或提供给第三方。
第一章:技术与资本是双向因果,主导方向随阶段翻转

第二章 研究框架:
2.1 候选研究框架对比与选型

2.2复合框架
第三章 竞争格局总览
3.1 双阵营主要参与者

3.2 竞争格局的四个结构性特征
第四章 技术含量:

4.1 技术归属谱系:地基层

4.2 技术归属谱系:效率与稀疏性层(2024 年后)

4.3 Muon 案例:原创与工程的二分法为何失效

4.4 学术影响力的量化对照

4.5 技术栈自主深度:垂直整合层数

4.6 护城河保鲜期评估

第五章 通道一(α):资本转化为人才

5.1 顶尖研究者工作地:一次已经发生的反转

5.2 迁入美国的研究者数量
5.3 人才争夺战的价格水位

5.4 α通道的结论
第六章 通道二(γ):资本直接转化为算力
6.1 算力与算法效率

6.2 集群规模对照

6.3 芯片产能差距:三个口径

6.4 数据中心与算力口径

6.5 算力约束的真实表现
第七章 硬件适配性
7.1 CUDA 护城河的现状
7.2 昇腾 CANN 与 MindSpore 的真实成熟度

7.3 其他国产芯片适配状况

7.4 美国模型的硬件绑定

7.5 端侧部署
第八章 模型与能力全景
8.1 美国主要模型(2026 年 9 月)

8.2 中国主要模型(2026 年 9 月)

8.3 2026 年 9 月双榜快照(本报告能力结论的唯一数据基底)

8.4 能力对照:三个独立评测体系的不同答案

8.5 能力边界的实证:纳维-斯托克斯方程事件(2026-09-08)

第九章 成本、价格与真实性价比
9.1 官方核实价目表(每百万 token,2026-09-27)





9.2 单价便宜不等于账单便宜

9.3真实性与幻觉率

9.4 综合性价比排序

第十章 效能与性能:



10.2 谁吐字更快:
10.3 谁先把问题做完:分钟级编码、小时级重实现与人类基线

10.4 每1美元能买多少 token:

第十一章 技术互鉴与蒸馏争议
11.1 美方指控的证据链

11.2 中国技术被外部采用的证据链

第十二章 用户基础与使用量趋势
12.1 token 调用量

12.2 用户规模

12.3 企业渗透与兑现率

第十三章 政策环境
13.1 美国

13.2 中国

第十四章 融资估值与资本开支
14.1 美国主要公司估值

14.2 中国主要公司

14.3 资本开支:

14.4 融资结构的变化:从现金流转向债务

14.5 循环融资
第十五章 专家观点图谱
15.1 欧美专家


15.2 中国专家与从业者

15.3 争议焦点的各方说法对照

第十六章 真正的人工智能
16.1 真正的智能:五种定义与各自的判据

16.2 差距清单:

16.3 哪个模型更接近:

16.4 未来的颠覆会不会与今天的领先者无关

16.5 已发生的颠覆与尚未验证的颠覆


第十七章 历史技术牛熊周期复盘与当前定位
17.1 历史案例

17.2 当前周期与历史的结构性对照


17.3 若破灭,按层级的受损排序

17.5 九个领先指标与警戒阈值

第十八章 投资框架与多因子潜力评分
18.1 评分模型设计




18.2 评分结果的四点解读
第十九章 前瞻推演
⚠️ 前瞻性分析:以下为基于当前趋势推演的未来情景,非确定性预测。
19.1 关键趋势向量

19.2 四象限情景矩阵

