ARTICLE · 1125631
AI 芯片竞争升温:亚马逊自研芯挑战英伟达
AI 芯片竞争升温:亚马逊自研芯挑战英伟达在全球 AI 算力军备竞赛中,英伟达依靠 CUDA 生态与 Blackwell 系列 GPU 占据数据中心 AI 芯片80‑90% 市场份额,几乎垄断大模型训练市场新华网。亚马逊 AWS 以自研Trainium 训练芯片 + Inferentia 推理芯片组合,走云内优先、性价比突围路线,成为英伟达最不容忽视的对手,但双方并非完全对立,AWS 同时大规模采购英伟达 GPU,执行 “自研 + 外购” 双轨算力策略。 推荐阅读: AI 芯片(AI 加速器) Ai芯片的技术原理、架构、应用场景【必读】
一、亚马逊自研芯片主力产品
Trainium(训练芯片)
- Trainium3(2025 年底发布,3nm 工艺)
FP8 算力 2.52PFLOPS,单颗 144GB HBM3E 内存;服务器 Trn3 UltraServer 最高可搭载 144 颗芯片,集群 FP8 峰值算力 362PFLOPS澎湃新闻。 官方宣称对比同级英伟达系统,训练、推理综合成本降低 40%,能效提升 40%,芯片间互联 NeuronLink‑v3 带宽高于 NVLink5。 市场热度极高:2026 年年中之前产能基本被预订一空,Anthropic、OpenAI、Uber、Meta 均签下大规模算力承诺,Trainium 系列累计客户订单承诺2250 亿美元级别。
- Trainium4(规划 2027 交付)
性能相比 Trainium3 再大幅跃升,关键突破:支持英伟达 NVLink Fusion 互联协议,可以和英伟达 GPU 混布在同一集群,打通生态壁垒,降低客户迁移门槛新浪财经。
Inferentia 系列:推理专用芯片
主打大模型上线后的 Token 生成,推理成本较 GPU 降低 50‑70%,亚马逊 Bedrock(Nova 大模型)绝大多数推理负载跑在 Inferentia 上,适合企业大规模落地 AI 应用。
配套软件:Neuron SDK,适配 PyTorch,支持主流开源大模型,但生态成熟度远不及 CUDA。
二、亚马逊的竞争策略:不硬刚全能,打差异化
- 优先吃推理、标准化训练市场
复杂前沿大模型预训练仍大量使用英伟达 Blackwell;大规模微调、批量推理、企业落地优先导入 Trainium/Inferentia,用成本优势抢夺客户,这是亚马逊主战场新浪财经。 - 云生态锁客,逐步向外扩张
现阶段 Trainium 仅对 AWS 云实例开放;亚马逊高管确认正在评估对外直接销售自研芯片给外部企业数据中心,一旦落地,将直接杀入英伟达的地盘。 - 一边对抗一边采购英伟达
AWS 计划 2027‑2028 部署200 万颗英伟达 GPU,自研芯片做降本分流,英伟达承担最高难度前沿训练,两套算力并行提供给客户选择,并非要彻底替代英伟达Amazon。
三、和英伟达相比的优劣势
✅ 亚马逊 Trainium 优势
- 成本与能效:同等任务性价比高出 30‑40%,云实例小时单价显著更低,对预算敏感企业吸引力强新浪财经。
- 集群互联:NeuronLink 集群互联带宽表现优秀,大规模集群扩展性强。
- 供应链可控:自研芯片不受 GPU 缺货、涨价制约,保障 AWS 云算力供给。
❌ 亚马逊核心短板
- 软件生态差距巨大:英伟达 CUDA 是行业事实标准;Neuron SDK 需要模型做适配移植,小众算子、前沿科研模型支持不足,科研、前沿创新场景用户迁移意愿低。
- 极限算力差距:在 FP4 超高精度前沿训练,Trainium3 距离 Blackwell GB300 仍存在差距。
- 部署范围受限:当前主要局限 AWS 云内,尚未大规模对外销售。
四、行业格局:群雄围攻英伟达,但壁垒仍高
除亚马逊 Trainium 外,谷歌 TPU、微软 Maia、各类初创公司都在冲击 AI 芯片市场,但英伟达凭借CUDA 软件护城河依然稳固。
短期(1‑2 年):自研芯片主要抢夺推理、微调、中型模型训练市场;顶尖前沿大模型训练,英伟达 GPU 依旧是首选。 中长期看点:Trainium4 兼容 NVLink、各家 SDK 不断优化,云厂商自研芯片会持续挤压英伟达的利润空间,迫使英伟达调整定价,算力市场由英伟达一家独大走向多元供给36氪。
五、关键启示
对云厂商:自研 AI 芯片的核心价值,不只是 “打败对手”,更是控制算力成本、摆脱供应链被卡脖子,提升云业务毛利率。亚马逊自研芯片年化运行收入已经超过 200 亿美元,业务体量已经达到大型芯片公司级别新浪财经。 对 AI 企业选型:前沿科研、创新探索优先英伟达;模型定型、大规模上线推理、微调,可优先评估亚马逊 Trainium/Inferentia,显著降低算力账单。