ARTICLE · 1121411
AI ASIC为什么成为云厂商定制算力的一条路线
摘要:AI ASIC把稳定的训练或推理任务固化为专用硬件,云厂商则用海量内部负载摊薄研发成本,并把芯片、网络、软件和云服务一起优化。本文拆解这条路线的成立条件、系统结构、代表项目与商业化边界。
云厂商采购GPU,是购买一套成熟、通用的加速平台;自己设计AI ASIC,则像为长期重复的核心业务建一条专用生产线。前者上线快、生态完整,后者有机会围绕特定模型、网络和机房条件重新配置芯片资源,但要承担数年的研发、流片和软件建设。
因此,AI ASIC不是GPU的简单替代品,也不是所有公司都适合走的路线。它成立的前提是:工作负载足够稳定、调用规模足够大、云厂商掌握模型和数据中心运行信息,并能把一次性芯片投入分摊到长期服务中。
从Google TPU、AWS Trainium与Inferentia,到Microsoft Maia和Meta MTIA,公开资料显示,头部云与互联网平台正把定制芯片作为异构算力组合的一部分。GPU继续承担高通用性任务,ASIC则服务更明确的训练、推理、推荐或内部业务。
一、AI ASIC到底是什么
ASIC是Application-Specific Integrated Circuit,即专用集成电路。AI ASIC不是固定的一种芯片形态,而是围绕机器学习任务定制的处理器,可以服务矩阵乘法、推荐系统、视觉推理、大模型训练或Token生成。
它通常包含矩阵或张量计算阵列、向量和标量单元、片上缓存、HBM或其他内存控制器、片上网络、高速互连、主机接口和可靠性模块。与GPU相比,ASIC可以减少不需要的图形或通用结构,把面积、功耗和带宽集中到目标任务。
“专用”并不等于完全不能编程。现代AI ASIC仍需要编译器、运行时、算子库和框架接口,以支持不同模型。差别在于硬件可执行范围和优化重点更集中,软件需要更了解芯片的数据流和存储层级。
二、云厂商为什么具备定制条件
1. 工作负载规模足够大
ASIC前期要承担架构设计、验证、EDA、IP、流片、封装、板卡、服务器和软件开发成本。只有持续运行的大规模内部任务,才可能把一次性投入分摊到足够多的计算小时或Token上。
云厂商同时拥有搜索、推荐、广告、语音、视觉、大模型和外部云客户等负载。某些算子每天重复执行,利用率和机房部署也较可预测,这为专用芯片提供了明确目标。
2. 掌握真实模型和运行数据
通用芯片厂商面对广泛客户,需要兼顾更多算法和软件。云厂商能够观察内部模型的算子占比、批量、精度、通信模式、内存访问和故障记录,再把这些信息反馈到芯片设计。
这种优势不只是知道“模型需要多少TOPS”,而是知道时间花在矩阵计算、Embedding、数据搬运还是集合通信,并能据此调整缓存、HBM、互连和专用引擎。
3. 能把芯片嵌入云服务
云厂商不必只靠卖芯片回收投入。它可以把ASIC装入自有数据中心,以云实例、训练平台、推理API或内部业务形式提供服务。客户购买的是计算服务,底层芯片由平台调度。
这种模式降低了ASIC单独建立硬件渠道的要求,但没有消除软件门槛。客户仍要关心模型能否迁移、框架是否兼容、性能是否稳定,以及服务在地域和实例规格上的可获得性。
4. 能做数据中心级协同设计
AI系统的瓶颈不仅在芯片。供电、液冷、网络、存储、机架密度、故障管理和云调度都会影响总成本。云厂商可以从机房约束倒推板卡和芯片,并共同设计互连协议、服务器和资源管理软件。
Microsoft对Maia的公开说明就把芯片、以太网后端网络、机架供电、液冷和软件栈放在同一系统中。Meta公开的MTIA 300则把网络芯粒和通信卸载纳入芯片设计,用于推荐与排序模型的训练通信。
三、AI ASIC想解决的不是一个问题
1. 性能功耗比
专用电路删除不需要的功能,针对常用精度、矩阵形状和数据流优化,有机会在目标任务上提高每瓦吞吐。但这种改善必须限定在具体模型、精度、批量和系统条件下,不能从单个峰值数字推导全部工作负载。
2. 单位服务成本
云厂商关心的是训练一次模型或生成一个Token的完整成本,包括芯片、服务器、网络、电力、冷却、机房和软件运维。ASIC若能提高利用率、降低功耗或减少通信开销,可能改善云服务成本;前提是部署规模足以摊薄研发费用。
3. 供应来源与产品节奏
自研芯片可以增加一种算力来源,让云厂商围绕内部需求安排产品。但芯片仍依赖晶圆制造、先进封装、HBM、基板、设备和IP,不能被理解为完全脱离外部供应链。
4. 软硬件协同
ASIC可以围绕自有框架、编译器、模型和服务接口优化。Google TPU与JAX/XLA、AWS芯片与Neuron、Microsoft Maia与PyTorch/Triton、Meta MTIA与内部推荐系统,都体现了芯片和软件共同建设。
5. 差异化云实例
当云平台拥有可用的自研加速器,就能提供不同于标准GPU实例的产品组合。对客户而言,关键不是“自研”标签,而是可迁移性、可获得性、稳定性、性能价格和长期支持。
四、定制AI ASIC内部要保留哪些能力
1. 矩阵计算阵列
这是执行GEMM、卷积和注意力计算的主要单元。芯片会针对BF16、FP16、FP8、INT8或更低精度设计数据通路,平衡训练精度、推理吞吐和功耗。
2. 向量、标量与通用单元
模型中仍有归一化、激活、索引、采样、数据格式转换和自定义算子。ASIC如果只有矩阵阵列,遇到非规则算子就会频繁回退或搬运数据,因此需要一定通用能力。
3. 片上存储与缓存
缓存和软件管理的片上存储负责复用权重与激活,减少访问外部内存。容量、分区和数据搬运引擎要与目标模型匹配。缓存利用率不足时,算力单元会等待数据。
4. HBM与内存控制器
大模型需要较大的显存容量和带宽。参数、KV缓存、激活、梯度和优化器状态都会占用内存。推理尤其需要同时平衡批量、上下文长度、Token延迟和显存带宽。
5. 片上与片间互连
片上网络连接计算、缓存和内存;片间互连连接多颗加速器。训练需要AllReduce、AllGather和All-to-All,推理也可能采用张量并行、专家并行和分离式架构。互连不足会导致芯片等待通信。
6. 安全、虚拟化与可靠性
云服务需要租户隔离、错误检测、遥测、故障恢复和资源切分。ASIC进入数据中心后,是否能被云调度系统安全地分配和长期运行,与计算峰值同样重要。
五、训练芯片与推理芯片并不完全相同
训练要完成前向计算、反向传播和参数更新,通常需要更高精度、更大显存、快速卡间通信和长时间稳定运行。模型变化快,算子可编程性和调试能力也很重要。
推理关注首Token延迟、每Token成本、并发、KV缓存和服务稳定性。预填充阶段计算更密集,解码阶段常更受显存带宽影响;推荐系统则可能被Embedding访问和通信限制。
因此,AWS把Trainium定位于训练、Inferentia定位于推理;Microsoft Maia 200公开定位于推理;Meta MTIA早期重点服务推荐推理,2026年披露的MTIA 300则针对推荐与排序模型训练。产品名称都属于AI ASIC,但优化目标不同。
六、从芯片到云服务要跨过六道关
1. 架构定义
团队先用真实负载分析算子、精度、内存和通信,再决定计算阵列、缓存、HBM和互连。模型演进速度快,架构如果过度针对某一代模型,流片完成时可能已经落后于软件需求。
2. 芯片设计与验证
大规模AI芯片包含复杂计算、内存和高速接口,验证量大。流片前需要覆盖功能、性能、功耗、时序、安全和可靠性,任何重大缺陷都可能推迟产品周期。
3. 先进封装与HBM
高性能ASIC常依赖HBM和2.5D/3D先进封装。中介层面积、微凸点、基板、散热、封装良率和测试能力共同决定交付。
4. 服务器、网络与冷却
芯片要装入模组、服务器和机架,还要连接CPU、网卡、交换、存储和冷却系统。机房供电与散热无法承载时,芯片峰值能力不能持续运行。
5. 编译器与算子库
框架代码要经过编译器映射到硬件,算子库要覆盖主流模型。缺失算子、图切分、精度转换和通信调度都会降低利用率。软件成熟度通常需要跨多代芯片持续积累。
6. 云产品化
最后还要完成实例封装、容器、监控、计费、权限、SLA和运维。内部部署不等于对外云服务已经成熟,发布芯片也不等于形成大规模商业收入。
七、Google:TPU把芯片、互连与软件栈绑在一起
Google Cloud把TPU定位为面向机器学习训练与推理的定制加速器。公开的TPU v6e资料显示,每颗芯片包含矩阵乘单元、向量与标量单元,并配置HBM和芯片间互连;系统以不同规模的Slice和Pod交付。
截至2026年8月,Google Cloud官网已列出第七代Ironwood和第六代Trillium,并继续提供JAX、PyTorch与TPU软件栈。这里能看到云厂商路线的完整形态:芯片不是单独产品,而是与编译、框架、拓扑和云资源管理一起交付。
后续观察重点包括新模型算子覆盖、不同规模拓扑的利用率、客户迁移成本、实例可获得性和真实工作负载成本。
八、AWS:Trainium与Inferentia分别覆盖训练和推理
AWS把Trainium定位为机器学习训练芯片,把Inferentia定位为推理芯片,并通过EC2实例、SageMaker、EKS及其他云服务提供。Neuron软件栈包括编译器、运行时、训练和推理库、监控、分析与调试工具。
AWS还提供Neuron Kernel Interface,让开发者为Trainium和Inferentia编写定制内核。这个设计说明专用ASIC并非只运行固定算子,而是在硬件效率和软件扩展之间保留接口。
AWS官网披露的性能与成本比较属于公司测试口径,实际结果取决于模型、实例、软件版本和配置。商业化验证应观察客户采用、实例供给、软件迭代和持续使用,而不是只采用官方单点对比。
九、Microsoft:Maia从芯片扩展到网络和液冷
Microsoft在2024年公开Maia 100,强调芯片、软件、网络、机架供电和液冷共同设计。Maia软件栈对接PyTorch、ONNX Runtime和Triton,并提供编译器、运行时、算子库和开发工具。
2026年1月,Microsoft发布面向推理的Maia 200,官方披露其采用3nm工艺,配置216GB HBM3e、片上SRAM和数据搬运引擎,并通过两级以太网Scale-up架构连接加速器。相关性能和性能价格比较为公司披露口径,需要在具体服务和客户负载中验证。
Maia展示的是云厂商定制芯片的系统工程属性:芯片架构要同时考虑Token生成、网络、遥测、控制面和现有数据中心部署条件。
十、Meta:从推荐推理走向训练通信专用化
Meta公开资料显示,MTIA是其自研训练与推理加速器系列。2025年,Meta披露MTIA v2已在数据中心规模部署,主要服务广告排序与推荐推理;其训练芯片也开始进入生产爬坡阶段。
2026年8月,Meta进一步披露MTIA 300,定位推荐与排序模型训练,并把定制RDMA网卡芯粒和通信卸载引擎集成到系统设计。Meta解释,推荐模型的Embedding参数占比较高,频繁的All-to-All等通信会限制通用计算资源,因此把通信作为芯片设计的一部分。
这一案例不能直接外推到所有大模型。推荐训练和大语言模型在计算、内存及通信结构上不同,专用优化的效果必须限定到目标工作负载。
十一、国内路线一:百度智能云与昆仑芯
百度智能云把昆仑芯、飞桨、文心大模型和AI平台放在同一技术栈中。官网披露,昆仑芯2代采用XPU-R架构,支持INT8与FP16计算、GDDR6显存、虚拟化、芯片互连和视频编解码,并已进入百度内部及行业场景。
百度百舸一体机页面还列出昆仑芯P800加速卡模组,并强调多芯异构调度、通信库和训练推理管理。公开信息支持“芯片—框架—模型—云平台”协同这一事实,但不同产品的出货、客户复购和经营贡献仍要以公司后续披露为准。
昆仑芯已经公司化运营,因此其路径既包含云厂商内部工作负载反馈,也包含独立AI芯片公司的对外产品化,和完全只供内部使用的ASIC模式并不相同。
十二、国内路线二:阿里巴巴与含光800
阿里巴巴在2019年发布由平头哥研发的含光800,定位AI推理,公开用于商品搜索、推荐、广告、翻译和客服等内部业务。官方发布材料列出了ResNet-50测试结果和图像分类案例,但这些数字对应当时的模型、精度和测试环境。
含光800体现了稳定内部推理负载对ASIC架构的牵引:平台掌握业务模型和调用规模,可以围绕搜索与推荐的实际数据流设计芯片。
需要说明的是,公开可核验资料主要集中在2019年前后。本文不据此推断其当前部署规模、后续代际或收入贡献;相关信息需要等待阿里巴巴、阿里云或平头哥的更新披露。
十三、国内路线三:腾讯云与紫霄
腾讯在2021年披露三款自研芯片,其中紫霄面向AI推理,沧海用于视频转码,玄灵面向高性能网络。腾讯2021年度相关报告把这些芯片归入云计算软硬件自研体系。
这组产品反映了云工作负载按任务专用化的逻辑:AI推理、视频处理和网络数据面使用不同ASIC,而不是由一颗通用芯片处理所有任务。
目前公开可核验材料对紫霄后续型号、完整规格和规模部署披露有限。因此,文章只将其作为已公开的云端定制芯片项目,不把发布状态写成持续大规模供货或经营贡献。
十四、AI ASIC为什么不会让GPU消失
1. 模型仍在快速变化
新模型持续引入MoE、长上下文、多模态、稀疏和新的注意力结构。GPU拥有较成熟的通用编程生态,更适合快速变化和研究探索;ASIC要在设计效率与算法适应性之间取舍。
2. 云客户需要广泛兼容
外部客户使用不同框架、算子和模型。标准GPU更容易承接长尾需求;ASIC更适合平台能够控制软件栈、负载规模大且重复度高的部分。
3. 供应链风险不能靠单一路线消除
ASIC仍依赖晶圆、封装、HBM和制造设备。云厂商通常同时采购GPU、CPU、网络芯片和自研加速器,形成异构资源池,而不是只保留一种芯片。
4. 研发节奏存在错配风险
从架构定义到部署往往跨越多年。芯片完成时,模型需求可能变化;如果软件不能及时适配,专用硬件会形成闲置或低利用率。
十五、市场最容易误判的五件事
1. 自研芯片等于自产芯片
云厂商通常负责架构与系统设计,制造、封装、HBM和大量IP仍由产业链完成。自研描述的是设计和产品控制,不代表全流程内部完成。
2. 发布芯片等于对外销售
有的ASIC只服务内部业务,有的通过云实例开放,有的由独立芯片公司销售。三种模式的收入确认、客户结构和商业验证完全不同。
3. 官方峰值等于客户成本
峰值算力、性能功耗比和性能价格必须带测试口径。真实成本还包含利用率、迁移、网络、运维和任务排队。
4. ASIC可以固化整个模型
现代ASIC通常固化高频计算与数据通路,模型仍由软件描述。过度固化会降低算法适应性,因此编译器和可编程单元仍是重要组成。
5. 云厂商自研等于相关供应商已经获得订单
产业链公司具备某类技术,并不能证明进入特定ASIC项目。供应关系、验证、量产和收入必须以公司、客户或权威文件披露为准。
十六、产业链怎样围绕云端ASIC展开
上游包括EDA、处理器与高速接口IP、先进制程晶圆制造、HBM、封装基板、先进封装、测试和散热材料。云厂商或芯片团队完成系统定义,需要和制造及封装伙伴共同解决带宽、功耗、信号完整性和良率。
中游包括ASIC设计、编译器、运行时、算子库、通信库、板卡、服务器、交换和液冷。芯片性能要通过完整系统交付,单一环节参数不能替代端到端测试。
下游是云实例、训练平台、推理服务、搜索推荐、广告和大模型应用。实际价值最终由计算小时、Token吞吐、客户迁移、复购、资源利用率和总体成本验证。
本文不列未经证实的供应商映射。某公司拥有HBM、封装或高速接口产品,不等于已经进入Google、AWS、Microsoft、Meta或国内云厂商的具体ASIC项目。
十七、接下来持续跟踪什么
▪️ 芯片部署阶段:流片、样机、内部验证、生产部署、云实例开放和规模采购需要严格区分。
▪️ 软件成熟度:编译器、框架、算子、内核接口、通信库和调试工具是否持续更新。
▪️ 真实工作负载效率:训练时间、Token延迟、吞吐、功耗、利用率和迁移成本,而不是单一峰值。
▪️ 系统扩展能力:单芯片到多卡、机架和跨节点后的网络效率、稳定性与故障恢复。
▪️ 商业化方式:内部降本、云实例收入、芯片销售和独立公司经营需要分别验证。
结语
AI ASIC成为云厂商定制算力的一条路线,根本原因不是“专用芯片天然更强”,而是头部平台拥有足够大的重复负载、真实运行数据和数据中心控制能力,可以从模型、编译器、芯片、网络到云服务进行联合设计。
这条路线的成立条件同样严格:任务要相对稳定,规模要足以摊薄研发成本,软件要持续维护,制造和封装要按计划交付。GPU提供广泛通用性,AI ASIC服务明确负载,两者更可能长期构成异构算力,而不是简单的替代关系。
核心来源
1. Google Cloud,Cloud TPU产品与软件栈,https://cloud.google.com/tpu
2. Google Cloud,TPU v6e架构与配置,更新日期:2026-08-26:https://docs.cloud.google.com/tpu/docs/v6e
3. AWS,Trainium与Inferentia设备管理,https://docs.aws.amazon.com/eks/latest/userguide/device-management-neuron.html
4. AWS,Neuron软件开发栈,https://aws.amazon.com/ai/machine-learning/neuron/
5. AWS,Inferentia产品说明,https://aws.amazon.com/ai/machine-learning/inferentia/
6. Microsoft Azure,Maia 100芯片、网络、液冷与软件,发布日期:2024-04-03:https://azure.microsoft.com/en-us/blog/azure-maia-for-the-era-of-ai-from-silicon-to-software-to-systems/
7. Microsoft,Maia 200推理加速器,发布日期:2026-01-26:https://blogs.microsoft.com/blog/2026/01/26/maia-200-the-ai-accelerator-built-for-inference/
8. Meta,数据中心与MTIA部署进展,发布日期:2025-09-29:https://engineering.fb.com/2025/09/29/data-infrastructure/metas-infrastructure-evolution-and-the-advent-of-ai/
9. Meta,MTIA 300训练与通信设计,发布日期:2026-08-24:https://engineering.fb.com/2026/08/24/networking-traffic/mtia-300-meta-training-chip-built-in-nics/
10. 百度智能云,昆仑芯2代与AI大底座,https://cloud.baidu.com/solution/aif.html
11. 百度智能云,百舸一体机与昆仑芯P800,https://cloud.baidu.com/product/aihc-private.html
12. 阿里巴巴集团,含光800发布与内部应用,发布日期:2019-09-25:https://www.alibabagroup.com/en-US/document-1491206538574954496
13. 腾讯,2021年度云计算研发成果与紫霄芯片,发布日期:2022年:https://www.tencent.com/zh-cn/investors/annual-reports.html
风险提示
本文用于产业研究与技术科普,不构成投资建议。AI ASIC的性能、成本和能效高度依赖模型、精度、批量、网络和软件版本;厂商测试结果不能直接等同于客户环境。部分国内项目公开信息更新较少,本文不据历史发布推断当前部署规模。技术迭代、流片、先进封装、HBM供应、软件适配、客户迁移和云服务商业化均可能不及预期。