ARTICLE · 1135273
AI芯片:国产替代加速,谁在突围,谁在追赶
一、海外AI芯片热度不减,国产替代加速推进
国庆期间,海外AI芯片产业动作频频。AMD CEO苏姿丰明确表态"AI芯片需求远超供应,2027年将大幅扩产",公司市值突破1万亿美元关口;高盛、摩根士丹利同步上调台积电目标价,先进制程2027年预计再涨5%-10%,供给紧张格局延续;另一边,Lambda因违规向中企出口被美国BIS罚款,地缘供应链风险的警报仍未解除。
整体看来,AI算力的全球需求还在加速扩张,但供给端的地缘不确定性也在同步上升。 对于国内市场,高端芯片供给受约束、下游算力需求在增长——供需之间的缺口,正是国产AI芯片最好的成长土壤。
二、国产AI芯片的"第一梯队"
AI芯片并非单一品类,按技术路线可大致分为四类:通用GPU(图形处理器通用计算,生态最成熟,英伟达是标杆)、专用架构AI加速器(自研指令集,针对AI计算做专门优化,代表如谷歌TPU、寒武纪思元)、x86/ARM衍生架构(依托成熟指令集生态做AI加速,代表如AMD CDNA、海光DCU)、类脑/存算一体等新路线(尚处早期,暂不展开)。路线的选择本质上是"生态兼容"与"自主可控"之间的权衡——兼容性越高,短期落地越快;自主性越强,长期战略价值越大。
通用GPU路线:壁仞、沐曦、摩尔线程
壁仞科技走的是"自主可控算力天花板"路线,从底层GPGPU架构到软件栈全自研。第一代产品BR106已于2023年量产,BR166(双Die Chiplet封装)2025年量产,2026年上半年收入达到12.36亿元,同比暴增近20倍。下一代旗舰BR20X预计2026年正式推出,支持FP8/FP4,并配套Blink 2.0超节点互连协议。
沐曦股份走的是"高兼容+全国产工艺"路线。旗舰产品曦云C600是国内首款基于全国产工艺的通用GPU,从设计到制造、封装实现国产供应链闭环,2026年上半年已进入量产交付,并通过国家安全可靠测评。其MXMACA软件栈宣称支持超6000个CUDA应用,生态迁移成本较低。公司2026H1营收13.24亿元,二季度已实现扣非盈利。
摩尔线程产品线最完整,从数据中心到端侧全覆盖。PH100芯片基于第四代MUSA架构"平湖",万卡级夸娥智算集群已落地,Dense大模型训练MFU达60%。
自主架构路线:华为昇腾、寒武纪
华为昇腾是毫无争议的国产AI芯片"一哥"。昇腾910C采用中芯国际7nm(N+2)工艺,达芬奇架构,双芯封装下FP16算力达800 TFLOPS。华为的核心优势不在单卡,而在系统级能力——通过灵衢高速互联总线和超节点架构,用384卡甚至4096卡的集群协同来弥补单芯片性能差距。目前昇腾910C超节点已部署超1000套,市场份额已超越英伟达。
寒武纪是A股"AI芯片第一股",2025年首次实现年度盈利,2026年上半年营收59.96亿元,净利润23.11亿元,同比双双翻倍。旗舰产品思元690于2026年初量产,双Die封装,FP16算力超700 TFLOPS,配备196GB HBM3内存,互连带宽超890Gbps。寒武纪的策略是"不做云、不与客户竞争",因此成为互联网大厂采购国产芯片的首选——字节跳动已累计部署超十万张思元590/690芯片。
x86生态路线:海光信息
海光信息凭借x86架构授权,走的是"CPU+DCU"双芯协同路线,最大的优势是生态兼容性。2026年上半年营收90.99亿元,归母净利润17.98亿元,毛利率55.2%,是国产算力阵营中盈利能力最强的企业之一。其DCU产品已适配400余款主流大模型,覆盖99%非闭源大模型,DTK软件栈覆盖训练、推理及AI4S全场景。海光的客户以金融、能源、政务等传统行业为主,渗透深、粘性强。
三、国内外芯片的性能差距
算力对比:单卡差距仍在,系统级追赶更快
先看硬件参数。以英伟达H200为基准,国产旗舰芯片在FP16算力上大约是H200的50%-75%水平,显存容量约55%-85%,显存带宽约45%-70%。制程工艺的差距更明显——英伟达H200用的是4nm台积电工艺,国产芯片主要依赖7nm左右制程。
但这个对比有两个前提需要说明:
第一,单卡性能≠实际可用性能。华为的策略最有代表性——单卡虽然不是最强,但通过超节点架构和灵衢总线,把384张甚至4096张芯片高速互连起来,系统级算力利用率反而更高。华为的数据显示,4K超节点组成的10万卡集群,MFU比传统8卡服务器集群高2.75倍。
第二,性能要看实际场景,不能只看峰值算力。科大讯飞的数据显示,深度推理训练效率从对标A800的30%提升至84%以上,MoE模型训练效率从30%提高到93%。这里面有硬件迭代的因素,更有软件栈优化的贡献。
生态差距:CUDA护城河正在被稀释
软件生态是英伟达最深的护城河,也是最难追赶的部分。CUDA经过20年积累,拥有几百万开发者和数万个优化好的库、算子、应用。
国产替代走了两条路线:一是兼容优先(沐曦MXMACA支持6000+ CUDA应用、摩尔线程MUSIFY一键迁移),降低短期迁移成本;二是全栈自研(华为CANN+MindSpore、寒武纪Neuron),长期更自主可控。
一个值得关注的变量是:随着大模型架构进化和新编译器(Triton、TileLang)涌现,前沿开发对CUDA的依赖在减弱。海思首席科学家廖恒认为"软件差距已基本持平" ——这个判断可能偏乐观,但训练端生态差距仍大、推理端迁移成本大幅下降,是基本共识。
落地场景:推理在替代,训练追赶中
| ★★★★☆ | ||
| ★★★☆☆ | ||
| ★★★☆☆ | ||
| ★★☆☆☆ | ||
| ★★★☆☆ |
核心结论:推理端加速替代,训练端仍有代差。 推理场景因为性能要求相对低、业务逻辑相对简单,是国产替代的突破口。训练场景尤其是超大规模预训练,国产芯片仍需1-2代产品的追赶时间。
四、产业链拆解与A股标的梳理
AI芯片产业链可以分为五大环节:芯片设计 → 制造 → 封测 → IP/EDA → 整机服务器。每个环节的商业模式、竞争格局和投资逻辑都不一样。
4.1 芯片设计环节
芯片设计是AI产业链中增长弹性最大的环节,AI算力爆发与国产替代形成双击,2026年国内AI加速器国产化率已突破60%;毛利率普遍50%以上,但研发投入巨大,一款GPU从立项到量产需2-3年、几十亿元投入,技术与生态构成双重门槛。
代表标的:寒武纪(688256)、海光信息(688041)、龙芯中科(688047)。
4.2 先进封装与测试
先进封装是AI芯片产业链中需求增长最确定的环节之一,CoWoS/2.5D/3D等先进封装从"后道工序"升级为"核心环节",2026H1封测三巨头扩产投资合计超200亿元;先进封装溢价能力强,但整体是重资产规模经济行业,越过盈亏平衡点后利润弹性大;工艺与产能壁垒高,客户认证周期长达1-2年,国内企业在全球已有一席之地(长电全球前三)。
代表标的:长电科技(600584)、通富微电(002156)、华天科技(002185)。
4.3 IP与EDA
IP与EDA是芯片产业链的"基础设施",受益于国产替代政策强驱动,但整体市场规模较小、天花板需要时间打开;典型的高毛利轻资产模式(华大九天毛利率近90%),客户粘性极强;但技术壁垒也最高,海外三巨头Synopsys/Cadence/Mentor垄断全球70%以上市场,几十年的积累不是短期能追上的,是产业链"最难啃的硬骨头"。
代表标的:华大九天(301269)、芯原股份(688521)。
4.4 整机与服务器
整机服务器是AI算力落地的最终载体,2026年中国AI服务器市场规模预计达3500亿元,增速可观但低于芯片设计环节;整机利润率较低(浪潮毛利率约12-15%,曙光约27%),靠规模效应赚钱,AI服务器利润率高于传统服务器;壁垒主要在客户关系和供应链管理,马太效应明显,但技术壁垒低于芯片设计。
代表标的:浪潮信息(000977)、中科曙光(603019)。
附:A股核心标的全景表
数据来源:各公司2026年半年报/业绩预告,数据截至2026年8月。"-"表示未获取到该公司2026H1精确数据,建议以公司公告为准。增速为营收/归母净利润同比。
五、发展趋势与投资逻辑
5.1 未来三大发展趋势
趋势一:Chiplet + 先进封装成为缩小代差的关键路径。 在先进制程受限制的背景下,Chiplet(芯粒)架构和先进封装是国产芯片追赶的核心抓手。通过多颗小芯片封装在一起,用"面积换性能"来弥补单芯片制程差距。壁仞BR166已经采用双Die Chiplet封装,华为昇腾910C也是双芯封装,通富微电、长电科技等封测厂在2.5D/3D封装上持续扩产。未来1-2年,Chiplet方案会从"双芯"走向"多芯",封装在产业链中的价值占比将进一步提升。
趋势二:推理需求爆发,端侧+云侧双向增长。 大模型落地进入"用起来"的阶段后,推理算力的需求增速会超过训练。一方面,云端推理需求随着Agent应用、多模态内容生成而爆发;另一方面,端侧AI(手机、PC、汽车、IoT)正在快速渗透,高通、联发科等手机芯片巨头已在All in端侧AI。对于国产芯片来说,推理场景是替代的最佳切入点——性能要求相对低、验证周期短、客户分散、供给约束更大。推理市场的蛋糕在变大,国产份额也在提升,这是双击逻辑。
趋势三:算力基础设施化,国产算力网络加速成型。 AI算力正在从"企业自有资产"变成"社会基础设施"。国家算力枢纽、地方智算中心、运营商算力网络,叠加东数西算工程,正在构建一张覆盖全国的算力网络。这张网用谁的芯片,直接决定了国产替代的速度和深度。目前来看,华为昇腾在政务和国企体系占据优势,寒武纪在互联网和民营算力中心渗透更快,海光在金融能源等传统行业根基最深。谁能成为"算力基础设施的标配",谁就能吃到最大的一块蛋糕。
5.2 投资逻辑
短期(0-12个月):推理场景替代加速,昇腾生态快速放量
推理是国产替代主战场——性能差距小、迁移成本低、验证周期短。华为昇腾凭借全栈能力主导政务/运营商/国企市场;寒武纪凭中立定位拿下互联网大厂订单。
中期(1-3年):训练端逐步突破,BR20X/昇腾960验证客户认可度
壁仞BR20X、华为昇腾960、寒武纪下一代产品将在未来1-2年陆续落地,目标直指大模型训练。如果万卡训练集群MFU达到英伟达方案的70%-80%,训练端替代将加速。关键瓶颈:国产HBM能否如期量产。
长期(3-5年):算力自主可控是战略底线,国产份额长期提升
AI算力是数字经济底座,不可能长期依赖外部供给。从"能用"到"好用"再到"好用且便宜",只是时间问题。赛道长期天花板高,值得持续关注。
六、风险
技术迭代不及预期:AI芯片迭代极快,下一代产品性能或良率不达预期将影响市场份额和盈利。
生态建设缓慢:软件生态是最大短板,开发者生态和应用适配进度制约硬件推广速度。
客户验证周期长:高端芯片进入大客户供应链需长时间验证,放量节奏可能低于预期。
海外技术封锁升级:若出口管制进一步升级(EDA、IP、设备),将影响技术迭代节奏。
行业竞争加剧:国内厂商众多,可能出现价格战和同质化竞争。
HBM供应瓶颈:全球HBM产能高度集中,国产HBM量产进度不及预期将制约产能释放。