写完《国产算力硬件产业链》后,很多人问我:硬件都卷成这样了,算力还有机会吗?
我的答案是:硬件战争才打了上半场,软件战争甚至还没真正开始。
大家都以为芯片是最难啃的骨头,殊不知"买得到硬件,买不到生态"才是真正的卡脖子。如果把算力比作智能手机,硬件是机身芯片,软件就是操作系统——没有好用的系统,再强的硬件也只是能发热的砖头。
今天我们从创业投资视角,聊聊这条被大多数人忽略的黄金赛道。
一、为什么软件才是真正的卡脖子?
很多人把算力软件理解成"驱动程序",就像把安卓理解成"手机开机程序"一样片面。
算力软件是一整套让芯片真正"跑起来"的技术栈:从底层驱动、编译器,到AI框架、算子库,再到调度平台、开发工具——少了任何一层,再强的芯片也只是硅片。
打个最通俗的比方:英伟达CUDA就像手机界的安卓,17年积累了160万开发者、10万+优化算子,几乎所有主流AI模型都基于它开发。而现在的国产算力软件,就像三年前的鸿蒙——硬件准备好了,但生态还在建设初期。
反常识:大家都以为芯片是最大瓶颈,实际上2025年国产AI芯片出货165万张,市占率突破41%(IDC),但国产软件平均适配率不到40%——超过一半的国产芯片买回去跑不满性能,甚至很多模型跑不起来。 |
这就是"买得到硬件,买不到生态"的本质:你可以几个月流片出对标A100的芯片,但不可能几个月建起百万开发者的生态。
国产算力软件栈从下到上分为五层:

目前主要玩家分为五类:- 全栈派:华为昇腾(CANN+MindSpore),唯一建成完整软件栈,开发者突破400万- 框架派:百度飞桨、旷视天元、一流科技OneFlow,专注AI框架层- 兼容派:摩尔线程MUSA、沐曦MXMACA,走类CUDA路线降低迁移成本- 科研派:中科院计算所、清华等,在编译器、基础算子有深厚积累- 创业派:天数智芯、智子芯元等,聚焦特定环节技术突破
2026年的国产算力软件,正处于"从能用走向好用"的关键拐点:基础驱动和框架已有,但算子丰富度、性能优化、开发者体验还差得远——这正是创业者最大的机会窗口。
二、为什么软件爆发就在当下?
2026-2028年是国产算力软件黄金三年,底层逻辑有五个:
第一,硬件先行,软件必须补课。2025年国产AI芯片出货量增200%,但软件适配速度远远跟不上。现在国产芯片平均算力利用率只有30%,70%的性能因为软件优化不到位被浪费了。
第二,CUDA垄断必须打破。英伟达靠CUDA构建的护城河本质是"软件锁定":开发者用惯了CUDA就不愿换芯片。现在高端芯片出口管制,反而给了国产软件"强制断奶"的机会。
第三,大模型对算力效率的极致追求。训练万亿参数大模型一次就要几千万,软件优化提升30%效率,就意味着省几千万真金白银。大模型厂商对算力效率的渴望,已经到了"一分钱掰两半花"的地步。
第四,信创从硬件延伸到软件。以前信创主要换硬件,现在进入"全栈替换"阶段。政务、金融、央企等核心领域,要求从驱动到应用全栈自主可控——这是确定性极强的To G/To B市场。
第五,从"有没有"到"好不好用"的拐点已到。2023-2025年解决"有无问题",2026年开始进入"好不好用"阶段,客户愿意为能让芯片跑满性能、降低使用门槛的软件付费。
三、全链条拆解:五层产业链结构
最底层:驱动、固件与编译器最接近硬件的一层,相当于电脑BIOS和系统内核。代表产品有华为毕昇编译器、寒武纪BangC等。这层技术壁垒最高,基本是芯片厂商自研,创业公司可切入特定场景优化。
基础层:AI框架与算子库相当于手机系统内核,是开发者直接打交道的接口。华为MindSpore、百度飞桨都属这层。算子库是系统里的"基础APP"——CUDA有10万+优化算子,国产普遍只有1-2万个,很多冷门算子缺失,这是目前最大短板。
中间层:调度、优化与分布式训练现在创业最活跃的领域,相当于手机上的系统优化工具。包括:异构算力调度平台(统一管理不同厂商芯片)、推理优化引擎(提升推理速度、降低成本)、分布式训练框架、模型压缩工具。
应用层:行业解决方案与MLOps直接面向最终用户,相当于手机上的各种APP。包括大模型适配工具、垂直行业AI开发平台、MLOps运维工具链。这层离客户最近,付费意愿最强,是行业老兵创业首选。
生态层:开发者与社区最容易被忽略但最重要的一层,相当于应用商店和开发者社区。安卓赢不是因为技术最好,而是因为开发者最多、应用最多。现在国产软件最大短板就是开发者生态——会写CUDA的一抓一大把,会写国产芯片算子的凤毛麟角。
四、钱到底被谁赚走了?
我整理了各环节价值分布:
产业链环节 | 价值占比 | 毛利率 | 技术壁垒 | 竞争格局 |
AI框架与算子库 | 30% | 80%-95% | ★★★★★ | 头部集中,赢者通吃 |
编译器与驱动 | 15% | 75%-90% | ★★★★★ | 芯片厂商自研为主 |
算力调度与中间件 | 25% | 60%-80% | ★★★★ | 创业公司活跃,百花齐放 |
推理优化与工具链 | 20% | 70%-85% | ★★★★ | 细分领域机会多 |
行业应用与MLOps | 10% | 50%-70% | ★★★ | 分散,垂直领域有机会 |
反常识发现:硬件毛利率普遍30%-50%,软件普遍60%以上,核心环节甚至90%+。为什么?因为硬件是一次性买卖,软件是持续收费——卖一块芯片赚一次钱,卖软件授权、订阅费可以年年收。英伟达市值高,不是因为卖芯片赚得多,而是CUDA带来的持续收入和锁定效应。
技术壁垒最高的是AI框架、算子库和编译器,但这不代表创业者没机会——通用框架打不过,可以打垂直场景;通用算子打不过,可以打特定场景的专用算子优化。
现在真正的卡脖子环节:一是CUDA兼容性,存量代码迁移成本太高;二是算子丰富度,10万vs1-2万的差距;三是开发者使用习惯;四是软件优化带来的性能差距。
核心商业逻辑:得生态者得天下。算力软件竞争不是技术竞争,是生态竞争。谁能吸引最多开发者,让最多模型跑在自己平台上,谁就是赢家。这和手机系统竞争一模一样。 |
五、经济性:这门生意怎么赚钱?
算力软件主流商业模式有三种:1. 开源+商业版:基础版开源吸引开发者,企业版收授权费和服务费,是AI框架主流模式2. 订阅制:按算力规模或年收费,调度平台、MLOps工具普遍采用3. 效果分成:帮客户优化算力效率,从节省的成本中分成——帮客户省1000万分200万,客户很愿意买单
现在是典型的"需求爆发,供给严重不足":一边是几万张国产卡的算力中心建起来,跑不满性能急得团团转;另一边是能做适配优化的团队少之又少。成熟的算子优化工程师,年薪已经开到80-150万还抢不到人。
人才缺口有多大?2025年全球算法框架领域人才缺口12万,中国占3.3万,90%集中在国产算力软件方向。高校根本没有对口专业,连系统教材都没有,人才培养速度远远跟不上。
为什么软件毛利率比硬件高?本质是软件边际成本为零:开发一个算子花100万,一个客户用是这个成本,一万个客户用还是这个成本。而硬件每卖一块都要付原材料、生产、物流成本。更重要的是生态网络效应:用的人越多→开发者越多→应用越多→用的人更多,一旦转起来,竞争对手根本追不上。
六、未来趋势与机会
先看市场规模:
年份 | 市场规模 | 国产渗透率 | 核心驱动 |
2025 | 488亿元 | 35% | 硬件出货爆发,基础适配需求 |
2026E | 730亿元 | 48% | 大模型训练推理优化需求爆发 |
2027E | 1080亿元 | 62% | 信创全栈替换,行业应用落地 |
2030E | 2600亿元 | 85% | 生态成熟,端边云协同 |
数据来源:信通院、IDC、行业调研
未来五年市场从500亿增长到2600亿,年复合增速超40%,是典型高速增长蓝海。技术趋势包括:大模型原生框架、异构计算统一编程、AI自动算子生成、端边云协同调度。产业格局将是"一超多强":华为占据最大生态份额,各细分领域跑出专精特新公司,开源成为主流。
六个确定性最强的创业赛道:
1. 特定场景算子优化不要做通用算子库,那是大厂的事。做特定场景优化,比如大模型注意力机制、文生图专用算子、科学计算专用算子。一个好的专用算子能把性能提升2-3倍,客户愿意花大价钱买。
2. 异构算力调度中间件现在没有算力中心只用一种芯片,都是多厂商混布。怎么把不同架构芯片统一管理,像调度水电一样按需分配任务,是所有算力中心的刚需。这个赛道不用做芯片也不用做框架,做好调度就行,目前还没有绝对龙头。
3. 垂直行业MLOps工具链通用MLOps已经很多,但垂直行业的很少。比如金融需要满足合规、可解释、风控要求;医疗需要处理医疗影像、隐私计算。在一个垂直行业做深做透,比做通用工具更容易拿客户。
4. CUDA一键迁移工具现在最大痛点是存量CUDA代码迁移成本太高。如果能让90%的CUDA代码不改或只改几行就能跑在国产芯片上,性能损失控制在10%以内,会被所有算力中心抢着买。
5. 国产芯片推理优化引擎大模型推理成本是训练的好几倍,怎么把推理成本打下来是所有大模型公司最关心的事。vLLM已经证明了方向价值,但国产芯片上的推理优化还做得很不够,针对国产芯片深度优化的引擎商业价值非常明确。
6. 算力软件人才培训人才缺口这么大,做培训本身就是好生意。和高校、芯片厂商合作,做国产算力软件认证培训、实战训练营,输出算子开发、性能优化工程师,既解决行业痛点,又能赚培训费,还能建立人才生态。
当然,这个赛道也不是遍地黄金,三个风险要注意:一是生态赢者通吃,通用层面机会不多,别去做通用AI框架,那是大厂战场,一定要做细分、垂直、场景;二是技术迭代太快,今天先进的技术半年后可能被开源方案替代,要贴近客户需求,不要为技术而技术;三是不要迷信"兼容CUDA",兼容是过渡手段不是目的,完全兼容不可能,最终一定要建自己的生态,一直跟在CUDA后面追没有出路。
回到最开始的观点:硬件是躯体,软件才是灵魂。
国产算力硬件战争已经打出眉目,但软件战争才刚刚开始。这是国产算力的最后一公里,也是最长、最艰难的一公里,更是机会最大、利润最丰厚的一公里。
硬件赚一次的钱,软件赚一辈子的钱;硬件是制造业竞争,软件才是生态竞争。
对创业者来说,现在就是最好的时间窗口——当所有人都盯着硬件卷的时候,转过身去,软件的蓝海里全是机会。
夜雨聆风