ARTICLE · 1060673
2026「燧原科技AI算力」个人研究与分析

国产AI算力深水区 · 技术长文
八年 · 五次流片 · 一次都没有失败
不兼容CUDA的国产芯片,凭什么让腾讯押了八年?
2026燧原科技技术全景 —— 从自主指令集到万卡集群
16万片S60累计出货 | +279%2026上半年营收增速 |
114.6%研发投入占营收 | 1708亿上市首日市值 |
先交代阅读前提:燧原是一家典型的DSA(Domain Specific Architecture,领域专用架构)公司——从第一颗芯片起就自研指令集、自建软件栈,不做CUDA兼容层。这意味着评价它的标准,不能直接照搬评价英伟达的那一套:比单卡算力,更要比架构效率、软件覆盖和集群组网能力。正文15章按技术从业者关心的问题组织,各章独立成篇,可以按需跳读。
要理解燧原,先要理解它所在的路线分支。今天的AI计算芯片大致分成三类:一类是英伟达的GPGPU(通用图形处理器),从游戏显卡演化而来,靠CUDA生态垄断训练市场;一类是华为昇腾、寒武纪、燧原代表的DSA(领域专用架构),为AI计算专门设计芯片,谷歌TPU、亚马逊Trainium也属于这一类;第三类是各家大厂的自研NPU(神经网络处理器),通常只服务自家业务。
DSA路线的核心思想不复杂:把芯片面积和晶体管预算,集中到AI计算真正高频的操作上。通用GPU需要为图形渲染保留3D管线、为科学计算保留FP64单元,这些资源对AI负载基本闲置。DSA芯片直接砍掉这些"通用性税",把省下来的面积用于张量计算、数据搬运和片上存储——代价是除了AI,别的计算几乎做不了。燧原的设计比多数DSA厂商更彻底:它从第一代芯片起就基于完全自主的指令集,不买ARM、不套用现成ISA,连软件栈都从驱动开始自建。
把燧原的技术栈从上到下排开,是一条完整的纵向链条:
图1-1燧原技术栈全景:芯片—板卡—系统—软件—客户,全链条自研
这条链路上有两个关键判断值得单独说。一是燧原不做消费级显卡、不建公有云、不卖算力服务,只面向数据中心交付云端算力——产品形态从芯片、加速卡、模组到整机集群都有,软件栈则跟随硬件交付;二是它的软件栈是"为DSA而生"的,而不是像多数国产厂商那样给CUDA套一层兼容壳。这两个判断决定了后面所有章节的讨论框架:单卡怎么比、软件怎么评、集群怎么组,都要在"DSA + 全栈自研"的坐标系里看。

图2-1两位AMD老兵的起点:2018年,上海一间临时办公室(AI配图)
燧原的故事从人开始。联合创始人赵立东毕业于清华大学电子工程系("EE85"班),在硅谷工作超过20年,先后任职于S3、Juniper Networks和AMD——在AMD负责CPU/APU产品规划与核心IP研发,并参与创立AMD中国研发中心;2014年回国后历任锐迪科微电子总裁、紫光集团副总裁。另一位联合创始人张亚林毕业于复旦大学,在AMD从资深芯片经理做到中国研发中心技术总监,曾领导开发并量产多颗重要产品。业界把他们合称"AMD双子星"——这段履历直接决定了燧原的技术基因:系统级芯片设计能力,以及把大芯片量产化的工程纪律。
2018年3月19日,两人在上海注册成立燧原科技。当时国内AI芯片创业的主流是"兼容CUDA、做英伟达替代品",两位创始人却选了另一条路:不兼容CUDA、自研指令集、自建软件栈。赵立东后来解释过这个选择的逻辑:CUDA并不开源,做兼容意味着永远被动跟随英伟达的版本迭代,架构演进的主动权始终在别人手里。
这条路的第一个里程碑,是2019年12月发布的邃思1.0——首颗国产云端AI训练芯片。此后八年,燧原保持"一年一代"左右的迭代节奏,四代架构、五款芯片全部一次流片成功:
2018.3 —— 燧原科技成立——赵立东任董事长兼CEO、张亚林任总经理,聚焦云端AI芯片;当月获上海科创集团种子轮
2018.8 —— 腾讯领投Pre-A轮3.4亿元——此后A/B/C/D/E轮持续加码,成为第一大外部股东
2019.12 —— 发布邃思1.0 + 云燧T10——当时国内首颗云端训练芯片,FP32 20 TFLOPS,落地之江实验室千卡集群
2021.7 —— 发布邃思2.0 + 云燧T20/T21——3306mm²当时中国最大AI芯片,国内首个HBM2E 64GB单芯片,TF32 160 TFLOPS
2021.12 —— 发布云燧i20(邃思2.5)——第二代推理卡,INT8 256 TOPS,能效比提升3.5倍
2023 —— 第二代产品累计出货超3万片——D轮融资,腾讯债转股加码
2024.6 —— 燧原S60量产(邃思320)——第三代推理卡,MCM封装+Chiplet,此后成为绝对主力;战略转向「推理先行」
2024.12 —— 庆阳万卡推理集群建成——1252台服务器+10016张S60;E轮融资投前估值约175亿元
2025.7 —— 发布邃思400 + 燧原L600——第四代训推一体模组,144GB/3.6TB/s,原生支持FP8,对标H20
2026.7 —— WAIC发布云燧ESL64-O超节点——OEX正交无背板、0线缆、单机柜64卡、可扩展16384卡
2026.9.11 —— 登陆科创板——发行价142.18元,首日收涨179.22%、市值1708.5亿元;截至9月18日市值2225.48亿元
图2-2燧原发展时间轴(2018–2026):八年四代架构,从一颗训练芯片到万卡集群
八个节点里,有三个对理解燧原的技术路线最关键。第一个是邃思2.0(2021年7月):57.5mm×57.5mm、面积3306mm²,是当时中国面积最大的AI计算芯片,采用2.5D立体封装整合9颗裸芯片,达到日月光2.5D封装极限;FP32 40 TFLOPS、张量TF32 160 TFLOPS均为当时国内第一,同时是中国第一个支持HBM2E和单芯片64GB内存的AI芯片。这颗芯片证明了燧原"用成熟工艺+超大芯片+先进封装"做性能的能力——这个技术路线在后续所有代际里一以贯之。
第二个是燧原S60(2024年6月量产):第三代推理卡首次采用MCM(多芯粒)封装,把两颗同构芯片合封(Chiplet方案),片上通过NoC(Network on Chip)互联,集成多个GCU-CARE计算核心,还内置了多核ARM Cortex A55和RISC-V处理器核,以及硬件视频解码单元。更重要的是产品战略的转向:第三代只有推理卡、没有同代训练卡——"推理先行"从这一代开始成为燧原的路线。
第三个是邃思400 + L600(2025年7月27日发布):历时两年半开发,原生支持FP8低精度计算,144GB存储、3.6TB/s存储带宽、800GB/s互联带宽,是燧原第一款训推一体的第四代产品,直接对标英伟达H20。它的意义不只是参数——它宣告燧原要从"推理卡公司"向"训推一体系统公司"升级。
燧原官方把产品体系按代际划分为四代:第一代(邃思1.0 + 云燧T1X训练系列 / i1X推理系列)、第二代(邃思2.0/2.5 + 云燧T2X / i2X)、第三代(邃思320 + 燧原S60推理卡)、第四代(邃思400 + 燧原L600训推一体模组)。下面这张表把各代芯片与产品的关键参数一次摆齐(邃思320/400部分参数官方未完整公开,已标注第三方口径):
| 邃思1.0 | |||||
| 邃思2.0 | |||||
| 邃思2.5 | |||||
| 邃思320 | FP16 128 TFLOPS | 48GB | |||
| 邃思400 | 144GB |

图3-1燧原8年产品迭代时间线:邃思1.0(2019)→2.0(2021)→2.5 →S60(2024)→L600(2025)→第五代展望(2027)(资料图,来源:燧原科技)
邃思1.0是燧原技术路线从纸面到硅片的第一次验证。它的微架构是典型的AI众核设计:整个SoC集成 32个GCU-CARE计算引擎,组成4个计算群组,全面支持FP32/FP16/BF16、INT8/INT16/INT32等常见张量数据格式——2019年就支持BF16,是当时少有的前瞻性选择。配套的云燧T10训练加速卡功耗约190W(最大),FP32算力20 TFLOPS,自研ESL高速互联提供200GB/s片间带宽,可支撑E级数据中心的大规模训练。
这颗芯片的第一个重量级客户是之江实验室,后者用它构建了千卡级AI液冷算力集群。对一家成立不到两年的创业公司,这是当时国内极少见的"训练芯片一次商用"案例——也是燧原"工程纪律"的最初证明。
邃思2.0是燧原技术上最"用力"的一代。为了在12nm成熟工艺上做出媲美先进制程的性能,燧原选择了"大芯片 + 先进封装":57.5mm×57.5mm、面积3306mm²(当时中国最大),通过2.5D立体封装整合9颗裸芯片,把日月光2.5D封装能力用到极限。架构上,邃思2.0升级为全自研的GCU-CARE全域计算架构,引入数据流计算加速引擎——在数据搬运的过程中就能计算,把"算得快"和"搬得省"结合起来,这是它能在能效上对标同期7nm产品的关键。
算力端,FP32 40 TFLOPS、张量TF32 160 TFLOPS均为当时国内第一;内存端是国内第一个支持HBM2E和单芯片64GB高带宽内存的AI芯片(1.8TB/s)。配套的云燧T20/T21基于OCP OAM标准设计,配合第二代GCU-LARE全域互联(双向300GB/s),可支持数千张卡互联。第二代训练与推理芯片累计出货超3万片,是燧原从"做出芯片"走向"规模出货"的关键一代。
同代的云燧i20(邃思2.5)则把目标从训练切到推理:INT8算力256 TOPS,能效比提升3.5倍,主打广告、搜索、推荐等传统AI场景。这一代的经验直接影响了第三代的产品决策——推理市场的需求比想象中更早到来。
S60是燧原当下真正打开市场的产品,也是技术路线转折的载体。基于邃思320芯片,S60有几个此前没有的技术特征:
业界普遍认为S60对标英伟达L40S,主打大模型推理、广告搜索推荐、多模态AI业务。截至2026年9月,S60累计出货16万片,支持超300个应用场景,适配联想、新华三、超聚变等主流服务器,服务腾讯、美图等客户,覆盖10亿级终端用户——在国产AI加速卡落地规模上进入第一梯队。
L600是燧原2026年的新主角,也是它从"推理卡公司"走向"训推一体"的关键产品。OAM标准形态,144GB存储容量、3.6TB/s存储带宽、800GB/s互联带宽,原生支持FP8低精度计算——FP8是2025年后大模型训练的主流低精度格式(DeepSeek训练即采用FP8),支持FP8意味着L600能显著降低训练的内存占用和功耗。
据路演披露,L600已回片但尚未大规模量产交付,正在联合客户推进大模型训练领域应用研发,预计2026年内完成小规模产品交付、2027年大批量交付。它的战略意义在于:既能做大模型推理,又能做微调与预训练,未来用于支撑万卡、十万卡超大算力集群。

图3-2燧原S60加速卡实拍:这颗卡撑起了燧原2025年超过八成收入(资料图,来源:华龙证券研报/燧原科技)

图4-1专用AI芯片的内部世界:矩阵计算单元如街区般密集排列——把面积都留给AI计算(AI配图)
燧原硬件技术的第一层护城河,是把"地基"握在自己手里。指令集是计算机软硬件生态的"宪法"——x86统治了PC、ARM统治了手机,谁掌握指令集,谁就掌握生态入口。燧原从第一代芯片起就基于完全自主的指令集设计,不买ARM、不套用任何现成ISA。在指令集之上,它原创了两套关键IP:GCU-CARE加速计算单元(对标英伟达Tensor Core的张量加速单元)和 GCU-LARE全域互联技术(对标NVLink的卡间高速互联,第二代双向带宽达300GB/s)。
把一枚GCU放到显微镜下,计算单元延续了AI芯片通用的"三级流水"组织方式:张量计算(Tensor,一次算一整块矩阵,AI计算主力)、向量计算(一次处理一整段数组,如激活函数)、标量计算(单个数字的运算,如循环计数)。以邃思1.0为例,整个SoC集成32个GCU-CARE计算引擎、组成4个计算群组——这种"多引擎 + 群组化"的设计,是燧原为大规模并行计算准备的硬件基础。
GCU-CARE针对张量运算做了深度优化,配合数据流计算加速引擎(在数据搬运的过程中就能算),把"算得快"和"搬得省"结合起来。AI计算最怕的是"算得快但数据喂不上"——数据搬运往往占掉AI芯片大部分功耗,数据流引擎直接决定能效比。这是燧原"S60在推理场景能效比有竞争力"口碑的技术来源。
存储是AI芯片的另一条主线。邃思2.0起采用HBM2E高带宽内存(国内首个),把显存堆到64GB、带宽做到1.8TB/s;邃思400的L600进一步把存储做到144GB、带宽3.6TB/s——大显存意味着大模型参数可以更多留在片上、减少去片外搬数据的次数,这对MoE这类千亿参数模型至关重要。
精度支持上,前代产品覆盖FP32/FP16/BF16/INT8/INT16/INT32;S60支持FP32/FP16/BF16/INT8(不支持FP8);L600开始原生支持FP8。FP8是2025年后大模型训练的主流低精度格式,把训练的内存占用和功耗显著压低——支持FP8,是L600能在训练场景站住脚的前提。
互联是燧原技术主线的第三块拼图。第一代产品自研ESL高速互联(200GB/s);第二代GCU-LARE升级到双向300GB/s、支持数千张卡互联;2026年7月WAIC上,燧原联合中兴通讯发布云燧ESL64-O超节点——OEX正交无背板设计实现"0线缆"连接,单机柜集成16个计算节点、共64卡,可扩展到16384卡集群,CPU、交换芯片、网卡芯片均基于国产化产业链。这套从"卡间互联"到"超节点"再到"万卡集群"的系统能力,是燧原对标英伟达DGX体系的野望所在(详见第7章)。
燧原最反主流的地方,是把前两代芯片都做在格芯12nm成熟工艺上——邃思1.0(141亿晶体管)、邃思2.0(3306mm²、9裸片2.5D)、邃思2.5(55mm×55mm)全是12nm。为什么不用7nm?两个原因:一是成本——12nm成熟工艺的流片和量产成本远低于先进制程,对现金流吃紧的创业公司是现实选择;二是设计——通过超大芯片面积 + 先进封装堆性能,绕开对先进制程的依赖。燧原官方的说法是:邃思2.5基于12nm工艺,通过架构升级提高单位面积晶体管效率,可实现与同期7nm GPU相匹敌的计算能力。
直到邃思320、邃思400,制程都没有公开。市场普遍推测其延续"成熟制程 + 先进封装"路线,并推进供应链国产化——这条"绕开先进制程依赖"的技术路线,是理解燧原全部优势和全部风险的钥匙(详见第9章)。

图5-1软件栈像一栋「楼」:每一层都有人住,最顶上的开发者不用关心底层怎么运转(AI配图)
硬件和互联搭好了,真正卡住人的往往是软件。燧原的AI计算及编程软件平台叫驭算TopsRider,地位相当于英伟达的CUDA——但有一个根本差异:它不为兼容CUDA而生,而是为释放自家DSA芯片的潜能而生。招股书披露,驭算平台通过软硬件协同架构设计,深度协同释放DSA架构在AI计算场景下的硬件潜能,实现远超传统GPGPU硬件的能效比与计算吞吐量。
图5-2驭算TopsRider软件栈:从驱动到集群,全栈自研才能让DSA芯片"能用"
TopsCC 是燧原给专家开发者的编程入口:通过扩展C++ 并提供一套运行时库,让开发者以类C++ 的方式对GCU编程,可以操作标量和多维数组,定义执行模型和存储模型,简化数据切分和数据流操作。对应到英伟达生态,TopsCC的角色类似nvcc + CUDA C。
TopsGraph 图编译器负责把AI框架的计算图做解析、转化和优化(算子融合、内存规划、精度处理),用统一的Graph IR适配不同AI框架——这一层是"迁移成本可控"的关键,因为主流框架的模型经过图编译器后,大部分算子可以由系统自动映射,不需要开发者手写。
TopsAten 算子库是"现成的动作包":招股书披露,驭算平台深度适配大量AI模型和应用场景,可以提供约1600个深度优化的AI加速算子。对技术团队来说,这个数字决定了"常用模型能不能开箱即用"——1600个算子覆盖了绝大多数主流模型的基本操作。
ECCL 通信库配合GCU-LARE,解决多卡并行训练和推理的通信瓶颈,对应NCCL的角色。此外,2025年5月燧原发布了 TritonGCU 编程指南——支持Triton方言,让熟悉Triton的开发者能更快上手GCU,这是燧原降低编程门槛、向开源生态靠拢的重要一步。
生态进展是燧原软件最需要正视的现实。与腾讯的深度合作中,燧原持续针对互联网AI主流场景、模型和算子进行软件平台的深度适配——搜广推、大模型推理是它打磨最深的场景。2025年2月,燧原实现全国各地智算中心DeepSeek模型的全量推理适配,让"燧原卡能跑DeepSeek"成为可验证的事实。
但差距同样醒目:CUDA生态沉淀了20年、全球600万开发者,而燧原的驭算平台开发者规模约8.7万人——不到CUDA的2%。真正的鸿沟不在技术,在社区:第三方工具、教程、问答闭环都还差得远。与技术负责人沟通时,这一点往往比单卡性能更值得在意。
软件栈讲完,技术负责人心里多半只剩一个问题:我那套CUDA代码搬到燧原要多久?先说结论:与"兼容CUDA"的厂商不同,燧原不提供CUDA兼容层,CUDA代码不能直接跑在燧原卡上,必须做真正的迁移。先看两套体系的对应关系——大部分映射仍然直白,但"对应"不等于"兼容":
一次真实迁移,大概要走四步:① 搭环境验证设备可用(燧原提供软件栈文档与安装工具);② 模型导出/转换——用主流框架的模型导出工具把模型搬到GCU,PyTorch等框架适配层已打通,纯框架调用部分成本可控;③ 算子对齐——用profiling工具找出缺失或低效的算子,用TopsCC重写自定义算子;④ 性能调优——图编译、算子融合、混合精度、INT8量化。燧原宣称其平台"易迁移易部署",在腾讯等客户的搜广推和大模型场景中经过了大规模验证。
比技术更难的是"敢不敢"。36氪对燧原的一句评价很扎心:"真正愿意和燧原从零开始适配的客户,需要很大的勇气。"这勇气来自三处——信任它的技术路线能跑通(8年5颗芯片一次流片成功的工程履历)、信任它有持续投入软件的能力(上市募资61.19亿元中有33亿投向软硬件协同创新项目)、信任它的生态会滚起来(TritonGCU、PyTorch适配、开源社区动作不断)。对客户来说,迁移不是一次性成本:新模型发布后,适配的及时性和算子覆盖的跟进速度,才是长期持有的隐性成本。
落到操作层面,给技术负责人三句话:如果你的业务是拿开源PyTorch模型做推理部署,且模型以主流架构为主(搜广推、大模型推理、多模态),燧原的迁移成本其实可控——1600个深度优化算子覆盖了绝大多数常用动作,腾讯等客户已经验证了大规模落地;真正费钱的是三类团队:写了大量自定义CUDA Kernel的(每个私有算子都要用TopsCC重写)、对训练生态要求极高的(大规模预训练工具链仍在追赶)、以及依赖CUDA第三方库的(CUDA生态的现成组件在GCU上不可用)。推理场景经过验证可以上,训推一体等L600生态成熟后再上量——这也是2026年多数客户的实际选择。
芯片做出来了,卡也做出来了,真正拉开差距的是"把几千张卡连起来干活"的系统能力。大模型竞赛进入"万卡时代"后,系统能力的重要性超过单卡——这是燧原用超节点补课的战场。
燧原的互联能力分三级。第一级是卡内/卡间高速互联:自研ESL高速互联(第一代200GB/s)演进到GCU-LARE(第二代双向300GB/s),支持数千张卡互联。第二级是超节点:2026年7月WAIC上发布的云燧ESL64-O,采用OEX正交无背板设计,计算节点与交换节点垂直交叉互连,实现"0线缆"——单机柜集成16个计算节点、共64卡,通过正交连接器与单级交换拓扑,大幅降低互联成本和系统故障点,整机部署周期从天级缩短到分钟级。第三级是万卡集群:ESL64-O可扩展到16384卡集群,CPU、交换芯片、网卡芯片均基于国产化产业链。
超节点是2026年的新武器,庆阳万卡集群则是燧原系统工程能力的既有证明。2023年11月燧原落地庆阳;2024年7月底与亿算智能合作投资3.07亿元,在庆阳"东数西算"枢纽节点建设国产万卡推理集群;2024年8月中国移动联合点亮;2024年12月集群正式建成——1252台国产推理服务器、10016张燧原S60算力卡,形成2500 PFlops推理算力,从启动、点亮到建成仅用半年,被称为"庆阳速度"。初期芯片利用率67%,经算子优化、通信协议重构、框架适配后提升至90% 以上。
这个数字值得停下来看一眼:利用率从67% 到90%+,靠的不是换硬件,而是软件栈与系统层的持续调优——算子优化提升单算子效率、通信协议重构降低集合通信开销、框架适配消除模型加载瓶颈。对技术团队来说,这比单卡跑分更能说明一家公司的系统能力。
图7-1燧原集群产品矩阵:从标准化系统到超节点,覆盖不同部署阶段
公允地说,超节点2026年7月才发布、尚在推广期,与英伟达NVLink + InfiniBand的十万卡成熟体系还有工程差距;燧原也持续探索NPO光互连等下一代技术。但方向是对的:国产算力竞争已经从"单卡比拼"进入"系统级较量",提前布局超节点的厂商,在下一轮集群招标里会有明显先发优势。
燧原最让外界困惑的决策,是第三代产品只有推理卡、没有同代训练卡——这与前两代"训练 + 推理并重"明显不同。公司自己的解释是:第三代产品立项时生成式大模型还没爆发,国内AI市场以传统模型和搜广推为主,推理是最先放量的市场;而DeepSeek这类MoE大模型的出现,又让"推理算力"的需求暴增。于是燧原把火力集中到推理上,先拿收入、再反哺训推一体。
从产品形态看这个判断是成立的。S60的技术设计处处为推理优化:48GB大显存让更多模型参数留在片上、减少访存;INT8量化支持让传统搜广推模型跑得又快又省;硬件视频解码单元直接服务多模态场景;MCM封装和NoC架构则保证在大规模部署下的良率与成本。截至2026年9月,S60累计出货16万片——在国产推理卡里,这是规模最大的单一产品之一。
这个战略的商业意义也很直接:推理卡单价低、走量大、交付快,能让公司在研发持续烧钱的同时尽快形成收入现金流;等收入盘子起来,再拿钱反哺训推一体产品迭代。L600就是这套战略下的下一代产品——2026年小规模交付、2027年放量,届时燧原才真正进入训练市场的腹地。

图9-1一枚晶圆上的「考试」:良率高,芯片才便宜——这是所有国产大芯片共同的关卡(AI配图)
与寒武纪、摩尔线程不同,燧原目前没有被列入美国实体清单——这是它供应链叙事的第一块基石。但"没被列清单"不等于"供应链自由":招股书明确披露,部分关键原材料/服务环节存在一定依赖境外供应商的情况,出口管制或供应紧张情形下存在采购受限风险。燧原的供应链处境,用三句话就能说清。
其一,制造端押注"成熟工艺绕行"。邃思1.0、2.0、2.5三代芯片都在格芯(GlobalFoundries)12nm成熟工艺上量产——12nm不涉及EUV光刻,不在美国对华先进制程管制范围内,这是燧原能够持续流片的前提;通过超大芯片面积(3306mm²)+ 2.5D先进封装堆性能,绕开对7nm以下先进制程的依赖。第三代邃思320、第四代邃思400的制程官方未披露,市场普遍推测其延续"成熟制程 + 先进封装"路线。燧原背后还有国投IC基金的产业棋局:国投IC基金依托被投产业资源,协助燧原对接国内优质稀缺供应链产能——先进制程代工、HBM高带宽存储器、先进封装、高速互联等一批项目,成为燧原芯片国产化落地的上游关键配套。
其二,存储端受HBM管制约束。2024年12月美国收紧对华先进HBM出口管制,而燧原的高带宽内存(HBM/HBM2E)长期依赖海外供应——S60的48GB、L600的144GB都要靠HBM类内存支撑。这意味着燧原与所有国产大算力芯片厂共享同一个"瓶子口":HBM的供应、价格与合规路径,决定它能不能按时把芯片做成卡、把卡交付出去。国产HBM(如长鑫存储HBM3)2026年才进入量产爬坡期,供应与质量都有不确定性。
其三,封装与产能的国产化布局。燧原的先进封装(2.5D、MCM)依赖日月光等封测厂;S60产品线已获得"高性价比供应链的完全产能保障"。WAIC 2026上,燧原还与先封科技发布了适配AI算力芯片的CoPoS(Chip-on-Panel-on-Substrate)面板级先进封装样品——面板级封装比晶圆级封装面积更大、成本更低,是下一代大芯片封装的重要方向。
产能数据同样值得看:2023–2025年,燧原AI加速卡及模组产量分别为24,795张、49,422张、74,159张,产销率分别为99.46%、76.98%、89.44%——产能三年接近翻三倍,产销率保持在较高水平,说明需求是真实的。
聊完技术,回到一个商业上最反直觉的问题:腾讯自己都用英伟达,为什么还要花大钱养一家不兼容CUDA的芯片公司?答案藏在燧原的商业结构里——它是国产AI算力里最典型的「深度绑定式」供应商:从股权到业务都押在一家互联网巨头身上的"单一大客户模式"。
先说股权。发行前,腾讯科技(上海)直接持有燧原7726.70万股、持股19.9493%,一致行动人苏州湃益持股0.3087%,腾讯系合计持股20.2580%,是第一大外部股东;上市时腾讯系又通过上海启善在战略配售中出资2.48亿元获配174.71万股。再看业务:2019年双方开始业务合作,经历多代芯片迭代,腾讯愿意投入算法团队、承担模型迁移适配成本,陪着燧原打磨软硬件产品。2023年、2024年、2025年,燧原对腾讯的关联销售占营收比例分别为33.34%、37.77% 和74.9%–83.79%(市场报道口径差异来自对腾讯关联方的统计范围)。
腾讯图什么?拆开看有三层。第一层是战略卡位:中美博弈背景下,国产算力是确定性方向,腾讯需要一个自己"说了算"的芯片供应商,而不是把底座全部押在华为(同时是云业务竞争对手)或寒武纪(不受自己控制)身上;第二层是成本与议价:招股书披露,2025年燧原向腾讯销售的同类AI加速卡价格低于向非关联第三方销售的价格——大客户带来规模订单,也带来更强的议价能力;第三层是陪练价值:腾讯把搜广推、大模型等真实业务场景开放给燧原做适配战场,帮燧原把软件栈磨到"能用"——这份"场景红利"是钱买不来的。
对燧原而言,这个模式是双刃剑。好处显而易见:稳定的订单、真实的场景、敢于陪你适配的超级甲方——没有腾讯,不兼容CUDA的路线可能根本走不到今天。坏处同样刺眼:超过八成收入来自一个关联客户,意味着增长叙事高度依赖腾讯的采购意愿;一旦腾讯自研芯片放量、或削减采购、或要求继续压价,燧原的营收和毛利都会剧烈波动。上交所问询函专门追问了这个问题,燧原的回复是:已在拓展其他互联网客户,第四代产品已通过多个潜在客户的硬件及模型匹配,正在推进灰度测试,预计2026年内完成小规模交付、2027年大批量交付。
收入结构上,2025年AI加速卡及模组收入8.56亿元(占主营业务收入86.83%),智算系统及集群、IP授权及其他占剩余部分。毛利率2025年31.78%,在"GPU五小龙"中最低——因为它没有生态溢价,又要为规模出货支付代工和存储成本,还要给大客户让利。盈利时间表上,招股书预计:在生产经营不受到国际贸易摩擦等不可抗力的重大影响的前提下,公司有望在2026年或2027年实现合并报表盈利,具体取决于2026年收入达成率和毛利率水平。
燧原的财务史,是一部典型的芯片创业烧钱样本:从2018年成立到2026年上市,累计亏损超过58亿元(2022年至2026年一季度口径)。2022年净亏损11.16亿元;2023到2025年,营收从3.01亿元涨到9.90亿元(复合增长率81.32%),归母净利润却三年累计亏掉约43.4亿元——收入在增长,亏损在收窄,但距离盈利仍有距离。2026年出现关键转折:上半年营收11.20亿元、同比增长279.08%,半年就超过了2025年全年。
| -11.16 | ||||
| +234.3% | -16.65 | |||
| +139.9% | -15.10 | |||
| +37.1% | -11.64 | |||
| 2026H1 | 11.20 | +279.1% | -6.32 | 半年超去年全年,营收创新高 |
亏损的钱花在哪里?主要去向是研发。2025年研发投入11.35亿元,占营收114.63%——全年研发投入比全年收入还多。费用端:销售费用1.38亿元(占13.90%)、管理费用1.75亿元(占17.71%)、财务费用856万元。经营现金流 -9.65亿元,报告期三年经营现金流累计净流出39.72亿元——扩张与运营几乎完全依赖外部输血。
研发投入的用途,从募资投向可以看得很清楚:上市募资61.19亿元中,约33亿元投向"先进人工智能软硬件协同创新项目"(超万卡集群核心技术、软件栈研发),第五代芯片项目15.03亿元、第六代11.97亿元——钱从资本市场来,再流向上游供应链和研发,这是燧原维持"一代一代迭代"节奏的底气。按照产品规划,燧原计划2027年推出第五代云端AI芯片、2029年发布第六代系列芯片。
2026年一季度的负债变化是另一个观察点:一季度末负债总额90.00亿元,较2025年末13.75亿元单季暴增76亿元(+554.58%),公司解释为预收客户款项和银行借款预付上游产能——即"锁产能的入场券",先给上游下大单、付预付款,才能保证未来几个季度交付。乐观方说这是"订单驱动的战略备货",谨慎方说一季度营收只有2.87亿元、难以解释负债暴增——两种说法都成立,区别在于你押注的是"国产算力紧缺持续多久"。
把视野拉远,燧原从来不是独自长大的。2025年中国AI加速卡总出货量约400万张,英伟达出货约220万张、份额约55%,国产厂商合计约41%;燧原2025年AI加速卡及模组销量约6.6万张,对应国内市场份额约1.7%。但"GPU五小龙"(摩尔线程、沐曦、壁仞、天数智芯、燧原)的集体上市,让这个市场第一次有了横向比较的标尺。
技术路线:GPGPU兼容 2025营收:16.44亿 2026H1:13.24亿 毛利率:56.51% 代表产品:C500/MXC500 | |
技术路线:全功能GPU 2025营收:15.06亿 2026H1:17.36亿 毛利率:65.57%(年报口径) 代表产品:MTT S4000 | |
技术路线:GPGPU 2025营收:10.35亿 2026H1:12.36亿 毛利率:53.84% 代表产品:BR100/BR300 | |
技术路线:GPGPU 2025营收:10.34亿 2026H1:9.46亿 毛利率:53.99% 代表产品:智铠100 | |
技术路线:DSA(不兼容CUDA) 2025营收:9.90亿 2026H1:11.20亿(+279%) 毛利率:31.78% 代表产品:S60/L600 |
五个横向坐标,燧原的位置立刻清楚:成立最早(2018)、最晚上市;营收最小(2025年9.90亿)、增速最快(2026H1 +279%);毛利率最低(31.78%)、客户最集中;出货量不落后(约6.6万张,与沐曦并列);估值倍数最高(静态PS超200倍)。更关键的是路线差异:摩尔线程做"全功能GPU"(AI+图形+科学计算)、沐曦走GPGPU兼容路线、壁仞主打训练GPU、天数智芯做通用GPU——只有燧原(以及华为、寒武纪)坚持DSA专用架构、且完全不做CUDA兼容。
路线的差异决定了评估方式的不同。GPGPU厂商的竞争维度是"兼容性 + 单卡算力 + 性价比",生态由CUDA免费提供;DSA厂商的竞争维度是"架构效率 + 软件栈完整度 + 系统组网能力",生态要自己从零建。市场给燧原的最高估值倍数,某种程度上是在为"唯一不借英伟达地基造芯"的稀缺性付费——但这条路也意味着,它的每一分软件投入都要自己出钱,短期内毛利率必然被拖低。
除了五小龙,牌桌上还有更重的对手。华为昇腾是"全栈 + 云"的垂直霸主,自研芯片 + CANN + 超节点 + 华为云,是国产份额第一;寒武纪是"中立第三方"的DSA玩家,2025年已实现全年盈利;海光走x86 + CUDA兼容路线,在服务器市场两线布局。未来两到三年,国产算力大概率是"昇腾第一、寒武纪与沐曦/摩尔在腰部竞争、燧原靠大客户绑定守位"的格局——燧原能否守住位置,取决于比对手更快的产品迭代和更早的盈利兑现。

图13-1三条技术路线:GPGPU(通用)、NPU/DSA(专用),从左到右越来越「专」;燧原站在最右端(AI配图)
把燧原放到全球坐标系里,最有价值的比较不是"谁更强",而是三个不同层面的技术对照——单卡性能、系统能力、生态厚度。这三个坐标系里,燧原的位置完全不同。
坐标系一:单卡。燧原S60对标英伟达L40S(同为数据中心大模型推理卡,S60 FP16约128 TFLOPS、48GB显存、无FP8、无卡间互联),L600对标英伟达H20(144GB显存、3.6TB/s带宽、支持FP8、800GB/s互联)——在推理场景,燧原的大显存和INT8优化让它在性价比上有竞争力;但训练场景仍是短板:英伟达GPU + cuBLAS/cuDNN对各类模型的训练优化沉淀了十几年,燧原的L600训推一体生态2026年才刚开始。概括:推理可以一战,训练仍在起步。
坐标系二:系统。英伟达有NVLink + InfiniBand + DGX SuperPOD,一张卡到十万卡集群无缝扩展;华为有超节点架构(昇腾910C集群方案),主打万卡级互联;燧原有自研GCU-LARE互联 + 云燧ESL64-O超节点(OEX正交无背板、0线缆、单机柜64卡、可扩展16384卡、全链路国产化)——方向对了,但ESL刚发布、尚在推广期,千卡到万卡集群的工程成熟度、分布式训练框架适配、故障运维工具链,都与前两者有差距。
坐标系三:生态。英伟达CUDA是"事实标准",600万开发者、20年沉淀,几乎所有AI框架、工具、模型都原生支持;华为CANN + MindSpore + 昇腾社区加上PyTorch官方支持,是国产头部生态;燧原驭算TopsRider全栈自研、约1600个深度优化算子、8.7万开发者,正在通过TritonGCU、PyTorch适配、开源动作把门槛压下来,但开发者规模、第三方工具、故障排查文档仍不在同一量级。给个公允的排序:单卡上燧原紧咬L40S/H20,系统上刚补齐超节点拼图,生态上落后不止一代——但"落后"不等于"不能用",在国产替代的约束下,"够用 + 可得 + 有人陪练"本身就是核心竞争力。
单卡算力:L40S推理卡、H20训推卡,CUDA生态加持 强项场景:训练+推理全场景 互联与集群:NVLink+IB,十万卡体系 软件生态:CUDA事实标准,深度最厚 可获得性:对华高端受限,供给稀缺 | |
单卡算力:FP16约800TFLOPS(第三方口径),国产头部水平 强项场景:全栈部署、政企智算中心 互联与集群:超节点万卡级方案 软件生态:CANN+MindSpore,国产最强 可获得性:自用优先+政企,公开供给有限 | |
单卡算力:S60对标L40S(FP16约128TFLOPS);L600对标H20(144GB) 强项场景:推理能效、大显存单卡、搜广推与大模型推理 互联与集群:GCU-LARE+ESL64-O超节点(16384卡扩展,2026年发布) 软件生态:驭算TopsRider全栈自研,约1600算子,8.7万开发者 可获得性:第三方可采购,大客户绑定(腾讯为主) |
智算中心、政企大模型、行业AI项目里,燧原S60/L600已经越来越常出现在投标名单中。但这家公司恰好是「大客户绑定 + 官方披露克制 + 新老产品交替」三重合体——招标参数怎么定、验收标准怎么设、合同怎么签,处处有讲究。下面七件事,是采购方最容易踩坑的地方。
2026年国产大算力芯片整体供不应求,燧原的S60产能紧俏,第四代L600则处于"已回片、未大规模量产"状态——预计2026年内小规模交付、2027年大批量交付。发标/立项前必须先做三件事:确认目标型号的交期(S60有现货逻辑、L600别指望短期大批量)、确认供应商的交付节奏与调价机制(HBM成本上涨会传导到整卡)、给备选供应商留通道(寒武纪、昇腾、海光、沐曦等都可能在同一批应标名单里)。
邃思320/400的算力、制程官方未完整公开,S60的FP16算力(约128 TFLOPS)也是第三方口径,所以招标参数建议写「可运行XX代开源模型推理」「支持PyTorch X.X」这类功能指标,或要求投标方提供实测报告,而不是硬套第三方数值。评审时务必用自己的真实业务模型做POC(概念验证):看吞吐、时延、MFU(模型算力利用率)、低精度切换后的精度表现、算子覆盖(自定义算子要用TopsCC重写);同时分清推理与训练——S60是纯推理卡(无FP8、无卡间高速互联),大规模训练请等L600生态成熟、先上小集群验证再放量。
燧原不兼容CUDA,CUDA代码不能直接迁移——这是与寒武纪(同样DSA但提供部分迁移工具链)、海光(CUDA兼容)核心区别。采购预算里务必单列软件适配项:模型迁移(框架适配层已打通,纯框架调用成本可控)、自定义算子重写(TopsCC,每个私有算子都要重写)、性能调优(图编译、算子融合、INT8量化)、以及长期适配成本(新模型发布后,适配及时性取决于厂商跟进速度)。建议在合同中明确厂商的适配支持责任与响应SLA。
燧原的HBM等关键物料仍依赖境外供应(招股书已披露出口管制风险),采购合同至少应覆盖四类条款:供应稳定性承诺(产能保障与备货安排)、交付周期与违约(排产紧张,交期条款是刚需)、价格调整机制(HBM涨价如何分担)、维保与支持(固件/驱动更新、原厂支持、故障响应SLA)。同时确认燧原产品是否在项目所在地的采购目录/名录(各地规则不一,发标前核实)。
验收环节最容易出现"纸面过了、落地翻车"。建议把验收拆成四层:性能验收(用合同约定的真实模型与数据集跑通,并达到约定吞吐/时延指标)、兼容性验收(指定PyTorch版本、推理框架、操作系统)、服务验收(文档、培训、工具链交付完整)、稳定性验收(连续运行约定天数无故障)。付款节奏与里程碑挂钩:到货、验收、稳定运行期各占一部分。
燧原当前在售主力是S60(推理)与L600(训推一体,2027年放量),老一代云燧T2X/i2X已逐渐退出增量市场。先把优劣势摆上桌,再决定牌怎么打。
优势:48GB大显存、INT8优化强、能效比好、出货16万片验证充分 劣势:无FP8;无卡间高速互联;不支持CUDA直接迁移 适合谁:大模型推理、搜广推、多模态推理、智算中心推理集群 | |
优势:144GB大显存、3.6TB/s带宽、支持FP8、800GB/s互联,对标H20 劣势:2026年小规模交付、2027年才放量;生态刚起步 适合谁:训推一体、千亿参数模型、超节点集群建设 | |
优势:训练(T20/T21)与推理(i20)产品成熟、成本低 劣势:算力天花板低,已非主力出货 适合谁:存量升级、成本敏感的中小模型场景 |
燧原不是整机厂,它的"中标"有两种形态,采购方必须分得清:芯片/板卡直接供货(卖给整机厂或集成商)和智算系统及集群交付(以燧原为项目总集成商)。近年公开案例:
读到这里,不同身份的人带着不同的问题。这里给三条快速路径:
最后,说两句总结。燧原的技术画像可以浓缩成一句话:它是一家把「别人的地基」换成「自己的地基」的公司——自主指令集、GCU-CARE计算引擎、GCU-LARE互联、驭算软件栈、超节点集群,五层都是自己写的。这套路线的代价是前期慢、毛利低、生态薄;收益是架构自主、可深度优化、不受外部授权约束。8年5颗芯片全部一次流片成功、万卡集群利用率做到90%+,是这套路线工程可行性的直接证据。
燧原的下一章,不在股价K线里,而在三个答案里:腾讯之外的第二曲线何时起来、L600能否按计划在2027年放量、毛利率能否站上40%。按照产品路线图,第五代芯片计划2027年推出、第六代2029年发布——如果每一代都像前四代一样按节奏兑现,燧原在国产算力牌桌上的位置会越来越稳;如果中间任何一环失速,市场也会用脚投票。技术公司的价值最终回到技术本身,这句话在燧原身上,比在任何一家国产芯片公司身上都更适用。赵立东用一句话概括过这家公司的价值追求——"流水不争先,争的是滔滔不绝"。燧原的技术路线,走的正是这条不争先、但滔滔不绝的路。
(全文完)
上海燧原科技股份有限公司首次公开发行股票并在科创板上市招股说明书、审核问询函之回复报告、上市公告书(上交所披露,2026年) 燧原科技硬件文档中心:《Enflame S60产品手册》(release v3.1)——MCM封装、NoC、ARM A55/RISC-V、硬件视频解码等技术细节 燧原科技软件栈文档中心:《驭算TopsRider v3.4简介》——GCU/EFSMI/驱动与运行时说明 EDN电子技术设计:《燧原科技于Hot Chips大会详解邃思芯片架构》(2021年8月)——邃思1.0众核结构与GCU-CARE计算引擎 中国信息通信研究院:《AI芯片技术选型目录(2020年7月版)》——邃思1.0参数(GF 12nm、190W、16GB HBM、512GB/s) 上海证券报:《燧原科技:锚定云端AI芯片 致力于成为通用人工智能基础设施领军企业》(2026年9月2日路演回放)、《燧原科技上市首日高开188.37%》(2026年9月11日) 解放日报/上观新闻:《燧原科技登陆科创板》(2026年9月11日)——S60累计出货16万片 第一财经:《上海又一AI芯片企业登陆科创板,算力竞赛下国产芯片如何突围》(2026年9月11日)——S60应用场景与2025年销量 财联社:《燧原科技登陆A股 科创板补强DSA架构算力拼图》(2026年9月)、《燧原科技如何跨越创新三关》(2026年9月11日) 36氪:《腾讯撑场、60亿豪赌,"GPU四小龙"最后一龙刚刚过会》(2026年6月15日)、《今天,腾讯收获2000亿AI芯片IPO》(2026年9月11日) 证券时报:《燧原科技科创板IPO获受理》(2026年1月23日)、《燧原科技"豪华朋友圈"》(2026年6月16日)、《燧原科技上市首日上涨179.22%》(2026年9月) 财新网:《燧原科技完成IPO辅导 最新估值约205亿元》(2026年1月4日)——L600与ESL超节点参数 中国经济网:《算力竞赛迈入新阶段:从"单卡比拼"走向"系统级较量"》(2026年7月18日)——云燧ESL64-O五层协同设计 21世纪经济报道:《WAIC 2026芯片"共识":超节点才是未来》(2026年7月20日)——OEX正交架构细节 澎湃新闻/龙头新闻:WAIC 2026燧原超节点与NPO光互连报道(2026年7月) 南方+:《H20重返中国市场在即,燧原和沐曦同日发布新一代AI芯片》(2025年7月28日)——L600技术参数 IDC:中国AI加速卡市场跟踪报告(2025年-2026年发布) 庆阳市人民政府网:庆阳智算中心、万卡集群与光电混合智算中心建设报道(2024-2026年) 东方财富网、新浪财经、证券之星:燧原科技(688801.SH)行情与市值数据(2026年9月11日-18日)