ARTICLE · 1112126
估值万亿的AI底牌,被一台坏了半年的测试机卡死!AMD飞轮背后的开源血泪史
深夜的咖啡馆里,木质长桌前坐着一个戴黑框眼镜的年轻工程师。
他的笔记本屏幕上,正滚过一行行动辄上千行的底层 C++ 算子代码,那是当今全球最火的大模型开源推理引擎 vLLM 的核心代码库。

▲ 知名半导体研究机构 SemiAnalysis 发帖,公开向 EmbeddedLLM 创始人 TJ 及团队致敬
如果把当前全球市值最高的人工智能战局比作一场星际战争,AMD 正在用它最顶级的旗舰芯片 Instinct MI355X,正面硬刚英伟达的 B200 霸权。各大科技巨头砸下数以百亿计的美元,PPT 上的算力峰值一个比一个惊悚。
但鲜为人知的是,在长达数月的时间里,负责把这颗百亿美元旗舰芯片“跑通、跑快、送进千家万户”的核心代码守门人,手里连一台能正常开机的硬件都没有。
直到 2026 年 5 月,整个开源社区在底层优化这条芯片时,手头只有唯一一台单机测试设备,而且已经坏了整整好几个月!
01荒诞的现实:百亿美元的算力帝国,卡在一张借不到的工位上
在开源世界里,有一个神圣的头衔叫 CODEOWNERS(代码所有权人)。
简单来说,如果某个芯片厂商想让全世界的开发者都用上自己的硬件,它的底层驱动和优化代码就必须合入像 vLLM 这样的顶级开源项目。而项目仓库里的每一个改动、每一个 PR,最终都必须由 CODEOWNERS 点头签字。
在 vLLM 的官方代码库里,掌管 AMD ROCm 路径所有生死大权的,是一个叫 TJ(@tjtanaa) 的年轻人,以及他带领的 EmbeddedLLM 团队。

▲ Discord 截图曝光:TJ 无奈表示“我们曾有一台 MI355,但坏了几个月,而且根本没有多机互联环境”
2026 年 5 月,知名半导体分析机构 SemiAnalysis 披露了一段令人啼笑皆非的 Discord 内部对话。
当社区开发者焦急地询问为什么多机分布式优化迟迟无法推进时,负责核心优化的 TJ 只能在频道里苦笑回复:
“我们曾经有过 1 台 MI355……但这台机器已经坏了好几个月了。而且,我们手头根本没有多机互联环境。”
这是何等魔幻的现实?
一边是 AMD 在各大峰会上高调发布基准测试,宣称 MI355X 在部分大模型吞吐上超越英伟达;另一边,在开源一线写代码、修崩溃、调算子的核心维护者,却在面对一台趴窝的机器干瞪眼。
当最新的顶级模型(如 DeepSeek-v4)横空出世时,开源维护者们在首发第 0 天(Day 0)只能连夜优先适配英伟达的 H100 与 B200。这纯粹是现实所迫:英伟达的开发机时刻在线待命,AMD 的测试机却连电源都点不亮。
02为什么大模型写代码,不能靠“脑补”?
可能有人会问:写代码难道不能在普通电脑上写完,再拿去芯片上跑吗?
在大模型底层系统工程的世界里,离开真实硬件搞开发,就像闭着眼睛在悬崖边开赛车。

▲ EmbeddedLLM 团队定位:扎根在 AMD Instinct 软硬件生态中的核心基础设施力量
要理解这个技术死结,可以看清支撑其运转的“铁三角”:
- vLLM
:大模型时代的“高性能发动机”。ChatGPT、Claude 背后能秒级吐字,全靠它管理显存碎片和请求排队。谁在这上面跑得快,谁就是各大云厂商的采购首选。 - ROCm
:AMD 的“官方翻译官”。相当于英伟达的 CUDA,负责把复杂的 Python 代码翻译成底层芯片能懂的机器语言。 - MI355X
:AMD 最新的“超级核武”。拥有惊人的显存容量和带宽,但必须依赖极其精密的算子才能彻底释放性能。
现代 GPU 的算子优化早已深入到了手写汇编和矩阵核心(Matrix Core)层面。
代码差一个指令周期,显存读写就会发生冲突;底层驱动微调一个版本,整套系统就会直接触发 Linux 内核崩溃(Kernel Panic)。
自动化测试系统(CI/CD)的瘫痪,让处境进一步恶化。

▲ 2026 年 3 月底,EmbeddedLLM 团队正式打通了每日自动化的 Nightly 编译与 Docker 分发
在 vLLM 这种高强度迭代的项目中,每天都有来自全球的数百次代码提交。系统必须通过像 Buildkite 这样的流水线,把代码部署到真实的物理 GPU 上,加载几十 GB 的真实模型权重,实打实地跑一遍推理和通信。
测试机坏了,整个自动化回归测试就变成了瞎子。
代码不敢合入,Bug 无法复现,生产级的分布式编排方案(如 Kubernetes 上的 llm-d)缺乏集群做压力测试,直接导致下游商业客户在遇到微突发流量时频频死锁。
03绝地反扑:单行代码让性能狂飙 7.7 倍
即便在手头连稳定机器都没有的绝境下,这支仅有数人的精锐团队依然在开源战壕里打出了惊天逆转。
2026 年 2 月底,EmbeddedLLM 发布了一篇极具震撼力的技术长文《超越移植:vLLM 如何在 AMD ROCm 上构建极致性能推理》。
他们向整个行业宣告:AMD 生态不再满足于“能跑就行”的功能补齐,而是要向英伟达发起性能反杀!

▲ 团队提出针对 MI355X 的显式三路径路由与定制 Attention 算子
他们重构了底层的注意力机制算子:
- ROCM_AITER_FA
算子直接让多头注意力(MHA)模型的吞吐暴涨 2.7 至 4.4 倍; 在应对 DeepSeek 等前沿 MoE 架构的复杂 MLA 结构时,性能再次提升 1.2 至 1.5 倍; 更打通了预填充(Prefill)与解码(Decode)的显式三路径路由,彻底榨干硬件潜能。
紧接着,在 2026 年 4 月,一场载入开源史册的性能风暴爆发了。
权威基准评测机构 InferenceX 在跟踪评测中发现:仅仅因为 vLLM 上合入了一个代号为 #35850 的 PR(由维护者团队修复了 AITER MLA 的底层调度缺陷),前沿大模型 Kimi K2.5 在 MI355X 上的每用户吞吐量直接飙升了 7.7 倍,交互响应速度暴涨最高 15 倍!

▲ InferenceX 记录下这惊人的一幕:25天内,单个 PR 彻底改写了 MI355X 的性能曲线
这记响亮的耳光打醒了所有人:AMD 的硬件底子从来不差,差的只是那群能把芯片潜能逼出来的核心开发者,手头缺少趁手的兵器!
04惊天转折:360 万美元集群入场,飞轮彻底转动
这一切荒唐的窘境,在 2026 年 5 月迎来了历史性拐点。
在独立智库 SemiAnalysis 的深度介入与强力推动下,AMD 高层(包括副总裁 Anush Elangovan)终于意识到了问题的致命性,并做出了一个极其果断的战略决策:
不再把硬件借调当成成本审批,而是把它当成生态生死的战略投资!

▲ SemiAnalysis 发文宣布“AMD 飞轮预警”,价值约 360 万美元的持久互联集群正式交付开源社区
AMD 一口气拿出了真金白银的硬件资源:
- 约 250 万美元
的 9 节点 MI355X 超级集群,配备全套 8x400G Pollara 高速网卡,专门用来啃下跨节点多机互联、PD 分离和大规模专家并行(EP)的硬骨头; - 约 110 万美元
的 4 节点以上开发集群,无缝接入日常 CI/CD 流水线。
EmbeddedLLM 官方随后激动发帖确认:持久访问的 MI355X 集群已就位,ROCm 飞轮正在疯狂旋转!

▲ EmbeddedLLM 官方发声:“AI 推理是基础设施,这场硬仗将由算子、编译器与执行力赢下!”
开源社区的资深工程师们纷纷致敬
vLLM 核心维护者 Misha Goin 公开盛赞:“TJ 团队就是 vLLM 上 AMD 路线的绝对历史最佳(GOAT),他们终于拿到了早该属于他们的资源!”

▲ vLLM 核心圈子集体为这支默默奉献的幕后功臣送上掌声
05毒辣洞察:黄仁勋最可怕的护城河到底是什么?
这起轰动全球半导体圈的事件,给整个 AI 行业留下了一个极度深刻的启示。
长久以来,外界在谈论英伟达的垄断时,总是津津乐道于 CUDA 的指令集、Tensor Core 的微架构、NVLink 的吞吐带宽。
但致谢帖下的一条高赞技术评论,一针见血地戳破了窗户纸:
“CUDA 最坚固的护城河压根不在白皮书里的那些指令集。只要有人想写软件,无论学生还是黑客,都能随时搞到一张卡放在工位上不断折腾。”

▲ 开发者指明关键:向开发者提供硬件属于战略分发决策,不能简单算作成本支出
很多芯片巨头把硬件设备当成昂贵的“固定资产”,层层审批、扣扣搜搜、坏了没人修;而黄仁勋早在二十年前,就把显卡当成思想的特洛伊木马,送进了全世界每一个顶尖实验室的工位。
硬件产出只是起点,成熟的软件生态必须依托长期扎实的底层工程支撑。
每一个丝滑的 pip install,每一套免编译的 Docker 镜像,每一个让推理速度翻倍的夜间补丁,背后都是无数个像 TJ 这样坐在咖啡馆里的工程师,守着滚烫的真机,一行行敲出来的血汗成果。
正如 EmbeddedLLM 在推文最后写下的那句话:
“AI 推理是人类未来的基础设施。下一代 AI 基础设施的胜利,绝不会靠默认的渠道分发来赢得;它最终属于算子、属于编译器、属于运行时,以及那群日夜不息、坚决执行到底的人。”
敬那些在深夜暗光屏幕前,为开源世界默默拓荒的守夜人。