夜雨聆风学习资料网

ARTICLE · 1154358

撕开 DeepSeek MLA 源码:现代 C++ / Tenso

撕开 DeepSeek MLA 源码:现代 C++ / Tenso

撕开 DeepSeek MLA 源码:现代 C++ / Tenso

DeepSeek MLA 这套机制,把单 Token 的 KV 缓存从 64KB 压到了 1.125KB。压缩率高达 98.24%,显存压力直接大减。

但真落到底层算子,有个坑差点把这收益全吃掉。要是老老实实在显存里反投影还原全维度 Key/Value,中间激活的读写开销就能把省下的显存全耗光。

为了保住这波收益,得靠矩阵吸收做算子融合。Decode 阶段直接把矩阵吸进去,在低秩空间完成打分;到了 Prefill 阶段,就得看 Batch 大小来权衡要不要吸收。

最后还得靠 FlashMLA 和微缩放格式,把异步拷贝、跨 Chunk 递推这些硬件流水线的底牌全掀开,才算真正把系统跑顺。

原文撕开 DeepSeek MLA 源码:现代 C++ / TensorRT-LLM 底层算子设计与优化全景
作者提示: 个人观点,仅供参考
广东,9小时前,

相关学习资料