ARTICLE · 1159615
趋境科技亮相全球C++及系统软件技术大会,详解开源 Mooncake 架构的革新与实践

12 月 12 日,由 CSDN 与奇点智能研究院联合举办的「2025 全球 C++ 及系统软件技术大会」在北京金隅喜来登大酒店盛大开幕。恰逢 C++ 正式发布 40 周年,本次大会汇聚了C++之父、美国国家工程院、ACM、IEEE院士 Bjarne Stroustrup,北京大学讲席教授、复旦大学先进计算系统研究院院长谢涛等 40 余位来自 C++ 及系统软件领域的杰出专家。
趋境科技作为专注于大模型推理优化的创新企业受邀参会,趋境科技技术专家、Mooncake的核心贡献者杨珂博士出席并发表主题演讲,详解Mooncake架构在大模型推理领域的技术革新与实践价值,现场讨论与交流氛围热烈。

Mooncake 是由趋境科技、月之暗面 Kimi 、 清华大学 MADSys 实验室、9#AISoft、阿里云、蚂蚁集团等产学研力量共同建设的开源分布式大模型推理架构。
Mooncake 创新性地提出了以 KV Cache 为核心的分离式架构,通过大规模分布式内存池管理 KV Cache,显著提升了 KV Cache 复用率,减少了大模型推理过程中的重复计算。同时配合端到端高性能、零拷贝的传输引擎,将预填充、解码与 KV Cache 存储分别映射至最适配的硬件资源,实现了存储与计算资源的最优协同调度,在保障使用体验(SLO)的前提下,充分提升大模型推理的吞吐性能。
Mooncake 当前已在阿里云、蚂蚁集团、月之暗面、科大讯飞、京东等头部企业实现规模化部署。在月之暗面,Mooncake 承载了 Kimi 80%以上的流量,实现了 75% 的系统吞吐量提升。在多轮对话场景中,通过 Mooncake Store 与 SGLang 的 HiCache 模块集成,实现了 84% 的首字响应时间(TTFT)下降。

杨珂博士强调,Mooncake 与 vLLM、SGLang、LMCache、xLLM、Chitu 等主流推理框架深度集成用,全面支持 PD 分离、KVCache 共享、大 EP、RL 更新等关键特性,成为工业界推动大模型资源池化和高效推理的重要基础设施,为企业级大模型应用提供了高性能、低成本的推理解决方案。
未来,趋境科技将持续深耕开源生态建设,推动 Mooncake 架构与更多产业场景深度融合,与全球开发者共同探索AI时代系统软件的创新边界,助力大模型技术规模化落地。
关于趋境科技
趋境科技源自清华大学高性能计算研究所,由中国工程院院士、清华大学计算机系教授郑纬民担任首席科学顾问。团队提出全球首创的 “全系统异构协同推理” 与 “以存换算” 两大核心技术,联合业内顶尖技术团队打造 KTransformers 推理引擎与 Mooncake 分布式推理框架,彻底打破传统算力瓶颈,将大模型本地部署门槛降低10倍,实现算力基础设施并发吞吐性能跃升,成为引领全球 AI Infra 推理领域技术演进的核心力量。至今,趋境科技已构建覆盖 “推理引擎 - 硬件终端 - 模型服务平台 - AI开发工具” 的全栈产品矩阵,为企业级用户打造从算力破局到 AI 价值交付的全链路大模型私有化部署解决方案。

往 期 推 荐
Mooncake 技术详解|长上下文场景 TTFT 骤降 84%,对接 SGLang HiCache 模块的设计和实现(上篇)
Mooncake技术详解|长上下文场景TTFT 骤降84%,对接 SGLang HiCache 模块的性能优化与灵活部署(下篇)