夜雨聆风学习资料网

ARTICLE · 1141942

【论文日推】多模型调度与通信卸载|10.08

【论文日推】多模型调度与通信卸载|10.08
智算互联网络论文日推第 64 期 · 2026.10.08
今日 10 篇■推理 8■训练 1■评估 1
第 1、2 篇关注多模型调度与跨地域服务,第 3 篇卸载训练通信。第 4、5 篇对照 MoE 网络映射与异步解码,第 6、7 篇讨论缓存复用与推理确定性。第 8、9 篇回看特化引擎与低碳调度,第 10 篇借鉴 CXL 事务同步,结果尚不能外推至 KV cache 服务。优化正转向调度、通信与缓存协同,性能比较仍需核对执行语义和实验边界。
推荐列表
01LLM 推理与服务
Janus: Multi-LLM Serving at Production Scale
ACM SIGOPS Symposium on Operating Systems Principles (SOSP) · 2026-09-28 · Tianbao Zhou, Yi Wang, Yu Zhou 等17人 (Peking University)
推荐理由
联合模型放置、弹性扩容与请求调度,直接对应共享集群中的资源效率和 SLO 保障。Janus 用服务层与引擎层协同设计,把慢速模型共置优化和快速突发扩容结合起来。
论文要点
  • 大量异构模型共享集群时,突发请求、幂律热度与互补资源需求难以由单一调度机制同时处理。
  • 模型调度器每 30 秒执行向量装箱、每 0.5 秒进行弹性伸缩;LST-IMH 调度请求,xTensor 虚拟化 HBM,并通过三态模型生命周期和 D2D fork 支持快速扩容。
  • 摘要给出 LST-IMH 的 2-近似保证;在 768 设备生产部署及 60.3 万请求回放中,SLO 达成率为 0.97–1.0,最强基线为 0.80–0.92;每日使用 13,440 设备小时,比静态 Serverless-LLM 少 27%。
DOI https://doi.org/10.1145/3830418.3843867 · 代码·GitHub https://github.com/Janus2026/Janus
02LLM 推理与服务
Taming Inference Workloads at Global Scale: Foundation Model Serving in Amazon Bedrock
ACM SIGOPS Symposium on Operating Systems Principles (SOSP) · 2026-09-28 · Pratik Pankaj Raichura, Somu Perianayagam, Rama Krishna Sandeep Pokkunuri 等4人 (Amazon (United States))
推荐理由
跨地域路由将缓存稳定性、容量和健康状态共同纳入决策,贴近多地域 AI 服务研究。Amazon Bedrock 的 WLM 通过地域约束内的逻辑执行池和有界状态不一致组织全球推理服务。
论文要点
  • 加速器容量在地域间分布不均,请求 token 消耗逐步显现,不同工作负载还具有不同的延迟和吞吐目标。
  • 将请求入口与执行解耦,把 prompt-cache 稳定性作为路由约束;准入与路由使用本地或缓存状态,跨地域定期核对配额,并在请求路径外依据容量与健康信号刷新路由权重。
DOI https://doi.org/10.1145/3830418.3843855
03分布式训练预印本
HOCCL: Offloading Collective Communication from GPU Cores to Accelerate Distributed Training
arXiv (Cornell University) · 2026-09-28 · Yao Fei, Gongming Zhao, Hongli Xu 等8人 (University of Science and Technology of China)
推荐理由
直接缓解 collective communication 与训练计算对 GPU SM 的资源争用。HOCCL 让 DMA 驱动 collective communication,释放原本被通信占用的 GPU SM。
论文要点
  • 现有 collective communication 的数据搬运与同步占用 SM,挤压训练计算及 Tensor Core 的可用资源。
  • 构建 zero-SM 通信框架:stream manager 维持与其他 kernel 的算子时序,P2P executor 执行无 SM 点对点传输,collective scheduler 编排传输以提高带宽利用率。
  • 实验中通信性能与最先进方案平均相差不超过 3%,消除原先接近总 SM 数量 10% 的通信占用,端到端训练吞吐最高提升 5%。
arXiv https://arxiv.org/abs/2609.34334
04仿真与评估预印本
Joint Effects of GPU Server Topology, Parallelism, and Congestion Control on MoE Inference: A Controlled Simulation Study
arXiv (Cornell University) · 2026-09-29 · Kaikai Yuan, Rui Xi, Yu Liu 共3人 (Inspur (China))
推荐理由
用 ASTRA-sim 与 ns-3 联合分析拓扑、TP/EP 和拥塞控制,直接对应仿真评估路径。在受控 MoE 合成工作负载中,拓扑收益取决于并行划分、rank 映射与拥塞控制的组合。
论文要点
  • MoE 推理完成时间不能只由通信量解释,还受逻辑通信组到 GPU、NIC 与节点间网络的映射影响。
  • 使用 ASTRA-sim 的 NS-3 后端,对 32 个 GPU rank、四种 MoE 配置和固定 4096-token prefill-like Chakra 合成 trace,交叉比较六种拓扑、四种 TP/EP 划分、两种 collective 算法及四种网络模式,共运行 768 次确定性仿真。
  • 在每模型 144 种启用反馈的配置子集中,暴露通信占平均完成时间的 89.9%–95.8%;TP16EP2 的平均完成时间是 TP2EP16 的 3.68–4.35 倍,RoCE DCQCN 比 RoCE HPCC 慢 23.8%–35.7%;结论限于所测工作负载与仿真器语义。
arXiv https://arxiv.org/abs/2609.37828
05LLM 推理与服务
StreamEP: Straggler-Tolerant MoE Decoding without Communication Barriers
ACM SIGOPS Symposium on Operating Systems Principles (SOSP) · 2026-09-28 · Yizhuo Liang, Shaoyu Wang, Jaeyong Song 等7人 (University of Southern California)
推荐理由
消除 MoE EP 的全局通信屏障,缓解共享、非均匀网络上的 straggler 放大。StreamEP 让各 GPU 独立收取、计算和转发 token,以异步流水推进 MoE 解码。
论文要点
  • 传统 EP 每层同步所有 GPU,在共享且非均匀互连的普通集群中,最慢传输会通过通信屏障阻塞整体执行。
  • 以原生 NCCL 实现 StreamInfer:各 GPU 独立推进 token;逐层 token 队列管理异步执行,碎片整理调度器合并不完整 batch 并保证前向进展,两阶段通信器支持异步、变长 GPU 间传输。
  • 在 200 Gbps 节点间网络的 16×L40S 和 16×A100 集群上,StreamInfer 的解码吞吐最高达到传统 EP 的 1.7 倍。
DOI https://doi.org/10.1145/3830418.3843869
06LLM 推理与服务预印本
Tessera: Demand-Driven KV Cache Management for Retrieval-Augmented LLM Serving
arXiv (Cornell University) · 2026-09-26 · Fei Fang, Chung-Hsiang Lo, Yi Liu 等5人 (University of California, Santa Cruz)
推荐理由
联合 KV cache 驻留、生成负载和请求路由,贴近分布式缓存复用与 TTFT 优化。Tessera 将检索阶段暴露的内容需求用于协调分离式服务中的 KV cache 管理和请求路由。
论文要点
  • RAG 与 agent memory 中的相同内容会出现在不同前缀或位置;可组合 KV 复用仍面临状态尚未生成、已被淘汰或位于远端节点的问题。
  • 在执行前暴露所需 context unit,将当前需求、检索历史、KV 驻留与生成负载联合用于缓存管理和路由;生成节点并行准备本地、远端及缺失状态,并在请求关键路径外保留新计算的状态。
  • 在相同请求速率下,相比 SGLang 和配合 EPIC 的 LMCache,平均 TTFT 最多降低至约 1/3.6;在基线饱和的请求速率下仍保持低 TTFT,并匹配底层组合策略的回答质量。
arXiv https://arxiv.org/abs/2609.32999
07LLM 推理与服务预印本
Vosti: Specifying, Implementing, and Verifying Deterministic LLM Inference
arXiv (Cornell University) · 2026-09-30 · Jianxing Qin, Alexander Du, Danfeng Zhang 等5人 (Duke University)
推荐理由
为调度和 KV cache 优化建立输出一致性约束,可借鉴其可靠性验证方法,但不涉及故障恢复。Vosti 用系统级规格与分层形式化证明,保证执行策略变化时相同请求仍产生逐位一致的 logits。
论文要点
  • batch 组成、prompt 分块与 KV cache 复用或重计算可能改变输出;已有推理引擎的确定性模式缺少完整系统级规格。
  • 使 kernel 选择独立于运行时引擎状态,并把缓存 KV 绑定至逻辑 token 前缀;用 Verus 归纳证明检查调度和分页前缀缓存,用 Triton 分析器验证选定 kernel 在 batch、查询长度和缓存布局变化下输出逐位相等。
  • 摘要给出引擎层与 kernel 层的确定性证明结论;所有测试的执行变化均保持 logits 逐位一致,在 decode-heavy 工作负载上的性能与 vLLM batch-invariant 模式相当。
arXiv https://arxiv.org/abs/2609.38981
08LLM 推理与服务经典回顾
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
ACM SIGOPS Symposium on Operating Systems Principles (SOSP) · 2025-10-01 · Kuntai Du, Bowen Wang, Chen Zhang 等12人 (University of Chicago)
推荐理由
利用确定的输出长度联合设计 KV cache 生命周期和 JCT 感知调度。PrefillOnly 针对只输出一个 token 的判别型 LLM 请求,减少 KV 存储并利用可预测完成时间进行调度。
论文要点
  • 推荐、信用核验和标注等 prefill-only 任务只生成一个 token,通用引擎仍按任意输出长度保留资源,浪费显存并限制吞吐。
  • 只存储最后计算层的 KV cache,降低显存需求;利用固定输出长度在请求执行前预测 JCT,采用 shortest prefill first 等 JCT 感知策略。
  • 在不增加平均和 P99 延迟的情况下,每秒查询处理量最高达到原来的 4 倍。
DOI https://doi.org/10.1145/3731569.3764834
09LLM 推理与服务经典回顾
Multi-Objective Scheduling for Large Language Model Inference with Prompt-Level Cost Prediction and SLO Awareness
2026 IEEE 8th International Conference on Communications, Information System and Computer Engineering (CISCE) · 2026-03-27 · Jiajing Liao, Feng Chang, Yihan Xue 等6人 (University of Florida)
推荐理由
将 prompt 成本预测、碳强度和租户 SLO 联合用于请求分流。CAPS 将在线请求路由到低延迟、低碳或可延迟批处理池,平衡 goodput 与每请求碳成本。
论文要点
  • 面向长时间训练任务的碳感知调度不适合短时、突发且对 SLO 敏感的多租户在线推理。
  • 轻量 prompt 复杂度预测器估计 token 生成成本与延迟风险,结合实时电网碳强度、GPU 能耗画像和租户 SLO 分层,在三个执行池间路由,并以复合奖励权衡 goodput、碳排和 SLO 违约率。
  • 使用公开会话 trace 和地域碳强度数据的 trace-driven 仿真中,相比 round-robin,每生成 1K token 的平均碳排降低 26.8%,SLO 达成率匹配或超过专门的 SLO-aware 基线。
DOI https://doi.org/10.1109/cisce69494.2026.11504731
10LLM 推理与服务跨界借鉴
XTRA: Unifying Cache Coherence and Concurrency Control for Distributed Transactions in a CXL Pod
ACM SIGOPS Symposium on Operating Systems Principles (SOSP) · 2026-09-28 · Zhijun Yang, Yu Hua, Ming Zhang 等6人 (Huazhong University of Science and Technology)
推荐理由
研究对象是 CXL 分布式事务;同步目录与数据分离的机制可启发共享 KV 存储设计,尚未验证 AI workload。XTRA 用紧凑同步目录协调大规模 CXL 共享数据池,并复用事务冲突检测维护缓存新鲜度。
论文要点
  • CXL 跨主机硬件缓存一致性覆盖有限,难以直接对大容量共享内存池实现高效同步与并发控制。
  • 将同步状态集中到硬件一致性区域内的小目录,把数据保留在非一致性大内存池;利用事务冲突检测在读取时惰性保证缓存新鲜度,并以软件互斥把目录管理扩展至无 HCC 的普通 CXL 内存。
  • 摘要报告,相比最先进系统,吞吐最高提升 15.6 倍,P50/P99 延迟最高分别降低 4.0 倍和 283.9 倍;这些结果来自分布式事务评估,不能直接外推至 KV cache 服务。
DOI https://doi.org/10.1145/3830418.3843888
欢迎关注并星标本号,持续获取 AI 系统与网络方向论文推荐。

相关学习资料