1. 核心发现综述
2. 分层卸载下的非线性性能退化机制
2.1. 小型模型对GPU卸载的高度敏感性

2.2. 大型模型的平滑退化特性

2.3. 归一化吞吐揭示模型间敏感度差异

2.4. 硬件平台对卸载惩罚程度的影响
3. 序列长度与KV缓存对卸载效率的放大效应
3.1. KV缓存的线性增长特性及其资源占用
3.2. 解码阶段主导下的延迟累积机制
3.3. 输出长度作为调度决策的关键输入
3.4. 预填与解码阶段的成本不对称性
4. 抢占开销的稳定性与主导因素识别
4.1. 抢占总开销的恒定性验证
4.2. 模型重载作为主要成本来源
4.3. 卸载时间的模型尺寸依赖性
4.4. 抢占模型大小不影响被抢占方开销

Qwen2.5-3B (5.9GB) | Qwen3-8B (15.6GB) | Qwen2.5-14B (28.3GB) | ||||
RTX 5000 | A6000 | RTX 5000 | A6000 | RTX 5000 | A6000 | |
KV GPU→CPU (s) | 0.0096 | 0.0125 | 0.0325 | 0.0387 | 0.0414 | 0.0439 |
Unload Model A (s) | 0.26 | 0.28 | 0.41 | 0.39 | 0.54 | 0.53 |
Reload Model A (s) | 2.71 | 2.33 | 4.70 | 3.62 | 6.70 | 5.12 |
KV CPU→GPU (s) | 0.0076 | 0.0075 | 0.0211 | 0.0205 | 0.0276 | 0.0275 |
Total overhead (s) | 2.98 | 2.62 | 5.16 | 4.06 | 7.31 | 5.73 |
Model swap (%) | 99.4 | 99.2 | 99.0 | 98.5 | 99.1 | 98.8 |
KV transfer (%) | 0.6 | 0.8 | 1.0 | 1.5 | 0.9 | 1.2 |
Overhead vs. baseline (%) | 2.04 | 1.72 | 2.11 | 1.86 | 1.75 | 1.61 |
夜雨聆风