SemPIC把文档级KV离线编译成语义缓存,三模型×四任务逼近整段重算,适合RAG与文档Agent的重复上下文。 arXiv:2607.28069评分:8.9 / 10

术语说明
PIC:Position-Independent Caching:预先编译可复用文档 KV,再放到请求时位置并拼接。
SemPIC:用可训练 Writer 编译语义化文档 KV,供不变 Reader 在标准缓存路径消费。
KV Packet:主要学习可复用块边界状态的 PIC 基线。
Full Recompute:对完整提示从头算 KV,质量上界对照。
KV Gradient Checkpointing:反向时重算 Writer 中间激活,同时保留缓存 KV 梯度通路以省显存。
micro-F1:语料级 token micro-F1,用于衡量缓存复用相对整段重算的任务质量。
A. 研究问题
同一批长文档,会被不同指令、对话历史和文档次序反复塞进 Agent。前缀缓存对不上这种复用;朴素位置无关 KV 又缺后续上下文,质量容易塌。
B. 核心贡献
诊断:边界条件 PIC 能修好边界附近,却留下内部与任务级残差 离线可训练的原生文档 Writer,输出标准分层 KV,在线 Reader 不变 KV Gradient Checkpointing:保留缓存梯度路径,同时压峰值训练显存
C. 方法 / 框架
LoRA 只在 Writer 编译文档时打开;Writer 把文档蒸馏成原生 per-layer KV,预训练解码器作不变 Reader。行为蒸馏对齐 Full Recompute;在线仍走标准 cache-hit,不必改服务接口。
痛点:位置对齐 ≠ 上下文齐全
RoPE 重排只能修位置相位。文档在孤立编译时没见过后续邻居与指令,朴素拼接会上下文残缺。
为何要把适应从边界拉到整篇文档
诊断显示 KV Packet 明显压低近边界注意力偏差,但内部与任务级误差仍在。需要让文档表示本身离线可学。
为何不改在线 Reader
服务侧继续吃标准 KV、走 cache-hit。训练成本付在离线编译,在线路径保持不变,落地摩擦更小。
D. 关键结果
证据 01主增益
总体均值 micro-F1:KV Packet 0.53 → SemPIC 0.60;Full Recompute 0.62。
离线文档级适应已经逼近整段重算的大半收益。
证据 02覆盖面
12 设置里 10 个高于 Packet;Qwen3 4B/8B 均值约 +0.10/+0.13。
对主流开源解码器复用场景更友好。
证据 03互补空间
Joint(边界+文档)总体 0.61,高于单用 SemPIC。
边界修补与文档编译不是二选一。
证据 04证据边界
三模型×四任务;Llama MuSiQue 单点 Packet 更高。
别当通用银弹;个别任务仍需 Joint/重算兜底。
数据来源:单位:Beihang University · State Key Laboratory of Complex & Critical Software Environment。证据覆盖:学习缓存相对 Packet/Full Recompute;离线训练成本与域迁移未充分展开。
So What:说白了,文档 Agent 账单里最烫的那一段,常常是同一批长文在换指令后反复 prefill。SemPIC 把复用文档变成可落盘的语义 KV 资产。
E. 产业启示
飞哥视角:别再只优化「前缀能不能命中」。知识库更新完先离线编译一轮文档 KV,再验收 cache-hit 质量是否逼近整段重算。对照今日 SVR:一个省文档重算,一个省无效续写。
F. 结论与边界
这篇最适合反复检索同一批文档的 RAG/Agent:离线语义 KV 能逼近整段重算质量,但离线训练成本与跨域迁移仍是边界。
限制面
Writer 要离线训练与部署流水线,冷启动和文档变更成本不能假装没有。 个别设置(如 Llama MuSiQue)边界方法仍可能更强,需任务级选型。 跨域文档分布漂移时,语义缓存是否保持逼近 Full Recompute,还需外推验证。
📋 可以直接复制的话术
长文档别反复 prefill:先离线编译成语义 KV。
相对 KV Packet:micro-F1 0.53→0.60,逼近整段重算 0.62。
验收文档缓存:看命中质量,也看离线编译成本。
💬 论文金句
mean micro-F1 over KV Packet from 0.53 to 0.60 approaching Full Recompute at 0.62 adaptation is confined to offline cache construction
同题精选(2)· 推理效率:少重算、少空转
本篇讲文档 KV 复用;同线可对照:

夜雨聆风