乐于分享
好东西不私藏

长文档别反复prefill:SemPIC把复用文档编译成语义KV,micro-F1从0.53到0.60

长文档别反复prefill:SemPIC把复用文档编译成语义KV,micro-F1从0.53到0.60
SemPIC把文档级KV离线编译成语义缓存,三模型×四任务逼近整段重算,适合RAG与文档Agent的重复上下文。
arXiv:2607.28069评分:8.9 / 10

术语说明

PIC:Position-Independent Caching:预先编译可复用文档 KV,再放到请求时位置并拼接。

SemPIC:用可训练 Writer 编译语义化文档 KV,供不变 Reader 在标准缓存路径消费。

KV Packet:主要学习可复用块边界状态的 PIC 基线。

Full Recompute:对完整提示从头算 KV,质量上界对照。

KV Gradient Checkpointing:反向时重算 Writer 中间激活,同时保留缓存 KV 梯度通路以省显存。

micro-F1:语料级 token micro-F1,用于衡量缓存复用相对整段重算的任务质量。

A. 研究问题

同一批长文档,会被不同指令、对话历史和文档次序反复塞进 Agent。前缀缓存对不上这种复用;朴素位置无关 KV 又缺后续上下文,质量容易塌。

B. 核心贡献

  • 诊断:边界条件 PIC 能修好边界附近,却留下内部与任务级残差
  • 离线可训练的原生文档 Writer,输出标准分层 KV,在线 Reader 不变
  • KV Gradient Checkpointing:保留缓存梯度路径,同时压峰值训练显存

C. 方法 / 框架

LoRA 只在 Writer 编译文档时打开;Writer 把文档蒸馏成原生 per-layer KV,预训练解码器作不变 Reader。行为蒸馏对齐 Full Recompute;在线仍走标准 cache-hit,不必改服务接口。

痛点:位置对齐 ≠ 上下文齐全

RoPE 重排只能修位置相位。文档在孤立编译时没见过后续邻居与指令,朴素拼接会上下文残缺。

为何要把适应从边界拉到整篇文档

诊断显示 KV Packet 明显压低近边界注意力偏差,但内部与任务级误差仍在。需要让文档表示本身离线可学。

为何不改在线 Reader

服务侧继续吃标准 KV、走 cache-hit。训练成本付在离线编译,在线路径保持不变,落地摩擦更小。

D. 关键结果

证据 01主增益

总体均值 micro-F1:KV Packet 0.53 → SemPIC 0.60;Full Recompute 0.62。

离线文档级适应已经逼近整段重算的大半收益。

证据 02覆盖面

12 设置里 10 个高于 Packet;Qwen3 4B/8B 均值约 +0.10/+0.13。

对主流开源解码器复用场景更友好。

证据 03互补空间

Joint(边界+文档)总体 0.61,高于单用 SemPIC。

边界修补与文档编译不是二选一。

证据 04证据边界

三模型×四任务;Llama MuSiQue 单点 Packet 更高。

别当通用银弹;个别任务仍需 Joint/重算兜底。

数据来源:单位:Beihang University · State Key Laboratory of Complex & Critical Software Environment。证据覆盖:学习缓存相对 Packet/Full Recompute;离线训练成本与域迁移未充分展开。

So What:说白了,文档 Agent 账单里最烫的那一段,常常是同一批长文在换指令后反复 prefill。SemPIC 把复用文档变成可落盘的语义 KV 资产。

E. 产业启示

01高频复用的知识库/手册先离线编译成 KV,别每个问题都整段 prefill
02验收同时看 cache-hit 质量与离线编译成本,延迟单独比会骗人
03在线路径尽量保住标准 KV 命中接口,别轻易上辅助编码器改服务形态
飞哥视角:
别再只优化「前缀能不能命中」。知识库更新完先离线编译一轮文档 KV,再验收 cache-hit 质量是否逼近整段重算。对照今日 SVR:一个省文档重算,一个省无效续写。

F. 结论与边界

这篇最适合反复检索同一批文档的 RAG/Agent:离线语义 KV 能逼近整段重算质量,但离线训练成本与跨域迁移仍是边界。

限制面

  • Writer 要离线训练与部署流水线,冷启动和文档变更成本不能假装没有。
  • 个别设置(如 Llama MuSiQue)边界方法仍可能更强,需任务级选型。
  • 跨域文档分布漂移时,语义缓存是否保持逼近 Full Recompute,还需外推验证。

📋 可以直接复制的话术

长文档别反复 prefill:先离线编译成语义 KV。
相对 KV Packet:micro-F1 0.53→0.60,逼近整段重算 0.62。
验收文档缓存:看命中质量,也看离线编译成本。

💬 论文金句

  • mean micro-F1 over KV Packet from 0.53 to 0.60
  • approaching Full Recompute at 0.62
  • adaptation is confined to offline cache construction

同题精选(2)· 推理效率:少重算、少空转

本篇讲文档 KV 复用;同线可对照:

  1. Agent 为什么总重复踩坑?因为它不会记住失败
  2. Agent 自我演化进入下一阶段:开始主动找自己的盲区