长文档工作流,终于被这个开源方案升级了!
在跨国企业做过长文档翻译的人,大概率都被“切片工作流”折磨过。
比如一份上百页的技术手册,想让大模型翻译,并不是直接把 PDF 丢进去就完事。
现实往往是:上下文窗口不够,格式复杂,表格、脚注、图片说明还会打乱节奏。
所以,常见的做法是用Dify、Fastgpt搭建复杂的工作流:
- 先做工程化切分:把 PDF 拆成一页页,或者按段落切成合适字数的 Chunk(文本块)。
- 分批调用 LLM 翻译。
- 最后进行拼接和润色。
这种“工程上的权宜之计”不仅维护成本极高,效果往往也一言难尽。
今天看到百度最新开源的一个技术方案Unlimited OCR,他们用一种极其优雅的算法,给长文档处理提供了一个“去工作流化”的全新思路。
项目地址:https://github.com/baidu/Unlimited-OCR
这个方案最核心的亮点是 R-SWA(Reference Sliding Window Attention)
它的技术灵感非常有意思,主要源于对人类自然行为的观察和模仿。
想象我们人类在手抄一本书时,通常的行为是:
眼睛盯着原文
脑子里记着刚刚写完的几句话(而不是抄写完的所有内容)
然后继续往下写
R-SWA就是创造性的参考该行为,给AI 的注意力分成两层:
- 参考层(Reference):模型始终能看到输入侧的参考内容,比如原始文档图片、提示词。这部分是稳定的、全局可见的,相当于人抄书时眼睛一直看着原文。
- 工作记忆区(Sliding Window ):对于模型已经生成出来的内容,它不再记住全部历史,而是只保留最近一小段输出,类似于抄书时我们只会记住刚刚写完的几句话。随着任务继续往后走,旧的输出会自然滑出窗口。
这个设计最直接的好处是:输出端的 KV Cache 可以保持恒定,不会随着生成内容越来越长而一路膨胀。长任务,终于不用越跑越慢了。
技术论文里也给了一个很直观的数据:当输出长度达到 6000 token时,由于去除了无用的历史记忆包袱,Unlimited OCR 的生成速度(TPS)相比传统方式提升了 35% 。它能在标准 32K 长度下,一次性推理完成数十页文档的转录,且在 OmniDocBench 测试中准确率比基线模型提升了大约 6% 。
说实话,看到这个方案我是比较兴奋的。
如果模型本身就能更自然地完成连续处理,那我们很多吭哧半个月搭出来的复杂 workflow,可能真的会被简化。
也许技术进步最让人感慨的地方就在这里:你越知道过程有多难,越能看懂一个好思路的分量。
#文心 #文心大模型 #DeepSeek #OCR #AI大模型 #AI技术 #干货分享 #长文档翻译
夜雨聆风