让AI帮你从海量文档里找答案,最常见的做法是传统RAG:先把文档转成文本,拆碎,存进向量数据库,提问时检索相关段落,再交给大模型总结。然而,当碰到文档里有很多表格、图表的时候,这种传统的做法就显得力不从心了。
今年6月,来自UC Berkeley、普林斯顿、EPFL和Databricks的研究团队发布了一篇论文,深入研究了传统RAG面对复杂文档的不足之处。同时他们提出了一个全新的方案:PixelRAG,直接让模型看文档的像素截图,而不是读那些被“压扁”后的文字。
传统RAG翻车的三类原因
论文在SimpleQA评测集上做了一次精细的归因分析。SimpleQA是1000道基于维基百科的事实问答题,正好适合量化文档问答链路里的各种损失。
他们把失败原因拆成三类:
第一,解析损失,占36.6%。把HTML页面转成纯文本时,表格、infobox这类结构化信息很容易彻底消失。原本藏在表格里的数字,转换后就变成零散的字符堆,检索时根本找不到。
第二,排序损失,占55.2%。维基百科页面右侧的infobox信息密度极高,在75.9%的查询里直接冲到检索排名第一,把真正包含答案的段落挤到20名开外。模型拿到的“最相关”上下文,其实只是个信息摘要,而不是答案本身。
第三,阅读损失,只占8.2%。文本化之后结构被拉平,模型容易把不同年份或不同公司的数字张冠李戴,给出看似合理却完全错误的答案。
解析损失和排序损失合计占了91.8%,大部分错误其实发生在文档理解和检索阶段,而不是最后的生成。 这个发现直接把矛头指向了底层数据处理方式,也让直接对文档像素进行视觉编码的想法,变得极具说服力。

PixelRAG怎么让模型“看”文档
PixelRAG的做法,是把整个流程从“读字”切到“看图”,一共分四步。
渲染。用无头浏览器打开维基百科页面,设定宽度875像素,然后按1024像素的高度,把长页面切成一个个小tile。700万篇文章一共切出约3000万个小块。每个tile就是一张完整的页面截图,表格、图表、排版结构原样保留,啥也不丢。
索引。用Qwen3-VL-Embedding-2B这个视觉语言模型,把每个tile编码成一个2048维的向量。所有向量拼起来,存进FAISS向量索引,占用大约120GB。这个过程只存向量,不存原始截图。
训练。为了让嵌入模型学懂怎么把图像片段和用户问题对齐,团队合成了约4万对训练数据,用LoRA微调了嵌入模型,单张H100上3小时就跑完了整个训练过程。
存储。维基百科全量原始截图做下来要占5.6TB,但论文给出的生产方案是按需渲染、用完即删。线上只持久化那120GB的向量索引,原始截图可以不要,存储成本一下就降到可部署的程度。

真实效果:六个基准全面超越文本RAG,token成本直降10倍
真刀真枪跑下来,PixelRAG在六个基准上全部干过了传统文本RAG。
具体看两个数:SimpleQA准确率从71.6%提到78.8%,表格类查询从42.5%提到48.8%,整体最高领先达到18.1%。这些提升主要来自对图表、infobox的精准俘获,之前被文本化弄丢的信息,现在被直接看见了。
成本端的变化更出人意料。在一个需要反复搜索和阅读长文档的agent场景下,传统文本RAG一口气烧掉3750万token,PixelRAG只用了360万,降幅接近10倍。原因很简单:给模型喂一张截图,比喂几千字的碎片文本高效得多,大量无效上下文直接省掉了。论文还提到,和谷歌这类替代方案比起来,PixelRAG的成本还要再便宜2到4倍,但这和刚才的10倍削减是两个独立的对比口径,一个是绝对压缩,一个是相对便宜。
另外,如果对图片做进一步压缩,还能再省掉三分之一的token。

但也不是随便拿个视觉模型就能上。实验发现,参数量小于Qwen3-VL-4B的小模型,在这种直接编码屏幕截图的方式下,效果反而比传统文本检索差12.5个百分点以上。换句话说,这件事对视觉模型的尺寸有明确的门槛。
论文里也说明了这个方法目前还存在的问题:用固定像素高度切tile的做法,可能会把表格或段落从中间生硬切断,这个“视觉版chunking难题”暂时还没解决。固定像素切片切断关键信息,是当前最大的遗留挑战。
企业现实:大部分人还在“读字”,但风向在变
但纵观目前的市场现状,今天企业级RAG的主流做法还是先把图表、表格转成文字再索引。NVIDIA的企业级RAG蓝图就很有代表性:它的多模态能力是把文档里的表格、图表、信息图提取出来,转成文字后存入向量数据库,生成时再调用视觉语言模型来解读图像。这本质上依然是“读文字”,而不是直接看像素。
PixelRAG的作者建议,可以把这种视觉检索当作增强层,部署在现有文本检索系统之上。表格、图表密集的查询走视觉管道,纯文字的部分继续用文本管道,两者各干各的,混合输出。
这种混合思路,和企业在现实调研里的态度转向正好吻合。根据VB Pulse 2026年第一季度的企业调查,愿意采纳混合检索(向量+关键词+元数据等)的组织,从今年1月的10.3%涨到了3月的33.3%,三个月涨了三倍。
在存储层面,NVIDIA也提出了AI数据平台的概念,试图让存储系统直接内嵌RAG能力,在数据层就完成检索和推理。未来如果PixelRAG这类方法走向成熟,智能存储或许就不用再费力导出文本,而是直接吐出文档截图对应的向量,让模型直接看图说话。
从“读字”到“看图”,虽然还有固定像素切片这样的遗留问题需要解决,但它的确为RAG的发展打开了新的思路。
📌 点击「阅读原文」查看最近24小时更多AI热点新闻、社媒焦点、大V深度分享
👆 关注公众号,获取定期推送的最新最重磅AI信息
夜雨聆风