
(图源:项目仓库。标语是「Web Screenshots Beat Text」,副标写着「在几百万张渲染好的页面上做视觉检索」)
给 AI 喂资料的标准流程里,有一步几乎没人质疑过:先把文档解析成纯文字。网页扒成文本、PDF 抽成字符串,然后切块、做向量、进库。
问题是这一步会丢东西。一张财报里的表格,解析完可能变成一串对不上行列的数字;一张流程图、一份排版讲究的说明书,抽完文字之后结构就散了。后面检索得再准,丢掉的信息也回不来。
PixelRAG 换了个做法:不解析成文字,把文档渲染成截图,直接对图片做检索。它来自伯克利(Berkeley SkyLab、BAIR 和 Berkeley NLP),指导老师里有 Matei Zaharia(Spark 作者、Databricks 联合创始人)、Joseph E. Gonzalez 和 Sewon Min,Apache 2.0 开源,目前 6.9k 星。仓库简介口气很大:
The end of web parsing. The beginning of scalable pixel-native search.(网页解析的终结,可规模化的像素原生检索的开始)
一个具体的例子
作者用一个问题把差别摆了出来:2010 年欧冠决赛,国际米兰对拜仁,国米射正了几次?

(图源:项目仓库。上半是文字 RAG:维基页面被解析成文字块,那张统计表在这一步丢了,检索回来的片段里没有数据,模型只能回答「无法从给定上下文中确定」;下半是 PixelRAG:同一个页面渲染成截图,表格原样留着,检索回带表格的那张图,模型从图上直接读出「Shots on target · Inter Milan · 7」)
答案就写在页面那张统计表里,人打开原页面能直接找到。文字管线把表格结构碾平之后,这个数字就取不出来了。这类问题在真实资料里很常见——财报、说明书、论文里的图表、后台截图,信息本来就长在版面上。
它是如何工作的
整条链路里没有「解析成文字」这一环:

建索引:文档(网页或 PDF)先用 pixelshot 命令渲染成截图切片,走的是 Chrome / Playwright 那一套真实浏览器渲染;然后用 Qwen3-VL-Embedding-2B 把图片编码成向量——这个模型是作者在截图数据上做过 LoRA 微调的;最后存进 FAISS(默认)或 Qdrant。
查询:问题用同一个编码器变成向量,在图片向量里找最像的几张,取回来的是截图而不是文字段落,最后交给一个能看图的模型,让它从图上读答案。
因为查询和图片在同一个向量空间里,这套东西顺带支持以图搜图——直接丢一张图片进去当查询条件。
不想自己建库,可以直接用
它预先建好了一份 828 万个维基百科页面的截图索引(FAISS 基础索引约 217GB),架在 api.pixelrag.ai 上,发个 HTTP 请求就能搜,不用自己渲染、不用自己跑模型:
curl -X POST https://api.pixelrag.ai/search \ -H "Content-Type: application/json" \ -d '{"queries": [{"text": "What is the capital of France?"}], "n_docs": 5}'自己的资料要建库也行,作者给了完整的渲染、索引和训练管线,想换骨干模型可以自己 LoRA 微调。另外还有一个给 Claude Code 用的插件 pixelbrowse,让 Claude 能自己截页面、再读这些图。
装起来
pip install pixelragpixelshot https://en.wikipedia.org/wiki/Python --output ./tiles需要 Python 3.10+,以及系统里的 Chrome/Chromium(或让 Playwright 装自带的那个)。建索引对机器有要求:Linux 上要 CUDA,macOS 上走 Apple Silicon 的 MPS。作者给的参考速度是,一份示例 PDF 建索引,苹果 M 系芯片约 3 分钟、GPU 约 1 分钟。
几条要注意的
• README 里没有量化对比。 那个欧冠表格的例子很有说服力,但仓库没给「在某个评测集上比文字 RAG 高多少」的数字,也没和 ColPali 这类已有的视觉文档检索工作做比较。方法讲得清楚,效果好多少得自己拿数据试。 • 读的那一端必须能看图。 检索回来的是截图,所以负责作答的模型得是多模态的。想接一个纯文本模型来读,这套走不通。 • 索引又大又费算力。 维基那份基础索引 217GB,自己建库还要把每个页面真的渲染一遍、再过一遍视觉模型,成本比抽文字高不少。资料量大的时候这笔账要先算。 • 版本还很早。 v0.4.0 是 2026 年 7 月 16 日刚发的,接口和效果都还在动。
写在最后
「先解析成文字」这个默认动作,是整条 RAG 管线里最少被审视的一步,而很多资料的关键信息恰恰长在表格和版面上,一解析就没了。PixelRAG 把这一步换成了渲染截图,让检索和阅读都发生在像素上,靠的是视觉嵌入模型这两年真的能用了。
它给的还不是一份完整的效果证明——没有跑分对比,成本也明显更高。但方向值得看:伯克利那几位的背书、828 万页的现成索引摆在那儿,想验证「我的资料是不是也在解析这一步丢了东西」,拿它试一遍成本不高。
Apache 2.0。仓库地址:github.com/StarTrail-org/PixelRAG。
近期文章推荐
开源 OpenKnowledge:人和 AI 共用一个本地 markdown 知识库
开源 llm_wiki:知识库自己建、自己维护,你只管往里丢文档
DeepTutor:港大开源个人学习系统,一个会记住你的终身个性化私教
夜雨聆风