
做文档解析模型,跑出几张效果不错的 Demo 并不难。
真正困难的是回答三个让用户产生信任感的问题:
• 模型到底有多准? • 新版本真的变好了吗? • 它与其他模型能否公平比较?
这就需要 OmniDocBench。
但过去,完整跑通 OmniDocBench 往往意味着:准备 Linux 环境、租用 GPU 服务器、下载数据集,再处理 TeX Live、ImageMagick、Ghostscript 和 CDM 公式评分工具链。模型可能很快就跑起来了,评测环境却能让开发者折腾几天。
现在,这道门槛被大幅降低了。

开源项目 OmniDocBench AMD Windows 已经完成全流程验证:
只需一台配备兼容 AMD Radeon GPU 的 Windows PC,或者一台 Ryzen AI MAX+ 395 AIPC,就能在本地完成专业级文档解析评测。
项目地址:
这个项目已经跑通 OmniDocBench v1.6 全量 1,651 页数据,覆盖四项标准指标:
• Text Edit-distance:文本识别是否准确 • Reading-order Edit-distance:阅读顺序是否正确 • Table TEDS:表格结构是否解析准确 • Formula CDM:数学公式是否正确解析

以 PaddleOCR-VL-1.6 为参考模型,AMD Windows 本地 ROCm/HIP 路径取得了以下结果:
这证明的不是“AMD Radeon GPU能运行模型”,而是它可以完成:
数据准备 → 模型推理 → Markdown 生成 → 文本评分 → 表格评分 → 公式评分 → 结果验证
完整闭环。
1. 不再为了评测专门租GPU服务器
模型开发不是只测一次。
你可能需要反复修改 Prompt、量化方式、图像分辨率、布局模型和后处理规则。每改一次,就要重新推理、重新评分。
现在,这些实验可以直接在本地 AMD PC 上反复完成。评测从一次昂贵的“发布前工程”,变成可以进入日常开发循环的工具。
2. 一句话让AI Agent搭好环境
这个仓库专门提供了 AGENTS.md,供 Codex、Claude Code、OpenCode 等编程 Agent 阅读。

克隆仓库后,只需告诉 Agent:
请阅读 AGENTS.md,并按照其中的流程完成环境搭建和验证。Agent 会依次完成:网络检测、WSL 准备、数据集下载、CDM 环境安装、参考模型运行和最终评分。
每个安装阶段后面都有 verify。Agent 不需要“感觉应该成功了”,而是根据退出码和真实结果判断;中途失败,也可以修复后继续,不必全部重来。
3. 把20多次踩坑压缩成可复用脚本
完整 CDM 公式评分最容易出现“程序没有报错,得分却是 0”的假成功。
此外还有 Python 版本不兼容、WSL 安装失败、ImageMagick 把彩色公式变成灰度、两套 TeX Live 冲突、Windows 编码破坏中文 JSON 等问题。
这个 repo 把 20 多次真实调试经验沉淀成:
• 幂等安装脚本 • 自动验证程序 • 按症状检索的踩坑知识库 • AI Agent 执行流程
前一个开发者踩过的坑,后一个开发者不必再踩。
4. 一套环境,可以公平比较多个模型
评测基础设施与模型 Adapter 完全分离。

接入新模型时,只需要让 Adapter 为每张页面图片生成对应的 Markdown 文件,原有评分系统无需重写。
因此,它不仅能评测 PaddleOCR-VL,还可以扩展到 MinerU、Docling、Marker、其他 VLM、企业自研模型,甚至云端文档解析 API。
所有模型使用同一数据集、同一评分器和同一设备,比较才更公平。
5. 让团队真正做起版本回归
修好了表格,会不会破坏公式?
换了量化模型,速度提升后精度下降多少?
新版本 Overall 提高了,究竟是文本、表格还是公式贡献的?
固定的 OmniDocBench 流程,可以让每个版本留下客观证据。团队不再依赖“肉眼看起来更好”,而是明确知道哪里进步、哪里退化。
推荐环境:
• Windows 11 + WSL2 • 支持 ROCm/HIP 的 AMD Radeon GPU • Python 3.10 或 3.11 • 推荐 8GB 以上显存、32GB 内存和 100GB SSD

首先,克隆仓库:
git clone https://github.com/AIwork4me/omnidocbench-amd-windows cd omnidocbench-amd-windows然后,打开 Codex、Claude Code 或 OpenCode,输入:
Read AGENTS.md and execute the setup flow.接下来,Agent 会按照:
setup → verify → diagnose → repair → resume完成整套环境搭建。
希望手动执行的开发者,也可以按照中文 README 中的四个阶段运行:
1. 检测网络并准备 WSL 2. 下载 OmniDocBench v1.6 和 1,651 页数据 3. 安装 CDM 环境并运行 PaddleOCR-VL-1.6 Adapter 4. 计算四项指标并执行最终验证
完整链路还可以使用:
powershell -ExecutionPolicy Bypass -File scripts\full-verify.ps1这个项目降低的不只是 租用 GPU服务器的成本。
它同时降低了文档解析评测的:
硬件门槛、环境门槛、学习成本、调试成本、复现成本和团队协作成本。
专业评测不应该只属于拥有昂贵服务器的大团队。
学生、独立开发者、创业公司和企业研发团队,都应该能在自己的设备上验证模型,而不是只能相信论文中的数字和厂商展示的 Demo。

手上正好有 AMD Radeon GPU,或者 Ryzen AI MAX+ 395 AIPC,不妨亲自跑一次。
也欢迎为更多文档解析模型贡献 Adapter,让 AMD Windows 上的文档智能评测生态越来越完整。
项目地址:
https://github.com/AIwork4me/omnidocbench-amd-windows
让评测从昂贵的服务器工程,变成每一位开发者都能使用的本地研发工具。
夜雨聆风