乐于分享
好东西不私藏

文档解析评测终于不用租GPU服务器了:一台AMD AIPC就能跑完整OmniDocBench

文档解析评测终于不用租GPU服务器了:一台AMD AIPC就能跑完整OmniDocBench
文档解析评测终于不用租GPU服务器了:一台AMD AIPC就能跑完整OmniDocBench
摘要: OmniDocBench AMD Windows 已完成全量验证。现在,一台配备 AMD Radeon GPU 的 Windows PC,或 Ryzen AI MAX+ 395 AIPC,就能在本地完成 OmniDocBench v1.6 的 1,651 页文档解析评测,并获得文本、阅读顺序、表格和公式四项标准指标。环境搭建还可以直接交给 AI Agent。
1.jpg

做文档解析模型,跑出几张效果不错的 Demo 并不难。

真正困难的是回答三个让用户产生信任感的问题:

  • • 模型到底有多准?
  • • 新版本真的变好了吗?
  • • 它与其他模型能否公平比较?

这就需要 OmniDocBench。

但过去,完整跑通 OmniDocBench 往往意味着:准备 Linux 环境、租用 GPU 服务器、下载数据集,再处理 TeX Live、ImageMagick、Ghostscript 和 CDM 公式评分工具链。模型可能很快就跑起来了,评测环境却能让开发者折腾几天。

现在,这道门槛被大幅降低了。

2.jpg

开源项目 OmniDocBench AMD Windows 已经完成全流程验证:

只需一台配备兼容 AMD Radeon GPU 的 Windows PC,或者一台 Ryzen AI MAX+ 395 AIPC,就能在本地完成专业级文档解析评测。

项目地址:

https://github.com/AIwork4me/omnidocbench-amd-windows
01
不是跑几张样例,而是完整评测

这个项目已经跑通 OmniDocBench v1.6 全量 1,651 页数据,覆盖四项标准指标:

  • • Text Edit-distance:文本识别是否准确
  • • Reading-order Edit-distance:阅读顺序是否正确
  • • Table TEDS:表格结构是否解析准确
  • • Formula CDM:数学公式是否正确解析
3.jpg

以 PaddleOCR-VL-1.6 为参考模型,AMD Windows 本地 ROCm/HIP 路径取得了以下结果:

指标
结果
Overall ↑
95.2524
Text Edit-distance ↓
0.03397
Reading-order Edit-distance ↓
0.12833
Table TEDS ↑
94.3216
Formula CDM ↑
94.8326

这证明的不是“AMD Radeon GPU能运行模型”,而是它可以完成:

数据准备 → 模型推理 → Markdown 生成 → 文本评分 → 表格评分 → 公式评分 → 结果验证

完整闭环。

02
它给开发者带来了什么?

1. 不再为了评测专门租GPU服务器

模型开发不是只测一次。

你可能需要反复修改 Prompt、量化方式、图像分辨率、布局模型和后处理规则。每改一次,就要重新推理、重新评分。

现在,这些实验可以直接在本地 AMD PC 上反复完成。评测从一次昂贵的“发布前工程”,变成可以进入日常开发循环的工具。

2. 一句话让AI Agent搭好环境

这个仓库专门提供了 AGENTS.md,供 Codex、Claude Code、OpenCode 等编程 Agent 阅读。

4.jpg

克隆仓库后,只需告诉 Agent:

请阅读 AGENTS.md,并按照其中的流程完成环境搭建和验证。

Agent 会依次完成:网络检测、WSL 准备、数据集下载、CDM 环境安装、参考模型运行和最终评分。

每个安装阶段后面都有 verify。Agent 不需要“感觉应该成功了”,而是根据退出码和真实结果判断;中途失败,也可以修复后继续,不必全部重来。

3. 把20多次踩坑压缩成可复用脚本

完整 CDM 公式评分最容易出现“程序没有报错,得分却是 0”的假成功。

此外还有 Python 版本不兼容、WSL 安装失败、ImageMagick 把彩色公式变成灰度、两套 TeX Live 冲突、Windows 编码破坏中文 JSON 等问题。

这个 repo 把 20 多次真实调试经验沉淀成:

  • • 幂等安装脚本
  • • 自动验证程序
  • • 按症状检索的踩坑知识库
  • • AI Agent 执行流程

前一个开发者踩过的坑,后一个开发者不必再踩。

4. 一套环境,可以公平比较多个模型

评测基础设施与模型 Adapter 完全分离。

5.jpg

接入新模型时,只需要让 Adapter 为每张页面图片生成对应的 Markdown 文件,原有评分系统无需重写。

因此,它不仅能评测 PaddleOCR-VL,还可以扩展到 MinerU、Docling、Marker、其他 VLM、企业自研模型,甚至云端文档解析 API。

所有模型使用同一数据集、同一评分器和同一设备,比较才更公平。

5. 让团队真正做起版本回归

修好了表格,会不会破坏公式?

换了量化模型,速度提升后精度下降多少?

新版本 Overall 提高了,究竟是文本、表格还是公式贡献的?

固定的 OmniDocBench 流程,可以让每个版本留下客观证据。团队不再依赖“肉眼看起来更好”,而是明确知道哪里进步、哪里退化。

03
如何快速开始?

推荐环境:

  • • Windows 11 + WSL2
  • • 支持 ROCm/HIP 的 AMD Radeon GPU
  • • Python 3.10 或 3.11
  • • 推荐 8GB 以上显存、32GB 内存和 100GB SSD
6.jpg

首先,克隆仓库:

git clone https://github.com/AIwork4me/omnidocbench-amd-windows cd omnidocbench-amd-windows

然后,打开 Codex、Claude Code 或 OpenCode,输入:

Read AGENTS.md and execute the setup flow.

接下来,Agent 会按照:

setup → verify → diagnose → repair → resume

完成整套环境搭建。

希望手动执行的开发者,也可以按照中文 README 中的四个阶段运行:

  1. 1. 检测网络并准备 WSL
  2. 2. 下载 OmniDocBench v1.6 和 1,651 页数据
  3. 3. 安装 CDM 环境并运行 PaddleOCR-VL-1.6 Adapter
  4. 4. 计算四项指标并执行最终验证

完整链路还可以使用:

powershell -ExecutionPolicy Bypass -File scripts\full-verify.ps1
04
最后

这个项目降低的不只是 租用 GPU服务器的成本。

它同时降低了文档解析评测的:

硬件门槛、环境门槛、学习成本、调试成本、复现成本和团队协作成本。

专业评测不应该只属于拥有昂贵服务器的大团队。

学生、独立开发者、创业公司和企业研发团队,都应该能在自己的设备上验证模型,而不是只能相信论文中的数字和厂商展示的 Demo。

7.jpg

手上正好有 AMD Radeon GPU,或者 Ryzen AI MAX+ 395 AIPC,不妨亲自跑一次。

也欢迎为更多文档解析模型贡献 Adapter,让 AMD Windows 上的文档智能评测生态越来越完整。

项目地址:

https://github.com/AIwork4me/omnidocbench-amd-windows

让评测从昂贵的服务器工程,变成每一位开发者都能使用的本地研发工具。