夜雨聆风学习资料网

ARTICLE · 1042326

介绍一个腾讯开源的文档转换模型:WeVisDoc

介绍一个腾讯开源的文档转换模型:WeVisDoc

从论文、扫描件里复制内容,正文还算好办,公式和表格最让人头疼。腾讯开源的 WeVisDoc 可以直接读取文档页面图片,输出结构化 Markdown,公式转成 LaTeX,表格转成 HTML,方便继续编辑或交给知识库处理。

WeVisDoc 文档解析评测结果

WeVisDoc 是基于 Qwen3-VL 微调的端到端文档解析模型,提供 2B 和 4B 两个版本,代码与模型均采用 Apache-2.0 协议。它面向论文、报告和扫描文档的结构恢复,更适合开发者或需要批量整理资料的用户。

项目地址:https://github.com/Tencent/WeVisDoc

项目主页:https://tencent.github.io/WeVisDoc

2B 模型:https://huggingface.co/Tencent/WeVisDoc-2B

4B 模型:https://huggingface.co/Tencent/WeVisDoc-4B

技术报告:https://arxiv.org/abs/2609.20423

核心功能

它把整页文档当作图片理解,同时恢复标题、段落、表格和阅读顺序。遇到论文里的数学公式,会输出 LaTeX;遇到多行多列表格,则输出 HTML,省去逐项复制和重新排版。

仓库支持 PNG、JPEG 和 WebP,可以处理单张图片,也能批量扫描文件夹。PDF 目前要先拆成页面图片。已有非空结果会默认跳过,适合中断后继续跑批量任务。

模型训练分成两轮。第一轮补齐文档类型、结构和画面质量,并合成保留版式的模糊、噪声等退化页面;第二轮再用独立样本查找剩余错误,把训练数据和输出 token 集中到薄弱类型。这也是它重点处理扫描件、低清页面和复杂公式的原因。

按项目公布的三次推理均值,4B 版在 OmniDocBench v1.6 得到 95.38,在 PureDocBench 三条赛道的平均 Overall 为 75.54。评测结果说明模型对数字文档和退化页面都有较好适应性,但真实效果仍会受图片清晰度、版式和输出长度影响。

安装与使用

环境需要 Python 3.10+。单张图片可以先用 Transformers 本地推理:

git clone https://github.com/Tencent/WeVisDoc.gitcd WeVisDocpython -m venv .venvsource .venv/bin/activatepython -m pip install -r requirements-local.txtpython -m wevisdoc.local --model Tencent/WeVisDoc-2B \  --image page.png --output results/page.md

需要批量或提供接口时,按官方文档安装 requirements-vllm.txt,再运行 bash scripts/serve_vllm.sh Tencent/WeVisDoc-2B。官方脚本使用 Bash,Linux 环境更省事;2B、4B 都需要结合显存选择。本文未做本地推理测试,评测数字来自项目 README 与论文。

相关学习资料