ARTICLE · 1152835
腾讯微信开源了个"文档翻译器",扫描件直接变Markdown,精度干翻DeepSeek-OCR
今天聊一个刚开源就被抢着用的项目——腾讯的 WeVisDoc。
我们平时处理文档,最头疼的是什么?
扫描件是图片,PDF是图片,拍照的发票是图片……想让AI理解和编辑这些内容,传统流程是:OCR识别文字 → 排版分析 → 公式识别 → 表格还原 → 拼装成Markdown。
每一步都可能出错,串起来错误就滚雪球。
WeVisDoc把这条流水线压缩成一步:
输入一张文档图片,直接输出结构化Markdown。
公式自动转LaTeX,表格自动转HTML,标题段落自动分层。中间不需要任何人工干预。
凭什么说它强?
这不是自嗨,有硬数据。
在文档解析领域最权威的两个评测基准上,WeVisDoc-4B 全部排名第一:
OmniDocBench v1.6 得分 95.38,把一众对手甩在身后:
• DeepSeek-OCR 2:90.25
• 腾讯自家 HunyuanOCR-1.5:94.74
• FireRed-OCR(快手):93.26
更夸张的是 PureDocBench——专门测"脏文档"(模糊扫描、低质量拍照)的基准。WeVisDoc-4B 三条赛道均值 75.54,第二名 FD-RL 是 73.92,差距不小。
尤其在"真实退化"赛道(real-world degraded),WeVisDoc 拿到 69.08,比 DeepSeek-OCR 2 的 43.60 高出一大截。越烂的文档,差距越大。
技术上有什么特别的?
WeVisDoc 不是从零训练的模型。它的底座是 Qwen3-VL(通义千问的视觉语言模型),分别基于 2B 和 4B 两个规格微调。
真正的功夫在训练数据和微调策略上。从论文标题就能看出思路:"From Coverage to Capability"——先用海量文档数据覆盖各种版式,再针对困难场景强化能力。
推理层面,它完全兼容 OpenAI API 格式。这意味着:
• 用 vLLM 一键部署,任何支持 OpenAI 协议的框架都能直接调用
• 2B 版本在单张消费级 GPU 上就能跑
• 输出是纯文本 Markdown,可以直接喂给任何下游系统
实际用起来什么体验?
仓库里的使用方式极其简单:
# 起服务bash scripts/serve_vllm.sh Tencent/WeVisDoc-2B# 解析一张图python -m wevisdoc.client --image page.png --output result.md# 批量处理一个目录python -m wevisdoc.client --image-dir ./scans --result-dir ./markdown --workers 4不走服务也能用,Transformers 直接加载:
python -m wevisdoc.local --model Tencent/WeVisDoc-2B --image page.png整个代码仓库只有 6个Python文件,约400行。模型的智能全在权重里,代码只是薄薄一层壳。
对我们意味着什么?
几个直接能用上的场景:
1. 历史文档数字化古籍、档案、旧报纸——拍照或扫描后直接转Markdown,批量处理,人力成本降到接近零。
2. 财务/法务文档处理发票、合同、审计报告里的复杂表格和公式,一次转换直接可用,不需要人工校对排版。
3. 知识库建设把公司积累的PDF文档批量转成结构化Markdown,直接导入RAG系统或知识库。
4. 教育内容制作试卷、讲义、论文里的数学公式,LaTeX格式输出后可以直接渲染。
写在后面
腾讯这次开源得相当彻底:模型权重放在 HuggingFace 上(WeVisDoc-2B 和 WeVisDoc-4B),代码 Apache 2.0 协议,技术报告也发了 arXiv。
2B 模型在多个场景下已经超过了 3B-7B 的竞品,说明数据质量和微调策略比堆参数更有效。这个思路对所有做垂直领域AI的团队都有参考价值。
感兴趣的可以直接上手试:
• GitHub:github.com/Tencent/WeVisDoc
• HuggingFace:Tencent/WeVisDoc-2B / Tencent/WeVisDoc-4B
• 在线体验:tencent.github.io/WeVisDoc
如果你手头有大量需要处理的文档图片,强烈建议试试。2B 版本对硬件要求不高,单张消费级显卡就够了。
我们下期见。
如果觉得有帮助,欢迎点赞、在看、转发三连。