夜雨聆风学习资料网

ARTICLE · 1043238

图解腾讯最新开源文档解析模型WeVisDoc

图解腾讯最新开源文档解析模型WeVisDoc

#腾讯 #大模型 #LLM #AI
WeVisDoc 是腾讯微信视觉团队开源的一款端到端文档解析模型,主要用于理解文档图片。它不只是做 OCR 文字识别,还会进一步理解整页文档的结构。用户可以直接输入扫描件、截图或 PDF 页面,模型会识别标题、段落、列表、公式和表格等内容,并输出结构化 Markdown。公式可以转换为 LaTeX,表格可以转换为 HTML。

WeVisDoc 基于 Qwen3-VL-2B-Instruct 和 Qwen3-VL-4B-Instruct 微调,提供 2B 和 4B 两种版本。它还采用两阶段训练方法:先扩大文档类型、版式和外观的覆盖范围,再根据模型剩余的错误进行定向补强,从而提升复杂版面、扫描噪声、拍照畸变和退化文档中的解析稳定性。

论文数据显示,WeVisDoc-4B 在 OmniDocBench v1.6 上取得 95.38 的 Overall 分数,在 PureDocBench 三个赛道上的平均 Overall 为 75.54。它可应用于知识库构建、RAG、论文与财报解析、合同处理、文档数字化和自动化信息抽取等场景。

山西,1小时前,

相关学习资料