夜雨聆风学习资料网

ARTICLE · 1056540

一条命令把文档页面图片变成 Markdown

一条命令把文档页面图片变成 Markdown

以前跑文档解析,得版面检测、OCR、公式识别一个个模型串着跑。环节一多,前面漏检一个区域,后面全跟着错。

腾讯新开源的 WeVisDoc 直接把这条路砍短了:输入一页图片,直接吐出结构化 Markdown。正文、LaTeX 公式、HTML 表格一次成型,插图直接忽略。它基于 Qwen3-VL 微调,有 2B 和 4B 两个规格。官方测试里,它在四个评测设置上都拿了端到端解析器第一。

用起来也省事。起个 vLLM 服务,一条命令就能批量解析整文件夹的图片。中断了重跑还能自动续传,结果先写临时文件再改名,不会留下半截文件。不想折腾部署的话,也能直接用 Transformers 加载权重跑单图。

不过这模型也有边界。它只认 JPG、PNG 等页面图片,PDF 得自己先转成图。每回只能传一张图,遇到复杂图表也没法理解。而且它把宝全押在了一个模型上,一旦出错没有中间结果能回退。另外仓库目前只有推理代码,没放训练细节。

想试的话建议先用 2B 版摸个底,拿几十页自己的真实文档跑一遍,重点盯一下公式和表格准不准。

原文一条命令把文档页面图片变成 Markdown:腾讯开源端到端解析器 WeVisDoc
收录于开源实用工具
作者提示: 个人观点,仅供参考
上海,2小时前,

相关学习资料