夜雨聆风学习资料网

ARTICLE · 1150699

腾讯优图开源5B全模态解析模型,文档音视频一次转JSON

腾讯优图开源5B全模态解析模型,文档音视频一次转JSON

腾讯优图实验室发布了 Youtu-Parsing-Omni,一个 5B 参数的开放权重解析模型。它的任务不是生成内容,而是把各种形态的输入材料整理成结构化数据:文档、图表、音频、视频,进去之后统一输出 JSON。在文档解析领域常用的 OmniDocBench 评测上,这个模型拿到 96.96 分。

解析模型的价值藏在水面之下。大模型能回答问题,前提是知识以它能读的形式存在。而企业里真正有价值的材料,绝大多数是 PDF 合同、扫描件报表、带图表的财报、会议录音和产品演示视频——这些格式对模型来说是天然的障碍。过去的处理方式是拼装流水线:OCR 负责认字,版面分析负责分段,表格识别负责还原结构,语音转写负责音频,每一环都是独立模型,每一环的误差都会累加到下一环。Youtu-Parsing-Omni 的做法是把这些环节收进一个模型,一次前向直接给出 JSON。

这样做的好处不只是省事。流水线里最脆弱的地方是格式交接:OCR 输出的坐标传给版面模型,版面模型的分块再传给表格模型,任何一环的坐标偏移或编码差异都会放大成最终结果的错行错列。单模型端到端处理跳过了这些交接面,结构一致性更好。5B 的参数量也决定了部署门槛——单张消费级显卡就能跑起来,不需要多卡并行,这对想把解析环节放在内网的数据敏感行业尤其重要。

评测分数要放在具体任务里看。OmniDocBench 覆盖的是文档解析的典型难点:多栏排版、跨页表格、公式与混排、扫描件噪声。96.96 分意味着在主流测试集上,这个规模的模型已经接近专用文档解析系统的水平。但真实业务里的材料往往比测试集更脏——手写批注、盖章遮挡、手机随手拍的倾斜照片,这些情况的表现需要自己拿样本验证,公开分数只能作为选型的第一道筛子。

音视频解析是被低估的那一半。会议录音、客服通话、培训视频里承载的信息量,在多数企业里比文档更大,但也更少被结构化。模型能把音频和视频一并转入同一套 JSON 结构,意味着后续的检索、问答和摘要可以建立在同一份数据上,不必再为每种模态维护独立的索引。对做知识库和企业搜索的团队,这一步省掉的是长期的数据治理成本。

权限上有一个明确限制:该模型的许可证排除了在欧盟的使用。这类地域限制在开放权重模型里不算常见,但近年逐渐增多,通常与训练数据来源或合规要求有关。国内企业使用不受影响,但有欧洲业务分支或计划向欧洲客户交付服务的团队,需要提前把这一点纳入合规评估,不要等到部署完成才发现许可范围不匹配。

横向对比看,同档位的开源解析模型多数只覆盖文档与图像,音频和视频要另接转写服务;商业文档解析 API 虽然覆盖更全,但按页计费的成本对大批量历史材料来说并不低。5B 规模加上全模态覆盖,把"自建一套企业解析中台"的算力门槛压到了相当低的水平。真正要用起来,建议先拿自家最难的几十份材料做一轮盲测,把错行、漏表和公式还原这三类高频错误单独统计,再决定是否全量替换现有流水线。

相关学习资料