乐于分享
好东西不私藏

AFAC 大咖说|蚂蚁集团续兴中:金融文档解析,一场福尔摩斯式的推理游戏

AFAC 大咖说|蚂蚁集团续兴中:金融文档解析,一场福尔摩斯式的推理游戏

“面对一个复杂系统,当需要提升效率或解决训练不稳定的问题时,必须从基础研究的角度去拆解和分析。这要求研究员具备整体性思考能力,能精准分析、定位和归因,就像侦探破案一样。“蚂蚁集团财富保险事业群保险智能科技资深总监、AFAC 大赛出题家续兴中这样描述「复杂金融文档还原挑战」赛题的设计思路。

在金融智能落地场景中,文档解析是一道绕不开的坎。保险、银行、证券……每个细分领域都堆积着海量的文档资产,它们承载着业务规则、合同条款、产品说明,却大多以图片或 PDF 的形式沉睡在系统中。如何让机器真正读懂这些文档,也成为真实生产的关键门槛。

参赛选手需要设计并实现一个端到端的文档解析系统,将一张金融文档图片,完整、准确、有结构地转成 Markdown。注意这里有三个关键词:完整、准确、有结构

金融文档不是普通的作文。一份保险文档,通常包含多级标题、密集表格、脚注和批注,每项信息都必须 100% 准确。

为什么要做这件事?以保险表格为例,寿险产品需要非常精准地告诉张三,在某年某月能领到多少钱。这个数字从哪来?表格查询。经纪人拿到需求后,凭借直觉定位到第某一页的某一张表、某一个单元格,查出张三 45 岁时能领多少钱。

但用户那么多,不可能每次有人问都让经纪人帮忙查第几页、第几个单元格。机构当然希望能把这些文档结构化。但问题是,金融文档大部分是图片或 PDF,普通 OCR 能把字认出来,却没有智能。

这就引出了阅读顺序的问题。人能一眼判断阅读顺序,机器却可能先读右栏,再读左栏;文字都认对了,意思依然乱掉。结构,其实是语义极其重要的一部分。这正是行业权威 Benchmark(如 OmniDocBench)的核心维度,也是续兴中在赛题设计中强调的评测重点——文本、表格、阅读顺序三者平权,遵循行业标准,便于选手借鉴前沿方式。

在真实的金融业务场景中,文档解析的准确率直接影响着服务质量和合规风险。一个数字读错位置,可能导致理赔纠纷;一个表格列对齐错误,可能让产品收益计算偏差。续兴中团队在蚂蚁保的实际业务中深有体会:传统 OCR 方案在处理简单文档时表现尚可,但一旦遇到保险产品这种包含复杂嵌套表格、跨页引用、脚注批注的文档类型,准确率就断崖式下跌。

这并非某个公司的个别难题,而是整个行业的共性痛点。

赛题详情:

https://tianchi.aliyun.com/competition/entrance/532490

大模型能很好地解决这个问题,但也带来了新的约束——上下文天花板

金融文档的超大图可能有几亿像素点,光输入就会撑爆窗口,何况输出还可能长达十几万字。你不能指望一个模型硬吞整张图。这也是赛题源自蚂蚁保真实场景的原因:保险产品文档极长且含复杂表格,传统 OCR 及通用多模态大模型在此类超大图文档上表现不佳。

因此需要一套端到端 Agent 工作流:先切分,再调用小模型分多次解析,最终拼回一份保真的 Markdown。这并非单纯模型训练问题,而是需要 Agentic 方案,通过切分、拼接等逻辑解决,具有行业共性。即使模型窗口达 1M,面对几亿像素的超大图及密集输出,仍存在极限。单靠模型预训练难以完全收敛此问题,必须依靠智能体工程优化来平衡效果与成本。

续兴中打了一个比方:拼接这套 SOP 的过程,有点像福尔摩斯办案。面对一个复杂系统,当需要提升效率或解决训练不稳定的问题时,必须从基础研究的角度去拆解和分析。这要求研究员具备整体性思考能力,能精准分析、定位和归因。

技术层面上,这道题考验的是选手对多模态模型能力边界的理解,以及工程化落地的能力。切分策略如何设计才能保证语义不丢失?分块解析后如何精准拼接?如何处理跨页表格和引用?每一个环节都需要 careful 的算法设计和大量的实验迭代。

值得一提的是,该赛题提供的模型底座是 FinixDoc-VL,这是一个专门针对金融文档优化的多模态模型。FinixDoc 是由蚂蚁保算法团队研发的一套面向金融文档解析的端到端智能体式解析系统,核心模型 FinixDoc-VL 基于 4B 级 Qwen3-VL 训练。

此外,团队构建了金融文档难例评测榜单 FinixDocBench,并开源了部分子集,覆盖真实金融业务中的低质量、超长文档和密集表格等难点场景,在该榜单中 FinixDoc-VL 取得 81.43 的综合得分。

对于参赛选手,续兴中的建议很实在:这道题不依赖海量算力训练,更侧重算法设计与实验迭代,很适合高校同学发挥创新思维

问题本质是通用技术挑战,与金融业务细节解耦,无需深厚行业背景即可取得高分。这降低了参赛门槛,让更多专注于算法创新的同学能够入场竞技。

续兴中特别提到,高校参赛队伍在这类题目上往往有独特优势。相比于企业选手可能受限于既有技术栈,高校同学更愿意尝试新颖的算法设计,更敢于在实验迭代中寻找最优解。这道题的核心竞争力不在于谁有更贵的 GPU 集群,而在于谁能设计出更巧妙的切分策略、更高效的拼接逻辑、更鲁棒的错误处理机制。

当产业 AI 从能用走向好用,需要的不仅是更大的模型,更是更精巧的工程设计与更扎实的底层理解。在复杂系统中找到那条最优路径,既需要直觉,更需要方法。

对于想要参赛的同学,续兴中的建议是:不要被”金融文档”这个词吓到,核心挑战是通用技术问题。放下对行业 know-how 的顾虑,专注于算法本身,用实验驱动迭代,就有机会拿到好成绩。

AFAC金融智能创新大赛由中国计算机学会、北京大学、新加坡南洋理工大学、蚂蚁集团、NVIDIA等近30家组织和机构联合发起。自2023年首届举办以来,AFAC大赛已成长为全国乃至全球顶尖的金融智能赛事,累计吸引超1.5万支队伍、近5万名选手同台竞技,覆盖600余所高校、400余家企业,其中“00后”创业者已登上主舞台,展现出中国AI新生代的蓬勃力量。