一个被很多人低估的事实:企业80%以上的知识以非结构化形式存储——合同、票据、报告、图纸、流程文档。
当企业要做RAG、做知识库、做Agent的时候,第一道关卡不是检索,不是生成,而是把这些困在文档里的知识"读"出来,变成AI可以理解、检索、调用的结构化信息。这道关卡处理不好,后面所有环节都白做——垃圾进,垃圾出。
但现实是,这道关卡比大多数人想象的难得多。
复杂版式——表格跨页、嵌套表格、图文混排、工程图纸——解析准确率目前仅65-70%。表格提取被业界称为"最后的前沿",因为表格里往往藏着最关键的业务数据:金额、日期、条款、指标。多模态融合也不彻底——文本走一套,图片走一套,图中关键信息容易丢失。通用解析模型对企业垂直文档(金融合同、医疗病历、制造图纸)适配差,连OCR这种"基础问题"都仍有坑。解析结果质量不稳定,直接喂给RAG/知识库,就会成为Agent落地的第一张多米诺骨牌。
这不是一个"接个API就能解决"的问题,而是一道需要深耕的工程关卡。chunk怎么切?表格整块还是拆行?图文怎么绑定?长文档怎么分段?解析质量怎么测?怎么持续提升?每一个环节都有工程取舍。
这正是DACon 2026北京站设立【非结构化数据处理与知识获取】论坛的原因。这个论坛不讨论"大模型能不能理解文档",而是讨论企业非结构化数据AI化处理的最脏最累的那道关卡——怎么把困在文档里的企业知识释放出来,变成AI和Agent可以理解、检索、调用的结构化信息。
DataFun技术社区顺应潮流,正在组织10月23-24日即将落地北京的DACon大会,为听众奉献高质量的技术话题。本次会议,我们也邀请到了360人工智能研究院认知引擎算法负责人刘焕勇老师来担任【非结构化数据处理与知识获取】论坛出品人,一起邀请业界资深的技术专家来演讲。

刘焕勇老师现任360人工智能研究院认知引擎算法负责人,在文档智能、OCR与内容理解、知识图谱与知识管理、企业AI应用架构等方向有深厚的技术积累和丰富的落地经验。
本论坛将重点讨论以下话题:
- 文档解析深水区:复杂表格/跨页/嵌套版式的高精度解析,为什么表格是"最后的前沿"
- 多模态内容理解:图文混排的联合理解,文本与图像信息的融合对齐
- 领域适配:通用解析模型如何适配金融合同/医疗病历/制造图纸等垂直文档
- chunk切分策略:表格整块vs拆行、图文绑定、长文档分段的工程实践
- 行业场景实践:金融文档智能、制造图纸/质检、医疗病历/影像的处理落地
- 解析质量评估:处理结果准确率怎么测、怎么持续提升
每个论坛都强调"问题—方法—架构—案例—指标—踩坑"完整表达,杜绝纯产品介绍式分享,回应用户对真实案例的明确诉求。
如果你感兴趣来会议上分享实践内容,欢迎在这里填写演讲思路,一旦话题被采纳,我们会联系你的。
填写地址:https://qr18.cn/A4cYOz
所属会议请选择:DACon 2026 北京(线下)
角色请选择:讲师
讲师必填字段,需全部填写
活动推荐
2026年10月23-24日,DACon·北京站即将在北京希尔顿逸林酒店举办!
除了两天的技术干货分享,大会现场还会组织闭门会、晚场圆桌交流,讲师们会围绕具体的技术点进行介绍,旨在丰富大家在参会体验,希望大家不虚此行,满载而归。
🔥 8 折优惠购票火热进行中......点击「阅读原文」即可报名参会,咨询更多购票详情可联系票务经理:13311343487。

夜雨聆风