
不少药企研发、档案人员都有同款困扰:实验结束,数据不能一键进系统。 所有原始信息分散在各类纸质单据中,仪器打印数据、手写批注、多页拼接表格混杂,走完复核流程统一扫描归档。可每当需要调取数据做分析、入库建档时,所有关键信息都要重新手动录入、核对、匹配。 看似常规的文档归档工作,藏着极高隐性成本:PDF 扫描件无法被系统读取,复杂表格、仪器图谱、修订批注都要人工区分还原;研发论文、专利、SOP 入库前全靠人工拆解校验。 零散几分钟的录入叠加起来,整批资料整理就要几周;一处数据对齐失误,全盘统计都要推翻重来。
xParse 面向医药行业文档处理场景,将扫描件、混合排版和复杂版式中的内容识别并还原,整理成业务系统和知识库可以继续使用的数据。系统先承担重复性较高的识别与整理,业务人员再围绕关键内容进行复核、分析和决策。


实验记录、批记录、检验表、设备台账和历史档案,是药企数量较大的一类资料。
它们通常来自不同实验、不同仪器和不同部门,格式很难完全统一。一张页面中可能同时存在打印文字、图谱、标签、签章和修改标注;表格中还会出现无线框、密集字段、跨页内容和合并单元格。
过去,这些资料进入系统主要依靠人工。
工作人员打开原文,逐项确认样品编号、批号、实验时间和检测结果,再录入业务系统。遇到扫描质量不高或表格结构复杂的文件,还要在原文与录入页面之间反复切换。
xParse 可以识别扫描 PDF 中的文字、段落、表格、图片和版面区域,并尽量保留原有的信息关系。
针对有线表、无线表、密集表、跨页表格和合并单元格,系统结合版面位置和内容结构还原行列关系,使检测项、样品、指标和结果继续保持对应。
完成解析后,业务人员可以集中复核关键字段和异常内容,再将结果用于数据库录入、实验台账维护或后续分析。长期保存在文件柜和项目目录中的历史资料,也可以按照批次逐步处理,重新进入可检索、可使用的范围。

解析工作台

药企知识库需要处理的资料,远不止格式规整的 Word 文档。SOP、实验报告、法规文件、注册资料、论文、专利和质控材料,通常篇幅长、层级多,还包含表格、图示、脚注、附件和引用说明。论文常见双栏排版,专利则包含大量实施例和专业图示。文档上传只是第一步。
在进入检索和问答链路前,系统还要判断标题与正文的关系、表格中字段与数据的对应方式,以及结论适用的实验条件。解析阶段一旦丢失这些关系,后续模型也很难完整补回。
标题层级没有保留,返回内容就可能缺少章节背景;表头与数据被拆开,检索结果只剩下孤立数字;内容切得太碎,操作条件和执行步骤会落入不同片段;页眉页脚混入正文,同样的信息还会反复进入知识库。
xParse 在文档入库前识别标题、段落、表格、图片、页眉页脚和页面位置,并结合章节、段落和表格结构进行智能切分。
切分过程中,标题与所属正文保持关联,表头与对应数据尽量进入同一内容片段,结论也保留必要的实验条件和限定说明。知识库团队可以在入库前查看解析和切片结果,完成必要调整后,再接入后续应用。
每一个内容片段还可以保留与原文页面和内容区域的对应关系。研发、质控、注册和合规人员查看知识库回答时,可以继续回到原文,核对完整表述、数据来源和适用条件。
知识库提供的不再是一段脱离原文的文字,而是一条可以继续追溯和复核的信息线索。

知识库入库链路

药企内部的病例资料、临床记录、随访文件、检查报告和项目文档中,可能包含患者姓名、联系方式、证件信息、住院号、医生姓名、机构名称和项目编号。
这些信息可能分布在正文、表格、页眉页脚和扫描区域中。仅依靠关键词查找,很难覆盖所有情况;完全依靠人工逐页检查,资料量增加后又会带来较长的处理周期。
基于文档解析结果,xParse 可以继续识别敏感要素,并根据企业配置的规则进行遮盖、替换或删除。
不同用途的资料可以使用不同规则。内部科研资料可以保留必要的时间和业务信息;用于培训、测试或跨部门共享的文件,可以进一步处理人员、机构和项目相关内容。
系统完成初步处理后,业务人员可以在结果页面检查敏感内容的位置和处理效果,再输出脱敏后的文件。文档原有的章节和表格结构仍然得到保留,可以继续用于知识库入库、科研分析和模型测试。脱敏由此成为文档进入知识应用前的一道标准处理环节。

文档脱敏

医药文档的处理难点,很多藏在普通文字之外。检验报告中可能包含密集表格,注册资料中常见跨页内容,论文采用双栏排版并穿插图表、公式和脚注,历史扫描档案中还可能出现签章、粘贴附件和复杂页眉。
这些内容一旦被转换为连续纯文本,原有关系很容易丢失。表格结构被破坏,检测项与结果难以对应;双栏读取顺序错误,正文会被交叉拼接;跨页内容被截断,数据失去完整性;页眉、正文和脚注混在一起,知识库切片也会随之错位。
xParse 针对扫描页面、多栏版式、复杂表格、图片和公式等内容进行结构识别,尽量保留标题、正文、表格和页面位置之间的关系。
针对化学结构式、反应路线和分子式等专业内容,可以先完成区域识别、图片切分和原文定位,再交给专业模型或业务系统继续处理,为后续专项能力提供清晰输入。

复杂医药文档解析示意

SOP、质量标准、注册资料和管理制度都会持续修订,实验台账和检测明细也会随着业务推进不断变化。
每次收到新版本,业务人员都要确认新增了哪些内容、删除了哪些条款、参数和适用范围发生了什么调整。文件篇幅较长时,逐段核对本身就是一项耗时工作。
xParse 支持长文档比对和 Excel 比对,帮助用户定位新增、删除和修改内容。
SOP 和制度文件可以查看条款变化,注册资料和项目报告可以聚焦调整章节,实验台账和检测明细则可以对比行列及数值变化。
知识库团队也可以根据比对结果判断哪些内容需要重新解析和入库,减少文档更新后的重复处理。

文档比对

论文、专利、技术资料和国际法规,是药企研发与注册工作中的重要信息来源。
传统翻译过程中,正文经常需要复制到其他工具,表格、图注和章节关系也容易被打散。翻译完成后,工作人员还要重新排版并逐项核对原文。
基于文档解析结果,xParse 可以在保留章节、段落和表格关系的基础上处理文档翻译,并维持译文与原文页面之间的对应关系。
外文论文、专利和法规资料完成解析与翻译后,可以继续进行切分和入库,减少在不同工具间反复复制、排版和整理。

文档翻译

药企内部通常已经建设了实验管理系统、数据库、文档管理平台、注册资料系统、知识库和内部问答应用。
xParse 支持通过 API、解析工作台和组件化嵌入等方式接入现有环境。
业务人员可以在解析工作台中上传资料、查看结果并完成修改;IT 团队可以将解析、智能切分、脱敏和比对能力嵌入内部系统;知识库团队可以将解析结果对接到现有 RAG 或问答应用,也可以推送至 Dify、RAGFlow 等平台。
解析工作台和结果页面还可以嵌入已有业务平台,并结合 SSO 登录,使用户在原有工作界面中完成文档处理。
在单文档问答和文档 Agent 场景中,企业也可以接入本地大模型。xParse 提供结构化内容、检索片段和原文定位,本地模型负责理解问题和生成回答。
针对长期运行需求,xParse Enterprise 提供任务管理、多系统接入和运维监控,并支持私有化部署,使文档、解析结果和模型调用在企业本地环境中完成。

企业系统接入架构

药企文档繁多,实验记录、SOP、论文、专利、注册资料、临床材料、质控文件和历史档案,已经在日常业务中积累了很久。真正影响使用效率的,是这些资料能否被准确识别、合理整理,在完成必要的复核和脱敏后,进入业务系统与知识库。
对实验和质量人员,xParse 可以减少逐页录入和反复核对。
对研发人员,论文、专利和实验报告经过解析后,可以更快找到相关内容,并回到原文查看完整上下文。
对注册和合规人员,文档比对和原文定位可以帮助核对版本变化和资料依据。
对知识库团队,解析、切分、检查、脱敏和入库能够形成连续的处理链路。
对 IT 团队,一套私有化部署的文档解析服务,可以支撑知识库、文档问答和多个业务系统长期调用。
当实验记录中的数据、SOP 中的条件、论文中的结论、专利中的实施例和临床资料中的敏感信息,都能在同一条链路中被识别、组织和处理,药企积累多年的专业资料,才能持续服务研发分析、质量管理、注册申报和知识沉淀。




夜雨聆风