乐于分享
好东西不私藏

Agent 如何处理复杂文档?BaseMetas IDP 三大文档能力与 Skill 实现方案

Agent 如何处理复杂文档?BaseMetas IDP 三大文档能力与 Skill 实现方案

在企业办公、合同管理、知识库、档案管理和云文档等系统中,文件既是业务信息的主要载体,也是 Agent 执行真实任务时必须面对的对象。

用户可以直接向 Agent 提出:

  • 打开这份合同,定位付款条款;
  • 把一批 Office 文件统一转换成 PDF;
  • 合并这些 PDF,并添加“内部资料”水印;
  • 提取文档正文,生成摘要并写入知识库;
  • 清除 Word 中的批注和修订,生成正式版本。

大模型能够理解这些自然语言指令,但并不适合直接操作复杂的文档文件。文件获取、格式识别、在线预览、格式转换、内容提取和结构修改,仍然需要由稳定、可追踪的专业文档能力完成。

BaseMetas IDP 围绕企业文档处理中的三个基础问题,形成三类核心产品能力:• 文件预览 —— 解决文件能否在线查看的问题;• 格式转换 —— 解决不同文件格式如何统一的问题;• 内容处理 —— 解决如何按照业务规则操作文档的问题。

官网地址:https://basemetas.com

一、三大产品构成完整的文档能力底座

文件预览、格式转换和内容处理并不是三个彼此孤立的工具,而是覆盖文件查看、标准化和深度操作全过程的三类能力。

对传统业务系统而言,这三类产品提供的是标准文档服务;对 Agent 而言,它们则可以成为可理解、可选择和可调用的外部工具。

三者关系:预览负责让文件“能看”;转换负责让格式“统一”;内容处理负责让文档“能操作”。

例如,一份 WPS 合同可以先转换为 PDF,供用户在线审阅;随后提取正文,交给大模型分析;最后根据业务要求添加水印、页码或执行归档。

二、文件预览:让 Agent 具备查看文档的“眼睛”

1. 产品定位

文件预览解决的是不同类型的文件如何在浏览器中直接查看的问题。用户不需要安装对应的桌面软件,业务系统也不需要针对每一种格式分别开发查看器。只需将文件地址、文件标识或者上传文件提交给预览服务,即可获得在线预览页面或可嵌入业务系统的预览地址。

2. 覆盖多类型文件

BaseMetas 文件预览支持超过 200 种 文件格式,整体覆盖以下类别:

  • 办公文档与文本:文字、表格、演示、WPS、开放文档和常见文本文件
  • 版式文档:PDF、OFD 等
  • 图片:常见图片、扫描图片及部分专业图像格式
  • 音视频:支持常见音频、视频文件的在线播放
  • 压缩包:在线查看压缩包目录,并预览其中受支持的文件
  • CAD 与工程图纸:建筑、机械、制造和工程管理
  • 3D 模型:工业设计、三维展示、建筑可视化
  • 流程图与思维导图:业务流程、系统架构和知识结构
  • 代码与配置文件:研发管理、代码查看和 DevOps
  • 电子书:培训资料、电子教材和产品手册

3. 复杂文件场景

除了普通文件查看,企业应用还经常遇到网络文件、长文档、大文件、密码文档和加密压缩包等复杂情况。预览产品需要覆盖:

  • 网络文件获取与预览;
  • 长文档分页加载;
  • 大文件异步处理;
  • 密码 Office 文档;
  • 加密压缩包;
  • 压缩包目录浏览;
  • 重复文件结果复用;
  • 文件访问权限控制;
  • 预览地址有效期控制;
  • 水印、下载、打印和复制权限控制。

4. 作为 Agent Skill 的价值

在传统业务系统中,预览通常只是一个页面功能;在 Agent 应用中,预览还可以成为文档任务的可视化入口和人工复核环节。

例如用户提出:打开这份工程资料,让我查看其中的 CAD 图纸。

Agent 可以调用文件预览 Skill,获得预览地址并返回给用户,而不需要理解 CAD 文件的内部结构。

建议将预览能力封装为:

name: preview_documentdescription: >  将文件生成可在浏览器中查看的预览资源,  支持办公文档、版式文档、图片、音视频、压缩包、  CAD、3D模型、流程图、代码和电子书等类型。inputs:  file_source:    description: 文件地址、文件标识或上传文件  password:    description: 文件或压缩包密码,可选  preview_options:    description: 预览模式、权限、水印及页面参数outputs:  task_id:    description: 异步任务标识  preview_url:    description: 在线预览地址  file_type:    description: 识别出的文件类型  status:    description: 当前处理状态

适合触发该 Skill 的用户意图包括:打开或预览文件;查看压缩包中的内容;在线查看 CAD 图纸;展示 3D 模型;打开流程图或思维导图;查看 Agent 处理后的结果文件。

三、格式转换:为不同文档建立统一的使用方式

1. 产品定位

格式转换解决的是不同文件格式之间难以统一使用的问题。企业文件来源复杂,如果上层应用分别适配每一种格式,开发和维护成本会持续增加。

2. 核心能力

  • Office、WPS 等文档转换为 PDF;
  • 文档或 PDF 转换为图片;
  • PDF 转换为可编辑或可提取内容的格式;
  • OFD 与 PDF、图片等格式之间转换;
  • 图片和多页扫描件转换为 PDF;
  • 流程图和工程图纸生成便于分发的预览文件;
  • 音视频文件转换为统一播放格式;
  • 企业历史文件批量转换为标准归档格式。

3. 作为 Agent Skill 的价值

当用户提出:把这份 Excel 转成 PDF。

Agent 只需要识别当前文件、用户意图和目标格式,然后调用转换 Skill:

name: convert_documentdescription: >  将文件从当前格式转换为指定目标格式,  适用于预览、归档、编辑、交换和后续智能分析。inputs:  file_source:    description: 文件地址、文件标识或上传文件  target_format:    description: 目标文件格式  source_format:    description: 源文件格式,可选,可自动识别  options:    description: 页面范围、输出质量及其他转换参数outputs:  task_id:    description: 异步转换任务标识  result_url:    description: 转换结果地址  output_format:    description: 实际输出格式  status:    description: 任务执行状态

适合触发转换 Skill 的用户表达包括:转换成 PDF;导出为图片;把 OFD 转成 PDF;将 Office 文件统一为归档格式;生成适合在线查看的版本;把文档转换为可以进行后续分析的格式。

4. Agent 工作流中的标准化节点

例如,一份演示文稿可以先转换为 PDF,再生成逐页图片,最后由多模态模型分析每一页内容。

因此,格式转换在 Agent 工作流中承担的是“文档格式翻译器”和“标准化入口”的角色。

四、内容处理:让 Agent 能够真正操作文档

1. 产品定位

格式转换主要改变文件的载体形式,内容处理则直接操作文件内部的页面、文本、工作表、批注、修订、水印、安全属性和文档结构。

2. PDF 内容处理

  • 文档合并和拆分;
  • 页面删除、插入、旋转和排序;
  • 添加页码和水印;
  • 提取文本、图片、表格和附件;
  • 表单填写;
  • 批注清理和扁平化;
  • 文档保护、加密和解密;
  • 文档安全清理。

3. Word 内容处理

  • 提取或删除批注;
  • 接受或拒绝修订;
  • 开启或关闭修订模式;
  • 添加或移除水印;
  • 插入或替换页眉页脚;
  • 合并多个文档;
  • 清理文档内容;
  • 应用正式文档模板;
  • 公文套红;
  • 文档保护、加密和解密。

4. Excel 内容处理

  • 合并或拆分工作簿;
  • 合并、插入、删除和隐藏工作表;
  • 规范化表格结构;
  • 处理数据透视表;
  • 处理条件格式;
  • 设置或取消工作表保护;
  • 文件加密和解密。

5. 结构化操作指令

为了让 Agent 稳定调用,可以将每一种文档操作定义为结构化操作码:

Pdf.document.mergePdf.watermark.insertPdf.text.extractPdf.page.removeWord.revision.acceptAllWord.comment.removeWord.document.applyTemplateExcel.workbook.mergeExcel.sheet.removeExcel.table.normalize

自然语言由大模型负责理解,实际执行则通过确定性的操作指令完成。

例如,用户提出:合并这五个 PDF,在每页右上角添加“机密”水印,最后设置打开密码。

Agent 可以生成:

{  "files": [    "file-001",    "file-002",    "file-003",    "file-004",    "file-005"  ],  "operations": [    {      "operation": "Pdf.document.merge",      "parameters": {        "order": "input"      }    },    {      "operation": "Pdf.watermark.insert",      "parameters": {        "text": "机密",        "position""top-right",        "opacity"0.25      }    },    {      "operation": "Pdf.security.encrypt",      "parameters": {        "password": "******"      }    }  ]}

6. 作为 Agent Skill 的价值

内容处理能力可以封装为:

name: process_documentdescription: >  对 PDF、Word 或 Excel 文件执行结构化内容处理,  支持合并、拆分、提取、水印、修订、模板和安全保护等操作,  并支持多个操作按顺序执行。inputs:  file_source:    description: 单个文件、多个文件或文件标识列表  operations:    description: 按顺序执行的结构化操作列表  execution_mode:    description: 单文件、多文件合并或批量处理模式outputs:  task_id:    description: 内容处理任务标识  result_url:    description: 最终结果文件地址  operation_results:    description: 每个操作的执行结果  status:    description: 当前任务状态

适合触发内容处理 Skill 的用户意图包括:合并或拆分文件;添加水印和页码;接受全部修订;清除批注;提取 PDF 文本或表格;应用正式文档模板;合并 Excel 工作表;对文件进行加密或安全清理。

五、三类 Skill 如何协同完成复杂任务

假设用户提出:“把客户上传的 Word 合同转换成 PDF,添加机密水印,提取合同正文,并分析其中的付款和违约条款。”

Agent 可以将任务拆解为以下步骤:

在这个流程中:格式转换负责将原始合同标准化;内容处理负责添加水印和提取正文;大模型负责理解合同语义;文件预览负责向用户展示原文和处理结果。

其核心分工是:大模型负责理解、规划和判断,文档 Skill 负责准确、稳定地执行。

六、Agent Skill 的推荐实现方案

1. 建立基础 Skill 层

Document Skills├── preview-document├── convert-document└── process-document

2. 增加统一的 Skill Adapter

Skill Adapter 负责:接收 Agent 生成的结构化参数;校验文件来源和操作权限;提交任务;查询任务状态;处理超时和失败;将错误转换为 Agent 可理解的信息;返回预览地址、结果文件或提取内容。

3. 封装异步任务生命周期

文档预览、转换和内容处理可能需要一定时间,因此不应要求大模型持续阻塞等待。

Skill 应封装完整的任务生命周期:

提交任务  ↓获得 taskId  ↓查询状态或等待结果通知  ↓任务完成  ├─ 成功:返回预览地址、结果文件或提取内容  ├─ 失败:返回结构化错误  └─ 超时:进入重试、取消或人工处理

结构化错误可以采用以下形式:

{  "error_code": "FILE_PASSWORD_REQUIRED",  "message": "该文件已加密,需要提供正确的打开密码。",  "retryable": true,  "required_action": "request_password"}

Agent 读取该结果后,可以继续向用户询问密码,而不是直接终止整个任务。
4. 增加能力查询 Skill

文件格式和内容处理能力会持续扩展,因此不建议将全部支持范围永久写死在 Prompt 中。

可以增加一个能力查询 Skill:

name: query_document_capabilitiesdescription: 查询当前支持的文件格式、转换目标和内容处理操作。inputs:  capability_type:    description: preview、convert 或 process  source_format:    description: 源文件格式,可选  target_format:    description: 目标格式,可选  document_type:    description: PDF、Word、Excel 等,可选outputs:  supported:    description: 是否支持  capabilities:    description: 可用格式或操作列表  constraints:    description: 文件大小、密码和页面范围等限制

Agent 在执行不确定的任务前,可以先查询能力范围,再决定下一步操作。

七、从基础 Skill 到业务复合 Skill

预览、转换和内容处理属于原子能力。在实际应用中,还可以围绕业务目标封装更高层的复合 Skill。
复合 Skill
主要能力组合
合同审查
格式转换、文本提取、条款分析、结果预览
文档归档
格式标准化、水印、页码、安全处理、归档
文档对比
文件转换、正文提取、版本差异分析
正式文件生成
清除批注、接受修订、应用模板、导出 PDF
知识库入库
格式识别、转换、内容提取、切分和入库
档案数字化
扫描件整理、页面处理、内容识别和归档
工程资料助手
CAD 预览、资料查看、文件转换和归档
三维资产助手
3D 模型预览、资料关联和资产信息查询
研发资料助手
代码预览、配置查看和技术文档提取
例如,合同审查复合 Skill 可以编排:
识别文件类型  ↓转换为标准格式  ↓提取正文和表格  ↓大模型分析条款  ↓生成审查报告  ↓创建原文与报告预
基础 Skill 保持稳定、通用和可复用,复合 Skill 则面向具体业务目标组织调用顺序。

八、Skill 落地需要关注的工程问题

  • 输入输出必须结构化:明确文件来源、目标格式、页面范围、操作顺序、权限参数等。
  • 操作前进行能力校验:文件格式、操作适用性、组合可行性、密码、权限等
  • 错误信息需要可理解:说明失败原因和可采取的下一步动作
  • 建立安全边界:文件访问权限、租户隔离、网络地址校验、临时地址有效期、敏感参数保护、操作审计等
  • 保证任务幂等性:识别重复任务并复用已有结果

九、文档能力与 AI 能力的边界

BaseMetas IDP 的主要职责,是完成确定性的文档操作;大模型的主要职责,则是理解自然语言和文档语义。

二者的分工可以概括为:

Agent 与大模型
BaseMetas IDP
理解用户意图
获取和识别文件
拆解任务步骤
生成文件预览
选择适合的 Skill
转换文件格式
分析文档语义
合并、拆分和修改文档
判断条款和风险
添加水印和安全保护
生成摘要与报告
提取文本、图片和表格
决定是否需要人工确认
返回任务状态和结果文件
对于扫描文件文字识别、复杂版面理解、语义分析和文档问答,可以在三类文档能力之上进一步增加 OCR、视觉模型、RAG 和大模型服务。原始材料也明确说明,内容处理产品本身侧重确定性的文档操作,并不等同于 OCR 或 AI 分析平台。
推荐的整体分层为:
用户与业务应用        ↓Agent 交互与任务规划        ↓业务复合 Skill        ↓预览 / 转换 / 内容处理基础 Skill        ↓BaseMetas IDP 文档能力平台        ↓企业文件、存储与业务系统
大模型不直接修改复杂文件,文档服务也不负责替代大模型进行业务推理。这种边界能够同时保证智能性和执行可靠性

十、结语:让 Agent 获得可靠的文档“眼睛、翻译器和手”

文档类 Agent 真正落地时,面对的不只是自然语言和纯文本,还包括 Office、PDF、OFD、图片、音视频、压缩包、CAD、3D 模型、流程图、代码和电子书等多种企业文件。仅依靠大模型,难以稳定完成这些文件的预览、转换和修改。

BaseMetas IDP 将文档处理拆分为三类边界清晰的产品能力:

  • 文件预览 是 Agent 的眼睛,让不同类型的文件都能在线查看;
  • 格式转换 是 Agent 的翻译器,让不同格式进入统一的业务流程;
  • 内容处理 是 Agent 的手,让文档可以按照明确规则被提取、修改和生成。

在此基础上增加 Skill 描述、结构化参数、任务状态封装、权限控制和错误处理,就可以将传统文档能力升级为 Agent 能够理解和调用的工具体系。

对于正在建设智能办公、合同审查、知识库、档案管理、云文档、工程资料或者企业级 Agent 的团队而言,真正可靠的实现方式并不是让大模型直接处理复杂文件,而是:

让大模型负责理解和规划,让专业的文档 Skill 负责执行和交付。

相关资源

BaseMetas 生产增强版:

  • 商业版介绍:https://basemetas.com

BaseMetas FileView预览产品开源版本:

  • 产品介绍:https://fileview.basemetas.cn/docs/product/summary

  • 在线体验:https://file.basemetas.cn

  • GitHub:https://github.com/basemetas/fileview

如果你觉得本文对你有帮助,欢迎分享给更多朋友。后续还会分享更多在线文档Agent 落地的实战经验,敬请关注。