在企业办公、合同管理、知识库、档案管理和云文档等系统中,文件既是业务信息的主要载体,也是 Agent 执行真实任务时必须面对的对象。
用户可以直接向 Agent 提出:
打开这份合同,定位付款条款; 把一批 Office 文件统一转换成 PDF; 合并这些 PDF,并添加“内部资料”水印; 提取文档正文,生成摘要并写入知识库; 清除 Word 中的批注和修订,生成正式版本。
大模型能够理解这些自然语言指令,但并不适合直接操作复杂的文档文件。文件获取、格式识别、在线预览、格式转换、内容提取和结构修改,仍然需要由稳定、可追踪的专业文档能力完成。
BaseMetas IDP 围绕企业文档处理中的三个基础问题,形成三类核心产品能力:• 文件预览 —— 解决文件能否在线查看的问题;• 格式转换 —— 解决不同文件格式如何统一的问题;• 内容处理 —— 解决如何按照业务规则操作文档的问题。
官网地址:https://basemetas.com
一、三大产品构成完整的文档能力底座
文件预览、格式转换和内容处理并不是三个彼此孤立的工具,而是覆盖文件查看、标准化和深度操作全过程的三类能力。

对传统业务系统而言,这三类产品提供的是标准文档服务;对 Agent 而言,它们则可以成为可理解、可选择和可调用的外部工具。
三者关系:预览负责让文件“能看”;转换负责让格式“统一”;内容处理负责让文档“能操作”。
例如,一份 WPS 合同可以先转换为 PDF,供用户在线审阅;随后提取正文,交给大模型分析;最后根据业务要求添加水印、页码或执行归档。
二、文件预览:让 Agent 具备查看文档的“眼睛”
1. 产品定位
文件预览解决的是不同类型的文件如何在浏览器中直接查看的问题。用户不需要安装对应的桌面软件,业务系统也不需要针对每一种格式分别开发查看器。只需将文件地址、文件标识或者上传文件提交给预览服务,即可获得在线预览页面或可嵌入业务系统的预览地址。
2. 覆盖多类型文件
BaseMetas 文件预览支持超过 200 种 文件格式,整体覆盖以下类别:
- 办公文档与文本:文字、表格、演示、WPS、开放文档和常见文本文件;
- 版式文档:PDF、OFD 等;
- 图片:常见图片、扫描图片及部分专业图像格式;
- 音视频:支持常见音频、视频文件的在线播放;
- 压缩包:在线查看压缩包目录,并预览其中受支持的文件;
- CAD 与工程图纸:建筑、机械、制造和工程管理;
- 3D 模型:工业设计、三维展示、建筑可视化;
- 流程图与思维导图:业务流程、系统架构和知识结构;
- 代码与配置文件:研发管理、代码查看和 DevOps;
- 电子书:培训资料、电子教材和产品手册。
3. 复杂文件场景
除了普通文件查看,企业应用还经常遇到网络文件、长文档、大文件、密码文档和加密压缩包等复杂情况。预览产品需要覆盖:
网络文件获取与预览; 长文档分页加载; 大文件异步处理; 密码 Office 文档; 加密压缩包; 压缩包目录浏览; 重复文件结果复用; 文件访问权限控制; 预览地址有效期控制; 水印、下载、打印和复制权限控制。
4. 作为 Agent Skill 的价值
在传统业务系统中,预览通常只是一个页面功能;在 Agent 应用中,预览还可以成为文档任务的可视化入口和人工复核环节。
例如用户提出:打开这份工程资料,让我查看其中的 CAD 图纸。
Agent 可以调用文件预览 Skill,获得预览地址并返回给用户,而不需要理解 CAD 文件的内部结构。
建议将预览能力封装为:
name: preview_documentdescription: >将文件生成可在浏览器中查看的预览资源,支持办公文档、版式文档、图片、音视频、压缩包、CAD、3D模型、流程图、代码和电子书等类型。inputs:file_source:description: 文件地址、文件标识或上传文件password:description: 文件或压缩包密码,可选preview_options:description: 预览模式、权限、水印及页面参数outputs:task_id:description: 异步任务标识preview_url:description: 在线预览地址file_type:description: 识别出的文件类型status:description: 当前处理状态
适合触发该 Skill 的用户意图包括:打开或预览文件;查看压缩包中的内容;在线查看 CAD 图纸;展示 3D 模型;打开流程图或思维导图;查看 Agent 处理后的结果文件。
三、格式转换:为不同文档建立统一的使用方式
1. 产品定位
格式转换解决的是不同文件格式之间难以统一使用的问题。企业文件来源复杂,如果上层应用分别适配每一种格式,开发和维护成本会持续增加。
2. 核心能力
Office、WPS 等文档转换为 PDF; 文档或 PDF 转换为图片; PDF 转换为可编辑或可提取内容的格式; OFD 与 PDF、图片等格式之间转换; 图片和多页扫描件转换为 PDF; 流程图和工程图纸生成便于分发的预览文件; 音视频文件转换为统一播放格式; 企业历史文件批量转换为标准归档格式。
3. 作为 Agent Skill 的价值
当用户提出:把这份 Excel 转成 PDF。
Agent 只需要识别当前文件、用户意图和目标格式,然后调用转换 Skill:
name: convert_documentdescription: >将文件从当前格式转换为指定目标格式,适用于预览、归档、编辑、交换和后续智能分析。inputs:file_source:description: 文件地址、文件标识或上传文件target_format:description: 目标文件格式source_format:description: 源文件格式,可选,可自动识别options:description: 页面范围、输出质量及其他转换参数outputs:task_id:description: 异步转换任务标识result_url:description: 转换结果地址output_format:description: 实际输出格式status:description: 任务执行状态
适合触发转换 Skill 的用户表达包括:转换成 PDF;导出为图片;把 OFD 转成 PDF;将 Office 文件统一为归档格式;生成适合在线查看的版本;把文档转换为可以进行后续分析的格式。
4. Agent 工作流中的标准化节点

例如,一份演示文稿可以先转换为 PDF,再生成逐页图片,最后由多模态模型分析每一页内容。
因此,格式转换在 Agent 工作流中承担的是“文档格式翻译器”和“标准化入口”的角色。
四、内容处理:让 Agent 能够真正操作文档
1. 产品定位
格式转换主要改变文件的载体形式,内容处理则直接操作文件内部的页面、文本、工作表、批注、修订、水印、安全属性和文档结构。
2. PDF 内容处理
文档合并和拆分; 页面删除、插入、旋转和排序; 添加页码和水印; 提取文本、图片、表格和附件; 表单填写; 批注清理和扁平化; 文档保护、加密和解密; 文档安全清理。
3. Word 内容处理
提取或删除批注; 接受或拒绝修订; 开启或关闭修订模式; 添加或移除水印; 插入或替换页眉页脚; 合并多个文档; 清理文档内容; 应用正式文档模板; 公文套红; 文档保护、加密和解密。
4. Excel 内容处理
合并或拆分工作簿; 合并、插入、删除和隐藏工作表; 规范化表格结构; 处理数据透视表; 处理条件格式; 设置或取消工作表保护; 文件加密和解密。
5. 结构化操作指令
为了让 Agent 稳定调用,可以将每一种文档操作定义为结构化操作码:
Pdf.document.mergePdf.watermark.insertPdf.text.extractPdf.page.removeWord.revision.acceptAllWord.comment.removeWord.document.applyTemplateExcel.workbook.mergeExcel.sheet.removeExcel.table.normalize
自然语言由大模型负责理解,实际执行则通过确定性的操作指令完成。
例如,用户提出:合并这五个 PDF,在每页右上角添加“机密”水印,最后设置打开密码。
Agent 可以生成:
{"files": ["file-001","file-002","file-003","file-004","file-005"],"operations": [{"operation": "Pdf.document.merge","parameters": {"order": "input"}},{"operation": "Pdf.watermark.insert","parameters": {"text": "机密","position": "top-right","opacity": 0.25}},{"operation": "Pdf.security.encrypt","parameters": {"password": "******"}}]}
6. 作为 Agent Skill 的价值
内容处理能力可以封装为:
name: process_documentdescription: >对 PDF、Word 或 Excel 文件执行结构化内容处理,支持合并、拆分、提取、水印、修订、模板和安全保护等操作,并支持多个操作按顺序执行。inputs:file_source:description: 单个文件、多个文件或文件标识列表operations:description: 按顺序执行的结构化操作列表execution_mode:description: 单文件、多文件合并或批量处理模式outputs:task_id:description: 内容处理任务标识result_url:description: 最终结果文件地址operation_results:description: 每个操作的执行结果status:description: 当前任务状态
适合触发内容处理 Skill 的用户意图包括:合并或拆分文件;添加水印和页码;接受全部修订;清除批注;提取 PDF 文本或表格;应用正式文档模板;合并 Excel 工作表;对文件进行加密或安全清理。
五、三类 Skill 如何协同完成复杂任务
假设用户提出:“把客户上传的 Word 合同转换成 PDF,添加机密水印,提取合同正文,并分析其中的付款和违约条款。”
Agent 可以将任务拆解为以下步骤:

在这个流程中:格式转换负责将原始合同标准化;内容处理负责添加水印和提取正文;大模型负责理解合同语义;文件预览负责向用户展示原文和处理结果。
其核心分工是:大模型负责理解、规划和判断,文档 Skill 负责准确、稳定地执行。
六、Agent Skill 的推荐实现方案
1. 建立基础 Skill 层
Document Skills├── preview-document├── convert-document└── process-document
2. 增加统一的 Skill Adapter

Skill Adapter 负责:接收 Agent 生成的结构化参数;校验文件来源和操作权限;提交任务;查询任务状态;处理超时和失败;将错误转换为 Agent 可理解的信息;返回预览地址、结果文件或提取内容。
3. 封装异步任务生命周期
文档预览、转换和内容处理可能需要一定时间,因此不应要求大模型持续阻塞等待。
Skill 应封装完整的任务生命周期:
提交任务↓获得 taskId↓查询状态或等待结果通知↓任务完成├─ 成功:返回预览地址、结果文件或提取内容├─ 失败:返回结构化错误└─ 超时:进入重试、取消或人工处理
结构化错误可以采用以下形式:
{"error_code": "FILE_PASSWORD_REQUIRED","message": "该文件已加密,需要提供正确的打开密码。","retryable": true,"required_action": "request_password"}
Agent 读取该结果后,可以继续向用户询问密码,而不是直接终止整个任务。 4. 增加能力查询 Skill
文件格式和内容处理能力会持续扩展,因此不建议将全部支持范围永久写死在 Prompt 中。
可以增加一个能力查询 Skill:
name: query_document_capabilitiesdescription: 查询当前支持的文件格式、转换目标和内容处理操作。inputs:capability_type:description: preview、convert 或 processsource_format:description: 源文件格式,可选target_format:description: 目标格式,可选document_type:description: PDF、Word、Excel 等,可选outputs:supported:description: 是否支持capabilities:description: 可用格式或操作列表constraints:description: 文件大小、密码和页面范围等限制
Agent 在执行不确定的任务前,可以先查询能力范围,再决定下一步操作。
七、从基础 Skill 到业务复合 Skill
识别文件类型↓转换为标准格式↓提取正文和表格↓大模型分析条款↓生成审查报告↓创建原文与报告预
八、Skill 落地需要关注的工程问题
- 输入输出必须结构化:明确文件来源、目标格式、页面范围、操作顺序、权限参数等。
- 操作前进行能力校验:文件格式、操作适用性、组合可行性、密码、权限等。
- 错误信息需要可理解:说明失败原因和可采取的下一步动作。
- 建立安全边界:文件访问权限、租户隔离、网络地址校验、临时地址有效期、敏感参数保护、操作审计等。
- 保证任务幂等性:识别重复任务并复用已有结果。
九、文档能力与 AI 能力的边界
二者的分工可以概括为:
用户与业务应用↓Agent 交互与任务规划↓业务复合 Skill↓预览 / 转换 / 内容处理基础 Skill↓BaseMetas IDP 文档能力平台↓企业文件、存储与业务系统
十、结语:让 Agent 获得可靠的文档“眼睛、翻译器和手”
文档类 Agent 真正落地时,面对的不只是自然语言和纯文本,还包括 Office、PDF、OFD、图片、音视频、压缩包、CAD、3D 模型、流程图、代码和电子书等多种企业文件。仅依靠大模型,难以稳定完成这些文件的预览、转换和修改。
BaseMetas IDP 将文档处理拆分为三类边界清晰的产品能力:
- 文件预览 是 Agent 的眼睛,让不同类型的文件都能在线查看;
- 格式转换 是 Agent 的翻译器,让不同格式进入统一的业务流程;
- 内容处理 是 Agent 的手,让文档可以按照明确规则被提取、修改和生成。
在此基础上增加 Skill 描述、结构化参数、任务状态封装、权限控制和错误处理,就可以将传统文档能力升级为 Agent 能够理解和调用的工具体系。
对于正在建设智能办公、合同审查、知识库、档案管理、云文档、工程资料或者企业级 Agent 的团队而言,真正可靠的实现方式并不是让大模型直接处理复杂文件,而是:
让大模型负责理解和规划,让专业的文档 Skill 负责执行和交付。
相关资源
BaseMetas 生产增强版:
商业版介绍:https://basemetas.com
BaseMetas FileView预览产品开源版本:
产品介绍:https://fileview.basemetas.cn/docs/product/summary
在线体验:https://file.basemetas.cn
GitHub:https://github.com/basemetas/fileview
如果你觉得本文对你有帮助,欢迎分享给更多朋友。后续还会分享更多在线文档Agent 落地的实战经验,敬请关注。
夜雨聆风