ARTICLE · 1156658
企业 AI 落地高价值场景——06 文档智能
全文约 2800 字,阅读需 9 分钟
导语
一个财务,月底对着一摞发票,逐张看、逐张录;一个法务助理,把合同关键条款一条条手抄进表格;一个人力资源,把简历里的姓名、学校、年限一个个敲进系统。
三个人干的是同一件事——把非结构化的文档,变成能用的结构化数据。没人觉得有问题,因为一直就是这样。
另一边,有地方的卫健委上了文档智能之后,病历书写时间砍掉六成,关键字段缺失率降了七成六;有法律科技团队靠它,一个月能产出约两万份法律文书。
同样是和文档打交道,一边在手工搬运,一边在让 AI 读。差的不在勤奋,在有没有把"读文档"变成一项能复用的能力。
一、为什么文档智能算"底座",不是"又一个场景"
挑场景的三条标准卡一遍:高频,每个企业每天产出和处理的文档数不清;刚需,不读不抽,文档就进不了任何系统;可量化,每份省多少分钟、字段缺失率降多少,算得清。三条全中。
但它的特殊之处在第四点:前面几篇的场景,吃的全是同一类能力。
合同审查要抽条款(第 03 篇),财务票据要识别加三单匹配(第 02 篇),知识库问答要先解析文档才能答(第 01 篇),简历初筛要抽字段(第 05 篇)。这些动作拆开看,底层都是三件事:读得懂纸上的字(文字识别)、抽得出里面的字段(信息抽取)、写得出新文档(智能生成)。
合同、票据、简历、报告、公文,本质都是"非结构化文档"。这一层建好,前面几篇都能直接复用,不用每个场景各造一遍轮子。
二、文档智能第一步:先定"读得准",别直接让模型裸写
最容易踩的错,是把扫描件或图片直接丢给通用大模型,让它"帮我抽出合同金额和期限"。
通用模型看不见版面,表格跨页、印章遮挡、字迹模糊它都处理不好,结果就是要么抽错、要么凭空编一个金额。你拿去填系统,后面全错。
正确顺序是分层走:
第一层,文字识别。 先把图片、扫描件、版式文档转成机器能读的文本。模糊的、倾斜的、带印章的,要专门处理,不能指望一步到位。
第二层,信息抽取。 在文本上把字段结构化——甲方乙方、金额、期限、违约条款,抽出来标好类型。复杂版面(多栏、嵌套表格)要用专门的抽取能力,不是通用模型顺手就能干。
第三层,智能生成。 写文书、写报告、写摘要,必须基于前两层抽出的真实字段,别让模型凭空写。法律文书月产两万份,靠的是模板化生成加人把关,不是模型瞎编。
读得准,是抽得对的前提;抽得对,是写得稳的前提。三层顺序不能乱。
三、第二步:抽取要可校验,生成要可追溯
这是文档智能最稳的分工。
抽取侧,AI 把字段抽出来,同时标出"这段结论来自原文哪一段"。人工核对关键项时,能点开看出处,信任感才立得起来。聊城那组"字段缺失率降七成六",背后就是同一套思路:用真实抽取代替人工手抄,漏填的概率自然往下掉。
生成侧,AI 基于模板加真实数据起草,人做最终定稿。月产两万份法律文书的团队,不是让 AI 自由发挥,是把它变成"按模板填、人审边界"的流水线。模型负责快,人负责准。
这里有个和第 01、03 篇一样的机制:看不清就拒识。版面太差、字段置信度太低,直接转人工,不要硬抽硬写。每一次拒识,就是一处没处理好的边界,聚起来就是下周要补的能力。
四、第三步:从单文档走到流水线
单份文档识别抽取只是起点。文档智能真正的价值,是把它串成自动化链路:识别 → 抽取 → 校验 → 生成 → 回写。
发票进来,自动识别、三单匹配,异常才转人(接第 02 篇);合同进来,自动抽条款、标风险(接第 03 篇);简历进来,自动抽字段、排顺序(接第 05 篇)。同一条"水管",前面几篇的龙头一开就有水。
这也是为什么说它是底座而不是项目。很多企业的教训是:为票据单独建一套识别,为合同又建一套,为简历再建一套,三套能力长得几乎一样,却各养一支团队。底座思维是反过来的——先把"读文档"这一层建厚,上面所有场景来接。
五、两件容易被跳过的事:版面与权限
文档智能最容易翻车的两处,正好是它的两个前提。
版面那件,上文说了,模糊、跨页、遮挡、手写,这些边界情况不处理,准确率永远上不去。要建拒识机制,看不清就转人工,别硬来。不少企业上线即放手,结果前三个月准确率忽高忽低,就是因为没把边界管住。
权限那件,和前面几篇是同一个护栏。文档里常躺着敏感信息:身份证号、银行卡、病历、薪酬。文字识别阶段就要想清楚:哪些字段要脱敏、哪些原文不能出现在不该看的屏幕上(能问不能见)。对医疗、金融、连锁这类强监管行业,这是能不能上线的门槛,不是加分项。
六、怎么算账,多久能见效
账这样算:文档处理量乘以单份节省时长,再乘人力时薪,等于年节约;再把"字段缺失导致的返工、纠错"算进去,隐性收益更大。
举一个跨职能的例子。一家企业每月处理约一万份单据(发票加合同加简历),每份人工读录约 10 分钟,时薪算 50 元。AI 接手文字识别加信息抽取后,省下七成左右的人工,每月省一万乘十分钟乘零点七,约一万一千七百分钟,折合近一千两百小时,乘 50 元约五点八万每月,一年约七十万。这还没算"抽错一个金额导致后续全错"的纠错成本。
节奏上,和前面几篇一致的 60 天打法:
0 到 20 天,盘文档类型。 把企业最常见的几类文档(发票、合同、简历、报告)各找几十份样例,这是抽取和识别的基准。同时定敏感字段和脱敏规则。
20 到 45 天,跑通一类。 选量最大、版面最标准那类先上,比如发票识别加三单匹配,跑通"识别、抽取、校验、回写"这条链路。
45 到 60 天,扩品类接流水线。 把验证过的配置复制到合同、简历,再接上生成类动作,比如自动起草摘要、自动填模板,让它真正变成底座。
七、一个反直觉的结论
很多人把文档智能当"一个独立项目"去立项,配专人、排工期,做完发现只在票据用了。
真相是反的。文档智能该是底座,不是项目。它的价值不在某一篇,在它托起前面所有篇:合同、票据、简历、报告、公文,全来复用同一层能力。你为它花的每一分,前面五个场景都在分摊。
别为单个场景各建一套识别抽取,那是重复造轮子。先把"让 AI 读文档"这一层建厚,后面的场景一个接一个来接,成本才摊得薄、价值才滚得起来。
交付:文档智能落地清单
定位:文档智能是横向能力底座,不是独立项目;合同、票据、简历、报告共用
顺序:先文字识别转文本,再信息抽取结构化,生成类必须基于真实字段
质量:抽取可校验、标出处;生成基于模板加真实数据、人定稿
流水线:识别 → 抽取 → 校验 → 生成 → 回写,串起来接第 02、03、05 篇
权限:脱敏前置、能问不能见,敏感字段不裸奔
护栏:看不清就拒识转人工,别硬抽硬写
节奏:0-20 天盘类型、20-45 天跑通一类、45-60 天扩品类接流水线
内容推荐