事情是这样的。
个人有时候莫名其妙签一堆合同,自己也不可能看具体条款,看了也不懂;尝试搞个知识库让AI帮忙把合同管理起来,以后查条款一句话的事。选了WorkBuddy,腾讯的AI工作台,一句话派活。WorkBuddy有ima知识库连接器,扫个码就连上了。知识库建好,看起来就差往里传文档了。
知识的痛点,不在管理工具
传了一份建设工程施工合同进去。148页,大量条款层级,附录表格,还夹杂着签字盖章扫描页。开源工具碰到这种合同解析就惨了。
条款编号体系全乱了。合同条款一层套一层,1.1下面有1.1.1,1.1.1下面还有子项,原本层级分明。解析出来变成一堆扁平文本,编号和正文脱了节,1.1.1的内容跑到1.2下面,第三条第二款跑到第五条后面。跨页表格直接断裂,表头在第一页底部,数据在第二页,分家了。问AI合同价格是多少,它从碎片里拼了个错误数字。签字盖章页几乎全空白,手写签名和公章基础OCR直接跳过。
在WorkBuddy的连接器里翻到了TextIn xParse。
测试了一把效果怎么样,刚好手上有个租房合同,发现手写字也能行:
体验一下当房东的乐趣,看看什么时候收房租:

WorkBuddy还指出合同中没明确房租缴纳日期,很贴心。
如果你有很多类似合同可以让WorkBuddy给你管起来,到点发消息提醒你。效果还不错,去扒了扒xParse是什么。
TextIn xParse:不止是 OCR,是文档拆解大师

xParse是合合信息基于20年多模态文本智能推出的文档解析服务,不是简单OCR,是完整的文档智能处理体系。全格式兼容,PDF、Word、Excel、PPT等十余种格式。针对合同、财报、论文等复杂排版做了专项优化。
识别16种内容元素,自动还原标题层级、跨页表格拼接。 百页PDF约2秒,Markdown直接接入大模型。 支持50余种语言,日处理百万页。 WorkBuddy上免费每日1000页。
实测目前可以免费使用:
安装很简单,在WorkBuddy管理连接器中找到,点+号即可

2分钟解决文档入库
把那份翻车的148页合同重新传了一遍。
结果出来愣了一下。
条款层级完整了,一级二级三级层层递进,1.1.1乖乖待在1.1下面。跨页表格自动拼接,表头数据整整齐齐。签字盖章页上的手写签名识别出来了,公章也检测到了。148页合同,实测约30秒,4200多行结构化Markdown。
层级不是问题

公章也能识别

表格拿手好戏

合同解析解决了,接下来真正用起来了。
动嘴就能获取关键信息
把积累的合同全部重新传进ima。装修合同、劳动合同、租房合同,各种格式混着来,xParse全部解析成干净结构化文本存进知识库,按类型分了文件夹。
然后测试问答。只需一句话,就能获得关键内容,再也不用费力翻上半夜的文档了:
查看工程合同中的 工程范围,合同金额

WorkBuddy让我惊讶的是,结果把关键信息整理了,比看原始文档更加清晰。并且明确标注出来答案在文中的哪个部分哪一条。
更进一步还可以让WorkBuddy分析合同的风险

不止于此

xParse解决输入端,让AI拿到的合同文本是干净的、结构完整的。ima解决存储和检索端,让AI知道去哪找资料。WorkBuddy解决执行端,一句自然语言调度整个链路。三者一结合,闭环了。
核心就一句话。不是AI读不懂合同,是之前给它的文本太乱了。xParse把乱麻理成结构清晰的书,AI自然就读懂了。需要帮助可以联系TextIn客服,薅羊毛。

夜雨聆风