S2-项目实战01-把 PDF 变成结构化条款json
做合同解析,第一步不是急着上大模型。
法务拿到几十页的合同,最头疼的不是找不到词。而是没法逐条审查、对比和打分。所以第一步得先把纯文本拆成结构化的条款。
为什么不用 LLM?
整篇丢给大模型,一份得跑十来秒,还得花钱。结果还不稳定,出了错都不知道为啥。
用正则和规则引擎,半份都不到一秒,零成本。而且同一份合同每次切出来的结果一模一样,出了问题也好排查。
具体怎么拆?
按“第X条”把大条款切开,里面的子条款原样保留。接着用关键词给条款打标签,比如带“违约”就是违约类。这样后面才能按类型去套不同的审查规则。
代码跑通了,但还有坑。
作者拿五份示例合同跑了测试,全部分正确。不过实际业务里还会遇到麻烦。比如有些保密协议压根没有中文编号,或者甲方信息写在下一行。这些边缘情况还得继续调正则。
说白了,解析是确定性工序,归机器;审查才需要语义判断,再交给模型。 这篇只讲了怎么把合同拆好,至于怎么审,得看下一篇。
其它金额
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
原文S2-项目实战篇-01-合同解析插件:把 PDF 变成结构化条款 JSON(47 页合同半小时出坑)
收录于从零吃透企业级 AI 平台
原创,
浙江,37分钟前,
夜雨聆风