乐于分享
好东西不私藏

S2-项目实战01-把 PDF 变成结构化条款json

S2-项目实战01-把 PDF 变成结构化条款json

S2-项目实战01-把 PDF 变成结构化条款json

做合同解析,第一步不是急着上大模型。

法务拿到几十页的合同,最头疼的不是找不到词。而是没法逐条审查、对比和打分。所以第一步得先把纯文本拆成结构化的条款。

为什么不用 LLM?
整篇丢给大模型,一份得跑十来秒,还得花钱。结果还不稳定,出了错都不知道为啥。
用正则和规则引擎,半份都不到一秒,零成本。而且同一份合同每次切出来的结果一模一样,出了问题也好排查。

具体怎么拆?
按“第X条”把大条款切开,里面的子条款原样保留。接着用关键词给条款打标签,比如带“违约”就是违约类。这样后面才能按类型去套不同的审查规则。

代码跑通了,但还有坑。
作者拿五份示例合同跑了测试,全部分正确。不过实际业务里还会遇到麻烦。比如有些保密协议压根没有中文编号,或者甲方信息写在下一行。这些边缘情况还得继续调正则。

说白了,解析是确定性工序,归机器;审查才需要语义判断,再交给模型。 这篇只讲了怎么把合同拆好,至于怎么审,得看下一篇。

微信扫一扫赞赏作者喜欢作者

    正在加载...
      正在加载...
      名称已清空
      微信扫一扫赞赏作者
      喜欢作者其它金额
      作品
      暂无作品
      喜欢作者
      其它金额
      最低赞赏 ¥0
      其它金额
      赞赏金额
      ¥
      最低赞赏 ¥0
      1
      2
      3
      4
      5
      6
      7
      8
      9
      0
      .
      原文S2-项目实战篇-01-合同解析插件:把 PDF 变成结构化条款 JSON(47 页合同半小时出坑)
      收录于从零吃透企业级 AI 平台
      原创,
      浙江,37分钟前,