做过外贸的朋友都知道,海关出口货物报关单(预录单)上的数据,传统做法是人工一条条看、一行行敲进Excel。一份单子32个表头字段加十几行商品明细,眼花缭乱不说,还容易抄错漏。

今天给大家介绍一套PDF报关单自动解析系统,把PDF扔进去,系统自动提取所有数据,还能一键导出标准Excel模板。最新版本接入了AI大模型校验,识别率直奔100%,而且AI校验可以随时开关,想要速度还是精度,你说了算。
这套系统能干什么?
一句话总结:PDF丢进去,数据自动出来,Excel一键导出。
具体来说,它解决了三个核心痛点:
痛点一:手工录入太慢
一份报关单PDF,表头有32个字段(订单号、报关单号、提运单号、发货单位、运输方式、毛重、净重、件数……),表体有13列商品明细(商品编码、商品名称、规格型号、申报数量、法定数量、总价、币制……)。人工录入一份至少10分钟,批量处理几十份就是一整天。
系统自动提取,几秒钟出结果。
痛点二:录错了不知道
人眼识别PDF文字,遇到排版不整齐、文字换行顺序不一致的情况,很容易看错行。比如有的报关单上"4662米"在上面、"1449千克"在下面,有的反过来,手工录入经常搞混。
系统先用规则引擎提取,再交给AI大模型对照原文逐字段校验,AI发现错误会自动修正。
痛点三:导出格式不统一
不同人录入的Excel格式五花八门,汇总时还得重新整理。系统直接按标准模板导出,表头表体分两个sheet,格式统一,直接可用。
有哪些实用功能?
上传就自动解析
选好PDF文件,点上传,系统自动开始工作。上传过程中有双进度条实时显示:上面一条是文件上传进度,下面一条是AI校验进度。一目了然,不用干等。
上传时会提醒:"AI校验过程时间较久,请耐心等待,务必不要刷新页面"。因为AI校验需要几秒到十几秒,刷新页面会导致上传中断。

智能识别,拒绝乱传
系统会自动检查上传的PDF是不是真正的海关报关单。如果你不小心传了一份合同PDF或者其他无关文件,系统会直接拒绝并提示"该PDF不是海关出口货物报关单,无法识别解析"。不会浪费AI校验资源在无关文件上。

重复文件自动拦截
同一份报关单PDF传了两次?系统通过文件内容指纹(MD5哈希)识别,第二次上传会提示"该PDF已上传过,禁止重复上传"。避免重复数据污染统计。
在线预览,不用下载
列表里点"预览"按钮,直接在网页里打开PDF原文,不用下载到本地。对照解析结果看有没有错,方便快捷。

数据可以手动修改
AI再准也有万一的时候。点"编辑"按钮,表头表体都能改。其中"包装种类"字段做了下拉框,只能选标准类型(包、袋、箱、捆、桶、罐、卷、扎、筐、盒、瓶、件、个、标箱、匹、盘),从源头杜绝不规范填法。



一键导出Excel
管理员可以导出全部数据或当月数据,普通用户可以导出自己的数据。导出的Excel直接符合标准模板格式,表头32列、表体13列,拿过来就能用。

AI校验可以随时开关了!
很多用户反馈AI校验虽然准,但有时候希望快点出结果,或者暂时不需要那么高的识别率。最新版本增加了后台AI开关功能,管理员无需改代码、无需重启,随时切换:
管理员登录后,点击左侧菜单【系统设置】
找到【AI智能校验配置】区域
打开或关闭"启用AI校验"开关
点击【保存配置】,立即生效

关闭AI后:
上传速度提升5-10倍(不再等待AI校验,几秒出结果)
仅使用规则引擎解析(识别率约70%)
完全不消耗API额度
上传界面自动隐藏AI进度条,只显示文件上传进度
打开AI后:
上传后自动调用AI校验(识别率100%)
双进度条显示(文件上传 + AI校验)
每单成本约0.004元,每月1000单约4元
想追求速度就关闭,想保证准确率就打开,灵活切换,随时可控。
管理员还可以在系统设置页面直接修改API Key、切换模型(flash快速/pro更准)、调整超时时间和重试次数,并提供连通性测试按钮,一站式管理AI配置。
AI是怎么帮忙的?
这是最新版本最大的升级。简单说一下原理:
第一步:规则引擎快速提取
系统用PyMuPDF库读取PDF,按坐标定位文字,用正则表达式匹配关键字段。这一步速度快,但遇到排版差异大的PDF会出错。
第二步:AI大模型校验修正
把规则提取的结果和PDF原文一起发给DeepSeek AI大模型,让AI对照原文检查每个字段对不对。AI擅长理解上下文语义,能发现规则引擎搞混的字段并修正。
第三步:失败自动降级
万一AI服务超时或出问题,系统自动降级用规则结果,不影响正常使用。
实际测试34份报关单PDF,所有字段识别率100%——包括之前经常出错的提运单号、包装种类、币制(欧元)、规格型号等字段。
谁能用什么功能?
系统分两种角色:

简单说,普通用户管自己的PDF,管理员管所有人的数据加用户管理。
怎么安装使用?
Windows用户(最简单)
拿到 dist_win.zip 压缩包
解压,双击里面的 pdf_web_app.exe
浏览器打开 http://localhost:5000
用默认账号登录:admin / admin123
不需要装Python,不需要装任何依赖,下载即用。
Linux服务器
拿到 dist_linux.tar.gz,上传到服务器
解压并运行:
tar xzf dist_linux.tar.gzcd pdf_web_app./pdf_web_app
不管哪种方式,第一次运行会自动创建数据库和存储目录,零配置开箱即用。默认管理员账号是 admin / admin123,登录后记得改密码。
数据安全吗?
几个大家关心的点:
数据存在本地:数据库和上传的PDF都在你自己服务器/电脑上,不传到第三方
只能看自己的:普通用户只能看到和操作自己上传的数据
不能删别人的:普通用户只能删自己的记录
操作有记录:每条数据记录了上传时间、上传人
备份很简单:复制 data/ 文件夹就是完整备份
本次更新了什么?
相比最初版本,这次大更新主要做了这些事:
AI校验后台开关:管理员可在系统设置页面随时开关AI校验,无需改代码或重启,关闭后上传速度提升5-10倍
AI配置可视化管理:后台可直接修改API Key、切换模型、调整超时和重试次数,提供连通性测试
智能进度条:AI开启时显示双进度条,AI关闭时自动隐藏AI进度条,体验更清晰
接入AI大模型:DeepSeek AI校验修正,识别率从约70%提升到100%
拒绝非报关单:上传无关PDF会自动拒绝,不再浪费资源
PDF在线预览:不用下载,网页直接看原文
MD5去重:同一份PDF不能重复上传
包装种类下拉选择:编辑时只能选标准类型,杜绝不规范填法
多用户并发:支持多人同时上传,不会互相卡住
图标本地化:所有图标文件打包在本地,不依赖外部CDN,断网也能用
前端安全加固:全局HTML转义防XSS,用户管理参数传递改为缓存方式
不足和展望

下一版本,将使用golang语言重构,使用AI作为主导,自动学习,避免pdf格式多样化导致的重写规则。
写在最后
这套系统最初就是为了解决报关单手工录入的痛点。从最初纯规则匹配识别率70%,到现在AI校验后100%,前后迭代了十几个版本。
如果你也在做外贸,每天跟报关单打交道,试试这个工具,把时间省下来做更有价值的事。
有任何问题或建议,欢迎留言交流。
系统名称:PDF报关单解析Web系统 技术栈:Flask + PyMuPDF + DeepSeek AI + Bootstrap 5 开源地址:https://gitee.com/ydxjyjkzh/pdf-to-excel 支持平台:Windows / Linux / Docker
夜雨聆风