ARTICLE · 1047221
文档不能乱发给 AI,我写了个本地脱敏工具
脱敏 → 分析 → 还原,全程不联网
日常生活里,都有这样的时刻:手上有一份资料、一个案例,值得拿出来深入讨论、复盘、做研究分析——但它身上绑着公司或个人信息。
先说清楚这里讨论的是什么文件:本身不涉及任何保密内容、可以合规使用的数据和材料——不是国家秘密,不是工作秘密,就是普通文件,唯一的问题是上面带着个人敏感信息。涉密文件有涉密文件的规矩,不在今天讨论范围内,也根本不该走"发给 AI"这条路。
合规是底线。于是问题变成一道具体的操作题:怎么在合规的前提下,高效又安全地把敏感信息剥离掉,让文档能放心进入后续环节。
有人说:材料存在自己电脑上,不上传不就行了?问题是,如果你没有本地模型,只要调用 API、用云端模型,内容就必须离开本机,传到一台你不知道在哪的服务器上。
所以真正的解法不是"找一个信得过的平台",而是让敏感信息根本没有出门的机会:交给 AI 分析的,自始至终是剔除掉敏感信息的数据。没有敏感信息上路,就没有泄露的可能。
我把这个流程做成了三段:本地脱敏 → 交给 AI 分析 → 本地还原
· 文档先在本机跑一遍:单号变成 [单号1],地名 [地名1],手机号变 [电话1]
· 这份"打码版"发给 AI,它看到的只有代号,分析照样做
· AI 返回的报告里还是代号,本地用映射文件换回真名
映射文件只存在自己电脑上,全程不联网。
建议处理敏感材料时在断网环境下运行。
01它能做什么
识别引擎是纯规则的离线实现,不依赖任何 AI 模型——这个工具存在的意义就是材料不离开本机,当然不能先把材料发给 AI 去识别。
02它做不到什么
先说适用边界:它只处理不含保密内容的合规文件,解决的是"个人敏感信息剥离"这一件事。涉及保密内容的材料,请严格按保密规定处理,任何脱敏工具都不适用。
再说能力边界:它只认模式,不认语义:罕见姓氏、生僻名字、没有上下文提示的裸名字,可能会漏。
所以用完请务必审核脱敏结果。这份谨慎比工具本身重要。
换句话说:工具负责"快",人负责"对"。
03怎么获取
百度网盘:
扫码打开百度网盘下载。
免费,无广告,不注册,不收集任何数据。
04写在最后
做这个工具的起点很朴素:材料得能用起来,隐私也得守得住。
用起来之后欢迎提意见——尤其是你遇到的、它认不出来的写法。
声明:
这个工具只是一个辅助工具,不是安全保证。它能提高效率,但替代不了人的判断:
- 脱敏结果不保证百分之百完整,任何文件在发出之前,必须由使用者本人最终审核、确认;
- 是否使用、如何使用、脱敏后的文件发给谁,都是使用者自己的决定,使用后果由使用者自行承担。
本文提到的所有例子均为虚构,用于说明技术问题。
作者:Quinn
Quinns Pop Land