“我们数据库加密做得很好,数据安全应该没问题。”
某金融企业的CIO在内部安全会议上说这句话时,安全负责人欲言又止。他知道真相,但不知道怎么开口——公司90%的敏感数据根本不在数据库里。
三个月后,一份内部培训PPT被员工随手发到了行业群里。PPT里没有敏感关键字,但第7页的组织架构图暴露了核心团队名单,第12页的项目时间轴透露了战略节奏。竞争对手据此调整了市场策略,这家金融企业在关键项目上丢了标。
复盘会上,CIO问了一个灵魂问题:“这份文件我们系统里有没有?发过几次?发给过谁?”
答案是:不知道。
01 非结构化数据:看得见,但管不住
非结构化数据,指的是那些没有固定格式、无法直接用数据库字段描述的数据——文档、图片、PDF、邮件、压缩包、设计图纸、代码文件……
它们有几个共同特点:
第一,数量庞大。 一家中型企业的非结构化数据量,通常是结构化数据的5到10倍。合同、方案、会议纪要、财务报表、产品原型、客户资料,每天都在产生。
第二,存储分散。 员工的电脑里有一份,文件服务器(NAS)里有一份,云盘里还有一份。同一个文件,三份副本,三个风险点。
第三,流转不可控。 谁下载过、谁转发过、谁外发过,系统完全不知道。数据泄露事件发生后,溯源全靠人工排查,往往查到最后发现"大家都传过,但谁都不记得"。
第四,识别困难。 一份PDF合同,系统能"看到"它是一个文件,但"看不懂"里面的内容。一份手机拍摄的合同截图,系统连文字都提取不出来。
这就是非结构化数据安全的现实:数据在裸奔,但你看不见。
02 为什么传统方案行不通
很多企业不是没有尝试过管理非结构化数据,但效果普遍不好。
方案一:人工盘点。 让各部门自查敏感文件,上报清单。问题是标准不统一、执行不到位、更新不及时,最后变成"交一次作业,应付检查"。
方案二:关键字过滤。 在邮件系统、网盘系统里设置敏感词拦截。问题是误报率高("内部资料"四个字可能出现在任何文档里),漏报率也高(敏感内容换个说法就绕过去了)。
方案三:全盘加密。 所有文件强制加密,外发需要审批。问题是影响业务效率,员工抱怨多,最后变成"上有政策、下有对策",加密形同虚设。
这些方案的共同问题是:没有解决"分得清"的问题。
系统不知道这份文件是什么、属于什么类别、达到什么敏感级别,自然谈不上"管得住"。
03 分得清,才能管得住:三个实战原则
在多个行业的真实项目里,我们验证了一套非结构化数据分类分级的实战路径,总结为三个原则。
原则一:规则引擎打基础——先让系统"认字"
规则引擎的核心是"匹配"。系统对文件内容进行文本提取,同时运行六种检测手段:关键字匹配、数据指纹、正则表达式、文档指纹、图像指纹、语义分析。
含"机密"“内部资料”"绝密"字样的文件 → 自动标记为高敏感级别 合同、协议类文件 → 通过文档指纹识别格式特征,归入法务类 含身份证号、手机号、银行卡号的文件 → 通过正则表达式识别个人信息,触发合规告警 设计图纸、技术方案 → 通过图像指纹识别特定文件类型
规则引擎的优势是精准、可控、符合监管要求,适合对已知敏感类型进行精确识别。
在实际部署中,任子行团队针对金融、医疗、政府等不同场景优化了分类规则库,确保识别准确率始终维持在95%以上。
原则二:AI引擎提准确率——再让系统"读懂"
规则引擎能识别"认字"的场景,但面对大量边界模糊、内容复杂的文档,准确率会明显下降。
比如,一份项目汇报PPT里没有出现任何敏感关键字,但里面有一张组织架构图,暴露了核心团队的姓名和职位——这类内容,规则引擎识别不了。
这时候,AI智能引擎的价值就体现出来了。
基于恒脑安全垂域大模型,AI引擎的工作流程是:
- 本地文件扫描
→ 提取文档文本内容 - 产品解析文本
→ 处理各类格式(Word、PDF、图片、压缩包等100+种格式) - 专家经验积累
→ 内置15大分类规则、100+项二级分类,以及5级敏感分级标准 - 核心推理引擎
→ 结合语义理解,判断这份文件的真实业务含义 - 大模型输出结论
→ 直接给出分类(运营类/法务类/财务类/研发类/人事类等)和分级(1-5级)
在实际项目中,这套双引擎配合,AI识别准确率达到95%以上,安全运营效率提升70%以上。
原则三:双场景覆盖——PC终端和文件服务器都要管
分类分级不是只扫一个地方就完事了。
实战方案要同时覆盖两个场景:
- PC端文件分类分级
:针对办公电脑桌面环境,自动扫描终端文件,结合DLP授权,识别敏感数据存放情况 - 服务器文件分类分级
:针对NAS和文件服务器,集中扫描合同、方案等核心文档,摸清重要数据的分布地图
两个场景均支持规则扫描和AI扫描两种模式,业务模块分别授权,企业可以按需部署。
04 分得清之后,能做什么
分得清是第一步,分完之后才是真正的价值。
第一,形成数据分布地图。 系统根据识别结果,自动形成重要数据分布地图——敏感文件在哪些终端、在哪些网段、在哪些时间段流转,一目了然。
第二,文件外发审计。 当员工尝试将高敏感文件发送到外部邮箱或网盘时,系统自动拦截或告警,同时记录操作日志,精准溯源。
第三,支撑后续策略制定。 哪类文件需要强制加密、哪类文件限制外发权限、哪些终端需要优先整改,系统说了算,不是靠经验拍脑袋。
回到开头那个场景。
如果那家金融企业提前完成了非结构化数据分类分级,结果会不一样:
系统识别出那份PPT包含组织架构图和项目时间轴,自动标记为"4级(高敏感)" 员工尝试外发时,系统弹出告警:“当前文件含敏感信息,是否继续?” 即使员工强行外发,系统也会记录操作日志,事后溯源直接定位到人
数据安全的主战场,从来不在数据库里,而在那些看得见但管不住的非结构化数据里。
数安智见——从实战中来,到实战中去。
往期推荐
夜雨聆风