乐于分享
好东西不私藏

文档、图片、合同、邮件……非结构化数据才是数据安全的主战场,你管住了吗?

文档、图片、合同、邮件……非结构化数据才是数据安全的主战场,你管住了吗?

“我们数据库加密做得很好,数据安全应该没问题。”

某金融企业的CIO在内部安全会议上说这句话时,安全负责人欲言又止。他知道真相,但不知道怎么开口——公司90%的敏感数据根本不在数据库里

三个月后,一份内部培训PPT被员工随手发到了行业群里。PPT里没有敏感关键字,但第7页的组织架构图暴露了核心团队名单,第12页的项目时间轴透露了战略节奏。竞争对手据此调整了市场策略,这家金融企业在关键项目上丢了标。

复盘会上,CIO问了一个灵魂问题:“这份文件我们系统里有没有?发过几次?发给过谁?”

答案是:不知道。


01 非结构化数据:看得见,但管不住

非结构化数据,指的是那些没有固定格式、无法直接用数据库字段描述的数据——文档、图片、PDF、邮件、压缩包、设计图纸、代码文件……

它们有几个共同特点:

第一,数量庞大。 一家中型企业的非结构化数据量,通常是结构化数据的5到10倍。合同、方案、会议纪要、财务报表、产品原型、客户资料,每天都在产生。

第二,存储分散。 员工的电脑里有一份,文件服务器(NAS)里有一份,云盘里还有一份。同一个文件,三份副本,三个风险点。

第三,流转不可控。 谁下载过、谁转发过、谁外发过,系统完全不知道。数据泄露事件发生后,溯源全靠人工排查,往往查到最后发现"大家都传过,但谁都不记得"。

第四,识别困难。 一份PDF合同,系统能"看到"它是一个文件,但"看不懂"里面的内容。一份手机拍摄的合同截图,系统连文字都提取不出来。

这就是非结构化数据安全的现实:数据在裸奔,但你看不见。


02 为什么传统方案行不通

很多企业不是没有尝试过管理非结构化数据,但效果普遍不好。

方案一:人工盘点。 让各部门自查敏感文件,上报清单。问题是标准不统一、执行不到位、更新不及时,最后变成"交一次作业,应付检查"。

方案二:关键字过滤。 在邮件系统、网盘系统里设置敏感词拦截。问题是误报率高("内部资料"四个字可能出现在任何文档里),漏报率也高(敏感内容换个说法就绕过去了)。

方案三:全盘加密。 所有文件强制加密,外发需要审批。问题是影响业务效率,员工抱怨多,最后变成"上有政策、下有对策",加密形同虚设。

这些方案的共同问题是:没有解决"分得清"的问题。

系统不知道这份文件是什么、属于什么类别、达到什么敏感级别,自然谈不上"管得住"。


03 分得清,才能管得住:三个实战原则

在多个行业的真实项目里,我们验证了一套非结构化数据分类分级的实战路径,总结为三个原则。

原则一:规则引擎打基础——先让系统"认字"

规则引擎的核心是"匹配"。系统对文件内容进行文本提取,同时运行六种检测手段:关键字匹配、数据指纹、正则表达式、文档指纹、图像指纹、语义分析。

  • 含"机密"“内部资料”"绝密"字样的文件 → 自动标记为高敏感级别
  • 合同、协议类文件 → 通过文档指纹识别格式特征,归入法务类
  • 含身份证号、手机号、银行卡号的文件 → 通过正则表达式识别个人信息,触发合规告警
  • 设计图纸、技术方案 → 通过图像指纹识别特定文件类型

规则引擎的优势是精准、可控、符合监管要求,适合对已知敏感类型进行精确识别。

在实际部署中,任子行团队针对金融、医疗、政府等不同场景优化了分类规则库,确保识别准确率始终维持在95%以上。

原则二:AI引擎提准确率——再让系统"读懂"

规则引擎能识别"认字"的场景,但面对大量边界模糊、内容复杂的文档,准确率会明显下降。

比如,一份项目汇报PPT里没有出现任何敏感关键字,但里面有一张组织架构图,暴露了核心团队的姓名和职位——这类内容,规则引擎识别不了。

这时候,AI智能引擎的价值就体现出来了。

基于恒脑安全垂域大模型,AI引擎的工作流程是:

  • 本地文件扫描
     → 提取文档文本内容
  • 产品解析文本
     → 处理各类格式(Word、PDF、图片、压缩包等100+种格式)
  • 专家经验积累
     → 内置15大分类规则、100+项二级分类,以及5级敏感分级标准
  • 核心推理引擎
     → 结合语义理解,判断这份文件的真实业务含义
  • 大模型输出结论
     → 直接给出分类(运营类/法务类/财务类/研发类/人事类等)和分级(1-5级)

在实际项目中,这套双引擎配合,AI识别准确率达到95%以上,安全运营效率提升70%以上

原则三:双场景覆盖——PC终端和文件服务器都要管

分类分级不是只扫一个地方就完事了。

实战方案要同时覆盖两个场景:

  • PC端文件分类分级
    :针对办公电脑桌面环境,自动扫描终端文件,结合DLP授权,识别敏感数据存放情况
  • 服务器文件分类分级
    :针对NAS和文件服务器,集中扫描合同、方案等核心文档,摸清重要数据的分布地图

两个场景均支持规则扫描和AI扫描两种模式,业务模块分别授权,企业可以按需部署。


04 分得清之后,能做什么

分得清是第一步,分完之后才是真正的价值。

第一,形成数据分布地图。 系统根据识别结果,自动形成重要数据分布地图——敏感文件在哪些终端、在哪些网段、在哪些时间段流转,一目了然。

第二,文件外发审计。 当员工尝试将高敏感文件发送到外部邮箱或网盘时,系统自动拦截或告警,同时记录操作日志,精准溯源。

第三,支撑后续策略制定。 哪类文件需要强制加密、哪类文件限制外发权限、哪些终端需要优先整改,系统说了算,不是靠经验拍脑袋。


回到开头那个场景。

如果那家金融企业提前完成了非结构化数据分类分级,结果会不一样:

  • 系统识别出那份PPT包含组织架构图和项目时间轴,自动标记为"4级(高敏感)"
  • 员工尝试外发时,系统弹出告警:“当前文件含敏感信息,是否继续?”
  • 即使员工强行外发,系统也会记录操作日志,事后溯源直接定位到人

数据安全的主战场,从来不在数据库里,而在那些看得见但管不住的非结构化数据里。

数安智见——从实战中来,到实战中去。


往期推荐