夜雨聆风学习资料网

ARTICLE · 1090220

Docx,Excel,Pdf等非结构化资产也能数据分类分级啦

Docx,Excel,Pdf等非结构化资产也能数据分类分级啦

点击上方蓝字关注我们

  重要声明  
随着网络安全越来越重要,“安全info”将定期分享实用安全技术、最新行业动态、案例分析,实战技巧等。鉴于网络安全法的基础文章内容仅供学习,不做其他任何用处!

MDCGS 重磅更新:文件资产也能自动分类分级了!

    数据分类分级工作中,结构化资产有一定的特征可循,可以做分类分级工作;最让企业头疼🤕的还是非结构化资产如何做数据的分类分级;这也是我得到反馈最多的问题,“MDCGS支不支持文件资产的分类分级”。

    现在可以向大家宣布了,支持非结构化资产的分类分级工作了!


📢 写在前面

企业数据资产中,80% 以上是非结构化数据——PDF 合同、Word 文档、Excel 报表、图片截图……

这些文件里的敏感信息(身份证号、银行卡、手机号)靠人工排查?效率低、易遗漏。

MDCGS v1.1.2 正式支持文件资产分类分级! 只需上传文件,系统自动解析内容、识别敏感信息、完成分类分级。


🎯 支持的文件格式

格式
说明
📄 PDF
.pdf
📝 Word
.docx
📊 Excel
.xlsx, .xls, .csv
📝 文本
.txt, .md, .json
🖼️ 图片
.png, .jpg, .jpeg(支持 OCR)

⚡ 功能亮点

1️⃣ 自动解析,无痛上手

上传文件后,系统自动:

  • • 提取文件内容块
  • • 智能切分文本段落
  • • 识别内容中的敏感信息

2️⃣ 规则 + AI 双重识别

  • • 规则引擎:正则匹配身份证号、手机号、银行卡等固定格式
  • • AI 语义分析:智能识别姓名、地址、企业名称等半结构化内容
  • • OCR 识别:图片中的文字也能准确提取和识别

3️⃣ 统一的分类分级体系

文件敏感内容与数据库字段使用同一套分类模板,可自行在项目中下载上传:

  • • 🔒 L4:银行卡号、密码、密钥等
  • • 🔐 L3:身份证号、手机号、健康信息等
  • • 📋 L2:姓名、地址、邮箱等
  • • 📄 L1:公开发布的企业信息等

4️⃣ 批量处理,效率翻倍

支持多文件同时上传,后台异步解析,进度实时可见。


📱 操作演示

第一步:创建文件资产

在「文件资产」模块中新建资产,上传需要扫描的文件。

第二步:提交分类任务

选择分类模板,一键启动分类分级任务。

第三步:查看结果

任务完成后,可以:

  • • 查看每个内容块的分类分级结果
  • • 人工确认或修改识别结果
  • • 一键导出分类分级报告

💡 典型场景

场景 1:合同文档审计

上传所有 PDF 合同,自动识别其中涉及的:

  • • 个人信息(姓名、身份证号)
  • • 商业敏感信息(银行账号、交易金额)
  • • 分类定级,生成合规报告

场景 2:图片敏感信息筛查

上传产品截图、宣传图片,通过 OCR 识别其中是否包含:

  • • 泄露的个人信息
  • • 内部系统截图
  • • 敏感联系方式

场景 3:报表数据梳理

上传 Excel 数据报表,自动识别:

  • • 字段内容中的敏感数据
  • • 数据分布情况
  • • 生成数据资产目录

🔧 技术细节

架构设计

文件上传 → 内容解析 → 文本切分 → 规则匹配 → AI 识别 → 分类定级 → 结果存储

性能优化

  • • 内容块批量写入,避免大事务
  • • 多线程并发解析,提升效率
  • • 1GB 单文件限制,满足大多数场景

安全保证

  • • 文件不落盘,内存解析后立即释放
  • • 内容脱敏可配置
  • • 全程操作审计留痕

📊 与结构化数据统一管理

MDCGS 本次更新实现了结构化数据与非结构化数据的统一分类分级:

资产类型
数据示例
分类方式
数据库字段
user_phone
 列为 138xxxx
字段名 + 内容双重识别
文件内容块
PDF 第3段包含身份证号
文本内容智能分析
图片文字
截图中的手机号
OCR + 规则匹配

一个平台,两种资产,一套标准。


🚀 快速体验

在线演示:https://mdcgs.hyinfo.cc

账号:admin | 密码:admin123


欢迎 Star & Fork

GitHub:https://github.com/HaoY-l/mdcgs


相关学习资料