乐于分享
好东西不私藏

医疗AI分析工具开源!本地脱敏+实体识别,数据合规全搞定

医疗AI分析工具开源!本地脱敏+实体识别,数据合规全搞定

医院里这种情况很常见——有一批历史病历数据,想拿来做AI分析或者发论文。病历里患者的名字、身份证号、手机号、住院号散得到处都是,有的在姓名栏,有的嵌在病史叙述里,有的混在联系方式里。挨个手动删,一份病历要花十几分钟,一百份就是二十多个小时。

这个医疗AI分析开源工具解决的就是这件事。它在本地跑,病历数据从不离开你的服务器,OCR扫描或手动输入一段病历文本进去,它自动识别并脱敏处理:姓名、身份证号、手机号、地址、邮箱、社保号,一并找出来,用你指定的方式处理——替换成假名字、遮住中间几位、整体哈希、日期偏移,都可以。

源代码:https://www.gitcc.com/yinuo/openmed-cn

一、核心功能

● 本地运行,数据从不离开服务器

所有处理在本地完成,不需要调用任何云端API。病历数据从进来到出去,全程不联网。医院内网、隔离网环境、没有任何外网访问权限的服务器上,都能跑。这解决了医疗数据处理中最敏感的问题——患者隐私数据不会被传输到任何第三方。

● 自动识别33种语言的PII信息

不只是中文,它能识别并脱敏33种语言的姓名、身份证号、地址、电话、邮箱等敏感信息。中国的身份证、印度的Aadhaar号码、巴西的CPF、欧盟的National ID,配置好语言参数,批量处理。医院里有外籍患者病历时,同样适用。

● 批量处理病历数据,支持API接入

用几行Python代码就能接入现有系统:BatchProcessor设置好模型,一次性处理上百份病历,输出脱敏后的结构化数据。也提供REST API,Java、Swift、Kotlin等语言可以直接调用。医院信息系统的数据导出后接这个工具处理,整个流程可以自动化。

二、应用场景

● 医院历史病历用于AI训练

想做疾病预测模型、用药推荐系统或者病历NLP分析,第一步就是把病历里的患者隐私信息脱敏干净。传统做法是人工审核+规则匹配,漏掉率不低。用这个工具做预处理,模型训练的数据管道全程合规,内审和监管都能过。

● 医学院临床数据研究

医学研究生做回顾性研究,需要大量真实病历来验证假设。病历里患者信息必须处理掉才能对外共享。用这个工具批量脱敏后,数据可以安全地用于学术发表和数据共享,不用担心隐私泄露的问题。

● 跨国医疗AI合作项目

不同国家的医疗数据有不同的合规要求,GDPR、HIPAA、国内的数据安全法,各有各的标准。在本地完成脱敏后再传输,病历数据本体从未出境,合规问题迎刃而解。

三、商业价值

● 大幅减少人工审核工作量

一份病历手动脱敏平均需要10-15分钟,1000份就是170-250个小时。用这个工具做预处理后,人工只需要做最终抽查和边界情况复核,整体工作量可以压缩到原来的十分之一以内。

● 部署灵活,不挑硬件

从iPhone到GPU服务器都能跑。Apple Silicon用MLX加速,iPhone上用OpenMedKit本地处理;安卓用ONNX Runtime;没有专用硬件的服务器用CPU也能跑。医疗机构的硬件条件参差不齐,这个适配性降低了部署门槛。

● 支持API集成到现有系统

不只是独立工具,它提供Python API、REST服务和MCP服务器,可以直接集成到医院的HIS系统、数据仓库或者AI平台。脱敏变成系统里的一个标准步骤,而不是一个独立的额外操作。

四、AI时代新功能

● 与AI Agent协作,处理医疗文档工作流

这个项目提供Agent Skills,可以直接集成到Claude Code等AI编程工具里。让AI Agent处理医疗文档时,它会自动调用这个工具做脱敏,不把真实患者信息粘贴进AI提示词里。医生或研究员用自然语言描述想做什么,AI Agent自动完成数据处理全流程。

● 浏览器端本地推理,数据完全不落盘

导出的Transformers.js包可以在浏览器里直接运行,OCR扫描或输入病历文本,网页端本地处理,患者数据从进到出从未离开浏览器。对于需要在多机构协作场景下做数据处理的,这个能力填补了一个空白。

这个医疗AI分析开源工具在本地跑,病历数据从不离开你的服务器,OCR扫描或手动输入一段病历文本进去,它自动识别并脱敏处理:姓名、身份证号、手机号、地址、邮箱、社保号,一并找出来,用你指定的方式处理——替换成假名字、遮住中间几位、整体哈希、日期偏移,都可以。

源代码:https://www.gitcc.com/yinuo/openmed-cn