论著信息
原文标题: The Rise of Deepfake Medical Imaging: Radiologists' Diagnostic Accuracy in Detecting ChatGPT-generated Radiographs
期刊来源:Radiology 2026; 318(3): e252094
DOI: https://doi.org/10.1148/radiol.252094
作者: Tordjman MY, Yuce M, Ammar A, Huang M, Bouvier FMM, Lacroix M, Meribout A, Bolger I, Ozkaya E, Joshi H, Geahchan A, El Rahi R, Almansour H, Parihar AS, Horst C, Ozturk S, Isleyen ME, Pamuk GG, Cimilli AT, Deyer T, Calinghen A, Guillo E, Husain R, Laredo JD, Fayad ZA, Mei X, Taouli B
通讯作者: Mickael Tordjman(Mount Sinai Hospital, New York, NY)
一、研究背景与核心假设
过去十年间,生成式人工智能经历了从早期生成对抗网络(GAN)产出低分辨率概念验证图像,到现代扩散模型实现照片级真实感图像的跨越式发展。在此进程中,大语言模型(Large Language Models, LLMs)最初以文本生成为核心功能,迅速向多模态推理方向演进。
GPT-4o(ChatGPT-4o;OpenAI)于2025年3月面向公众发布,是首个原生整合文本、代码、音频及图像生成的通用型多模态LLM。GPT-5于2025年8月发布,集成相同图像生成能力。与传统需编码专业知识的专用GAN管道不同,GPT-4o和GPT-5可通过纯自然语言提示词生成解剖学合理的放射图像,大幅降低了技术门槛——任何人均可伪造医学影像,包括非专业人士。
在医学影像领域,合成影像已应用于增强深度学习算法训练集、平衡训练集中罕见疾病类别、以及为受训者提供无风险演练材料。然而,高保真计算机生成图像即"深度伪造"(deepfakes)因难以与现实区分而引发安全与信任危机,涵盖数据投毒、AI模型训练偏倚、电子病历篡改、诊断错误乃至医疗诉讼等风险。
既往基于GAN生成膝关节X线片的初步研究中,医师检测准确率仅略高于随机水平(61%),提示存在令人担忧的盲区。而LLM生成的合成放射影像如ChatGPT产物反映更精细的文本-图像对齐能力,可生成任意类型放射图像与疾病类型,此风险已显著放大。
本研究核心目的: 评估放射科医师和多模态LLMs区分ChatGPT生成的合成放射影像与真实临床图像的能力,并探讨经验水平、亚专业方向及既往生成式AI暴露史是否影响检测性能。
二、材料与方法解读
2.1 研究设计
采用三阶段回顾性横断面诊断准确性研究设计,结合前瞻性多读者多病例读片会话。研究周期为2025年4月至8月。方案经Mount Sinai医院机构审查委员会(IRB)审查豁免知情同意,理由为使用去标识化公开可用图像且仅调查医疗卫生专业人员。IRB豁免批准包含第一阶段目的盲法设计的许可。本地影像数据库获机构审查委员会批准使用(GCO#20-2199-00001-01)。
2.2 参与者
共招募来自6个国家12个不同中心的17名执业放射科医师(表1)。放射科医师经验跨度覆盖从住院医到资深专家(平均经验8年;范围0–40年),包括2名四年级住院医、早期职业生涯人员及经验达40年的资深医师。亚专业分布如下:骨骼肌肉影像学(n=6)、胸部影像学(n=2)、腹部影像学(n=3)、普通放射科(n=3)、介入放射学(n=2)、核医学(n=1)。所有读者使用诊断级显示器。
表1:参与研究的放射科医师经验、亚专业方向及从业国家
表1 表注:17名参与研究的放射科医师分别来自美国、法国、德国、土耳其、英国及阿联酋六个国家,涵盖骨骼肌肉、胸部、腹部、普通放射科、介入放射科及核医学六大亚专业方向,经验年限从高年级住院医至40年资深专家不等。
2.3 图像数据集
放射科医师接受两个独立类别平衡图像集评估,两数据集之间无重叠图像:
数据集1(Dataset 1): 共154幅图像——77幅GPT-4o生成合成放射图像 + 77幅真实放射图像。由两名放射科医师(M.T.和M.Y.,分别为专科培训后5年和2年)创建。合成与真实放射图像分布均衡(各50%)。77幅GPT-4o生成图像通过向ChatGPT-4o发送文本提示词创建,提示词模板为:"Generate a synthetic [anatomic area and projection] radiograph of [target abnormality, with or without a specific population]. Ensure [grain and/or noise requirement]"(即"生成一幅[解剖部位与投照方式]合成放射图像,显示[目标异常,含或不含特定人群]。确保[颗粒度和/或噪声要求]")。图像无损导出后由两名非研究读者放射科医师检查是否存在明显伪影或明显AI特征。异常图像被排除(如膝关节Skyline Laurin位),最终排除4幅放射图像,可能引入选择偏倚。GPT-4o对部分特定疾病无法生成合适图像(表S1),包括胸腔积液和椎体骨折;若图像合理则保留于最终数据集以减少额外选择偏倚。
77幅真实放射图像来源于IRB批准的本地数据库或公开数据集,包括NIH Clinical Center ChestX-Ray8数据集(https://nihcc.app.box.com/v/ChestXray-NIHCC)、Burapha University Spine Dataset(BUU-LSPINE)、Cervical Spine X-ray Atlas及FracAtlas骨折数据集。由两名放射科医师共识选择,标准为质量充分。真实图像的解剖分布、表现及噪声水平均与AI提示词匹配。
GPT-4o生成的77幅放射图像解剖区域分布:胸部(n=15)、脊柱(n=15)、四肢(n=47)。
数据集2(Dataset 2): 共110幅图像——55幅RoentGen合成胸部放射图像 + 55幅真实放射图像。RoentGen是一种器官特异性扩散模型,专门用于生成胸部放射图像。设置该数据集的目的是比较读者和LLM检测GPT-4o生成的多区域放射图像与领域特异性模型RoentGen生成的胸部放射图像之间的性能差异,后者可能产生更逼真的图像。

图1 图示:研究流程图。两个数据集被创建:数据集1包含使用ChatGPT-4o生成的合成放射影像,数据集2包含使用RoentGen生成的合成放射影像。RoentGen是一种器官特异性扩散模型,专门用于生成合成胸部放射影像。LLM = 大语言模型。
2.4 调查平台
使用自定义Web应用程序(HTML/CSS/JavaScript,通过GitHub Pages托管)分发问卷。图像全屏显示于中性背景上,禁用缩放及窗宽窗位调整以确保标准化阅片。图像随机排序,每位放射科医师分配唯一种子值以确保顺序多样性。要求放射科医师使用最低1920×1080像素分辨率及8bit灰度显示器。
2.5 读者评估终点
第一阶段(Phase 1,目的盲法评估): 放射科医师在盲于研究目的的情况下,对数据集1中每幅图像进行以下操作:
使用Likert量表(1=差,5=优秀)评估技术质量; 指示是否存在伪影(是/否); 提供诊断。 问卷末尾设开放性问题:"您是否注意到这些图像有任何异常之处?"
第二阶段(Phase 2,知情的合成/真伪分类): 告知放射科医师部分图像为AI生成后,要求将随机呈现的每幅放射图像分类为GPT-4o生成或真实,并以Likert量表(1=猜测,5=确定)评定置信度。同时完成背景调查问卷,涵盖经验、亚专业、既往AI生成放射图像暴露史及GPT-4o生成放射图像认知情况。揭晓哪些图像为真实、哪些为合成后,读者分享区分AI生成与真实放射图像的最常见线索。
第三阶段(Phase 3,RoentGen数据集评估): 要求放射科医师将数据集2中每幅胸部放射图像分类为真实或AI生成。
2.6 LLM评估
测试四种最新多模态模型——GPT-4o、GPT-5(OpenAI)、Gemini 2.5 Pro(Google)及Llama 4 Maverick(Meta)——使用图像数据集逐一评估。每个模型接收统一提示词:"Is this radiograph AI-generated or authentic? Please justify your answer in 1–2 sentences."("这幅放射图像是AI生成的还是真实的?请用1-2句话说明理由。")
GPT-4o和GPT-5通过在线教育平台访问,使用与生成合成放射图像不同的账户且文件重命名。Gemini 2.5 Pro和Llama 4 Maverick通过在线API平台(包括Together AI)访问。记录输出以评估这些模型检测AI生成放射图像的性能。
2.7 统计分析
Wilson评分法计算所有比例的95%置信区间(CI) 连续变量以均值±SD表示;分类变量以计数和百分比表示 组间比较:分类变量使用McNemar检验;连续变量使用t检验(配对或独立样本) 计算每个读者的灵敏度、特异度、阳性预测值(PPV)、阴性预测值(NPV)及总准确率 Fleiss κ量化17名读者在AI生成vs真实图像分类中的一致性 线性回归模型:logit转换准确率为因变量,经验年限为自变量 点二列相关系数(r)评估既往AI暴露熟悉度与总体分类准确率的关系 样本量计算:先验效能分析(单样本比例检验,无效假设=0.50,备择假设=0.60;α=0.05),每组需76–77幅图像以达到>80%效能检测10%偏离机会水平,故选定154幅图像(77 GPT生成 + 77 真实) 数据集2样本量类似推导(基于第二阶段准确率,无效=0.50,备择=0.75),每组约55幅图像 响应时间与准确率关系采用线性回归评估 分析软件:SPSS version 28.0(IBM);P < .05为统计学显著性界值
三、结果核心分析
3.1 第一阶段:目的盲法的图像质量与诊断评估
数据集1中放射图像的平均图像质量Likert评分为3.7±1.1(表2)。真实与AI生成放射图像的平均质量评分分别为3.8±1.2和3.6±1.2(P = .10),差异无统计学意义。
表2:合成与真实放射图像的图像质量、诊断及伪影评估
表2 表注:数据以均值±SD表示,跨17名读者计算。* P值为t检验比较合成与真实数据集的结果。† Likert量表范围为1(差)至5(优秀)。
关键发现:
伪影检出率差异显著: AI生成放射图像伪影检出率15.4%,真实放射图像5.5%(P = .01) 自发识别率低: 17名放射科医师中仅7名(41%;95% CI: 22, 64)在目的盲法状态下自发报告了AI生成图像的存在 诊断准确率相当: 读者对不同异常(骨折、肿瘤、感染等)的平均诊断准确率,AI生成放射图像为92.4%,真实放射图像为91.3%(P = .30)
3.2 第二阶段:放射科医师对AI生成与真实放射图像的分类评估
告知存在AI生成图像后,放射科医师识别AI生成vs真实放射图像的平均准确率为74.8%(95% CI: 68.4, 81.2),个体准确率范围58.4%–91.6%。合并灵敏度为69.1%(95% CI: 59.8, 78.4),合并特异度为80.4%(95% CI: 72.9, 87.9)。

图2 图示:17名放射科医师和大语言模型(LLMs)鉴别真实与GPT-4o生成放射影像的诊断性能。17名放射科医师的性能经汇总并以箱线图呈现。箱体代表四分位距(IQR),内部横线为中位数,触须表示范围。个体放射科医师性能分数以黑点叠加展示分布。四种LLM(GPT-5、GPT-4o、Gemini 2.5 Pro和Llama 4 Maverick)性能以不同颜色标记表示。垂直误差线为Wilson评分法计算的95% CI。
置信度评估: 17名放射科医师对AI生成与真实放射图像的置信度无统计学差异(平均Likert评分:3.89 vs 3.86,P = .45);总体平均Likert评分3.91±0.89。
经验与准确率的关系:
经验年限与logit转换后的准确率之间无线性关联(β = 0.01;P = .45) ≥8年经验组平均准确率80.9%(95% CI: 67.1, 94.7),<8年经验组72.2%(95% CI: 64.3, 80.1) 尽管更高经验者绝对数值略优,但无线性趋势证据
亚专业影响: 骨骼肌肉亚专业放射科医师平均准确率83.0%,显著高于其他亚专业70.3%(P = .04)
一致性分析: 17名读者间Fleiss κ = 0.31(95% CI: 0.26, 0.36),表明一致程度为一般(fair agreement)
既往暴露的影响:
59%(10/17)的放射科医师熟悉AI生成放射图像 76%(13/17)在本研究前不知道ChatGPT能生成逼真的放射图像 准确率与既往AI生成放射图像暴露史无相关性(r = 0.03;P = .92) 准确率与GPT-4o生成放射图像认知程度无相关性(r = 0.44;P = .08)
解剖部位与病变类型影响:
胸部放射图像与其他类型放射图像间的检测准确率无差异(P = .62) 正常与病理放射图像间无差异(P = .66) 骨折与非骨折放射图像间无差异(P = .15) 17名评估者最常漏检的10幅AI生成放射图像不涉及特定解剖结构
表3:放射科医师与LLMs鉴别GPT-4o生成放射图像与真实放射图像的性能
| 放射科医师 | |||||
[1958/2618] | [905/1309] | [1053/1309] | [905/1161] | [1053/1457] | |
[623/770] | [310/385] | [313/385] | [310/382] | [313/388] | |
[1335/1848] | [595/924] | [740/924] | [595/779] | [740/1069] | |
| LLMs | |||||
[131/154] | [62/77] | [69/77] | [62/70] | [69/84] | |
[127/154] | [56/77] | [71/77] | [56/62] | [71/92] | |
[87/154] | [33/77] | [54/77] | [33/56] | [54/98] | |
[91/154] | [17/77] | [74/77] | [17/20] | [74/134] |
表3 表注:数据为均值,括号内为95% CI,方括号内为评估次数。95% CI采用Wilson评分法计算。放射科医师性能指标为所有读者的均值计算。无论是放射科医师(合并准确率74.8%)还是任何测试LLM(最高准确率85.1%为GPT-4o)均无法可靠地检测出所有合成放射影像,凸显了识别合成放射影像的持续性差距。LLM = 大语言模型,NPV = 阴性预测值,PPV = 阳性预测值。
3.3 AI生成放射图像的特征性线索
根据放射科医师报告,AI生成图像最具辨识度的特征包括:

图3 图示:解剖匹配的真实与GPT-4o生成放射影像配对:(A)真实与(B)GPT-4o生成的后前位胸部放射图像,(C)真实与(D)GPT-4o生成的颈椎侧位放射图像,(E)真实与(F)GPT-4o生成的手部后前位放射图像,(G)真实与(H)GPT-4o生成的腰椎侧位放射图像。各配对证明GPT-4o能够在不同解剖区域生成放射影像学上合理的图像。

图4 图示:GPT-4o生成的骨折放射影像示例:(A)手部后前位放射图像,(B)下肢后前位放射图像,(C)足部内斜位放射图像。图像显示骨折线(箭头)异常平滑、干净、连续一致,B图中骨折线呈单皮质表现。这些理想化骨折线的存在——特征为不自然的平滑和不完整的皮质中断——可作为识别AI生成创伤影像的首要诊断线索。
3.4 第三阶段:RoentGen生成胸部放射图像评估
放射科医师鉴别真实vs RoentGen生成胸部放射图像的准确率为70.0%(95% CI: 62.3, 77.7)(表4)。与GPT-4o数据集相比,放射科医师识别RoentGen生成放射图像的合并准确率无统计学差异(74.8% vs 70.0%;P = .07)。经验更丰富的读者准确率略高(74.4% vs 68.2%),但无线性关联证据(β = −0.04;P = .89)。合并固定效应模型中,更长响应时间与更低准确率相关(β = −0.07;P = .009),表明即使校正读者能力和病例难度后,耗时越长的回答正确可能性越低。
表4:放射科医师与LLMs鉴别RoentGen生成放射图像与真实放射图像的性能
| 放射科医师 | |||||
[1309/1870] | [620/935] | [689/935] | [620/866] | [689/1004] | |
[409/550] | [214/275] | [195/275] | [214/294] | [195/256] | |
[900/1320] | [406/660] | [494/660] | [406/572] | [494/748] | |
| LLMs | |||||
[83/110] | [53/55] | [30/55] | [53/78] | [30/32] | |
[98/110] | [43/55] | [55/55] | [43/43] | [55/67] | |
[67/110] | [13/55] | [54/55] | [13/14] | [54/96] | |
[57/110] | [2/55] | [55/55] | [2/2] | [55/108] |
表4 表注:数据为均值,括号内为95% CI,方括号内为评估次数。95% CI采用Wilson评分法计算。RoentGen为一种器官特异性扩散模型,专门用于生成合成胸部放射影像。LLM = 大语言模型,NPV = 阴性预测值,PPV = 阳性预测值。
3.5 LLM检测结果汇总
GPT-4o数据集(多区域放射图像):
| 85.1% | |||
| 82.5% | |||
RoentGen数据集(胸部放射图像):
| 89.1% | |||
| 75.5% | |||
核心发现:
无一测试LLM能够检测出所有合成放射图像 GPT-4o生成放射图像的鉴别:GPT-4o(85%)和GPT-5(83%)显著优于Llama 4 Maverick(59%)和Gemini 2.5 Pro(56%)(均P < .001) RoentGen数据集中GPT-5(89.1%)表现最优,GPT-4o次之(75.5%) 即使是生成合成图像所用的GPT-4o本身也无法可靠识别自身输出的图像 LLM报告的合成图像线索包括:缺乏颗粒变异的平滑纹理、过度均匀的骨细节、异常锐利的手术器械、标记相关伪影
四、讨论与局限性梳理
4.1 核心学术论点
本研究揭示的关键问题具有多重维度意义:
技术可及性与安全风险的矛盾: 既往放射学专用生成模型(如GAN类)通常仅限于具备编码专业知识的人群使用,因需要大量训练数据,此类模型通常限制为单一解剖区域的放射图像生成,且不允许针对特定临床细节或疾病进行提示。相比之下,ChatGPT-4o图像生成功能的发布大幅降低了创建合成放射影像的技术门槛,使任何人都能通过简单文本提示词生成图像。这种广泛的可及性引发了恶意行为者伪造可信图像的担忧。
人类检测能力的局限: 本研究的中等Fleiss κ(0.31)表明集体人类判断力有限,自动化像素级溯源检测器可能提供安全保障网。值得注意的是,病理异常并未辅助检测——骨折与非骨折图像间准确率无差异(P = .15),表明病变存在本身并不能作为AI生成的提示线索。这一发现具有重要的临床警示意义:即使明显异常的图像同样可能为AI生成产物。
LLM检测的悖论现象: GPT-4o虽为合成图像生成工具,却在本研究中成为最有效的检测工具。然而,其仍无法可靠检测所有合成图像(85.1%准确率),意味着约15%的AI生成图像逃逸检测。Gemini 2.5 Pro和Llama 4 Maverick的表现接近甚至低于随机水平(56.5%和59.1%),尤其在RoentGen数据集中Llama 4 Maverick灵敏度仅为4%,几乎无法识别合成图像。
经验与亚专业的意外发现: 经验年限与检测准确率无线性关联,颠覆了传统"经验越多判断越准"的假设。骨骼肌肉亚专业放射科医师表现显著优于其他亚专业(83.0% vs 70.3%,P = .04),可能与其日常工作中更多接触骨细节评估有关——而过度的骨皮质平滑恰是AI生成图像的核心特征之一。
4.2 缓解策略与技术应对
论文系统性地提出了多层防御框架:
水印技术: 数字水印技术在保持诊断质量的同时嵌入不可感知的所有权或身份数据。先进方法包括可逆零水印(reversible-zero watermarking,结合VGG19变换),可实现近乎完美的鲁棒性。多模态融合水印技术可将MRI、SPECT和PET图像融合并通过提升小波变换和Hessenberg分解嵌入Aadhaar数据。
密码哈希: 密码哈希确保数据完整性,通过生成唯一图像指纹实现。如基于图卷积的Twofish Security框架计算加密前后哈希以实现基于哈希匹配的安全解密。
区块链溯源: 基于区块链的注册系统(如Hyperledger Fabric)提供去中心化审计追踪和智能合约+成员服务提供者的访问控制。进阶设计包括基于区块链的混沌Arnold猫映射加密方案。
综合防御架构: 以上工具组合形成多层框架,用于区分真实与AI生成图像并保障影像流水线安全。代码示例可在 https://github.com/mickaeltordjman/SecuritySyntheticImages/blob/main/Cryptography/crypto.ipynb 获取。
4.3 临床与科研意义
正面应用潜力: 合成放射影像可用于数据增强,尤其适用于隐私顾虑限制数据共享的罕见疾病或儿科疾病场景。从教育角度而言,合成罕见异常或系统性改变体位和曝光参数的能力可为放射学培训提供强大工具。
潜在滥用风险: 恶意行为者可能在公共数据集中掺入操纵图像,对未来算法造成数据投毒偏倚。合成影像可被用于保险欺诈、诉讼或孟乔森综合征(Munchausen syndrome)等场景。约五分之一(20%以上)的AI生成图像逃脱专家检测的事实凸显了此脆弱性。
监管空白: 截至目前,美国FDA和欧洲药品管理局尚未发布针对合成医学影像的明确指南。快速扩散的生成模型预示着针对验证、标注、隐私保护、滥用预防及医疗器械法规下风险分类的监管框架将成为必要。
4.4 研究局限性
模型演进不确定性: 当前LLM如GPT-4o持续更新迭代,未来模型更新可能改变或消除本研究所识别的AI生成图像伪影模式
样本量限制: 纳入的放射图像数量相对较小,选择依据为确保多位读者参与的可行性;明显的AI失败案例被排除(仅4例),可能引入选择偏倚;合成图像占比50%不代表真实世界流行率
双重角色偏倚: GPT-4o在数据集1中同时承担生成者和检测者角色,其检测准确率评估存在固有偏倚
决策不可解释性: LLMs不生成显著性图或热力图,限制了其决策过程的可解释性
第一阶段盲法局限性: 尽管读者在第一阶段中对研究目的处于盲态,但他们知晓这些放射图像具有特殊意义,这可能提升了自发检测AI生成图像的表现
读者群体限制: 本研究仅纳入执业放射科医师,非放射科医师的检测准确率可能更低;真实世界中合成图像的稀缺性将使识别更加困难
五、结论与展望
核心结论: LLM图像合成已从技术好奇心发展为能够生成高度逼真放射图像的实用工具。放射科医师(合并准确率74.8%)和当前多模态LLMs(包括GPT-4o、GPT-5、Gemini 2.5 Pro及Llama 4 Maverick)在识别合成放射影像方面的中等表现,加之这些工具广泛的公众可获得性,突显了恶意利用的可能性。
未来研究方向:
评估更广泛范围的生成模型及其输出 采用更具代表性的样本量和更低的AI图像流行率(可能降低读者灵敏度) 开发自动化deepfake检测算法 建立标准化水印标准和溯源协议 制定针对医学影像生成模型的监管指南
多层次响应策略: 包括临床医师教育、自动化deepfake检测系统、强制水印制度及严格的数据集治理在内的多层响应体系,对于防止这一新兴威胁演变为系统性问题至关重要。
教育资源: 为支持医师培训,经过筛选整理的deepfake数据集已在以下地址公开:https://noneedanick.github.io/DeepFakeXRay/
夜雨聆风