声明在前:这不是广告,没有任何工具付了推广费。评测基于2026年7月的工具版本,AI工具迭代极快,排名可能下个月就变了。
一、怎么测的
用同一个心内科入院记录的指令模板,分别喂给6款工具。指令包含:患者信息、查体数据、心电图和BNP结果,以及5条输出要求(按结构输出、先列依据再给分级、心电图不得改写、推断内容标注、禁止编造数据)。
评分看4个维度:医学术语准确性(心电图描述、心功能分级、ICD-10编码)、指令遵循度(有没有按要求输出)、中文自然度、合规性(数据出境风险、免费额度)。
6款工具:Claude Opus 4.7、GPT-5.5、Qwen3-Max(通义千问)、百川M4、文心一言5.0、DeepSeek V4。
二、逐一点评
1. Claude Opus 4.7 —— 综合最强,医学术语零失误
医学术语:满分。心电图"V1-V4导联ST段压低0.1-0.2mV"一字不差地保留,没有"润色"。NYHA分级判断依据列得清楚,ICD-10编码正确。Agent执行能力业界标杆,超长文本解析最强。
指令遵循:满分。7段结构一段不少,推断内容标了【推断】前缀,没有编造数据。6款里唯一完全按指令输出的。
中文自然度:偶有翻译腔。整体可读,但不如国产工具自然。
最大问题:海外工具,患者数据上传境外服务器,违反《个保法》。阿里已内部全面封禁Claude相关工具,合规风险需重视。
适合谁:不涉及患者隐私的练习场景,或已做脱敏处理。术语和格式要求最高的场景首选。
2. GPT-5.5 —— 通用推理均衡,但医学不够"专"
医学术语:基本准确。BNP 850pg/mL,它自动补了"排除心衰界值<100pg/mL",这个数值本身符合ESC指南,但问题在于指令没要求它补充参考值,属于"自由发挥"。心功能分级给了II级,但判断依据写得不够具体。
指令遵循:7段结构基本到位,但心电图描述被轻微"润色"了,"T波低平倒置"变成了"T波低平并倒置"。多模态能力出色,但写病历用不上。
中文自然度:好。比Claude自然,但不如国产工具。
最大问题:同样的合规问题。另外GPT-5.5有"自由发挥"的习惯,会在你没要求的地方加内容。
适合谁:对中文自然度要求高、能接受轻微润色的场景。需脱敏后使用。
3. Qwen3-Max(通义千问) —— 国内合规第一,中文医学语料扎实
医学术语:准确。心电图描述逐字保留,ICD-10编码正确,没有幻觉。比GPT-5.5稳。开源生态完善,中文性价比远超海外同级。
指令遵循:7段结构完整,但"推断内容标注【推断】前缀"这条没执行。这点不如Claude。
中文自然度:满分。6款里中文最自然的,"现病史"读起来就是中国医生写的口吻。
最大优势:国内合规,数据不出境。有免费额度。注意:通义千问7月15日下线了用户自建智能体功能(合规调整),但不影响基础对话使用。
适合谁:涉及真实患者信息、需要国内合规的场景首选。也是免费用户的第一选择。
4. 百川M4 —— 医疗专用大模型,幻觉率全行业最低
医学术语:最强。百川M4是清华联合百川智能发布的医疗增强大模型,在HealthBench权威评测上排名第一,超越GPT-5.5和Claude Opus 4.7。事实性幻觉率仅3.3%,全行业最低(GPT-5.5为3.8%,Claude为6.9%,DeepSeek为9.8%)。
独特能力:主动追问。通用模型拿到不完整信息会直接"猜",M4会像医生一样追问,一层层把信息补全。这个能力在写病历场景特别有用,因为住院医师口述的信息往往不完整。
指令遵循:7段结构完整,心电图描述保留。推断内容标注不如Claude严格,但比Qwen3好。
中文自然度:好。医学术语使用规范,读起来像临床医生写的。
最大优势:医疗场景专精,幻觉率最低。国内合规。
注意:通用能力(非医疗场景)不如Claude和GPT-5.5。如果你只用AI写病历,M4是最专业的选择;如果你还用AI做其他工作,需要搭配一个通用模型。
5. 文心一言5.0 —— 医学知识丰富,但格式不太听话
医学术语:准确,百度有医学知识图谱加持。但诊疗计划偏"科普化",用药建议写成"建议在医生指导下使用",没有直接给具体方案。
指令遵循:最大问题在这。7段结构只给了5段,心电图被改了一个字,"ST段压低"变成了"ST段压低改变"。
中文自然度:好,但偶有"百科风格"。
适合谁:查医学知识可以,写病历的格式遵循度不够,需要较多人工调整。
6. DeepSeek V4 —— 免费良心,推理强但医学训练不够
医学术语:基本准确,但ICD-10编码给错了,"冠状动脉性心脏病"给成了I20(心绞痛)而不是I25.1。心功能分级依据不够具体。推理成本大幅降低,国际影响力持续提升,被OpenClaw平台设为默认评测基准。
指令遵循:7段结构完整,但推断内容没有标注。心电图描述保留得不错。
中文自然度:好。逻辑清晰,但用词偏"技术流"。
最大优势:完全免费,国内开源。适合预算有限的场景。
适合谁:学生、规培生。ICD编码和用药方案必须人工核对。
三、横评对比表
幻觉率数据来源:百川M4官方发布,同口径对比。仅供参考,实际表现可能因场景不同而异。
四、不同场景怎么选
医疗场景首选:百川M4。医疗专用大模型,幻觉率最低,还会主动追问补全信息。如果只用来做医疗相关的事,这是最专业的选择。
日常写病历(脱敏后):Claude Opus 4.7 > 百川M4 > Qwen3-Max。Claude的术语和格式最好,但前提是做了脱敏。
涉及真实患者信息:百川M4 > Qwen3-Max > 文心5.0。国内合规,数据不出境。
纯免费使用:DeepSeek V4 > Qwen3-Max(免费额度)> 文心5.0(免费额度)。
追求输出质量(不在乎成本和合规):Claude Opus 4.7。医学术语零失误、指令完全遵循。
五、3条避坑提醒
坑1:海外工具不能传真实患者信息
Claude和GPT-5.5质量最好,但数据上传境外服务器违反《个保法》。阿里已内部全面封禁Claude相关工具。用之前必须脱敏:姓名用代号,不填住院号和身份证号。
坑2:没有一款工具的ICD编码能完全信任
6款工具都或多或少在ICD编码上出过错。DeepSeek V4把"冠状动脉性心脏病"(I25.1)给成了I20(心绞痛)。涉及医保报销的诊断编码,一律以你们医院的编码库为准。
坑3:工具更新很快,排名随时可能变
本次测评基于2026年7月版本。DeepSeek V4刚上线,百川M4发布不到一个月,工具能力还在快速迭代。建议每2-3个月用同一个指令重测一次。
写在最后
如果你觉得这篇测评有用,点个赞让我知道测评系列该不该继续做。你平时用哪款工具写病历?留言区说说你的体验。
— END —
本文为「AI工具测评」系列第1期。前几期「科室AI实战」和「医疗AI入门」可在历史文章中查看。
声明:工具选择仅供参考,最终使用需结合个人场景和合规要求。
夜雨聆风