夜雨聆风学习资料网

ARTICLE · 1061385

必修课 | 可用性工程文档别走过场

必修课 | 可用性工程文档别走过场

在欧盟 MDR((EU) 2017/745)符合性评估中,很多医疗器械企业的研发与法规团队依然把可用性工程

Usability Engineering, UE

Human Factors Engineering, HFE

当成拿证前补写的一份“静态测试报告”。直到公告机构(Notified Body, NB)审核员开具重大不符合项(Major NC),指出“测试受试者全部为内部工程师”、“测试中存在辅导提示”以及“残余使用风险未在 ISO 14971 中闭环”时,企业才发现整个可用性工程文档(Usability Engineering File, UEF)面临推倒重来的惨剧。可用性工程绝非过场文书,它是 MDR 贯穿全生命周期的核心安全支柱。


为何超过 50% 的上市后不良事件源于“使用错误(Use Error)”?

长期以来,医疗器械上市后的警戒(Vigilance)与不良事件数据统计显示,超过 50% 的医疗器械严重事故,其根源并非来自于硬件电路的烧毁或软件的代码崩溃,而是来自于操作人员的“使用错误(Use Error)”

复杂的菜单层级、高频且音调相似的假报警、反直觉的物理接头设计、或者缺乏对比度的显示界面,极易在急救、高压或疲劳的真实临床环境中,诱发医护人员或患者自身的误操作,进而导致给药过量、延误治疗甚至患者死亡。 可用性工程 (IEC 62366-1) 强制拦截

在旧指令(MDD)时代,可用性工程常常被边缘化为一项“锦上添花的辅助测试”。然而,MDR 立法者深刻吸取了上市后事故的教训,在 MDR 附录 I(Annex I)通用安全与性能要求(General Safety and Performance Requirements, GSPR)中,将可用性上升为强制的符合性支柱

  • GSPR 5(人机工程与使用错误控制):强制要求制造商必须通过人机工程设计,降低因设备特征(如界面、显示、控制)及预期使用环境引发的使用错误风险。
  • GSPR 14.2 & 14.6(软件与系统交互):要求包含软件的器械必须在开发生命周期中,验证其界面在不同环境下的易用性与人机交互安全性。
  • GSPR 23.4(说明书与信息可读性):明确说明书(IFU)作为用户界面的一部分,必须经过可用性验证,确保其可被目标用户正确感知与理解。

更严峻的是,根据欧盟最新警戒指南 MDCG 2023-3 Rev. 2 的官方界定,

由于器械人机工程特征(Ergonomic Features)缺陷导致的使用错误,在法律上被直接划归为“器械事件(Incident)”。如果该使用错误导致了患者死亡或健康严重恶化,必须强制向主管当局(CA)提交 MIR 严重事件报告!


IEC 62366-1 九大闭环步骤

要构建不惧审核员审查的可用性工程文档(UEF),必须精准掌握国际标准 IEC 62366-1:2015+AMD1:2020 与风险管理标准 ISO 14971:2019 的深层交织逻辑。

1. 核心定义辨析:

在发补答辩中,很多企业面对审核员指出的使用错误,习惯性地在报告中写道:“该错误系操作人员未严格阅读说明书导致的违规违章操作,属于用户的责任。”

这种逻辑在 MDR 审核中会被直接判定为“法规概念不清”!

根据 IEC 62366-1 第 3 条定义与 MDCG 2023-3 问答,必须严密区分以下三种使用场景:

【法规概念辨析与审查红线】

  • 正确使用(Correct Use):用户按照说明书操作,且没有发生任何使用错误。
  • 使用错误(Use Error):用户在正常使用(Normal Use)过程中,其操作或未操作导致了不同于预期或制造商设定的结果。使用错误是由于用户界面设计、认知心理与环境失配引发的,属于制造商必须通过设计进行控风险的法定范畴
  • 异常使用(Abnormal Use):指用户故意、有意识地违反说明书的蓄意破坏、极度冒失或蓄意无视安全信息的行为(如用输液泵当锤子砸东西)。只有真正的“异常使用”,企业才可以在证明已尽到合理界面设计后豁免进一步的界面风险控制

绝大多数企业口中的“医护人员粗心大意”,在 IEC 62366-1 框架下均属于“可合理预见的使用错误(Reasonably Foreseeable Use Error)”,制造商必须承担本质安全设计的责任。需在 RMF 中记录合理性

2. 可用性工程(UE)标准化实施9步骤

依据 IEC 62366-1:2015+AMD1:2020 第 5 条,一个合规的可用性工程过程必须包含以下九个顺序递进的步骤,任何步骤的缺失都会导致 UEF 链条断裂:

  1. 编制使用规范(Use Specification):明确预期医疗适应症、目标患者人群、作用身体组织、目标用户画像(User Profiles)、预期使用环境以及工作原理。
  2. 识别与安全相关的 UI 特征及潜在使用错误:基于 ISO 14971:2019 附录 A,识别影响安全的人机界面特征及可能发生的感知、认知和动作阶段的使用错误。
  3. 识别已知与可预见的危险源和危险情境:结合以往上市后数据、客诉及同类竞品召回记录,识别与 UI 相关的危险源。
  4. 识别并描述危险使用场景(Hazard-related Use Scenarios):详细描述包含任务序列、使用错误及潜在伤害(Harm)严重度的场景。
  5. 选择用于总结性评价的危险使用场景:筛选出所有包含关键任务(Critical Tasks)的场景,即如果不正确执行或未执行会导致严重伤害的任务。
  6. 建立用户界面规范(UI Specification):将风险控制措施转化为可测试的技术需求(包括显示屏尺寸、按键反馈力、警报音量、IFU 包装设计等)。
  7. 建立用户界面评价计划(UI Evaluation Plan):制定形成性评价与总结性评价的具体方案与通过标准。
  8. 设计实施与形成性评价(Formative Evaluation):在产品研发早期(如原型图、3D 打印件阶段)进行迭代测试,探寻潜在的界面缺陷。
  9. 执行总结性评价(Summative Evaluation):在最终量产定型产品上,开展严密的总结性可用性测试(Usability Testing)。

总结性评价 Summative Testing

总结性评价(Summative Evaluation)是整个可用性工程文档中含金量最高、也是 NB 审核员调取原始记录最多的环节。

1. 受试者样本量的科学测算(15 人/组法则)

在总结性测试中,受试者样本量的确定绝不能拍脑门决定。

根据 IEC 62366-2 及 FDA 人体工程学指南的统计学概率模型,当单组受试者数量达到 15 人 时,测试能够以 90% 至 97% 的极高概率发现该用户界面中存在绝大多数潜在的使用错误(基于假设使用错误发生概率 \(p \ge 11%\) 的二次项分布模型)。

【审核员审查红线:用户组(User Groups)的分组划分】 如果你的设备面向多种完全不同的用户群体,例如:

  • 群体 A:专业医院 ICU 护士
  • 群体 B:患者家属(非专业人员/Lay Users)
  • 群体 C:设备维护工程师

企业必须为每一个独立的用户组(User Group)招募至少 15 名受试者!企图用“10 个护士 + 5 个患者”凑齐 15 人提交报告的做法,会被审核员以“单个用户组样本量不具备统计学显著性”为由直接驳回。

2. 真实临床模拟环境(Simulated Clinical Environment)搭建

总结性测试必须在能够真实还原临床应激状态的高保真模拟环境中进行。

审核员会重点调取测试现场的视频或环境布置档案,核实是否还原了以下要素:

  • 环境干扰:急救室或 ICU 的背景噪音(如其他监护仪报警声)、适度调暗的光线环境、忙碌多任务打断场景。
  • 物理穿戴:医护人员是否按真实临床要求佩戴厚医用无菌手套进行微小按键或触控屏操作。
  • 真实包材:测试必须从受试者面对“最终无菌外包装”开始,评估拆封、安装、无菌屏障保护到上电启动的全过程。

3. 关键任务(Critical Tasks)与“近乎失误(Close Calls)”的记录

在测试过程中,不仅要记录受试者是否完成了任务,更要记录任务完成的质量与心理模型(Mental Model)

  • 关键任务(Critical Tasks):必须 100% 涵盖所有涉及高风险的步骤。
  • 近乎失误(Close Calls / Near Misses):受试者在操作过程中险些犯错(如按错按键后突然反应过来并纠正)。在 IEC 62366-1 中,近乎失误在审核员眼里等同于使用错误信号!它表明用户界面存在极强的混淆暗示,企业必须在测试后对 Close Calls 进行深度的根因分析(Root Cause Analysis)。

案例剖析

在实际的 NB 评估中,绝大多数中国企业的 UEF 卷宗翻车,都集中在以下三个极其典型的“形式主义”陷阱中:

踩坑一:找公司内部研发工程师代替临床医护人员做测试

  • 现象还原:某国内有源器械企业为了省钱省时,在总结性测试前,招募了公司内部的 15 名软件工程师和 RA 专员作为“受试者”,在公司会议室里完成了总结性测试,并得出了“操作顺畅、无使用错误”的完美结论。

  • 审核员发补逻辑(Deficiency Logic)

    【审核员视点 (Auditor's Perspective)】 “内部研发人员和员工对产品架构、软件逻辑以及设计背后的缺陷有着天然的认知熟悉度(Internal Bias)。他们根本无法代表没有经过产品开发培训的外部临床护士或医生。内部人员测试产生的所有数据均属于无效客观证据(Invalid Objective Evidence)。判定该总结性评价报告不符合 GSPR 5 及 IEC 62366-1 第 5.7.3 条要求,要求重新招募独立外部受试者重做测试!”

踩坑二:测试中出现操作失误时,主试人员口头提示并记录为“经指导后正确操作”

  • 现象还原:在测试现场,一名受试护士无法找到某个关键参数的设置菜单,卡顿了 3 分钟。旁边的测试主持人员(Moderator)实在看不下去,指着屏幕提示:“你点右下角那个图标试试。”护士点击后完成了设置。报告里记录为:“初始稍有不熟练,经口头指导后成功完成,无最终错误。”
  • 审核员发补逻辑(Deficiency Logic): 总结性评价属于盲测确认(Validation),绝对禁止主试人员在测试过程中提供任何非预期的口头提示、操作辅导或眼神暗示!这种人为干预破坏了测试的客观性,掩盖了用户界面设计的重大缺陷。在真实临床中,可没有研发工程师站在护士身边随时给提示。审核员直接判定该项关键任务为“任务失败(Task Failure)”。

踩坑三:UEF 文档与产品说明书(IFU)警示语割裂,风险未闭环

  • 现象还原:在形成性评价中,企业发现用户极易将 A 型管路误接到 B 型接口上导致严重过量给药。研发团队评估后发现修改物理接口模具需要花费数十万元,于是决定“不改硬件”,仅仅在产品说明书(IFU)里加了一行红色小字:“警告:请勿将 A 管路接入 B 接口。”随后在 UEF 报告中写道:“已通过增加 IFU 警告将使用风险降至可接受水平。”

  • 审核员发补逻辑(Deficiency Logic): 该做法直接违反了 MDR Annex I GSPR 4 的“三阶控制优先级(Three-step Risk Control Priority)”

    企业在没有证明“本质安全设计在技术上不可行”的前提下,直接滑向第三阶,且未通过后续的总结性测试验证‘这行小字警告是否能被用户有效感知与遵守’。审核员认定该残余使用风险未经有效控制,判定 GSPR 4 与 GSPR 5 不符合!

    1. 第一优先:本质安全设计(彻底改变硬件接口物理形状,使其无法误插);
    2. 第二优先:防护措施与警报(增加误接声光报警);
    3. 第三优先:说明书警告与信息。

避坑指南:实操建议与自查清单

为了确保可用性工程文档顺利通关公告机构审查,企业在项目推进中应落实以下四项核心建议,并对照自查清单进行闭环:

实操落地四项硬核建议

  1. 按真实目标用户画像(User Personas)进行独立的外部受试者招募: 严格按照目标市场(如欧洲)的医疗文化、语言背景、职业资历招募外部独立的受试人员。若是家用器械(Lay-use),受试者必须涵盖不同年龄段、视力水平及手部灵敏度的普通大众。
  2. 构建高保真真实临床模拟场景(High-Fidelity Simulation): 引入必要的环境应力(噪音、暗光、医用手套、时间压力)。全程录音录像,并使用一向透视玻璃观察室进行非干扰式记录。
  3. 编写严密的《总结性可用性测试方案与报告》: 详实记录每个关键任务的完成时间、困难点、近乎失误(Close Calls)、使用错误,并结合认知走查(Cognitive Walkthrough)与事后访谈(Post-test Interview),执行深度的根因分析( Root Cause Analysis, RCA)。
  4. 将残余使用风险无缝并入综合获益-风险分析(Benefit-Risk Analysis): 在技术文档中附具独立的《可用性风险可接受性论证说明》,证明所有残余使用风险均已降至可接受的最低水平(ALAP),且其残余风险被产品的临床获益所包含。

为了帮助企业 QA/RA 团队在递交前进行全面排雷,我们整理了以下自查清单:

→ → → 向右滑动 → → →

📋 可用性工程(UEF)合规自查与评审清单

审查维度
核心核查指标与自查要求
法规及标准依据
对应 UEF 卷宗文件
1. 使用规范 (Use Spec)
▢ 是否清晰界定了用户画像(User Profiles)、使用环境及限制?▢ 是否明确区分了“正常使用”与“异常使用”的边界?
IEC 62366-1 Sec 5.1MDR GSPR 5
《使用规范 (Use Specification)》
2. 危险场景与 14971 联动
▢ 识别出的所有危险使用场景是否 100% 映射到 ISO 14971 风险分析表中?▢ 是否涵盖了关键任务(Critical Tasks)的筛选依据?
IEC 62366-1 Sec 5.3/5.4ISO 14971:2019
《人机界面风险分析表》/ RMF 卷宗
3. 受试者代表性
▢ 总结性测试受试者是否 100% 为外部独立人员(无内部员工)?▢ 每个独立用户组(User Group)的受试者数量?
IEC 62366-1 Sec 5.7.3IEC 62366-2
《总结性测试招募与受试者背景表》
4. 测试过程客观性
▢ 测试方案是否明确规定了盲测与“无提示”原则?▢ 是否提供了高保真模拟环境(噪音、手套、光线)的布置证据?
IEC 62366-1 Sec 5.8/5.9
《总结性评价测试方案 (Protocol)》
5. 错误分析与残余风险
▢ 对测试中发生的所有错误及 Close Calls 是否进行了 Root Cause 根因分析?▢ 残余使用风险是否符合 GSPR 4 三阶控制优先级并在 BRA 中闭环?
IEC 62366-1 Sec 5.9MDR GSPR 4/5
《总结性评价报告》/《获益-风险分析》

结尾

可用性工程绝不是为了应对监管而堆砌的一纸测试报告,它是连接医疗器械“技术性能”与“真实临床安全”的关键桥梁。在欧盟 MDR 穿透式监管下,只有彻底摒弃内部员工走过场的思维,建立起从人机界面风险识别、形成性迭代、高保真总结性盲测到 ISO 14971 闭环的活态 UEF 体系,企业才能确保产品在公告机构挑剔的审查中平稳通关,真正为全球患者与医护人员筑牢安全的终极防线。


💡 讨论思考:

在你们公司目前的 MDR 研发与出海体系中,可用性工程(UE)是在产品设计初始阶段就由人机工程专家深度参与,还是在产品硬件定型甚至拿证前夕才由 RA/QA 团队倒推补写报告?你们在招募欧洲本地目标受试者(如护士、患者)执行 15 人/组的总结性测试时,遇到过哪些成本与合规难题?

欢迎在评论区分享你的想法!

相关学习资料