概览
AI 病理产品进入欧盟时,首先要冻结预期用途并判断软件是否构成医疗器械或 IVD。若输出用于从人体样本获得诊断、预后、预测或治疗相关信息,通常需要按适用的 MDR/IVDR 软件规则评估。合规证据不能只报告一组 AUC 或准确率;还要证明数据代表性、扫描仪和染色差异下的稳健性、独立外部验证、病理医生的人类监督、失败模式、网络安全,以及上市后的性能漂移和重大模型变更控制。
先定义产品:扫描仪、平台、算法还是完整系统?
数字病理链路可能包含玻片制备、扫描仪、图像管理系统、算法和病理医生工作站。不同组件可以分别上市,也可以共同形成一个医疗目的。预期用途要明确样本类型、病种、输出、目标用户、使用环境和算法在决策中的作用。
“辅助筛查”“可疑区域标注”“定量评分”“分型”“诊断建议”不是同一种风险。宣传语、IFU、软件界面和临床方案必须使用同一套产品边界。
性能证据为什么不能只看一个准确率?
单一汇总指标可能掩盖关键亚组和失败模式。AI 病理需要考虑阳性/阴性分布、疾病亚型、样本质量、染色批次、扫描仪、图像压缩、站点差异以及病理医生如何处理不确定输出。
IVDR 下的医疗器械软件性能评价围绕科学有效性、分析性能和临床性能建立证据链。算法指标必须和预期用途、临床工作流及可接受风险联系起来。
| 证据层 | 核心问题 | 示例输出 |
|---|---|---|
| 科学有效性 | 输出与目标临床状态是否有合理关联 | 文献、指南、机制与现有诊断路径 |
| 分析性能 | 输入变化下算法能否稳定产生正确输出 | 重复性、扫描仪/染色/图像质量稳健性 |
| 临床性能 | 目标人群和真实工作流中能否达到主张 | 多站点独立验证、敏感度/特异度及亚组 |
| 人机系统 | 病理医生如何理解、复核和覆盖算法 | 读片研究、可用性、失败与降级处理 |
数据集设计与偏差控制
数据合法性、代表性和性能适用性是不同问题。获得合法同意或研究豁免,不自动证明数据足以支持预期用途;高质量标注也不能替代目标市场人群和工作流的外部验证。
- 记录样本来源、入排标准、患者层级拆分和标签生成方法。
- 避免同一患者、同一玻片或高度相关图像跨训练与测试集合泄漏。
- 保留独立、锁定的外部验证集,并覆盖目标扫描仪和站点。
- 预先定义缺失、低质量、域外输入和算法拒绝输出的处理。
- 按临床相关亚组报告表现,而不是只给整体平均数。
AI Act 与 IVDR 如何在 AI 病理中相遇?
当 AI 病理系统作为需要第三方合格评定的受监管产品或安全组件,并符合 AI Act Annex I 的条件时,可能同时进入高风险 AI 要求。企业应把数据治理、日志、透明度、人类监督、准确性、稳健性和网络安全与 IVDR QMS、风险管理和性能评价对应。
MDCG 2025-6 提供了 MDR/IVDR 与 AI Act 交叉问题的官方 FAQ。项目应按具体产品判断,不应把“医疗 AI”四个字直接等同于同一个分类结论。
上市后如何监测模型漂移与变更?
真实世界中,扫描仪固件、染色流程、实验室人群和图像质量都会变化。PMS/PMPF 计划应定义要监测的性能指标、亚组、告警阈值、投诉、误判、人工覆盖和无法处理的输入。
模型再训练、阈值调整、扩展病种、新增扫描仪或改变预期用途,都需要预先分类其影响。重大变化可能触发新的验证、技术文档更新和公告机构沟通。
数据集要能暴露什么样的泛化问题?
除了病例数量,还应描述切片制备、染色、扫描设备、图像质量、病种谱、患者构成和标注方式。按这些因素检查测试集是否覆盖拟定用途,并确认训练、调参与独立测试之间不存在患者或近重复图像泄漏。
例如,同一患者的多个切片被随机分到不同数据集,可能使测试结果看起来较好,却不能有效解释模型遇到新患者时的表现。项目组应在分析前定义分组单位和排除规则,保留数据拆分及版本记录,而不是结果出来以后再决定哪些样本不计入。
算法指标如何连接病理医生的实际使用?
先说明输出是提示可疑区域、辅助计数、给出分类建议还是用于其他功能,再据此设计评价。独立算法性能与医生使用系统后的表现不是同一个问题;如果主张涉及工作流程收益,应预先说明如何测量、比较对象是什么以及哪些限制会影响解释。
异常输入、低质量图像、罕见亚型与用户纠正操作也应有记录路径。对未覆盖的情形,应在产品限制和风险管理中明确处理办法。性能评价最终需要解释系统在既定用途内能支持什么,而不只是展示一张总体准确率图表。
参考来源
请查阅原文中的适用范围、生效日期和完整要求。
讨论您的具体项目
介绍产品、已有资料和需要解决的问题,便于确定下一步工作。
IVD 性能评价与临床研究咨询相关问题
