AI 与 IVD
AI 病理进入欧盟:从数字切片算法到 IVDR 性能证据
面向 AI 病理与数字病理厂商,解释产品边界、MDSW/IVD 判断、预期用途、数据集、独立验证、人类监督、性能评价、模型漂移和欧盟上市后监测。
发布: · 复核:
核心结论
AI 病理产品进入欧盟时,首先要冻结预期用途并判断软件是否构成医疗器械或 IVD。若输出用于从人体样本获得诊断、预后、预测或治疗相关信息,通常需要按适用的 MDR/IVDR 软件规则评估。合规证据不能只报告一组 AUC 或准确率;还要证明数据代表性、扫描仪和染色差异下的稳健性、独立外部验证、病理医生的人类监督、失败模式、网络安全,以及上市后的性能漂移和重大模型变更控制。
关键要点
- 从预期用途与临床工作流判断产品边界,不从“用了 AI”判断法规类别。
- 训练、调参、内部测试和独立外部验证数据集必须有清晰隔离。
- 性能主张应覆盖目标样本、人群、站点、扫描仪、染色和失败模式。
- AI 模型更新、阈值变化和新扫描仪接入必须进入受控变更流程。
先定义产品:扫描仪、平台、算法还是完整系统?
数字病理链路可能包含玻片制备、扫描仪、图像管理系统、算法和病理医生工作站。不同组件可以分别上市,也可以共同形成一个医疗目的。预期用途要明确样本类型、病种、输出、目标用户、使用环境和算法在决策中的作用。
“辅助筛查”“可疑区域标注”“定量评分”“分型”“诊断建议”不是同一种风险。宣传语、IFU、软件界面和临床方案必须使用同一套产品边界。
性能证据为什么不能只看一个准确率?
单一汇总指标可能掩盖关键亚组和失败模式。AI 病理需要考虑阳性/阴性分布、疾病亚型、样本质量、染色批次、扫描仪、图像压缩、站点差异以及病理医生如何处理不确定输出。
IVDR 下的医疗器械软件性能评价围绕科学有效性、分析性能和临床性能建立证据链。算法指标必须和预期用途、临床工作流及可接受风险联系起来。
| 证据层 | 核心问题 | 示例输出 |
|---|---|---|
| 科学有效性 | 输出与目标临床状态是否有合理关联 | 文献、指南、机制与现有诊断路径 |
| 分析性能 | 输入变化下算法能否稳定产生正确输出 | 重复性、扫描仪/染色/图像质量稳健性 |
| 临床性能 | 目标人群和真实工作流中能否达到主张 | 多站点独立验证、敏感度/特异度及亚组 |
| 人机系统 | 病理医生如何理解、复核和覆盖算法 | 读片研究、可用性、失败与降级处理 |
数据集设计与偏差控制
数据合法性、代表性和性能适用性是不同问题。获得合法同意或研究豁免,不自动证明数据足以支持预期用途;高质量标注也不能替代目标市场人群和工作流的外部验证。
- 记录样本来源、入排标准、患者层级拆分和标签生成方法。
- 避免同一患者、同一玻片或高度相关图像跨训练与测试集合泄漏。
- 保留独立、锁定的外部验证集,并覆盖目标扫描仪和站点。
- 预先定义缺失、低质量、域外输入和算法拒绝输出的处理。
- 按临床相关亚组报告表现,而不是只给整体平均数。
AI Act 与 IVDR 如何在 AI 病理中相遇?
当 AI 病理系统作为需要第三方合格评定的受监管产品或安全组件,并符合 AI Act Annex I 的条件时,可能同时进入高风险 AI 要求。企业应把数据治理、日志、透明度、人类监督、准确性、稳健性和网络安全与 IVDR QMS、风险管理和性能评价对应。
MDCG 2025-6 提供了 MDR/IVDR 与 AI Act 交叉问题的官方 FAQ。项目应按具体产品判断,不应把“医疗 AI”四个字直接等同于同一个分类结论。
上市后如何监测模型漂移与变更?
真实世界中,扫描仪固件、染色流程、实验室人群和图像质量都会变化。PMS/PMPF 计划应定义要监测的性能指标、亚组、告警阈值、投诉、误判、人工覆盖和无法处理的输入。
模型再训练、阈值调整、扩展病种、新增扫描仪或改变预期用途,都需要预先分类其影响。重大变化可能触发新的验证、技术文档更新和公告机构沟通。
来源与复核
由 FirsTeckBio 法规与临床团队复核。本文不替代针对具体产品的法律或法规意见。