《Virchows Archiv》:Guidance for laboratory implementation, governance and continuous assurance of artificial intelligence in histopathology
编辑推荐:
摘要:人工智能(AI)正在迅速改变组织病理学,其应用范围涵盖工作流程优化、质量保证、肿瘤诊断、分级、生物标志物评估及预后估计。尽管众多AI算法已展现出令人鼓舞的分析性能和临床性能,病理实验室正越来越多地采用已获监管批准的商品化AI系统,而非自行开发算法。现有指
摘要:人工智能(AI)正在迅速改变组织病理学,其应用范围涵盖工作流程优化、质量保证、肿瘤诊断、分级、生物标志物评估及预后估计。尽管众多AI算法已展现出令人鼓舞的分析性能和临床性能,病理实验室正越来越多地采用已获监管批准的商品化AI系统,而非自行开发算法。现有指南主要聚焦于AI的开发、验证和监管批准,而对于安全常规临床实施所需的本地验证、治理和持续保障,提供的实践指导相对较少。本文提出了一个专门针对病理实验室内部AI临床实施的实用框架。该框架不涉及AI开发,而是聚焦于实验室将成熟AI系统引入临床实践所承担的责任。该框架根据预期临床功能对AI应用进行区分,认识到诊断应用、生物标志物评估、工作流程优化和生成式AI应用需要不同的实施、验证、治理和质量保证策略。该框架进一步将算法验证、本地验证和持续保障区分为互补的实施阶段,并倡导一种基于功能、风险相称的方法,整合到现有实验室质量管理体系中。本文就工作流程集成、互操作性、人工监督、用户能力、性能监测、事件管理、软件更新以及AI运行全生命周期中的相称再验证提供了实用建议。通过将实施延伸至监管批准之后,本指南对现有AI开发和监管框架起到补充而非替代作用。它为病理实验室、专业组织、认可机构和医疗服务提供者提供了一个实用的治理框架,以支持AI安全、标准化且可持续地融入常规组织病理学实践,同时维护诊断质量、患者安全和临床治理。
主体内容总结:
**引言**
人工智能(AI)正迅速成为数字组织病理学不可或缺的组成部分,其应用贯穿整个诊断路径,包括实验室工作流程优化、质量保证、病变检测与量化、分级、生物标志物评估、预后预测及临床决策支持。全玻片成像、计算病理学和深度学习的进展使AI算法能够在特定诊断任务中达到专家级表现,同时提供提高效率、可重复性和标准化的机会。因此,基于AI的医疗器械的监管批准正在增加,商品化AI工具在全球病理实验室的部署也在扩大。在AI开发和评估标准方面已取得相当进展,包括监管指南、报告标准以及临床AI就绪与评估(CARE)框架等实施模型,为AI系统的负责任开发与评估奠定了基础。然而,病理实验室的职责与AI开发者和监管机构存在根本不同。多数病理科室不会开发或训练AI算法,而是采购商品化、经监管批准的AI系统用于临床。其主要责任并非算法开发,而是确保经批准的AI系统在自身实验室环境中安全、有效且一致地运行。AI实施不同于常规实验室设备验证。实验室仪器一经验证通常保持稳定,而AI系统的性能可能因软件更新、算法修改、训练数据变化、扫描仪更换、染色变异、数字病理基础设施或工作流程变化、患者人群或疾病谱变化以及临床指南和实践演变而随时间改变。实施要求因AI系统的预期功能而异。基于图像的AI用于病变检测与量化、分级或生物标志物评估,与数据驱动的预测模型或运营性AI应用(如病例优先级排序、质量保证和实验室自动化)所需实施和验证策略根本不同。对所有AI应用采用统一的验证和治理要求既不实际也不相称。验证、人工监督、治理和实施后监测的程度应由预期临床用途、对患者护理的潜在影响及相关风险水平决定。
**指南的制定**
本指南由欧洲乳腺筛查病理工作组(EWGBSP)成员制定,该工作组是一个由乳腺病理学家组成的国际多学科网络,专业领域涵盖乳腺病理学、数字病理学、人工智能、实验室质量管理和临床实施。初稿由第一作者在回顾已发表文献和现有监管、实施及质量管理框架后起草。随后,所有合著者对稿件进行了迭代审阅和修订,通过多轮书面反馈完善建议,直至最终内容达成广泛一致。该文件反映了合著者的集体专家意见,旨在为在常规临床实践中实施AI的病理实验室提供实用指导。在已发表证据有限或不可用时,建议依据作者集体的实施经验以及适用于病理实验室AI部署的现有监管和质量管理原则。
**本指南的范围**
本指南为在诊断组织病理学中实施和管理成熟AI系统提供了实用框架。其围绕四个核心原则组织,以区别于现有AI开发和监管框架:(1) 将实施视为持续运营生命周期,从本地验证延伸至部署、监测、事件管理和相称再验证;(2) 基于功能的实施,即根据预期临床用途对AI系统分类,因为不同应用具有不同的实施、治理和质量保证要求。对于生物标志物AI,此功能方法补充而非替代ESMO-欧洲乳腺AI(EBAI)分类,后者根据生物学作用对生物标志物进行分类,而本指南则关注实验室实施、治理和质量保证,不论生物标志物类型如何;(3) 风险相称的验证,即技术、分析、临床和本地验证的程度由预期临床功能和相关患者风险决定,而非对所有AI应用采用统一验证策略;(4) 应用特定的质量保证,认识到不同AI系统表现出不同的性能特征、故障模式和治理要求,需要量身定制的监测和事件管理策略。
**选择适当的实施和验证策略**
不同AI应用服务于不同临床功能并需要不同实施路径。诊断图像分析、生物标志物评估、工作流程优化和生成式AI在预期用途、数据输入、临床风险和故障模式方面存在差异,不应采用单一统一方法实施。实施策略应由预期临床功能和相关患者风险决定。直接影响病理解释的诊断AI系统在部署前需要全面的分析、临床和本地验证。相比之下,运营性AI系统主要需要验证系统集成、工作流程性能和互操作性,而生成式AI应用则需要治理、强制人工监督和对生成内容的批判性审查,而非自主诊断验证。实施策略应反映本地医疗环境,认识到数字病理基础设施、监管框架和劳动力准备程度在国内及国家间存在显著差异。AI系统通常应仅用于制造商的预期临床用途。标签外实施应明确声明,并接受与相关临床风险相称的额外治理、验证和机构批准。与ISO 15189一致,验证证明方法适合其预期目的;而核实确认先前验证的方法在实验室自身使用条件下表现可接受。在本指南中,算法验证主要是开发者的责任,而病理实验室在临床部署前进行本地验证。
**实施作为持续生命周期**
AI的成功实施延伸至监管批准、初始安装和本地验证之外。治理应被视为一个持续生命周期,包含三个连续阶段:(1) 算法验证,(2) 本地验证和(3) 持续保障。每个阶段的程度应与预期临床功能和AI应用的相关风险相称。该生命周期补充了现有AI开发框架(如CARE框架),特别聚焦于监管批准后常规病理实践中成熟AI系统的治理和运营部署。实施前,实验室应选择适合预期临床应用的AI解决方案。尽可能优先选择有同行评审证据和独立外部验证支持的监管批准算法。选择应考虑预期临床用途、诊断性能、互操作性、工作流程兼容性、供应商支持和可用上市后性能数据。专业学会、外部质量评估提供者和协作验证研究的独立评估可能提供超越制造商报告性能的补充证据。
**阶段1:算法验证**
算法验证主要是开发者的责任,包含三个互补组成部分:技术验证、分析验证和临床验证。技术验证确认软件在其预期技术环境中正确运行。分析验证证明算法在相关技术和生物学变异中的准确性、可重复性和稳健性,而临床验证确立AI系统针对适当参考标准和临床终点实现有临床意义的性能。这些活动共同证明AI系统在监管批准前适合其预期目的。
**阶段2:本地验证**
本地验证是病理实验室的责任。与ISO 15189一致,验证确认先前验证的方法在实验室自身使用条件下表现可接受。本地验证确立经批准的AI系统在本地数字病理环境中安全一致地运行,包括与扫描仪、图像格式、实验室信息系统、计算基础设施、网络安全要求、实验室工作流程和代表性本地病例组合的兼容性。此步骤尤为重要,因为开发者经常提供关于商品化AI系统所基于数据集、验证策略和性能特征的有限信息。尽管常被忽视,本地验证仍是临床实施的必要前提。验证策略应针对AI系统的预期临床功能和相关临床风险定制。对于基于图像的诊断和生物标志物AI应用,提供了本地验证的示例性实例,并针对未达到预定接受标准时建议采取的行动。
**阶段3:持续保障**
持续保障在临床部署后开始,确保AI系统在其运营生命周期内持续安全有效地运行。持续保障包括持续性能监测、事件管理、软件更新、变更控制、宿主环境维护,以及在重大技术或工作流程变更后进行相称再验证。它还确认经批准的AI系统随着扫描仪、染色方案、工作流程、患者人群和临床实践的演变,继续在本地实验室环境中表现可接受。
**工作流程整合与治理**
AI实施是一个社会技术过程,将经过验证的AI系统与实验室基础设施、临床工作流程、质量管理系统和专业监督相结合,以确保在常规组织病理学中安全、有效和可持续的使用。成功实施需要明确定义AI系统在诊断路径中的角色、审查和响应AI输出的责任,以及涵盖文档、标准操作程序、用户培训、能力评估和系统故障或临时不可用应急计划的治理安排。实验室还必须建立将AI输出整合到病理报告并向临床团队传达的明确方案。根据预期应用和本地报告标准,AI数据可能作为决策支持、定量生物标志物指标或集成诊断特征。诊断报告应明确记录AI辅助的使用和范围,同时强调最终解释和诊断责任由报告病理学家承担。早期与多学科团队接触对于确保AI衍生数据以临床可操作、易于解释的格式报告并符合患者管理算法至关重要。
**互操作性和系统集成**
成功实施需要验证整个数字病理生态系统的互操作性,而非仅验证AI算法本身。本地验证应确认全玻片扫描仪、图像管理系统(IMS)、实验室信息系统(LIS)、AI软件和报告平台之间的可靠集成。应特别关注图像传输、病例识别、元数据完整性、结果通信和工作流程自动化,以最小化数据丢失、错误病例分配或报告错误的风险。在支持的情况下,实验室应优先采用公认的互操作性标准,包括用于数字病理图像交换的DICOM标准以及用于与实验室和医院信息系统通信的HL7/FHIR标准。然而,由于许多病理服务继续在包含专有图像格式和供应商特定接口的异构数字病理环境中运行,本地验证应证明互操作性可靠,并保持图像保真度、元数据完整性和患者识别,无论底层技术架构如何。实施应遵守适用的国家和区域数据保护和患者隐私立法。当数字图像或元数据传输给外部供应商或云平台时,实验室应确保适当的去标识化、合同保障、网络安全以及相关立法(如欧盟GDPR)的合规性,以及当地机构关于数据共享和跨境传输的政策。
**根据监管和预期临床用途的实施**
AI系统可通过不同实施路径进入临床实践,包括满足适用监管要求的商品化产品(如IVDR合规或FDA授权设备)、本地开发算法、研究性研究平台和前瞻性临床评估研究。实验室可选择在制造商预期用途之外使用监管批准的AI,或以“静默”模式实施AI以在临床部署前评估性能。这些场景需要不同水平的治理、验证和监管监督。实验室应在部署前明确定义每个AI系统的预期临床用途、实施状态和监管背景,确保验证、治理和监测水平与预期应用和相关临床风险相称。监管批准是实施的前提,而非临床就绪的唯一决定因素。尽管开发者负责算法开发、验证和监管批准,病理实验室仍负责确保在其自身临床环境中的安全实施。安全部署依赖于制造商和实验室之间的有效协作,明确定义软件更新、技术支持、事件调查和性能监测的责任。AI系统也可在前瞻性临床试验中实施,作为研究工具或作为试验资格、分层、生物标志物评估或终点评估的组成部分。此类使用需要方案定义的前瞻性验证、版本控制、预设质量控制程序、可审计性和治理安排,以确保参与实验室和试验期间的一致性。试验期间算法、扫描仪、染色方案或分析工作流程的变更应正式评估,因为它们可能影响生物标志物可比性和试验完整性。培训计划还应通过确保所有经验水平的病理学家批判性评估AI输出而非不加独立审查地接受算法生成结果来解决自动化偏差。
**管理分析前变异性**
分析前变异是基于图像的AI系统的重要变异来源。固定、组织处理、切片厚度、染色强度、盖玻片、玻片质量和扫描的变异可能影响图像外观并影响算法性能。实验室应验证AI系统在常规实践中遇到的分析前条件范围内稳健运行,包括常见伪影如褶皱、气泡、失焦区域、组织破碎和染色变异,特别是使用不寻常染色如苏木精-伊红(H&E)或用红色色原显色的免疫组织化学反应时。适当时,实验室应在AI分析前建立组织处理和H&E染色的可接受质量控制限值。数字图像预处理技术(包括染色归一化)可能提高某些算法的稳健性;然而,这些方法仅在针对预期AI应用验证并证明不损害诊断性能后才应实施。优化和标准化分析前过程仍是确保可靠和可重复AI性能的首选策略。
**人工监督和持续质量保证**
AI应增强而非替代专业判断,诊断决策的责任仍由报告病理学家承担。人工监督是所有AI辅助诊断工作流程的基本组成部分,无论预期应用如何。实验室应定义清晰的本地程序,说明何时可接受AI输出、何时需要强制人工审查,以及如何处理AI建议与专业解释之间的差异。当AI生成低置信度输出、意外或临床不合理诊断、不一致的生物标志物结果,或玻片技术欠佳或包含可能超出算法预期范围的罕见肿瘤类型时,人工审查尤为重要。由经过适当培训和经验丰富的病理学家进行监督,积极评估AI输出而非被动接受,可减轻与自动化偏差相关的风险。由于AI性能可能随时间变化,质量保证应超越定期设备检查,包括持续监测与AI应用预期功能相关的预定性能指标。诊断AI系统应使用与病理学家解释的一致性、敏感性、特异性和临床显著差异等措施进行监测。相比之下,运营性AI系统可使用工作流程效率、周转时间和系统可靠性评估。技术指标(包括扫描仪性能和软件故障)以及治理措施(如手动覆盖频率、事件报告和审计结果)也应构成常规监测的一部分。对于生物标志物评估系统,实验室可额外监测生物标志物分布的纵向趋势,以检测可能指示分析漂移的意外变化。即使AI软件本身保持不变(经批准算法通常如此),性能也可能因本地患者人群、转诊模式、标本特征、实验室流程或成像平台的变化而演变。持续监测应评估AI性能在本地临床环境中是否仍可接受,并在识别到临床显著性能变化时触发进一步调查或再验证。人工监督和持续质量保证共同提供互补保障,维护患者安全、保持诊断可靠性,并确保AI系统在其运营生命周期内持续安全有效地运行。人工监督水平和质量保证策略均应针对AI系统的预期临床功能和相关风险定制。
**用户培训和能力**
成功实施不仅依赖于技术验证,还依赖于用户能力。适用于所有实验室人员(包括住院医师)的培训应超越AI软件操作,包括其预期用途、局限性、潜在故障模式以及需要强制人工审查的情况。应强调识别自动化偏差(即用户可能对AI输出过度信任,尽管存在冲突的形态学证据)和确认偏差(即当AI结果接近主观印象时倾向于回归AI结果)。能力评估应评估用户正确操作AI系统、批判性解释其输出、识别不当建议并在必要时覆盖不正确AI输出的能力。AI构成质量保证的新组成部分,需要将AI活动整合到本地实验室质量管理体系中,并具有特定的培训和资源影响。在重大软件更新、工作流程修改或AI系统预期临床用途改变后,应考虑定期进修培训。
**治理、事件管理和生命周期维护**
监管批准是实施的前提,但不能确保在每个实验室或临床环境中均达到最佳性能。本地治理应超越监管合规,涵盖AI在临床使用中的运营管理。每个部署的AI系统应有明确定义的临床和运营所有权,并由适当的文档、版本控制、审计跟踪、访问管理、网络安全、变更管理以及纠正和预防措施(CAPA)流程支持。维护部署AI系统的最新清单(包括软件版本、预期用途和实施状态)有助于治理、可追溯性和监管合规。AI相关事件应纳入现有实验室质量管理体系,并使用既定质量改进原则管理。事件可能源于技术故障、图像采集错误、算法错误分类、工作流程中断、治理失败(如版本不匹配)或模型性能随时间的恶化。调查应包括事件分类、临床影响评估、根本原因分析、纠正和预防措施的实施、有效性验证和持续监测。由于故障模式在AI应用间不同,事件调查和缓解应针对AI系统的预期临床功能定制。软件更新和本地数字病理环境变更应通过正式变更控制程序管理。次要软件补丁或安全更新可能仅需有限验证,而算法再训练、主要软件修订、扫描仪或染色机更换或其他重大技术变更应在临床重新部署前触发相称的重复验证或再验证。实施应遵守适用的国家和国际监管框架,包括IVDR、FDA、CE标志、UKCA、欧盟AI法案、ISO 15189和ISO 13485。然而,本地治理对于确保AI系统在整个运营生命周期内安全有效使用仍然至关重要。尽管超出本指南范围,AI辅助检测有丝分裂象、淋巴血管浸润和淋巴结转移等特征可能随时间改变疾病分类和预后阈值(分级或分期迁移)。在解释未来临床证据和更新诊断标准时应认识到这些潜在影响。为促进这些建议转化为临床实践,提供了实用实施和治理检查清单。
**讨论**
人工智能正从研究迅速过渡到诊断组织病理学,为病理实验室创造了超越监管批准和算法性能的新责任。现有监管和开发框架为AI设计、验证和批准提供了指导,但实验室实践中的实际实施仍相对不发达。本指南通过提供可整合到现有实验室质量管理体系并适应不同AI应用预期临床功能的建议来解决这一差距。AI的快速演进提出了超越当前监管框架所涵盖的重要实施挑战。许多商品化病理算法目前是“锁定”模型,因实质性软件修改需要监管审查而很少改变。然而,新兴监管方法(包括预定变更控制计划(PCCPs)和持续演进的AI/ML医疗器械),以及多模态基础模型和生成式AI的日益使用,可能将实施从管理相对静态的软件转变为监督能够受控演进的系统。因此,治理框架将需要不仅适应软件更新,还要适应模型行为、证据生成和预期临床应用的持续变化。另一个未解决的挑战是缺乏基于证据的实施标准。虽然监管批准确立了安全性和性能的最低要求,但几乎没有证据指导本地实施的关键方面,包括验证数据集大小、接受标准、再验证频率、质量指标和AI特定的外部质量评估。这些要求可能因预期临床用途、本地基础设施和医疗环境而异,支持基于风险的灵活而非规定性方法。缺乏国际协调的方法也限制了已发表实施研究的质量、可比性和普适性。因此,标准化的研究设计、性能报告、外部验证和实施指标方法对于产生稳健证据和支持AI在常规病理实践中安全、一致采用至关重要。成功实施还将依赖于组织就绪性。AI应嵌入现有实验室质量管理体系,而非作为独立软件引入。这要求对数字基础设施、互操作性、劳动力培训、治理、网络安全和多学科参与的投入。相关成本远超软件采购,需要可持续的报销模式才能使AI成为常规临床实践。对于生成临床可操作生物标志物的AI系统,早期与多学科团队接触对于确保在结果解释、报告阈值、反射检测路径和临床整合方面达成一致至关重要。本地验证、治理、人工监督和已识别局限性的透明沟通对于维持临床医生和患者对AI辅助诊断的信心也很重要。本指南存在若干局限性。它代表了作者的集体意见,依据当前证据、现有实施框架和实践经验,而非使用德尔菲法、RAND/UCLA、GRADE或系统评价方法制定的正式循证指南。其有意保持技术中立,以最大化在不同AI平台和监管环境中的适用性。随着AI技术、基础模型和监管框架持续演进,这些建议将需要定期修订。未来工作应超越专家共识,走向基于证据的实施科学。需要前瞻性多中心研究来建立标准化的本地验证策略、基于证据的接受标准、AI特定质量指标、外部质量评估计划、事件分类系统和协调的治理标准。还需要用于图像采集、算法开发、性能报告、外部验证和实施的国际方法学标准,以支持可重复评估和安全的AI临床部署。应特别关注自适应AI系统、多模态基础模型和生成式AI。实现这些目标需要病理组织、认可机构、监管机构、医疗服务提供者、AI开发者和行业之间的协作,以制定保持足够灵活性以适应未来技术进步的共识标准。总之,AI安全整合到诊断组织病理学不仅依赖于准确算法,还依赖于稳健的实验室实施、治理和持续质量保证。本指南通过为在临床实践中实施成熟AI系统的病理实验室提供实用建议,补充了现有AI开发和监管框架。其核心原则是实施应与预期临床功能、相关临床风险和所需人工监督水平相称,认识到不同AI应用需要不同实施路径。采用这些原则可能促进更一致的实验室实施,同时为未来国际循证实施指南和认可标准的发展提供实用基础。