《Pediatric Radiology》:Current challenges for global equity related to the implementation of artificial intelligence in pediatric imaging
编辑推荐:
人工智能(AI)正迅速改变医学影像,为提升诊断准确性、优化工作流程和个性化护理提供了前所未有的机遇。然而,AI在儿科放射学中的整合带来了独特挑战,若未得到慎重处理,可能加剧现有的全球健康不平等。这些挑战涉及数据不平等和模型开发中的偏差、基础设施差异、监管和伦理
人工智能(AI)正迅速改变医学影像,为提升诊断准确性、优化工作流程和个性化护理提供了前所未有的机遇。然而,AI在儿科放射学中的整合带来了独特挑战,若未得到慎重处理,可能加剧现有的全球健康不平等。这些挑战涉及数据不平等和模型开发中的偏差、基础设施差异、监管和伦理差距、劳动力能力和培训差距、语言和本地化障碍、成本和商业化,以及可持续性和长期支持问题。本文由世界儿科影像联合会(WFPI)的代表撰写,讨论了AI在儿科放射学中全球验证和实施的关键障碍及其应对方法。通过将这些领域与实际行动和责任联系起来,并概述一个按时间顺序排列的路线图,本文提供了一个以公平为中心、针对儿科的具体框架,以指导全球实施。
**引言**
人工智能(AI)正通过提供增强诊断准确性、减少临床医生工作量和改善患者预后的工具来改变医疗保健。特别是在放射学领域,AI创新和整合已成为研究和发展的主要课题。然而,大多数经过验证并获准临床使用的AI工具是为成人人群设计的,仅有少数明确针对儿童进行验证。这反映了更广泛的系统性不平等,包括有限的优质儿科影像数据、有限的资金、较小的市场规模,以及与儿科数据收集相关的更严格法律和伦理约束。此外,AI创新的益处并未在全球范围内公平分配。大多数儿科放射学AI研究和开发集中在高收入国家(HIC),而全球约90%的儿童和青少年人口居住在中低收入国家(LMIC)。尽管存在这种人口现实,仅有少数AI研究和工具是针对LMIC背景设计的,而基于HIC数据训练的AI工具可能由于疾病流行率、影像方案和患者人口统计学的差异而无法很好地推广到LMIC人群。此外,儿科放射学AI工具开发中的独特挑战包括与年龄相关的生理和解剖差异、与儿童体型和配合度相关的影像技术变化,以及辐射防护考量。在此背景下,区分平等与公平至关重要,因为这两个概念意味着根本不同的实施策略。平等指的是向每个医疗环境或人群提供相同的AI工具,但这假设所有医院、社区和/或患者群体从相同的基线条件出发,这在儿科放射学中很少成立。而公平侧重于开发和实施AI以实现不同人群间的可比结果,认识到不同环境面临不同障碍,因此需要量身定制的解决方案。换言之,平等标准化输入,公平标准化输出。这一区别至关重要,因为平等可能放大现有差距,而公平驱动的AI工具设计和部署可以改善所有儿童的诊断质量和可及性,无论其地理和社会经济环境如何。因此,为确保AI对全球儿科放射学和儿童健康做出有意义贡献,迫切需要国际合作以支持包容性数据共享、能力建设以及对LMIC特定AI研究和基础设施的投资。本文由世界儿科影像联合会(WFPI)的代表撰写,讨论了AI在儿科放射学中全球验证和实施的关键障碍及其应对方法。
**方法**
本文内容基于作者自身经验以及共同作者间的共识讨论,并辅以对科学文献、在线指南文件和相关全球卫生组织网站的针对性检索。本文明确不包括带有证据质量评估的系统性文献综述。为将系统层面的障碍与儿科影像中的公平相关结果联系起来,本文按以下七个领域构建:数据不平等和模型开发中的偏差、基础设施差异、监管和伦理差距、劳动力能力和培训差距、语言和本地化障碍、成本和商业化,以及可持续性和长期支持。这些领域用于描述AI全生命周期(从设计、开发到部署和维护)中的障碍和解决方案。提供了一张表格,概述了与儿科影像相关的主要AI模型家族、其典型应用及其与这些公平领域的关系。
**数据不平等和模型开发中的偏差**
儿科影像的AI模型绝大多数基于HIC数据构建,导致显著的地理数据不平等。2021年一项系统综述发现,儿童健康中82%的机器学习研究来自HIC,仅3%来自LMIC。此外,儿童在医学影像数据集中严重代表性不足:一项对181个公共影像数据集的分析发现,儿童在所有患者中占比不到1%。在许多情况下,由于研究经费有限、同意要求更严格和隐私担忧,儿科影像数据并未大规模收集、共享或标注,导致儿科数据集规模小、多样性差,且集中在北美或欧洲的三级医院。AI模型开发中的偏差也与年龄和正常发育有关。许多AI系统将儿科视为一个类别,尽管婴儿、儿童和青少年之间存在重大生理和解剖差异,这一问题被称为与年龄相关的算法偏差。正常变异,包括不同民族间的骨密度或生长板外观,若在训练数据中缺失,可能被误分类为病理。这些限制可能导致系统性错误和代表性不足群体中的更高误诊率,从而扩大现有差距。一个真实案例是,在婴儿中,成人训练的胸部X光模型对心脏肥大表现不佳,由于婴儿胸部解剖差异,错误率接近50%。儿科人群中特定年龄段的代表性不足,如新生儿和青少年,可能导致性能不均,凸显了所有年龄亚组数据平衡的必要性。疾病流行率的差异进一步放大了这一问题。儿科结核病和营养不良等疾病在LMIC中更常见,但主要基于HIC数据训练的模型在开发过程中接触此类病例有限,因此可能在实际应用中无法识别它们。**解决方案和推动因素**:除非开发者考虑这些地理、人口统计和年龄相关的多样性,否则AI将继续对最可能受益的人群表现不佳。因此,为确保公平性,强烈建议在部署前对儿科AI工具在不同地理和民族群体中进行严格的外部验证。鼓励开发者强制要求按儿科亚组(包括年龄、性别、民族和地理)报告性能指标,以更好地识别差异并指导再训练,如CONSORT-AI和儿科特定ACCERT-AI框架等报告指南所建议。除外部验证外,AI工具应在实施前针对目标儿科人群进行正式基准测试。本地基准测试能够评估现实条件下的判别力、校准度和亚组性能,并确定在临床使用前是否需要阈值调整、重新校准或再训练。这一步骤对于确保不同儿科人群的安全性、可靠性和公平性至关重要。在技术方面,研究人员正在探索联邦学习等解决方案以缓解数据差异。联邦学习允许多家医院在不汇集原始数据的情况下协作训练AI模型,从而在尊重隐私的同时受益于多样化的数据。一项关于儿童脑肿瘤的国际研究中,跨19个地点(多个大洲)的联邦方法几乎达到了集中训练的准确性,并显著改善了模型在外部网络数据上的泛化能力(提高了20–30%)。多个专业机构呼吁包容性儿科AI开发。例如,美国放射学会的儿科AI工作组强调需要针对儿科的AI解决方案,并启动了“Image IntelliGently”活动以促进儿童安全有效的AI使用。欧洲儿科放射学会(ESPR)的AI工作组和世界儿科影像联合会(WFPI)倡导增加跨境数据共享和合作。非洲-加拿大AI与数据创新联盟将HIC和非洲国家的机构联系起来,共同开发健康AI解决方案。此类合作有助于整理多样化的儿科影像数据库,包括西方中心数据集中缺失的疾病和人群。为支持这些努力,需要在报告数据集组成时提高透明度,包括年龄范围、地理起源和民族代表性,以及更清晰的供应商文档,说明参考标准、偏差和限制。
**基础设施差异**
AI驱动的儿科影像依赖于关键基础设施,如可靠电力、数字影像设备、影像归档与通信系统(PACS)、宽带连接和足够的计算资源。许多LMIC的设施仍使用不可靠的电力或根本没有电力,这限制了任何数字影像或AI工作流程。稀缺的放射学资源(包括现代设备和IT基础设施)直接阻碍了LMIC机构采用AI。在一些低收入环境中,甚至传统X光机仍然是模拟的,互联网带宽不足以传输大型影像文件,这实际上将大多数AI解决方案限制在资源充足的中心。同样,许多设施缺乏电子病历和PACS,意味着关键数据和影像无法轻松集成到AI工作流程中。事实上,LMIC儿科数据在AI训练中的代表性不足部分归因于碎片化的数字化和薄弱的IT基础设施,这加剧了AI工具性能中的偏差。**解决方案和推动因素**:缩小这一差距需要分阶段、基于情境的基础设施建设。电力弹性和基本电力调节可以使影像、服务器和网络持续运行。连接解决方案必须符合当地实际情况。混合在线和离线工作流程,结合本地缓存和存储转发,可以在带宽弱时促进AI的持续使用。便携式数字放射摄影结合离线AI用于结核病筛查,展示了在远程项目中设备分析后同步的可行性。在云访问不可靠时,使用压缩模型的边缘优先方法可减少计算需求、能源消耗和延迟,同时保持准确性。互操作性通过使用基于标准的技术栈降低成本和复杂性,包括用于访问医学影像(DICOM格式)的DICOMweb、用于临床数据整合的HL7 FHIR,以及开源轻量级工具如Orthanc和OHIF DICOM查看器。国家层面的数字健康架构和成熟度路线图有助于排序投资、聚合需求并维持规模。世界银行和世界卫生组织(WHO)全球数字健康倡议的最新指南为国家级实施提供了实用框架。运营准备度评估,如RAD-AID放射学准备度,可在部署前识别电力、劳动力、网络和维护方面的差距,并指导LMIC医院的分阶段推广。最后,持续监测,包括部署后跟踪正常运行时间、延迟和公平指标,如ACR Assess-AI倡议所体现的,支持治理和随着时间的推移进行纠正。
**监管和伦理差距**
AI融入儿科影像引发了多项伦理、法律和道德考量。儿童代表了一个易受伤害的患者群体,具有独特的挑战和关于自主权、安全、同意和公正的考量,需要特别关注。为支持公平合作,需要明确的数据伦理和主权治理,包括关于儿科影像数据如何去标识化、共享、访问和使用的商定标准。同时,需要防止对LMIC影像数据的剥削和数字殖民主义,用于开发和生产使HIC优先受益的昂贵AI工具。与此一致,RAD-AID开发了RAD-AID友谊数据信托,为LMIC的医疗机构提供机会,将匿名数据共享到非营利性集体数据信托。通过这种方式,RAD-AID旨在吸引愿意开发并免费提供AI软件的AI开发商。对于儿童,知情同意尤其复杂,因为未成年人无法提供法律同意,而父母同意可能并不总是充分反映关于数据使用、存储或二次研究应用的长期考量。因此,透明的伦理准则对于尊重隐私、相称性和儿童对其数据不断发展的权利原则至关重要。另一个障碍是云与本地部署。许多AI工具使用云架构进行处理,但关于云用于健康数据的限制性或不明确法规构成了LMIC采用AI的主要障碍。本地部署看似一种替代方案,但可能安全性较低,且需要持续更新和现场技术支持。因此,需要制定监管框架,定义何时允许云存储和处理,如何管理跨境数据流动,以及适用哪些最低安全性和审计要求。这些框架还应包括数据管理规则,规定影像数据如何存储、去标识化、访问、传输和处理,并由清晰的数据共享协议支持。减少法律不确定性对于避免延迟LMIC所需的投资很重要。AI的临床使用也引发了关于问责制和可解释性的关键问题。如果AI系统通过偏差、数据集偏移或技术故障导致诊断错误,放射科医生、供应商和机构之间的责任可能不明确。在儿科中,延迟或漏诊的后果可能是终身的,可接受错误的阈值特别低。因此,伦理实施需要明确的责任线,包括用于验证、漂移监测的治理系统,以及要求算法设计和预期用途透明度的监管机制。临床医生必须能够理解和评估AI输出,并行使批判性判断,而不是在没有监督的情况下依赖自动输出。AI的引入也可能改变医患关系。信任在儿科护理中至关重要,家长和监护人依赖(儿科)放射科医生来解释复杂发现并倡导儿童的最佳利益。如果家庭认为关键决策被委托给算法,护理的关系基础可能被削弱。伦理实践要求AI用于增强而非替代护理中的人文维度,如同理心、情境判断和对儿童福利的倡导。**解决方案和推动因素**:伦理和公平实施的实用推动因素包括:明确的数据伦理和主权治理、保护儿童权利的同意流程、以及不同司法管辖区中云和本地部署的监管清晰度。其他优先事项包括:临床医生、机构和供应商之间的明确责任划分、对透明度和可解释性的强制性期望、以及常规的漂移和安全事件监测。将这些要求嵌入采购、培训和国际合作中,可以支持在不同环境中AI在儿科影像中的伦理使用。
**劳动力能力和培训差距**
AI在儿科放射学中的部署受到劳动力能力和培训方面的关键差距制约。图1提供了一个实施规划的实用清单,将培训和工作流程的本地化与安全、可及性、信任和儿科特定适应联系起来。成功实施需要儿科放射科医生以及数据科学家、IT专家和技术人员的支持,这些人员在LMIC通常有限。全球儿科放射科医生短缺已有充分记录,特别是在LMIC,专家意见的可及性有限且通常集中在三级中心。AI的实施对已经有限的劳动力提出了额外需求,包括数据集整理、偏差评估、性能监测和部署后算法评估等任务,且缺乏相关支持和培训。然而,只有少数部门任命了具有保护时间的临床AI负责人来指导采购、治理和临床整合。缺乏内部数据工程师和信息学支持使得许多机构依赖外部供应商提供端到端解决方案,这可能限制本地自主性、降低透明度、造成依赖并增加成本。较小的中心,尤其是LMIC中的中心,通常缺乏资源和人员来批判性评估供应商的声明或谈判针对儿科人群且经过验证的工具。除非这些结构性差距得到解决,AI的采用可能会扩大而非缩小全球在安全影像服务可及性方面的差距。当前的放射学培训课程,包括儿科亚专业,几乎不提供AI的结构化教育。大多数项目缺乏正式模块,通常仍侧重于AI的广泛概念,而非实际能力,如数据集标注、验证方法或临床实践中算法输出的监督。此外,关于儿科特定挑战的结构化教学有限,包括小型、异质性数据集、罕见疾病以及生长发育中的安全性影响。关键的是,这一培训差距超出了放射科医生。放射技师、物理学家和专职医疗人员在扫描采集、方案优化和质量控制中具有关键作用,但很少被纳入AI教育。同样,跨专业培训或与计算机科学家和工程师的跨学科合作机会很少,尽管这些对安全实施至关重要。缺乏这些技能,医疗专业人员将无法充分准备监督AI算法、批判性评估其输出,或在AI生成结果与临床证据冲突时有效应对。**解决方案和推动因素**:没有对劳动力发展和结构化培训的投资,AI可能无意中加深全球医疗保健中的差距。拥有专门AI领导力和技术支持HIC的机构能够迅速进步,而LMIC的中心可能难以安全有效地整合工具。因此,受保护的临床AI领导角色,结合对包括(儿科)放射科医生、放射技师、物理学家和IT专家的多学科培训的投资,对于确保AI在儿科影像中以安全、公平、可持续和全球相关的方式发展至关重要。这包括将AI能力嵌入儿科放射学课程,开发可访问的在线和模块化培训平台,以及建立国际合作以加强所有区域的能力。
**语言和本地化障碍**
语言仍然是决定儿科影像AI是否可用和安全的主要因素。大多数工具是用英语设计和文档化的,但仅非洲就有大约1500到3000种语言。在常规护理中,临床医生和家庭通常用当地语言交流,即使他们接受的是英语医学培训,这造成了有记录的沟通失误风险,并且当服务不以偏好语言提供时,会降低护理质量。在儿科环境中,三方沟通(照护者-儿童-临床医生)放大了这些风险,特别是在关于镇静、造影剂使用和辐射暴露的安全关键决策中。图2帮助映射影像路径中可能发生语言相关故障的环节,以便站点在最危险的步骤中实施缓解策略。多语言自然语言处理模型和数据集未能充分代表许多非洲和南亚语言,在健康背景下存在持续的准确性差距。语音系统还显示出口音和方言偏差,可能会降低放射学工作流程中使用的听写或语音驱动接口的性能。本地化不仅仅是语言。文化因素,如家长决策规范、对权威的尊重、性别角色以及对辐射风险的社区看法,塑造了家庭如何解释影像建议和AI解释。因此,文化中立或英语中心化的输出容易在LMIC儿科环境中破坏信任和知情同意。图3提供了一个在实践中应用本地化的简单框架,区分表面适应(如翻译和术语)与深层文化适应(影响信任、同意和决策)。**解决方案和推动因素**:最近的举措展示了进展和剩余差距。印度的Bhashini项目正在构建一个国家基础设施,用于印度主要语言的语音识别和翻译,使下游健康应用能够超越英语运行。在东非,一个斯瓦希里语大型语言模型已发布,用于支持母婴健康信息传递,并可能适用于放射学相关任务,如患者教育和同意。在放射学领域,早期研究表明,大型语言模型可以跨多种语言翻译和简化报告,但低收入语言和领域特定术语的性能变化需要在临床使用前进行谨慎验证。一个实用的前进路径包括为临床医生和患者模块提供多语言用户界面和输出,从广泛使用的区域语言开始。采购应要求本地语言用户界面(UI)、使用说明和培训材料。开发者应与当地专家共同设计儿科放射学词汇表,以保留细微差别并确保报告模板的一致性。国家语言项目(如Bhashini)和区域自然语言处理(NLP)社区可以提供语料库和基准,用于持续模型改进。系统应支持对重音和代码切换容忍的稳健语音和文本输入,并在安全关键步骤中配备人工监督。实施者应遵循WHO关于文化和语言适应的数字健康指南,包括适应工具包、与一线工作人员的用户测试以及部署后语言相关错误的监测。一个实用策略是与当地临床医生和照护者共同设计儿科影像AI,并使用WHO SMART数字适应工具包来本地化内容和工作流程,辅以RAD-AID放射学准备度等文化能力评估。部署应以分阶段试点进行,并根据用户反馈进行迭代改进。
**成本和商业化**
许多AI工具由商业供应商开发且价格昂贵。高昂的许可和维护成本可能阻碍LMIC地区的采用。因此,较富裕的医疗保健系统可能从这些工具中不成比例地受益,而服务不足地区则可能进一步落后。在LMIC环境中,限制因素不仅限于价格,还包括基础设施限制、劳动力和系统不稳定,这可能使生命周期成本和持续支持更加难以承受。除许可外,采用AI需要AI生命周期每个步骤的成本,包括部署前评估、硬件和集成、治理人员以及部署后安全监测。据研究人员所知,目前尚未公布对这些步骤成本的全面分析。然而,一份关于部署包含四个工具的AI平台的报告估计,5年成本为170万美元(每个工具42.5万美元),包括劳动力、内部客户成本和年度服务成本。值得注意的是,该报告基于额外程序报告了医疗系统的正投资回报。对于儿科患者,考虑到儿童影像总体量较低,投资回报可能为负。一项重要的非货币成本是AI的环境影响。具体而言,为AI提供动力(无论是在开发阶段还是在临床使用中部署)都消耗大量的计算和能源资源,预计会产生负面的可持续性影响。**解决方案和推动因素**:虽然单个商业化工具的资金支出可以相当直接地量化,但短期总成本更难准确计算,但必须预计会很大。对于机构,一个实用框架是将成本分为(a)固定的一次性前期成本(如接口、安全审查、合同和伦理审查、硬件/云连接器等),(b)经常性固定或可变成本(如年度许可或按次检查定价等),以及(c)维护成本(如硬件/云连接器更新、IT故障排除、安全监测等)。总拥有成本和可持续支持模式的更大透明度对于公平的儿科部署很重要。
**可持续性和长期支持**
AI的长期可持续性在LMIC中仍然是一个紧迫挑战。AI系统需要持续的软件更新、技术维护以及对不断变化的工作流程的适应,这些要求可能超出本地能力和开源可及性下的可用基础设施和专业知识。许多LMIC环境在初始部署后难以维持这些工具,原因是资金不可靠和内部技术专长有限。在许多情况下,供应商没有本地存在,限制了及时的支持和更新。在儿科放射学中,这一挑战因较小的市场规模和较弱的儿童特定AI解决方案的财务激励而加剧,导致与成人影像相比可用的产品少得多。因此,许多部署仍局限于短期试点,即使有效的AI工具也可能在没有计划更新、经常性资金和本地故障排除能力的情况下变得过时。**解决方案和推动因素**:可持续性取决于将AI嵌入现有卫生系统,并建设本地能力以维护和适应这些工具。关键推动因素包括:在(儿科)放射科医生和技术人员手中定义明确的本地责任、根据临床需求调整部署、以及利用开源或负担得起的许可模式。建设本地技术劳动力,包括培训国内IT专家和放射科医生进行AI软件管理,使站点能够独立维护和适应AI系统。这包括持续的性能监测,因为这对于维持临床相关性和避免算法漂移同样重要。这些方法在ACR的儿科AI和ESPR AI工作组指令以及更新的医学影像人工智能清单(CLAIM)中得到了强调。将部署锚定在全球专业网络内也可以通过共享实践和持续指导支持可持续性。通过在专业网络中共享项目,LMIC可以减少孤立感,分享最佳实践,并获取持续的指导和倡导,最终支持AI影像解决方案的长期可行性。最后,确保长期融资模式(如公私合作伙伴关系或纳入政府预算)对于AI工具超越试点阶段至关重要。
**公平实施路线图**
表2总结了上述领域特定的行动和责任。本路线图部分按时间顺序优先考虑少量高影响步骤,并区分LMIC内可行的行动与HIC可以采取的促进公平进步的行动。**近期**,优先事项是安全和现实的采用。在LMIC中,这意味着选择少量本地相关的用例,这些用例可以在有限连接下运行,建立基本本地治理用于预期用途和事件审查,并确保临床医生和照护者沟通的本地语言界面和培训材料。在HIC中,最重要的推动行动是标准化要求分层性能报告和外部验证的儿科特定采购和出版标准,以及支持提供技术援助和共享标注标准的公平伙伴关系。**中期**,优先事项是能力建设和可扩展的验证。在LMIC中,这意味着分阶段升级数字化和互操作性,建立多学科团队并配备受保护的临床领导力用于AI监督,以及参与尊重数据主权的研究中心验证或联邦学习网络。在HIC中,这意味着持续投资于跨年龄组和区域的代表性儿科数据集,协调儿科声明和监测的期望,以及改善可负担性和减少供应商依赖的成本模型。**长期**,优先事项是可持续性和持续安全。在LMIC中,这意味着本地维护能力、服务协议以及常规漂移和亚组性能监测,并配备清晰的更新路径。在HIC中,这意味着共享治理框架、长期融资机制以及包括公平终点和现实部署约束的全球基准测试。可追踪指标包括:按儿科亚组的分层性能报告、跨区域的外部验证、基础设施准备度及正常运行时间加延迟目标、完成角色适当培训及存在本地临床AI负责人、部署后漂移监测并记录更新或回退程序、语言和本地化错误报告、以及记录的总拥有成本及超出试点资金的可持续性计划。
**结论**
过去几十年,AI在医学影像中的创新和部署急剧增加,但其益处并未在全球范围内公平分布。实现儿科AI的全球公平需要在七个领域采取协调行动,即数据不平等和偏差、基础设施差异、监管和伦理治理、劳动力和培训能力、语言和本地化障碍、成本和商业化以及可持续性和长期支持。关键优先事项包括开发多样化的儿科数据集并以分层方式报告性能,在不同区域进行外部验证。还包括确保适合情境的基础设施和治理,投资于多学科培训,并规划可负担的长期维护和监测。通过综合这些行动和责任并概述按时间顺序的优先事项,本文提供了一个实用的、以公平为中心的框架,以支持儿科影像AI的安全全球实施。