人工智能辅助复苏中缺失的性别视角

《Scandinavian Journal of Trauma, Resuscitation and Emergency Medicine》:The missing sex and gender lens in artificial-intelligence-enabled resuscitation

【字体: 大 中 小 】 时间:2026年09月23日 来源:Scandinavian Journal of Trauma, Resuscitation and Emergency Medicine 3

编辑推荐:

  背景:Kumar等人近期在贵刊综述了人工智能(AI)在复苏救治四个领域的应用:调度员辅助识别院外心脏骤停(OHCA)、预测性心电图(ECG)算法、AI优化除颤以及结局预后判断,并将这些进展置于印度医疗基础设施的约束背景之下[1]。该综述未涉及复苏中的性别差异,

  
背景:Kumar等人近期在贵刊综述了人工智能(AI)在复苏救治四个领域的应用:调度员辅助识别院外心脏骤停(OHCA)、预测性心电图(ECG)算法、AI优化除颤以及结局预后判断,并将这些进展置于印度医疗基础设施的约束背景之下[1]。该综述未涉及复苏中的性别差异,尽管大量证据表明,经历OHCA的女性相较于男性,更不易被识别为心脏骤停、更不易接受旁观者心肺复苏(CPR),且存活率更低。研究人员认为,基于历史调度、旁观者及临床数据训练的AI系统,若未明确处理这一差异,则存在学习并再现该差异的风险,并据此提出具体建议。正文:这一差异已有充分文献记载。女性在公共场所接受旁观者CPR的可能性显著低于男性[2],一项2024年纳入全球58项研究的范围综述发现,59%的研究报告女性接受旁观者CPR的可能性更低,仅5%的研究发现相反结果[3]。定性研究识别出公众对这一迟疑背后的三种反复出现的认知:女性身体的性化、被认为身体脆弱,以及不相信女性真的发生心脏骤停[4]。值得注意的是,Kumar等人引用以说明AI前景的试验——哥本哈根机器学习辅助调度员识别OHCA——未报告识别准确率是否因性别而异[1, 5]。一旦通过统计调整来考察生存率,情况便更加清晰:一项纳入28项研究的系统综述发现,女性未调整的生存几率显著较低(OR 0.68),但在调整了目击状态和初始心律后,这一差异基本消失(调整后OR 1.01)[6]。这表明性别劣势集中在复苏路径的前端——识别与旁观者响应——而这正是AI调度和指导工具旨在改进的阶段。基于这段历史训练的AI系统有继承这一差异的风险。机器学习危害的一个既定分类框架将历史性、代表性、测量性、聚合性和评估性偏见区分为不公平训练数据产生不公平模型的五种不同途径[7],而每一种在复苏AI中都有直接对应物。Kumar等人引用的ECG预测模型据称实现了超过0.91的AUROC[1, 8],该模型家族在其他场景中已发现经性别审计后存在显著差异:一项针对心脏机器学习算法的系统综述发现,女性在训练数据中代表性不足,且在16个重复实验中有13个显示女性患者的假阴性率显著更高[9]。这不应被过度概括;另一项大规模评估发现,ECG分类器在其他结局方面对性别不均衡数据相对稳健[10],这本身就说明应进行常规的按性别分层验证,而非假定存在偏见或假定中性。一个可类比的方法论教训来自心脏病学之外:一种广泛使用的人群健康算法被发现系统性低估黑人的转诊需求,因为它使用医疗费用而非疾病负担作为健康需求的代理指标[11]——这提醒我们,表面上中立的优化目标可能悄无声息地编码人口统计学偏见。这一风险与更广泛的证据一致:临床医生表现出可测量的内隐性别偏见[12],商业语音助手通常被设计为顺从的、女性化的人物形象[13],大型语言模型在判断微妙性别相关偏见时可能偏离具有生活经验的人类评分者[14]。AI系统实际上是先前人类判断的统计汇总,除非被有意纠正,否则将再现该判断中的偏见。这并非不可避免:一个2025年专门为捕捉性别相关心血管风险连续谱而开发的AI增强ECG模型,识别出了传统、性别无关解读本会遗漏的女性高风险状况,证明有意的性别敏感设计可以缩小而非扩大现有差异[15]。就Kumar等人强调的印度背景而言,其旁观者CPR率仍低于2%[1],鉴于已记录的文化上对触摸和羞怯的顾虑,弥合这一差距默认不会是性别中立的;因此,在印度人群中对AI模型进行外部验证时,应明确纳入按性别分层的性能指标。研究人员建议:(1)在临床部署之前,复苏AI的每个阶段——从调度识别到预后判断——都应报告按性别分层的性能指标;(2)应对训练数据和模型管线针对上述特定偏见路径进行审计,而非仅检查总体准确率;(3)AI引导的旁观者指导工具应被设计为主动对抗记录在案的性别相关迟疑,而非对此保持沉默;(4)Kumar等人提出的印度多中心验证研究应将按性别分层的亚组分析作为强制条件,而非可选结果。结论:AI为复苏救治带来了真正的希望,Kumar等人强调其对印度庞大的心源性猝死负担的相关性是正確的。然而,旁观者CPR施救中的性别差距恰好位于调度和指导型AI旨在改进的复苏路径阶段,而机器学习系统继承历史偏见的机制已被充分描述并在密切相关的心脏应用中得到了实证证明。如果在开发和验证的每个阶段缺乏明确的、按性别分层的评估,AI赋能的复苏系统将面临自动化一种复苏科学已花费十余年试图纠正的不公平的风险。
论文解读

一、研究背景与问题

心源性猝死是印度乃至全球的重大公共卫生负担,及时的心肺复苏(cardiopulmonary resuscitation,CPR)和早期除颤是改善院外心脏骤停(out-of-hospital cardiac arrest,OHCA)生存率的关键环节。近年来,人工智能(artificial intelligence,AI)在复苏救治领域展现出广阔前景,Kumar等人曾在《复苏》期刊上系统综述了AI在四个复苏领域的应用:调度员辅助OHCA识别、预测性心电图(electrocardiogram,ECG)算法、AI优化除颤以及结局预后判断,并将这些进展置于印度医疗基础设施的现实约束下予以讨论。

然而,该综述未涉及复苏救治中的性别差异问题,尽管现有文献已充分证明这一差异的严重性。大量研究表明,经历OHCA的女性相较于男性,更不容易被旁观者识别为心脏骤停,更不可能接受旁观者CPR,最终生存率也更低。2024年一项纳入全球58项研究的范围综述显示,59%的研究报告女性接受旁观者CPR的可能性更低,仅5%的研究发现相反结果。定性研究识别出公众对女性施救迟疑背后的三种反复出现的认知障碍:女性身体的性化、被认为身体脆弱、以及旁观者不相信女性真的发生心脏骤停。更重要的是,性别差异对生存结局的影响具有明显的阶段性特征:一项纳入28项研究的系统综述发现,女性未调整的生存几率显著低于男性(比值比0.68),但在调整了目击状态和初始心律后,这一差异几乎完全消失(调整后比值比1.01)。这表明性别劣势并非贯穿整个复苏链条,而是集中于复苏路径的前端——即识别和旁观者响应阶段,而这恰恰是AI调度和指导工具旨在改进的核心环节。因此,有必要审视:如果AI系统基于这些带有性别偏差的历史数据进行训练,是否会学习并在更大尺度上复制这种不公平?

二、研究人员开展的研究与核心结论

针对上述问题,研究人员在分析现有证据基础上提出核心论点:基于历史调度、旁观者反应和临床数据训练的AI系统,除非在开发和验证的全过程中明确处理性别差异,否则存在系统性地学习并再现既有性别差异的现实风险。研究人员认为,这种风险并非假设性担忧,而是具有清晰的作用机制和来自密切相关领域的实证支持,必须采取具体的缓解措施予以应对。研究人员的结论是:如果不进行明确的、按性别分层的评估,AI赋能的复苏系统可能自动化复苏科学十多年来试图纠正的不公平,而这种结果并非不可避免。

三、主要技术方法概述

本文为观点性文章,未开展原始实验研究。研究人员采用的主要方法为基于现有证据的整合分析框架:一是引入了机器学习危害分类学,将历史性偏见、代表性偏见、测量性偏见、聚合性偏见和评估性偏见作为审视复苏AI性别公平性的分析工具;二是系统检索并整合了关于OHCA性别差异的观察性研究、系统综述和范围综述的定量证据;三是从心脏AI模型性别审计研究(发现16项重复实验中13项显示女性假阴性率显著更高)、人群健康算法偏见案例(使用医疗费用而非疾病负担作为需求代理指标导致系统性漏检黑人患者)、临床内隐偏见研究以及大语言模型性别判断偏差研究等多个来源收集了方法学教训。

四、研究结果

**1. 性别差异在复苏路径前端高度集中**

研究人员通过整合分析指出,性别对OHCA生存率的影响并非均匀分布。28项研究的系统综述显示,女性较低的未调整生存几率在调整目击状态和初始心律后几乎全部消失,证明性别劣势产生的机制位于“识别—响应”这一前端环节,且具有可干预性。定性研究进一步确认了公众对女性施救时特有的三重心理障碍:性化认知、脆弱性刻板印象和对女性心脏骤停真实性的怀疑。

**2. AI训练数据存在性别代表性不足的实证风险**

针对Kumar等人引用的高性能ECG预测模型(AUROC超过0.91),研究人员指出该模型家族在其他心血管应用场景中已被发现存在明显的性别差异:心脏机器学习算法系统综述显示,女性在训练数据中代表性不足,且13/16的重复实验中女性假阴性率显著更高。但研究人员同时指出不应过度泛化——另有一项大规模评估发现ECG分类器对性别不均衡数据可能相对稳健,这恰好说明不能凭假设断言存在偏见或不存在偏见,而应通过常规化的按性别分层验证来客观检验。

**3. 表面中立的优化目标可沉默编码人口统计学偏见**

研究人员引用人群健康算法案例表明:一个被广泛使用、面部看似中立的算法因以医疗费用为需求代理指标而系统性降低对黑人的转诊,该案例证明AI系统可以非预期的方式沿历史数据中的结构性歧视路径运行,复苏AI同样面临此类风险。临床内隐偏见、女性化语音助手设计以及大语言模型对性别偏见判断的不一致等证据共同提示:AI本质上是先前人类判断的统计汇总,若不加校正,其偏见会被复制和放大。

**4. 性别敏感设计可缩小而非扩大差距**

研究人员强调了正面案例:2025年开发的一种专门用于捕捉性别相关心血管风险连续谱的AI增强ECG模型,识别出了传统性别无关解读所遗漏的女性高风险状况。这表明有意的性别敏感设计不仅能避免复制偏见,更可能主动缩小既有医疗不公平,为复苏AI的开发路径提供了可行性示范。

**5. 印度背景下的特殊紧迫性**

针对Kumar等人关注的印度场景,研究人员指出印度旁观者CPR率仍低于2%,且存在围绕身体触摸和羞怯的已记录文化障碍。在此背景下,男性与女性接受旁观者救助的概率差异可能被放大,跨印度人群的AI模型外部验证必须将按性别分层的性能指标作为强制性要求。

五、讨论与结论

在讨论部分,研究人员形成了四项具体建议:(1)在从调度识别到预后判断的每一个复苏AI开发阶段,临床部署之前必须报告按性别分层的性能指标;(2)训练数据和模型管线应针对历史性、代表性、测量性、聚合性、评估性五类偏见路径进行专项审计,而非仅追求汇总准确率;(3)AI指导的旁观者施救工具应主动设计为对抗记录在案的性别相关迟疑,例如调整语言和提示来克服对女性身体接触的顾虑,而非对此保持沉默;(4)Kumar等人提议的印度多中心验证研究应将按性别分层的亚组分析设定为验证的强制条件,而非可选结果。

在结论部分,研究人员指出此项研究揭示的核心信息是:AI在复苏救治领域确实具有真实的前景,Kumar等人对AI在印度心源性猝死负担中的相关性的强调是正确的。然而,旁观者CPR施救中的性别差距恰好位于调度和指导型AI旨在改善的关键路径环节,机器学习系统继承历史偏见的机制已在心脏领域的紧密相关应用中被充分描述和实证验证。因此,在开发和验证的每个阶段,如果没有明确且强制性的按性别分层评估,AI赋能的复苏系统就有自动化一种复苏科学已花费十余年时间试图纠正的不公平风险。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号