《Public Health in Practice》:What works to address inequalities in primary care: Development of Living Evidence Maps using machine learning
编辑推荐:
目标:许多高收入国家的初级保健中健康不平等现象持续存在,处于劣势的人群尽管需求更大却往往获得较少的照护。传统的证据合成(evidence synthesis)方法难以跟上研究量的增长步伐,无法帮助政策制定者和从业者及时采取循证行动。研究人员的目的是利用机器学习
目标:许多高收入国家的初级保健中健康不平等现象持续存在,处于劣势的人群尽管需求更大却往往获得较少的照护。传统的证据合成(evidence synthesis)方法难以跟上研究量的增长步伐,无法帮助政策制定者和从业者及时采取循证行动。研究人员的目的是利用机器学习(machine learning, ML)增强证据识别、筛选和图谱绘制的效率,开发一套解决初级保健中不平等问题的干预措施动态证据图谱(Living Evidence Map)。研究设计:证据合成(evidence synthesis)。方法:研究人员使用EPPI-Reviewer软件开发机器学习分类器以识别相关研究,辅以引文检索并按预测相关性排序进行人工筛选(priority screening)。纳入研究按干预类型、劣势群体、健康或照护结局进行编码,随后使用EPPI-Visualiser进行可视化。结果:共筛选31,871篇文章,最终纳入577项原始研究(primary studies)、481篇系统评价(systematic reviews)和6篇伞形评价(umbrella reviews)。大多数研究聚焦于少数族裔群体,常见干预包括教育、建议与咨询以及文化适配照护(culturally tailored care)。针对性别与性少数群体以及结构性干预(如资金、人力)的研究匮乏。结论:动态证据图谱(Living Evidence Map)提供了一个动态的、与政策相关的工具,用于导航初级保健健康不平等的证据库。它通过让研究人员和决策者更容易看到现有证据、集中分布及缺口来提供服务。然而,需要进一步改进以纳入灰色文献证据及解决交叉性劣势(intersectional disadvantage)的干预措施,以支持终端用户的决策。
研究背景与问题
在全球范围内,医疗保健系统在提供公平和平等的初级保健(primary care)准入方面面临挑战。以英国为例,社会经济劣势地区的居民对所获初级保健满意度更低,这些地区的诊所医生更少、资金不足且更可能被评估为不达标,却需在患者更年轻时就处理更复杂的长期健康问题,这构成了“逆向照护法则(Inverse Care Law)”。近期关于健康不平等干预的现实主义评价(realist review)指出,要实现公平,初级保健需具备联结性、交叉性(intersectional)、灵活性、包容性和以社区为中心。然而,针对特定干预措施、环境和人群群体在初级保健中解决不平等问题的证据基础仍需构建以促成改变。随着发表论文的快速增长(过去20年仅初级保健出版物增长380%,全球学术产出年均增长4%),传统系统评价(systematic review)方法耗时费力(平均从设计到发表需16个月)且易过时,难以管理海量证据。机器学习(machine learning, ML)模型可通过识别模式进行预测,已被用于提升证据合成工作流效率,涵盖从识别证据缺口到研究选择、数据提取与合并的多个方面。证据图谱(Evidence maps)及相关合成日益用于组织和可视化大量研究证据以支持政策实践,人工智能(Artificial Intelligence, AI)工具在检索、筛选和图谱过程中的应用也在增长,但鲜有研究系统结合这些方法服务于健康与照护不平等领域的政策制定者与从业者,目前尚无描述如何通过初级保健解决不平等的动态证据图谱(Living Evidence Map)。本研究面向政策制定者、从业者、委托方及研究人员,旨在利用机器学习更有效审查证据,双重目标是扩展初级保健减少健康不平等的有效措施证据基础,并以结构化可及方式利用机器学习工具支持循证行动。该论文发表于《Public Health in Practice》。
主要关键技术方法
研究人员采用证据合成(evidence synthesis)方法开发动态证据图谱(Living Evidence Map)。使用EPPI-Reviewer软件及其集成机器学习工具,数据源来自OpenAlex数据库(含超2.5亿条记录的开放获取书目数据库)。开发二元机器学习分类器(binary machine learning classifier),基于1,006条手动纳入及22,426条排除记录训练,将数据分层分配至训练集、校准集和评估集。利用引文检索(citation searching)和自动化更新检索识别记录,采用“contreview”模型结合引文链接与文章文本排序。人工按预测相关性顺序筛选(priority screening),采用主动机器学习(active machine learning)重排记录。纳入文章由单名评审员按约定框架编码干预类型、劣势人群组、健康照护结局,使用EPPI-Visualiser创建交互式图谱,并对10%样本进行审计以确保准确性,辅以手动PubMed检索查漏。
研究结果
3.1. Overview of the Living Evidence Map(动态证据图谱概述)
研究人员筛选了31,871篇标题摘要,共纳入577项原始研究(primary studies, PS)、481篇系统评价(systematic reviews, SR)和6篇伞形评价(umbrella reviews, UR),另有154篇标记为次要贡献。多数研究聚焦一至两个结局、一至两个群体及二至三个干预措施。少数民族群体(尤其是拉丁裔/西班牙裔、非洲及加勒比黑人、亚裔)是研究最多的劣势群体,反映美国研究占主导;性别与性少数群体研究最少。结构性干预(如资金分配、人力分布)远少于个体层面干预(如教育、咨询、链接工作者(link workers))。不同劣势群体研究疾病各异,少数民族多关注糖尿病,纳入健康群体(inclusion health groups)多关注癌症。
3.2. Systematic and umbrella reviews(系统评价与伞形评价)
研究显示,干预措施中评论数量最多的前五类为:少数民族教育干预(127 SR, 2 UR)、少数民族文化能力干预(124 SR, 2 UR)、少数民族建议与咨询干预(121 SR, 2 UR)、少数民族社区与链接工作者干预(100 SR, 0 UR)、社会经济劣势群体建议与咨询干预(66 SR, 2 UR)。结局方面,最多为少数民族健康状况结局(170 SR, 1 UR),其次为少数民族可及性干预(117 SR, 4 UR)。
3.3. Primary studies(原始研究)
原始研究中干预数量前五为:少数民族教育干预(95)、少数民族社区与链接工作者干预(83)、少数民族建议与咨询干预(82)、少数民族文化能力干预(69)、按性别划分的特定群体建议与咨询干预(46)。结局方面最多为少数民族健康状况结局(210),其次为较低社会经济地位群体健康状况结局(127)。
3.4. Evaluation of the binary machine learning classifier(二元机器学习分类器评估)
在评估集(n=4,684)中,分类器性能表现为召回率(Recall)0.965、精确率(Precision)0.105、工作量减少(Workload reduction)60.7%。分类器保留了1842条记录,丢弃2844条,其中仅漏掉7条应纳入记录,证明其在高召回下显著减少了人工筛选负担。
讨论与结论翻译
4.1. Statement of principal finding(主要发现陈述)
利用动态证据图谱(Living Evidence Map)方法,研究人员确定了高收入国家初级保健中解决不平等干预研究分布的关键模式。描述少数族裔群体离散干预的研究数量较多——特别是涉及教育、文化适配和链接工作者的干预——而性别与性少数群体以及资金与人力等结构层面因素在证据库中仍代表不足。此外,研究人员展示了一种具有高召回率和实质性工作量减少的证据合成工作流。
4.2. Meaning of the results(结果意义)
动态证据图谱识别出大量支持少数族裔群体的干预研究并不意外,这些群体易通过电子健康记录识别且有特定需求(如文化与语言适配)。但许多研究源于美国且聚焦特定少数族裔,不能解释为证据基础全面或可转移至英国等其他国家。性别与性少数群体证据缺乏反映其在研究中的隐形及数据缺失(性别表达与性取向非常规编码)。结构性因素(资金、人力)干预研究缺乏虽不意外但令人担忧,上游结构性改变被公认必要,但研究倾向下游离散干预,因其易于在试验等设计中短期评估,而资金改革等政策改变复杂需长期数据;且资助方更倾向支持下游干预以展示对患者直接益处。动态证据图谱可作为有价值工具供研究人员和政策制定者探索、可视化及跟进初级保健健康不平等研究现状,也可突显文献缺口以指导未来优先级。
4.3. Comparison with existing literature(与现有文献比较)
Zhao等人开发的公共健康研究文献动态数据库也发现性别、居住地、种族/民族、社会经济地位是最常报告类别,差异源于其纳入观察性、定性及政策研究且将居住地易于测量,以及本研究将“性别与性(gender and sexuality)”与“生理性别(sex)”分开编码。本研究关于结构性干预缺乏的发现得到Clark等人2022年种族不平等结构性干预评价及McAllister等人心理健康不平等结构性改变研究的支持。此外,本研究发现系统评价数量与原始研究相近,反映了Hoffmann等人指出的系统评价数量激增趋势(PubMed上20年增长超20倍,2019年约每天80篇),可能因系统评价无需收集数据或伦理批准更易生产,也因其作为高质量证据受认可。
4.4. Implications for policy and practice(对政策与实践的意义)
机器学习工具是简化系统评价流程的关键创新,使跟进庞大文献成为可能。动态证据图谱(Living Evidence Map)允许决策者高效探索文献,但需维护且资金来源不明。研究突显缺乏针对特定服务不足社区(性别与性少数、宗教少数、残障人士、吉普赛、罗姆与游民社区)及多重劣势人群的初级保健干预研究,需更多基于社区的参与式研究。资助方应支持结构性干预并认可其复杂性与间接影响但规模与持久性可能更大。动态证据图谱在导航复杂证据景观上迈出重要一步,但决策者仍需解读大量研究,AI辅助摘要或人机混合方法可能是填补证据至决策鸿沟的方案。
4.5. Strengths and limitations(优势与局限)
优势在于使用动态证据图谱框架系统组织可视化庞大演进文献,集成机器学习减少人工负担,图谱公开可用(
https://www.heec.co.uk/component-library/evidence-maps/ )。局限在于目前未捕捉交叉性(intersectionality)或多重劣势(因缺乏相关研究),未纳入灰色文献(基于OpenAlex主要为同行评审学术文献,可能有发表偏倚),未纳入非英文及中低收入国家(LMICs)研究限制外推性,机器学习可能漏掉标题摘要未提特定劣势群体的相关研究,图谱仅反映研究数量而非证据深度。研究采用狭义初级保健概念(聚焦英国国家医疗服务体系(National Health Service, NHS)全科服务),方法虽技术但图谱意在服务政策制定者与从业者,故以可及方式呈现兼顾方法与透明可重复,采用NHS全科服务概念化。
4.6. Conclusions(结论)
在此,研究人员证明了开发动态证据图谱(Living Evidence Map)以提供初级保健解决不平等干预证据概览的可行性与效用。证据集中于特定群体(如少数族裔)和患者层面干预,而其他关键领域(如结构性干预)研究不足。随着研究量持续增长,动态证据图谱(Living Evidence Map)可在循证决策和识别关键证据缺口研究优先级中发挥重要作用,同时需认识到证据适用性因医疗系统与人群而异。
需要我帮你把这篇解读里的关键专业术语(如Living Evidence Map、EPPI-Reviewer等)整理成一个带简短解释的词汇表吗?