德国罕见病去中心化研究:患者数据二次利用的初步结果与障碍

《BMC Medical Informatics and Decision Making》:Decentralized rare disease studies in Germany: first results and hurdles of secondary use of patient data

【字体: 时间:2026年08月14日 来源:BMC Medical Informatics and Decision Making 5.5

编辑推荐:

  背景:罕见病相关的研究挑战在于其低患病率导致的信息匮乏和可靠数据稀缺。研究人员(指代原文作者)指出,“研究效力不足(underpowered studies)”问题源于小型研究社群、有限的研究参与者以及稀少的数据。德国项目“罕见病协作——医学信息学(Colla

  
背景:罕见病相关的研究挑战在于其低患病率导致的信息匮乏和可靠数据稀缺。研究人员(指代原文作者)指出,“研究效力不足(underpowered studies)”问题源于小型研究社群、有限的研究参与者以及稀少的数据。德国项目“罕见病协作——医学信息学(Collaboration on Rare Diseases – Medical Informatics,CORD-MI)”通过采用创新IT解决方案,在20所德国大学医院间实现合作数据使用,从而改善研究机会和患者护理。其中一个可能性是基于二次数据(secondary data)开展去中心化研究(decentralized studies)。以四种罕见病为基础的三项研究作为示例:(1) 囊性纤维化(Cystic Fibrosis,CF),(2) 苯丙酮尿症(Phenylketonuria,PKU),以及(3) 川崎病(Kawasaki Disease)和儿童多系统炎症综合征(Multisystem Inflammatory Syndrome in Children,MIS-C)。方法:所有三项去中心化研究均使用德国大学医院的常规住院数据。针对每个用例,一个跨学科团队定义了研究问题,基于医学信息学倡议(Medical Informatics Initiative,MII)的核心数据集(Core Data Set)创建分析脚本,在参与站点本地执行这些脚本,并汇总匿名化结果以进行描述性统计分析。研究人员应用了频率阈值规则(frequency threshold rule)以保护患者隐私。研究方案以及用于数据提取和评估的分析脚本均已公开,研究严格按照使用观察性常规收集健康数据开展研究的报告规范(Reporting of Studies Conducted Using Observational Routinely-Collected Health Data,RECORD)声明进行详细报告。结果:所有三项去中心化研究均获得了来自最多17所德国大学医院的结果。研究人员讨论了健康护理过程偏倚(health care process bias)、罕见病编码不准确、研究结果验证困难、因掩蔽小病例数导致的信息丢失以及队列定义不精确等方面的挑战。结论:明确这些障碍有助于识别改进领域,这将为未来开发新方法或调整现有工具和方法奠定基础。尽管调整会产生影响,但初步结果已表明,基于患者数据二次利用的去中心化分析能够改善罕见病的研究,进而改善对罕见病患者的护理。临床试验编号:不适用。
**论文解读文章**

**研究背景与问题**

罕见病(rare diseases)因其低患病率导致信息匮乏和可靠数据稀缺,造成了“研究效力不足(underpowered studies)”的困境——即研究社群小、参与者有限、数据稀少。传统上,罕见病研究多依赖随机对照试验(RCTs)和病例对照研究,而常规医疗数据的二次利用(secondary use of patient data)在罕见病领域尚未得到充分重视。德国医学信息学倡议(Medical Informatics Initiative,MII)旗下的“罕见病协作——医学信息学(Collaboration on Rare Diseases – Medical Informatics,CORD-MI)”项目旨在通过创新IT解决方案,在20所德国大学医院之间实现合作数据使用,以改善研究机会和患者护理。该项目探索了基于二次数据开展去中心化研究(decentralized studies)的可行性,即以囊性纤维化(CF)、苯丙酮尿症(PKU)、川崎病和儿童多系统炎症综合征(MIS-C)为示例,评估MII方法和基础设施能否应对罕见病的特殊挑战,并识别利用二次数据时的障碍。

**主要技术方法**

研究人员采用了MII的八步法流程进行去中心化二次数据分析(Zoch et al., 2024)。核心方法包括:由数据科学家团队基于MII核心数据集(MII Core Data Set, MII-CDS)创建R语言分析脚本;脚本分发至各参与站点(17所德国大学医院)进行本地执行;仅返回匿名化汇总结果;应用频率阈值规则(阈值为5)以保护患者隐私;结果通过描述性统计分析呈现。研究遵循RECORD声明进行报告,脚本和方案均公开在Git仓库中。

**研究结果**

**用例1:CF、妊娠与分娩**
基于2015–2021年观察期,研究人员通过ICD-10-GM编码识别出86–118例CF女性患者的住院分娩事件。最常见的并发症为妊娠期糖尿病(n=25–52),其次为胎位异常导致的难产(n=3–12)等。研究显示,多数分娩发生在妊娠37–41周,剖宫产和自然分娩均有记录。

**用例2:PKU、合并症与妊娠/分娩**
观察期2015–2021年,PKU患者的合并症(如抑郁障碍、慢性肾病)在31–99岁年龄组中最为常见,其中抑郁发作(F32.1)和复发性抑郁障碍(F33.1)记录较多。合并症患者总数占PKU总患者的2.15%。妊娠相关并发症(如妊娠期糖尿病、胎儿异常导致的难产)仅出现在2–8例分娩中,未发现母体PKU综合征证据。

**用例3:川崎病与MIS-C**
2015–2021年数据显示,川崎病病例在2020年略有下降,而MIS-C在2021年(独立ICD编码U10.9引入后)急剧增加。MIS-C患者中绝大多数伴有COVID-19阳性诊断,而川崎病患者中则不明显。男性患儿发病率高于女性,且川崎病患儿年龄低于MIS-C患儿(MIS-C多集中在6–15岁年龄组)。

**障碍识别**
通过三项研究,研究人员归纳了以下主要障碍:
1. **健康护理过程偏倚(health care process bias)**:医疗过程(如医生编码习惯、法规限制)导致数据失真。例如CF与妊娠/分娩需同时作为主诊断,但ICD规则不允许双主诊断,导致病例膨胀。
2. **罕见病编码不准确**:ICD-10-GM系统对罕见病描述不精确,而ORPHAcodes等专用术语在2023年春季前尚未强制使用。
3. **结果验证困难**:去中心化设计使本地数据无法直接核查,分析脚本需多轮测试和医学专家人工验证。
4. **信息丢失(掩蔽小数字)**:频率阈值规则(<5的值被掩蔽)导致无法精确计数,尤其在罕见病中产生较大范围估计。
5. **队列定义不精确**:仅依赖诊断模块和ICD分类,未纳入实验室检查等数据,导致部分病例遗漏或误判。

**讨论与结论**

讨论部分指出,尽管存在上述障碍,三项去中心化研究仍成功获得了来自最多17所大学医院的结果,初步验证了基于二次数据的去中心化分析在罕见病研究中的潜力。结论部分翻译如下:
作为CORD-MI项目的一部分,涉及14至17所德国大学医院的三项罕见病研究已成功开展。这不仅有效验证了分布式分析流程,还提供了德国罕见病医疗景观的见解。对特定医学领域的关注提升了跨学科项目团队的意识:医学专家认识到数据质量和患者数据二次利用特殊性的重要性,而数据科学家则理解了开展罕见病研究时需考虑的医学方面。尽管存在挑战,但分布式分析已产生初步原型结果。为提升这些发现的质量和医学意义,必须将现有方法调整至该特定医学领域的需求。通过这样做,可以释放基于二次医疗保健数据的分布式分析的全部潜力,旨在推进罕见病研究并改善对患者的医疗护理。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号