人工智能增强工具在非结构化医疗报告肿瘤数据提取中的应用:瑞士东部癌症登记处真实世界实施评估

《ESMO Real World Data and Digital Oncology》:Tumor data extraction from unstructured medical reports: application of an artificial intelligence-enhanced tool in the Eastern Switzerland Cancer Registry

【字体: 大 中 小 】 时间:2026年09月24日 来源:ESMO Real World Data and Digital Oncology 2.6

编辑推荐:

  背景:基于人群的癌症登记在很大程度上依赖对非结构化医疗报告的人工编码,这一过程既耗时又耗费资源。病例和报告的数量不断增加,同时合格的编码人员稀缺,使得维持及时且高质量的癌症登记面临挑战。 材料与方法:2025年3月至9月期间,研究人员实施并评估了一款人工智能

  
背景:基于人群的癌症登记在很大程度上依赖对非结构化医疗报告的人工编码,这一过程既耗时又耗费资源。病例和报告的数量不断增加,同时合格的编码人员稀缺,使得维持及时且高质量的癌症登记面临挑战。

材料与方法:2025年3月至9月期间,研究人员实施并评估了一款人工智能(artificial intelligence, AI)增强工具——一种基于Python的模块化应用程序,用于从瑞士东部癌症登记处收到的82,384份医疗报告中提取肿瘤数据。该工具基于微调的预训练德语双向编码器表示来自变换器模型(bidirectional encoder representations from transformers, BERT)处理来自超过200家机构的报告,并提供一个可直接整合到瑞士癌症登记软件NICERStat-KRG(Cantonal Cancer Registries, Switzerland)中的输出文件。

结果:对于10,739份报告(13%),发病日期、国际疾病分类(International Classification of Diseases, ICD)第10版代码,以及ICD-O-3.2解剖学部位、形态学和生物学行为与研究人员数据库中的相应肿瘤记录完全一致。其余报告由编码人员进行验证和登记。在癌症登记核心变量中,该工具与编码人员的结果达到了中度至高度的一致性,精确匹配率为19%至53%,部分匹配率最高达82%。该工具还将82%先前被编码人员忽略的报告正确分类为不相关。尽管编码人员资源减少了27%,与2024年相比,总体生产率显著提高。

结论:这些发现表明,本地部署的、保护隐私的人工智能增强工具可以显著提高基于人群的癌症登记的生产力和数据完整性。结果支持AI辅助工作流程在日益增长的工作量需求下促进常规登记操作的潜力。
基于人群的癌症登记(population-based cancer registration)是癌症控制的关键数据来源,但长期以来依赖人工编码非结构化医疗报告,流程耗时且资源密集。2020年瑞士实施《国家癌症登记法》后,所有特定范围内的肿瘤均被列为强制报告对象,每个肿瘤病例对应的报告数量逐年增加。与此同时,合格编码人员稀缺,导致登记及时性和质量难以保障。为应对这一现实压力,研究人员在瑞士东部癌症登记处(Eastern Switzerland Cancer Registry)部署并评估了一款人工智能增强工具(AI-enhanced tool),旨在通过自动化提取肿瘤数据提高登记效率和数据完整性。该研究首次报告了此类工具在基于人群的癌症登记中的真实世界实施效果,其结果对癌症登记、流行病学和健康信息学领域具有直接参考价值。

研究人员开展的研究聚焦于将AI工具整合进日常登记工作流。该系统是一个基于Python的模块化应用程序,使用微调的预训练德语双向编码器表示来自变换器模型(bidirectional encoder representations from transformers, BERT)处理非结构化医疗报告。模型训练语料库由该登记处2020至2023年间的178,667份临床报告构成,覆盖病理学、细胞学、放射学、肿瘤委员会和出院报告等多种类型,并由经验丰富的登记人员根据内部及欧洲癌症登记网络(European Network of Cancer Registries)、国际癌症研究机构(International Agency for Research on Cancer)等国际标准进行标注。系统通过光学字符识别(optical character recognition, OCR)将便携式文档格式(portable document format, PDF)报告转换为机器可读文本,经规则预处理后提取核心登记变量(发病日期、国际疾病分类第10版(ICD-10)诊断、ICD-O-3.2解剖学部位/形态学/行为、组织学分级、侧别)和管理变量(报告来源、类型、日期和患者通知日期)。提取结果以逗号分隔值(comma-separated values, CSV)格式导入国家癌症登记软件NICERStat-KRG(National Institute for Cancer Epidemiology and Registration, MySQL-based),由登记人员审核、验证和最终确认。AI工具定位为决策支持系统,所有病例均须经人工验证,无人能绕过编码人员直接登记。

在整体处理方面,系统共处理82,384份报告,其中2,403份(2.9%)为不可读PDF,约100份为非德语报告,未能自动处理;65,572份(80%)提取到相关肿瘤信息并被归类为相关。所有报告均导入NICERStat-KRG。其中10,739份报告(占已处理报告的16%、总报告的13%)的发病日期、ICD-10代码、ICD-O-3.2解剖学部位、形态学和生物学行为与数据库中对应肿瘤记录完全一致,无需人工重新提取或重新编码核心变量。该子集相当于每年减少70%个全时当量(full-time equivalent, FTE)的人工编码工作量,即节省了大量数据录入和编码时间,但并未取消登记人员的审核环节。其余71,645份报告中的所有提取变量均由登记人员完整审核、验证和修正。

在核心变量提取准确性方面,发病日期的精确匹配率为19%,按月份/年份级别匹配时升至48%;ICD-O-3.2解剖学部位精确匹配26%,前三位数字匹配47%;ICD-O-3.2形态学精确匹配33%,前四位数字匹配35%;组织学分级精确匹配26%;ICD-10诊断精确匹配15%,前三位匹配20%;侧别精确匹配率最高,达53%;专门分级系统(Greasmann、Elston–Ellis和世界卫生组织中枢神经系统肿瘤分类(WHO CNS))精确匹配48%。对于登记人员此前忽略的18,235份报告,工具正确分类82%为不相关,但错误分类22%为相关,提示仍需人工复核以避免误纳入。

在生产力与人员配置方面,与2024年同期(未使用AI)相比,尽管可用工作人员的全时当量减少27%(从560%降至410%),新登记肿瘤数增加69%(从4,351例增至7,371例),处理文档数增加92%(从31,113份增至59,592份),自动生成的患者通知缺失问卷数增加33%(从3,384份增至4,508份)。这些数据表明,在人员缩减和工作量上升的双重约束下,AI工具显著提升了登记效率。

讨论部分指出,该系统成功的关键在于采用“AI辅助+人工监督”的混合模式,效率提升来自减少重复性数据录入和编码任务,而非取消专家审查。数据治理方面,系统完全部署于本地基础设施,避免云处理,符合瑞士数据保护和癌症登记立法要求,这对受严格法律约束的登记机构尤为重要。局限性包括:模型仅基于单一区域性登记处的德语数据训练,可能限制其他语言和医疗情境下的泛化能力;工具对图像型PDF、非德语报告以及多份报告关联到同一肿瘤事件的纵向聚合仍存在不足。未来开发方向包括多语言模型扩展、改进OCR识别能力以及跨报告源的纵向病例聚合。研究结论可翻译为:本地部署的、保护隐私的人工智能增强工具能够显著提高基于人群的癌症登记的生产力和数据完整性;该结果支持AI辅助工作流程在日益增加的工作量需求下促进常规登记操作的潜力。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号