利用大语言模型从非结构化临床文本中提取医学信息以增强医疗卫生互操作性:概念验证研究

《Journal of Medical Internet Research》:Extracting Medical Information From Unstructured Clinical Text Using Large Language Models to Enhance Health Care Interoperability: Proof-of-Concept Study

【字体: 时间:2026年07月24日 来源:Journal of Medical Internet Research 8.2

编辑推荐:

  背景:非结构化临床文本仍是医疗卫生领域可互操作数据复用与大规模二次分析的主要障碍。大语言模型(large language models,LLMs)有潜力自动化提取结构化临床信息,但其应用受限于高质量标注训练数据的稀缺。目的:为解决上述局限,研究人员旨在开发并

  
背景:非结构化临床文本仍是医疗卫生领域可互操作数据复用与大规模二次分析的主要障碍。大语言模型(large language models,LLMs)有潜力自动化提取结构化临床信息,但其应用受限于高质量标注训练数据的稀缺。目的:为解决上述局限,研究人员旨在开发并验证一种可扩展、隐私保护的框架,利用从结构化Fast Healthcare Interoperability Resources(FHIR)生成的合成数据微调开源LLMs,以有效从非结构化文本中提取可互操作的临床信息。方法:研究人员评估了基于LLM的框架,从癌症相关出院信中提取结构化临床信息并映射至兼容FHIR的表示。为实现大规模监督训练,研究人员开发了随机样本生成器,通过Qwen3-235B从41,175名癌症患者的结构化FHIR数据中随机采样聚合生成合成出院信。所得合成出院信(n=75,000)与其原始结构化数据配对,形成用于微调27B参数医学语言模型MedGemma 27B的大规模数据集。评估在合成测试集(n=7500)、真实世界出院信(n=30,由医师和一名医学生评估)以及使用开源模型(Qwen3、LLaMA和GPT-OSS)的对比单次(one-shot)方法上进行。结果:微调模型在合成测试集上多个临床实体提取性能高,完整国际疾病分类(International Classification of Diseases,ICD)诊断代码F1为0.84,肿瘤相关信息0.99,实验室数值0.99,药物名称与剂量0.99,解剖学治疗学化学分类(Anatomical Therapeutic Chemical,ATC)药物代码0.94;操作相关提取更具挑战,OPS代码F1为0.63,操作描述0.90。微调模型在几乎所有提取类别上持续优于通用LLMs单次对比。医师对真实世界出院信评估中,病例级正确率:ICD诊断78.9%,肿瘤信息86.1%,药物93.0%,操作61.3%。结论:结果表明,从结构化临床数据生成合成文本能够使LLMs的有效且可扩展训练用于从非结构化文档中提取可互操作、多实体临床信息。
研究背景方面,电子健康记录(electronic health records,EHRs)中非结构化文本约占80%,富含上下文但缺乏标准化、语言多样性高且隐私限制严,难以复用。Health Level Seven Fast Healthcare Interoperability Resources(FHIR)标准以细粒度资源(如Condition、Procedure、Observation)表示临床数据,是语义互操作核心,但自动从临床文档提取信息仍是开放问题。早期FHIR-GPT等框架证明LLM可增强互操作,但训练数据稀缺与人工评估成本高为瓶颈,合成数据生成成为关键策略。研究人员提出PIGEON(Patient Information Generation from Organized Notes)范式,从生产环境FHIR R4服务器(超20亿资源)直接生成合成监督训练数据,在严格数据治理下微调开源LLM,并以MedGemma 27B为例验证。
主要关键技术方法上,研究人员使用德国埃森大学医院(University Hospital Essen)生产FHIR R4服务器中41,175名癌症患者队列(中位每人27次就诊,中位656个FHIR资源)构建FHIR缓存;以Qwen3-235B为教师模型,通过149,000条规则化“recipes”随机采样FHIR资源,确定性生成实验室与药物表格、LLM生成病史与病程叙述,产出75,000封合成出院信配中间JSON标签;以MedGemma 27B为基座,在单张NVIDIA A100上用Unsloth库做指令微调(FP16/BF16混合精度、梯度累积),训练/测试按患者级9:1划分;推理端接检索增强生成(retrieval-augmented generation,RAG)后处理模块,将ICD-10、ATC、OPS代码候选经多语句向量入FAISS索引,由MedGemma 4B在确定候选集内选码;真实世界评估由3名皮肤科医师与1名医学生对30封跨科室真实出院信做病例级全对才算正确的标注,并以Qwen3-235B单次提示对照。
研究结果部分,Cohort Characteristics小节表明,41,175名癌症患者队列中女46.1%、中位年龄66.3岁,肺癌(ICD-10 C34)最常见占9.9%,FHIR缓存含5700万资源(4700万Observation、360万Condition等),覆盖10,000个ICD与11,000个德国OPS代码,证明数据源规模与多样性足以支撑合成数据构建。Synthetic Discharge Letter Evaluation小节显示,在7500封合成测试集上PIGEON宏平均F1 0.912,完整ICD代码0.840、肿瘤0.991、实验室0.994、药物名0.9997、ATC 0.937、OPS代码0.635,均大幅超过Qwen3-235B(完整ICD仅0.500、OPS 0.171)等通用模型;接入RAG后处理使完整ICD F1从0.731升至0.867(+0.135)、OPS从0.635升至0.730(+0.095)、ATC从0.852升至0.918。Human Evaluation小节中,30封真实出院信上PIGEON平均病例级正确率87.5%,Qwen3-235B为72.2%;其中主诊断ICD章节86.0%、肿瘤86.1%、药物93.0%、实验室97.9%,但操作仅61.3%;PIGEON采取保守抽取、几乎不幻觉,Qwen3-235B在自由文本药物与实验室中结构错乱严重;6封信双医师标注187对实体判断一致率87.7%,Cohen κ 0.751(substantial agreement)。
讨论部分指出,该框架从真实FHIR后端程序化生成训练数据,免去人工标注,任何采用FHIR的机构均可本地复现且不外传患者数据,支持院内隐私合规部署;PIGEON作为ETL补充,可将出院信预提取为结构化摘要供医师核对,把临床角色从录入转向校验;模块化解耦抽取模型、RAG校正器与预处理,便于独立迭代。局限包括单中心(埃森)、仅德语、真实评估仅30封、操作(OPS)代码因解剖/入路/侧别编码密集而最弱(错误集中于目录歧义而非随机错码)、仅微调单一LLM且基线仅为通用模型单次提示。作者规划多中心(德国Medizininformatik-Initiative站点)、多语种、以强推理模型作教师扩合成边缘案例、LLM-as-a-judge减人工标注、小模型分治提升效率。
结论部分原文翻译:本研究提出并评估了一种隐私保护且资源高效的框架以提升医疗卫生数据互操作性。研究人员证明,从真实FHIR资源衍生的合成数据微调的资源高效开源LLM,能够以具竞争力的准确度将非结构化的德语出院信转换为标准化格式。该方法补充传统ETL流水线,并为大型专有模型提供安全替代。作为一项在欧洲最大机构级FHIR存储库之一上进行的单中心概念验证,本工作证明了该方法的技术可行性,并为寻求利用非结构化临床数据的医疗卫生系统提供了实用基础。在常规临床使用前,仍须在独立FHIR对齐机构间进行前瞻性多中心验证,长期目标是提升运营效率与患者照护。
Bahad?r Ery?lmaz、Kamyar Arzideh、Mikel Bahn、Hendrik Damm、Sina Warmer、Henning Sch?fer、Ahmad Idrissi-Yaghir、Tabea M G Pakull、Lea Jessica Albrecht、Jens Kleesiek、Georg Lodde、Christoph M Friedrich、Elisabeth Livingstone、Dirk Schadendorf、Katarzyna Borys、Felix Nensa、René Hosch 发表于《Journal of Medical Internet Research》。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号