《Discover Medicine》:Implementing LLMs in clinical practice from unstructured and semistructured electronic record data to analysis ready data sets in central nervous system tumors
编辑推荐:
原发性中枢神经系统(CNS)肿瘤在美国每年影响25,000人,带来重大健康挑战。研究受困于电子健康记录(EHR)系统间数据碎片化,以及人工抽取诊断、分子与治疗数据效率低下。大语言模型(LLM)通过自动化抽取、提升效率与一致性并提供AI驱动洞察成为解决方案。研究
原发性中枢神经系统(CNS)肿瘤在美国每年影响25,000人,带来重大健康挑战。研究受困于电子健康记录(EHR)系统间数据碎片化,以及人工抽取诊断、分子与治疗数据效率低下。大语言模型(LLM)通过自动化抽取、提升效率与一致性并提供AI驱动洞察成为解决方案。研究人员分析了256例确诊胶质母细胞瘤(GBM)患者的4,974份EHR文档,所有患者均入组NCI NIH IRB(IRB00011862)批准的00-C-0074、02C0064、04C0200、06C0112、16-C-0081、20-C-0027方案。队列1(GBM,n=109)用于开发流程,队列2(多种CNS组织学,n=147)与队列3(GBM病灶,n=15)作测试集。通过NIH NIDAP文本抽取程序(NTEP)以GPT-4o抽取诊断日期、Karnofsky功能状态评分(KPS)、切除范围、MGMT与IDH状态及放疗起止日期等临床特征;提示词经迭代并采用JavaScript Object Notation(JSON)格式,输出与256例患者详阅病历建立的手动金标准比对以评估特征与文档类型准确率。提示精炼使提示字符数增30倍,队列1七特征中五者达≥95%准确率;MGMT从26%升至99%,放疗日期从93%升至98%;KPS(82%)与切除范围(84%)较低。队列2中MGMT与IDH最高(87%、90%),队列3稍低仍强(70%、78%)。各队列中MGMT与IDH为最准抽取生物标志物,放疗小结跨队最优。结果表明经审慎文档选择与提示设计,LLM可准确抽取EHR临床特征,支撑CNS肿瘤研究并具更广临床适用;未来将扩展特征集并外数据集验证。
研究背景方面,原发性中枢神经系统(CNS)肿瘤在美国年影响约25,000人,其中胶质母细胞瘤(GBM,WHO IV级)预后差,中位生存约15个月,MGMT启动子甲基化与IDH突变是指导烷化剂化疗的关键分子标志物。传统EHR数据抽取依赖人工阅片,耗时易错且跨系统碎片化和非结构化/半结构化文本难以直接分析,限制转化研究与真实世界数据(RWD)利用。为此,研究人员在NIH框架下开展一项利用大语言模型(LLM)从非结构化与半结构化EHR自动抽取CNS肿瘤临床特征并构建分析就绪数据集的研究,论文发表于《Discover Medicine》。
关键技术方法上,研究人员纳入256例NIH IRB批准方案下的CNS肿瘤患者,分三队列:队列1为109例病理确诊GBM(2005–2023),队列2为147例非转移CNS肿瘤(排除与队列1重叠31例),队列3为15例GBM(含8例原发与7例低级别转化)。使用NIH NIDAP文本抽取程序(NTEP)调用FedRAMP合规的GPT-4o,在NTEP中迭代设计提示词(含JSON格式输出、域术语如“primary”“subtotal”),先在10份文档试点达100%再扩至全队列;以多学科团队详阅全部256例建立的手动金标准比对,ground truth中缺失标“unknown”,LLM返“null”计为真阳性;统计用准确率、敏感度、特异度、F1、ANOVA等。
研究结果部分,3.1节提示迭代影响显示,初始至终版提示字符数增30倍,队列1平均准确率升37%,七特征中五者≥95%;MGMT由26%至99%(+73%),IDH由低至91%(+48%),放疗起止日期93%→98%。3.2节队列1优化表明,放疗小结(RT summary)跨七特征平均80%最高,外科病理最低28%;MGMT 98%、IDH 91%、放疗日期及诊断日(病史91%/放疗小结83%)佳,KPS仅进度笔记82%。3.3节队列2(混合CNS)与队列3(GBM)测试中,队列2 MGMT 87%、IDH 90%、放疗日期80%、诊断日70%、KPS最高49%;队列3 MGMT 70%、IDH 78%、KPS均29%,放疗小结仍最优。3.4节分类性能显示,MGMT在队列1放疗小结敏/特异:未知类特异35%但未知预测准确率100%;队列2进度笔记MGMT检测最佳;IDH在队列1放疗小结特异93%/99%/61%,未知敏感94%;队列2进度笔记野生型敏感76%、突变87%;队列3进度笔记野生型敏感100%、突变89%。ANOVA示RT日期方差最大,RT小结整体最稳。
讨论部分总结:LLM抽取效能主要取决于提示迭代与文档选型而非模型本身;放疗小结对时序与分子项优,但病史/首诊笔记补诊断与手术日;KPS因记录不规范(“60–70”“unchanged”)跨队列仅29%–82%;MGMT/IDH在2005/2009前常缺致大量“unknown=unknown”虚高错分;单中心EHR限制外推,需外部验证或联邦学习;NIDAP仅接Azure OpenAI FedRAMP边界,换Bedrock/Vertex需重审ATO;冲突日期以首份病理报告为准。结论部分翻译:本研究利用LLM自动化抽取CNS肿瘤EHR临床特征,证明经NIDAP与NTEP安全部署可实现精细抽取;准确率高度依赖临床输入的提示迭代与文档选择,分子特征MGMT与IDH达95%–100%;混合组织学需审慎筛选;LLM接入真实世界管线可推进CNS肿瘤分子分型与放疗纵向进展分析;未来扩外验与跨瘤种。