《Practical Radiation Oncology》:Automated Classification of Radiation Oncology Safety Events Using Large Language Models: A Novel Approach to Streamline Reporting and Enable Retrospective Analysis
编辑推荐:
目的本研究旨在评估使用大语言模型(LLM)自动化分类放射肿瘤学安全事件的可行性,并勾勒出一个利用人工智能(AI)辅助工作流的未来报告系统框架。方法与材料回顾性安全事件数据从本机构的报告系统中提取,并使用Python脚本进行去标识化和格式化。通过应用程序编程接口(API)调用G
目的
本研究旨在评估使用大语言模型(LLM)自动化分类放射肿瘤学安全事件的可行性,并勾勒出一个利用人工智能(AI)辅助工作流的未来报告系统框架。
方法与材料
回顾性安全事件数据从本机构的报告系统中提取,并使用Python脚本进行去标识化和格式化。通过应用程序编程接口(API)调用GPT-5(OpenAI),并通过迭代式提示工程(一种不修改模型参数的自然语言过程)对事件进行多维度分类,包括失效模式、严重程度、治疗类型、发现者角色、排除标准,以及事件发生/发现的工作流阶段。模型的性能由三位独立的、盲审的专家审核者进行验证,并使用Cohen's κ量化评审者间一致性。
结果
在包含80个事件的盲测验证集上,模型的分类结果平均在67.9%的维度级比较中落在专家组公认答案范围内(纳入决策为96.2%;治疗类型为85.3%;发生工作流为76.6%)。模型与个别审核者之间的一致性(平均Cohen's κ = 0.31)与审核者彼此之间的一致性(平均κ = 0.42)相当,表明其性能接近独立专家水平。严重程度评分在模型和人工审核者中均表现出最大的变异(模型-审核者κ = 0.14;审核者间κ = 0.22),这表明严重程度评分是最需要改进的主要领域。模型-专家一致性与专家间一致性的可比性,支持将该模型应用于全量数据集分析而无需进一步优化。
结论
基于LLM的分类展示了在自动化回顾性安全事件标注和简化未来报告工作流方面的强大潜力。在提议的未来系统中,工作人员只需提供详细的叙述描述,而AI模型则执行分类,并在出现不确定性时提示人工验证。这种混合方法可以提高放射肿瘤学安全报告的效率、一致性和可扩展性。据我们所知,这是首个将LLM应用于放射肿瘤学安全事件自动化分类的研究,提出了一个概念验证框架,具有更广泛地应用于AI辅助事件报告和质量改进的潜力。
引言
患者安全事件报告系统是培育安全文化、提升医疗保健机构护理质量的基础,但其有效性取决于所收集数据的质量和可分析性。1,2 放射肿瘤学由于其复杂的多步骤工作流,涉及众多专业人员和技术之间的交接,在捕捉和学习安全事件方面面临独特的挑战。3,4 在实践中,一个机构从其报告系统中获得的收益,在很大程度上取决于该系统如何在报告便捷性与分析所需结构化程度之间取得平衡,而我们自身的经历直接体现了这种张力。
我们机构的安全报告平台SafetyAlways以报告便捷性为首要目标:它是一个通用的、全院范围系统,员工以自由文本描述事件,仅原生的捕获一组最少的结构化字段。因此,我们近5年来积累的788个事件几乎处于未分析状态。这些叙述内容丰富,但缺乏结构化分类,我们无法回答那些使事件学习变得有价值的关键运营问题——哪些事件值得优先关注、哪个工作流阶段最容易出错、或者哪些员工群体报告不足、可以鼓励其更多参与。手动从数百篇多段落的叙述中提取这些结构需要耗费难以承受的专家精力;因此,在实际操作中,积压的事件无人审查。
国家事件学习系统,如放射肿瘤学事件学习系统(RO-ILS)和放射肿瘤学安全系统(SAFRON),5,6 采取了相反的设计思路:它们定义了标准化分类体系并捕获结构化数据元素,从而使得上述类型的分析成为可能。然而,这种结构化是通过要求报告者在提交时手动对每个事件进行分类来实现的。在繁忙的诊所中,这种手动标注本身就会抑制报告意愿:在已经写好了自由文本描述之后,临床医生还必须将同一事件重新编码到多个分类字段中。5,7,8 这种额外负担令人却步,尤其是对于那些对安全学习同样有价值的险些事故和轻微事件的报告。
这两种情形有一个共同特征:在这两种情况下,分类所需的信息已经存在于报告者撰写的自由文本叙述中——如果叙述写得充分且细节丰富。区别仅在于这些信息是否以及如何被提取。因此,我们提出第三种方案:使用大语言模型(LLM)直接从叙述中提取结构化字段。对于我们回顾性的数据而言,这可以将一份静态档案转变为可分析的数据集,而无需额外的人力投入;对于更广泛的系统化报告而言,同样的能力可以自动填充分类字段,既保留了结构化数据的分析价值,又消除了抑制报告意愿的标注负担。
LLM的最新进展为解决这一长期存在的挑战提供了可能的方案。人工智能(AI)正日益被应用于加强医疗领域的患者安全,包括事件和不良事件数据的分析。9 我们提出利用LLM,特别是GPT-5 OpenAI(2025年8月7日发布),10 从自由文本的事件描述中自动提取结构化分类。
在本研究中,我们:(1) 证明LLM可以仅凭叙述描述对放射治疗(RT)安全事件进行多维度分类,达到与专家审核者的一致性水平与审核者间一致性相当;我们进一步表明,分类质量主要受事件叙述完整性的限制,而非模型能力——当报告写得充分时,模型的标注与专家判断高度吻合,而简略或模糊的叙述则限制了人工和自动分类的质量;(2) 发现先前隐藏的模式,包括安全事件中最常见的失效模式,从而能够有针对性地改进和干预;以及(3) 提出了一种新的报告系统设计,将LLM分类集成其中,以实现简便报告和深入分析——尽管全面实施尚待基础设施建设。尽管此前已有研究探索过一般医疗环境中患者安全报告的自动化分类,11 但尚无研究将LLM应用于RO-ILS。据我们所知,这是率先将LLM应用于从自由文本叙述中直接进行安全事件多维度分类的应用之一,提出了一个概念验证性的、AI辅助的框架,在放射肿瘤学安全数据的捕获、结构化和分析方面具有更广泛应用的潜力。
分节摘要
数据来源
我们查询了2021年1月1日至2025年9月11日期间本机构SafetyAlways系统中与放射肿瘤学相关的安全事件工单。提取的字段包括事件工单编号、事件日期和叙述描述。使用Python脚本对描述字段中的受保护健康信息(PHI)进行去标识化,移除姓名、病历号和出生日期等直接标识信息。由于自动移除不能保证完全彻底,去标识化后的
数据集特征
我们排除了LLM识别出的与放射肿瘤学安全质量保证无关的事件(n = 138),对余下的事件进行分析(n = 650)。650个分析事件涵盖了放射治疗工作流中多样的安全事件。事件描述从简短报告(最少4个词)到详细叙述(最多592个词)不等,描述长度中位数为52个词。
图1展示了按日历年提交的工单数量。该
讨论
本研究证明了利用LLM仅凭叙述报告对放射治疗(RT)安全事件进行分类和分析的可行性——鉴于多年来积累的事件描述数量庞大且变异性强,这是一项传统上劳动密集且颇具挑战性的任务。
通过对照三位独立的专家审核者进行验证,我们确认了模型的分类结果与专家判断的一致性水平与专家彼此之间的一致性相当。在此基础上,我们应用了
结论
本研究证明了使用LLM从自由文本描述中分类放射肿瘤学安全事件的可行性,其结果与专家审核者的一致性达到了与审核者间一致性相当的水平。与人工审核类似,分类的可靠性主要受事件叙述完整性的限制,而非模型能力,这为事件报告中长期存在的挑战提供了一种实用解决方案。通过保持
利益声明
作者声明不存在任何已知的竞争性经济利益或个人关系,这些可能影响本文所报告工作的客观性。
Qiongge Li|Jian Liu|Xing Li|Wei Nie|Jiajin Fan