《Nuclear Medicine and Molecular Imaging》:From Patient Selection to Surveillance: Artificial Intelligence Applications in Radioiodine Therapy – A Systematic Review
编辑推荐:
放射性碘治疗需要在患者选择、给药活度规划、影像评估和随访方面进行个体化决策。本系统综述总结了人工智能(AI)在131I治疗路径中的当前应用,并评估了限制临床实施的障碍。遵循PRISMA 2020指南,研究人员在PubMed、Scopus、
放射性碘治疗需要在患者选择、给药活度规划、影像评估和随访方面进行个体化决策。本系统综述总结了人工智能(AI)在131I治疗路径中的当前应用,并评估了限制临床实施的障碍。遵循PRISMA 2020指南,研究人员在PubMed、Scopus、Web of Science和Wiley数据库中检索了涉及接受131I治疗的分化型甲状腺癌或良性甲状腺疾病患者的原创研究,其中使用了AI、深度学习(DL)或机器学习(ML)方法。研究人员综合证据,并使用NIH/NHLBI研究质量评估工具评估研究质量。在775篇识别记录中,24篇研究符合纳入标准。AI应用包括治疗前决策支持、碘亲和性疾病的检测和表征、剂量测定和活度优化、辐射安全评估、治疗反应预测、左甲状腺素剂量估计和复发风险分层。现有证据以回顾性、单中心研究为主,主要关注分化型甲状腺癌,外部验证有限。AI有潜力改善131I治疗的标准化和个体化,但方法学异质性和临床效用证据不足目前限制了常规采用。需要具有统一终点和稳健验证的前瞻性多中心研究以促进临床转化。
放射性碘治疗(RAIT)基本原理:RAIT利用甲状腺滤泡细胞通过钠-碘同向转运体(NIS)主动浓聚碘离子的能力,是靶向放射性核素治疗的早期成功范例。自1940年代初由Saul Hertz首次临床应用以来,RAIT已成为管理良恶性甲状腺疾病的基石。尽管关于RAIT后继发恶性肿瘤风险的争议持续,现有证据异质性且不具结论性。多项大型研究未显示治疗性
131I暴露后总体癌症相关死亡率或遗传效应明确增加,但近期荟萃分析报告了与特定继发恶性肿瘤(包括白血病和唾液腺癌)的可能剂量依赖性关联。此外,新兴证据表明RAIT可能与克隆性造血相关,但该发现的长期临床意义仍不确定。尽管RAIT总体安全且耐受良好,但当前长期证据不具结论性,凸显了持续监测和个体化风险评估的必要性。
RAIT挑战:活度选择是RAIT的核心挑战之一,直接决定疗效与毒性间的平衡。然而,关于最佳给药活度尚无普遍共识,主要学会通常推荐针对临床意图(如残留消融、辅助治疗或已知转移性疾病治疗)调整的活度范围,导致实际实践中的显著变异。在分化型甲状腺癌中,活度选择受TSH刺激方法影响。治疗前碘状态也显著影响
131I生物分布,低碘饮食用于最大化靶组织摄取。全身辐射暴露主要取决于全身碘潴留和清除,肾功能不全时可能延长。锂可通过延长
131I潴留增加靶组织吸收剂量,但可能增加非靶组织辐射暴露。在良性疾病中,Marinelli公式用于计算近似靶吸收剂量,但需准确体积和摄取数据,且未明确考虑抗甲状腺药物(ATD)使用等临床病史。此外,Graves病患者摄取/周转的短期个体内变异以及“顿抑”或“自顿抑”现象使剂量预测复杂化,因此“精确剂量测定”仍可能无法实现精确的个体甲状腺剂量。
放射性碘与影像:平面甲状腺放射性核素显像受主观判读、读者依赖性变异、组织重叠和有限定量能力的限制。SPECT/CT改善了病灶定位和
131I摄取的定量评估,但需混合设备,增加成本和复杂性,并增加CT相关辐射暴露。此外,缺乏广泛实施的自动甲状腺分割以及持续依赖手动图像处理延长了分析时间,并引入了显著的观察者间和中心间变异。甲状腺超声广泛可用、安全且相对廉价,空间分辨率高,但不提供关于碘摄取或器官动力学的直接功能信息。放射学领域已通过AI工具(自动检测、分割和工作流程分类)应对类似挑战,提高了效率和可重复性,提示核医学可从AI驱动的解决方案中受益,特别是自动分割、定量分析和SPECT无CT衰减校正。
预测RAIT结局:个体水平结局预测在良性疾病和术后分化型甲状腺癌中均固有复杂,因为治疗反应来源于多种相互作用决定因素,这些因素在给药前很少被全面测量。良性甲状腺功能亢进症RAIT失败的预测因素包括男性、延迟RAIT、既往ATD使用、较高fT4、非常高的24小时摄取和较大甲状腺体积,但关键修饰因素(ATD时机/持续时间、对比剂后碘污染)常不一致测量或记录。在DTC中,预后受残留或肿瘤负荷异质性以及病灶水平碘亲和性的进一步限制,更高处方活度并未可靠改善长期结局。在良性甲状腺功能亢进症中,临床相关结局(如缓解、持续甲亢或治疗后甲减)可能因活度选择策略相似而不同。报告成功率因研究间结局定义和随访时长的差异而显著变异,强调在评估RAIT后结局时需要标准化终点和随访期,并支持整合临床暴露史、影像和生物动力学的综合预测模型开发。
核医学中的人工智能:方法学上,临床AI应用可根据数据模态和预期临床功能分类。在医学影像中,DL模型广泛用于分类、检测和分割任务,实现自动定量分析和影像生物标志物提取。互补的放射组学方法使用手工影像特征结合经典ML算法,以提高可解释性和与临床数据的整合。结构化临床和实验室数据常用监督学习模型进行风险预测和治疗反应评估,而自然语言处理可实现从非结构化临床记录中提取信息。放射性碘(
131I)治疗的复杂性和变异性使其成为AI支持临床决策的有前景领域。AI方法可能通过整合多模态数据支持更精确和个体化的治疗决策。DL方法可改善自动图像分析和定量评估,而ML模型可增强治疗反应预测、吸收剂量估计和风险分层。重要的是,AI可通过作为培训人员的决策支持和教育工具,改善判读技能和临床一致性,从而协助解决核医学专家短缺问题。然而,临床实施需要高质量、精心整理的数据、严格验证、校准、可解释性和临床相关性能指标,以确保跨人群的安全性和泛化性。
材料与方法:综述内容:本系统综述通过批判性综合AI支持的诊断评估、剂量测定、治疗反应预测及安全/后勤方面的证据,推进了AI在RAIT中的应用领域,同时解决了关键方法学、临床和伦理挑战。与以往主要关注模型性能的综述不同,本工作采用临床导向视角,将AI发展与实际核医学工作流程和决策联系起来。综述提供了AI在RAIT中应用的分类,识别了主要证据缺口(如异质数据集和有限外部验证),强调了AI作为决策支持工具的作用,讨论了伦理和治理考虑,并概述了未来研究优先事项,包括可解释AI和前瞻性临床整合验证研究。研究问题形式化:本系统综述旨在分类当前应用于RAIT的AI方法,批判性评估其报告性能和临床效用,识别证据缺口,并概述未来研究优先事项,以支持安全、可扩展和伦理负责地向临床核医学实践转化。预设的研究问题包括:AI方法如何根据临床任务和建模方法系统分类?最常用的数据源和验证策略是什么?哪些方法学和临床趋势出现?临床实施的主要障碍及未来方向是什么?这些研究问题在结果部分通过提取研究级证据得到解答,并在讨论部分综合。论文选择过程:研究人员在PubMed、Scopus、Web of Science和Wiley四个数据库中进行了系统检索,使用结合AI和RAIT相关术语的数据库特定语法。检索公式包括预测、预后、副作用、结局、分析等术语与
131I、放射性碘等组合,以及人工智能、机器学习、深度学习、CNN、神经网络等。重复记录通过Zotero自动去除并手动验证。标题和摘要经手动筛选,全文文章根据PICO框架制定的纳入和排除标准评估资格。详细检索方案遵循PRISMA 2020指南,协议已在PROSPERO注册(CRD420261397734)。纳入和排除标准:纳入涉及接受
131I治疗的分化型甲状腺癌或良性甲状腺疾病的成年患者,应用ML、DL或CNN方法于RAIT临床相关组件(包括影像、结局预测、剂量测定、辐射安全或出院计划)的研究。排除非人类、理论性、无关同位素研究、综述、社论、会议摘要、无结果方案及缺乏可测量RAIT相关结局的研究。数据提取与综合:研究人员应用预设标准化提取模板,一致捕获研究级证据,包括文献背景、临床用例、研究设计和队列、数据模态及完整AI管线。提取验证方法、性能指标和作者报告的限制。两名研究人员独立提取,分歧通过共识会议解决。综合按应用领域组织,使用叙述和主题分析识别方法学模式、异质性来源和转化障碍;鉴于预期人群、终点和报告异质性,未优先考虑荟萃分析,强调严谨性、临床相关性和可重复性。
结果:文献检索识别出775条记录。Zotero自动识别214篇重复记录,271篇因出版类型被排除,290篇符合筛选资格。218篇经标题和摘要手动排除,26篇未获取全文,剩余46篇中24篇根据PICO标准纳入。纳入研究发表于2018至2025年。研究特征:24项研究中,最常见设计为回顾性单中心,部分基于合成数据。10项研究基于中国患者队列,2项来自韩国,2项来自伊朗,2项来自美国。患者人群通常以女性为主且中年,RAIT最常见指征为分化型甲状腺癌,尤其是乳头状甲状腺癌。较少研究涉及良性甲状腺疾病或治疗后管理(如甲减/左甲状腺素剂量),以及辐射安全和剂量测定背景。最常见AI方法为监督性表格机器学习模型,最常使用基于树的集成/提升方法(随机森林、梯度提升/XGBoost/Extra Trees)加SVM和逻辑回归,少数使用DL处理影像(4/24,主要为CNN/U-Net型架构用于CT或全身显像任务)。一些研究强调通过规则学习、聚类或混合可解释框架实现可解释性/结构发现(3/24)。总体而言,研究目标集中于治疗前预测碘亲和性或非亲和性或隐匿性转移、预测治疗反应/消融成功、复发或治疗失败,以及通过剂量测定或给药活度规划、出院和辐射安全预测、自动图像分类、分割和个体化左甲状腺素剂量实现更个性化和高效护理。质量评估:使用NIH/NHLBI研究质量评估工具评估方法学质量。每个标准评为“是”(1分)、“否”或“无法确定/未报告”(0分)。总体得分计算为满足标准的百分比。研究根据比例分为高(≥75%)、中(50-74%)或低(<50%)方法学质量。评估由两名研究人员独立进行,分歧通过讨论解决。治疗计划:患者选择:在DTC中为RAIT选择合适候选者具有挑战性,因为临床决策取决于两个不同但互补的治疗前问题:患者是否存在常规影像隐匿但
131I全身扫描可检测的临床相关转移性疾病,以及已识别转移是否可能为
131I亲和性(可治疗)或非亲和性(
131I难治性)。Su等人(2025)研究通过构建可解释、临床就绪的表格ML,回顾性队列定义隐匿性肺转移为CT阴性但
131I-WBS阳性,筛选11个常规变量,训练六种分类器,使用SHAP解释最佳LR模型。Gao等人(2024)和Song等人(2025)反映第二种趋势:基于CT的深度学习作为摄取表型替代,以及从单步分类器向工作流程模型的演变。Gao使用治疗前非增强CT,结合治疗RAIT后SPECT的亲和性标签,实现两阶段分割分类级联。Song构建多中心管线,先检测结节(Faster R-CNN/FPN),再分类摄取表型(ResNeSt50),使用Rx-WBS作为参考标签。这些AI研究强调了Tg作为疾病负担替代物的核心作用,并确定了患者选择的其他决定因素,包括年龄、性别、分期/侵袭特征和甲状腺生物标志物。年龄在表型间也存在差异。重要地,成像管线强调小结节大小是CT驱动分类的关键实际限制,支持旨在最小化无效暴露、简化向替代策略过渡并迈向更个性化治疗规划的选择范式。方案、活度选择、剂量测定和生物动力学:个体化
131I剂量测定可帮助最大化肿瘤剂量同时保持在安全限值内,但“完整”方案通常耗时,是常规使用的重大障碍。近期AI研究集中于在实践限制下实现个体化剂量测定和活度选择。Georgiou等人(2024)使用前馈深度学习神经网络预测最大允许活度(MPA),支持通过省略晚期时间点压缩方案。Jalilifar等人(2025)比较多种ML方法,多层感知器(MLP)在预测器官吸收剂量方面表现最佳,针对SPECT/CT GATE Monte Carlo地面真值验证。Ciucci等人(2024)使用两阶段集成稳定稀疏/噪声采样下的时间积分活度,ML分类器选择单指数或双指数动力学,提升鲁棒性。Popovic等人(2021)将监督分类应用于术后规划,人工神经网络(ANN)最佳复现专家活度类别决策,并改善初级医师一致性,展示作为决策支持和培训/标准化工具的效用。总体而言,这些研究表明AI可通过缩短剂量测定工作流程、从可及成像近似高保真度剂量测定、使用有限时间点改善τ估计以及标准化活度选择来支持临床可操作的RAIT管理,但外部验证仍可变,性能限制集中在解剖或动力学挑战性病例。安全、辐射暴露和门诊管理:治疗后的辐射防护考虑延伸至家庭接触者,并影响服务提供,因为住院隔离能力和出院时机取决于残留活度和剂量率约束。两项研究评估了数据驱动方法以支持出院决策和门诊后勤。Ebrahimi等人(2018)追求个体化第三方剂量测定,训练前馈神经网络,使用直接相对剂量测量和患者剂量率动力学,网络在识别高风险亲属方面带来意外改进(>1 mSv:AUC 0.957 vs 0.633),突出了风险分层咨询和定制限制的实用作用。Zhang等人(2025)解决互补操作终点:在国家标准残留活度阈值下48小时出院资格。他们拟合指数衰减模型至连续残留活度测量,估计有效半衰期,训练SVM模型,报告强辨别力(AUC 0.92),支持更早规划隔离时长同时保持与安全限值一致。治疗评估:影像分析:Lin等人(2021)训练注意力增强CNN(Dscint)用于全身显像分类,性能高度依赖数据增强,更深架构未改善辨别力,类别平均指标掩盖了临床相关失败模式,凸显数据稀缺和标签/表型异质性作为稳健部署的关键约束。Chantadisai等人(2024)通过耦合自动ROI放射组学与正则化逻辑回归预测消融成功,放射组学未优于Tg,但组合模型主要通过更高特异性改善辨别力,重要实际限制(接近背景摄取的背景失败)集中在低Tg、有利结局病例,暗示“非信息性”图像本身可能标志着低风险。两项研究在终点、建模范式和主导技术约束上不同,但共同支持AI标准化扫描判读或从
131I影像增强结局分层的可行性,同时强调需要更强泛化性证据。DTC/PTC早期和中期治疗结局:近年来,AI研究从描述孤立预后因素发展为构建多变量预测决策支持模型。Lubin等人(2021)使用随机森林模型预测首次RAIT失败,识别预测因素包括更高治疗前Tg/TgAb水平和不良病理结果,ML方法识别了传统逻辑回归未保留的预测因素。Sa等人(2024)使用更大回顾性数据集和明确可解释管线预测有效反应和TSH抑制下生化缓解,Tg指标主导预测,同时添加来自摄取或扫描替代物的可操作贡献。Bülbül & Nak(2024)在乳头状甲状腺癌中应用多种分类器处理不平衡,提升模型仍实现良好AUC/准确性,支持ML整合许多弱预测因素为临床有用分层。治疗后内分泌管理:近期AI工作扩展到治疗后内分泌管理。Liu等人(2024)使用随机森林引导选择保留六个简单预测因素,SVR表现最佳,在两中心前瞻性实施中,模型预测剂量在RAIT后第2天启动,显著增加早期达到ATA风险适应TSH目标的比率并缩短达目标时间,展示了决策支持的临床益处。Ngan等人(2025)反映高维EMR建模趋势,Extra Trees回归器实现强内部剂量预测性能,BMI和合并症负担成为主导驱动因素。良性甲状腺功能亢进症应用:尽管AI研究在DTC中占主导,优化非恶性甲状腺疾病中的RAIT管理仍具临床重要性。Duan等人(2022)回顾性分析Graves病患者,使用ML预测6个月时甲减,构建7变量模型,辨别力中等,支持个体化治疗后监测和更早规划甲状腺激素替代。Wang等人(2025)开发基于AI的工具自动分割CT上的甲状腺,计算患者特异性辐射剂量,MSRA-UNet++在分割准确性上优于标准UNet++,并生成不确定性图,当AI衍生分割用于剂量测定时,传统Marinelli-Quimby公式高估了吸收剂量,表明几何感知剂量计算可改善良性甲状腺疾病中的活度规划。长期随访:复发预测和风险分层:应用AI预测DTC中RAIT后结局的研究集中于治疗后复发风险分层,采用多种方法学范式。Wang等人(2024)收集29个潜在输入变量,训练多种模型,实现中等辨别力,但优于ATA分层,强化了术后Tg和淋巴结负担的预期主导信号,并添加了代谢合并症的潜在新颖贡献。Kim等人(2023)使用归纳逻辑编程生成可解释IF-THEN规则,主要由连续Tg驱动,实现高特异性但较低灵敏度和弃权,与动态再分层角色一致。Jang等人(2023)应用K-means聚类推导数据驱动淋巴结截断值,分离无复发生存率,说明“AI作为截断点发现”范式。使用公共UCI数据集的研究(如Shrestha等人,Deif等人)报告高交叉验证性能,但缺乏外部验证,临床说服力有限。Triayudi等人(2025)通过结合模糊共聚类与成本敏感蒸馏至校准学生模型,并在TCGA/SEER上验证,支持便携式复发风险模型的可行性。临床而言,这些方法共同建议了更个体化RAIT后监测强度的途径,但前瞻性多中心评估仍是关键缺口。
讨论:AI方法按临床效用和建模方法的分类:24项研究中,AI方法应用于整个RAIT护理连续体,包括治疗前评估、治疗计划、辐射安全和后勤管理,以及治疗后评估和长期随访。这种全面分布表明AI可能通过从孤立、任务特定分析工具向嵌入常规工作流程的集成端到端决策支持框架转变,促进RAIT的临床范式转变。AI应用可按临床任务系统分组为:治疗前决策支持、影像判读和定量、反应和结局预测、剂量测定和活度规划、辐射安全和后勤,以及下游管理和监测。数据源和验证策略:纳入研究中,AI模型利用了异质数据流,可归纳为四个重复输入领域:核医学影像、解剖影像(主要为CT)、临床/人口统计学/实验室变量,以及剂量测定和生物动力学数据集。这种异质性凸显了AI驱动RAIT模型的固有模态多模态性。方法学和临床趋势:临床文献强烈偏向DTC,尤其是乳头状甲状腺癌,较少模型解决良性甲状腺疾病。最常针对的终点是复发或结构性疾病进展,其次是治疗反应相关结局。方法学上,DL主导图像中心任务,表格ML在复发预测、内分泌剂量估计和风险分层中占主导。重要地,越来越多研究强调可解释性和临床透明度,使用基于规则的系统、SHAP解释或蒸馏框架,标志着从纯黑箱模型向决策支持工具的转变。实施障碍和未来方向:主要障碍包括泛化性、可解释性、工作流程整合和治理问题。许多模型在回顾性、单中心数据集上训练,增加了数据集偏移和性能下降风险。中国队列占主导可能影响发现代表性,需更多跨地理人群研究。终点和标签异质性限制可重复性,标签质量受不完美参考标准和随访变异性约束。此外,6-24个月评估窗口可能引入时间窗口偏差。几种方法面临实际工作流程约束,如低摄取时分割失败、小病灶灵敏度降低,或依赖非常规收集的剂量测定输入。实施需要更多辨别力指标:许多研究对校准、不确定性和决策阈值报告有限,很少评估临床影响、安全权衡或临床医生应如何根据模型输出行动。AI在良性甲状腺疾病中的研究存在巨大机会缺口。关于AI在核医学中的教育角色未直接评估,但一些研究比较了AI预测器与人类专家性能,提示未来可能探索AI教育和决策支持工具。未来方向可能包括大型语言模型(LLMs)在核医学中的应用,但需严格验证和安全治理。伦理和治理考虑仍是安全整合AI的关键,包括偏见与公平、数据隐私、模型漂移、可追溯监督机制和临床责任。更广泛地,应明确AI发展的正当理由,即通过透明评估、前瞻性验证和清晰治理结构,明确旨在改善患者结局、公平性和安全性。结论:总体而言,AI应定位为临床决策支持工具,而非替代核医学专家。最大的即时临床价值在于支持重复性、数据密集和多维任务,如影像判读、风险分层、剂量测定估计、治疗反应预测和长期监测。AI可改善RAIT的工作流程效率、标准化和个体化,但仍需医师监督和最终临床解释。目前,大多数证据仍为回顾性且方法学异质,外部验证和终点定义不一致,因此尚未达到完全自主临床实施的阶段。未来进展将依赖于多中心前瞻性研究、统一报告标准、可解释AI框架以及跨不同人群和成像方案的稳健验证。