患者特异性深度强化学习用于相间变化下质子束扫描输送控制

《International Journal of Particle Therapy》:Patient-specific Deep Reinforcement Learning for Proton Beam Delivery under Inter-Phase Variations

【字体: 时间:2026年07月24日 来源:International Journal of Particle Therapy 2.0

编辑推荐:

  目的:质子治疗受肿瘤运动挑战,尤其是受呼吸运动影响的肺部肿瘤。常规计划策略通过引入安全边界或使用鲁棒优化来补偿运动,增加了周围健康组织的照射。输送过程中的实时计划适应是减轻分次内运动效应的一种有前景的替代方案。材料与方法:研究人员提出一种基于患者特异性深度强化

  
目的:质子治疗受肿瘤运动挑战,尤其是受呼吸运动影响的肺部肿瘤。常规计划策略通过引入安全边界或使用鲁棒优化来补偿运动,增加了周围健康组织的照射。输送过程中的实时计划适应是减轻分次内运动效应的一种有前景的替代方案。材料与方法:研究人员提出一种基于患者特异性深度强化学习(RL)的质子笔形束扫描控制框架,作为呼吸运动下实时计划适应问题的初步探索。RL智能体在三名患者的Mid-position(MidP)计划CT上独立训练,依次控制束流位置和光斑输送。在推理时,学习到的策略在每名患者4DCT的呼吸相位上执行,无需任何在线重训练或模型参数适应。智能体接收编码目标几何、束流位置和先前光斑输送的2D观测。该方法与常规静态GTV基础和ITV基础计划策略进行比较评估。结果:与静态GTV基础计划相比,智能体通过在输送过程中利用观测中的新信息改善呼吸运动下的靶区覆盖,患者1整个治疗过程中GTV的D95GTV平均提升4.54 Gy。与ITV基础计划相比,基于RL的方法总体降低危及器官(OAR)剂量暴露,三名患者的DmeanLung-GTV平均分别降低0.42、4.12和3.14 Gy,运动幅度最大的患者3其DmeanHeart降低1.41 Gy。结论:本研究应被解释为概念验证,突出了基于RL的控制策略在分次内运动下质子治疗输送中的潜力。尽管当前框架依赖静态训练,但为未来向完全动态和适应性治疗扩展奠定了基础。
研究背景方面,质子治疗凭借高度适形剂量分布和周围健康组织 sparing 能力成为放射肿瘤学重要模态,其中笔形束扫描(Pencil Beam Scanning, PBS)通过能量调节实现体内不同深度受控输运。然而肺部肿瘤受呼吸诱导连续运动影响,分次内靶区位移与束流动态扫描产生 interplay 效应,导致靶区内剂量异质分布,尤其在大幅度或不规则呼吸下更显著。常规应对手段包括内部靶区(Internal Target Volume, ITV)构建、腹部压迫、4D鲁棒优化等运动包络法,以及呼吸门控、肿瘤追踪等在线技术,前者依赖治疗前运动建模而非实时适应,后者需准确解剖信息获取与适应决策。机器学习此前多用于离线计划优化,强化学习(Reinforcement Learning, RL)虽在放疗分数化、射束方向优化中探索,但尚未用于实时PBS输送中联合适应光斑排序与权重。因此研究人员开展患者特异性深度RL(Deep RL, DRL)控制框架研究,以Mid-position(MidP)CT训练、4DCT相位推理,验证分次内运动下靶区覆盖改善与OAR剂量降低潜力,论文发表于《International Journal of Particle Therapy》。
关键技术方法上,研究人员采用比利时Cliniques Universitaires Saint-Luc三名肺癌患者4DCT(原始分辨率1.17×1.17×2 mm3,10个呼吸相位,GTV分别位于右上、右中、右下肺叶,峰值位移S-I方向最大10.6 mm),处方60 Gy/30次。框架将单束(机架270°、床角0°)各能量层分配给独立DQN智能体,观测为2D束流位置(BP)、目标掩码(TM)与已输送剂量图(SM),动作含4方向4 mm束流移动(BM)与0.5 MU光斑输送(DD),奖励融合BM距离惩罚与DD局部过量、OAR保护、GTV覆盖(DmaxGTV/DmeanGTV/DminGTV接近2 Gy)、均匀性及光斑密度约束,训练用OpenTPS+MCsquare(10?初级粒子预计算束元、10?最终计算)于MidP CT,推理直接投影各4DCT相位GTV掩码,无在线调参;对照为MidP CT上GTV基础计划(planGTV)与10相位并集体ITV基础计划(planITV)。
研究结果部分,引言指出RL此前未涉实时PBS光斑序列与权重联合适应,本研究首次以POMDP形式用2D观测控束。材料方法中三名患者运动幅度差异明确,PlanGTV与PlanITV参数完全一致。RL环境将每能量层作episode,多智能体由高至低能层顺序执行凑足2 Gy单次剂量,BP训练随机初始化、推理继上一能层终位。状态仅给BP/TM/SM三类2D矩阵,剂量与DVH仅训练内用。动作离散为BM与DD。奖励式(5)—(11)显式写出BM负距离奖、DD局部过量λover罚、OAR λOAR罚、GTV覆盖φ(z)=D??|z?D?|加权和及均匀性罚、光斑数超限罚。性能评估用D95GTV、D5GTV、DmeanLung-GTV、D2SC、V20GyLung-GTV及HI。
结果小节表明,全疗程(30×2 Gy)上planRL较planGTV的D95GTV在患者1/2/3分别+4.54/+2.20/+0.20 Gy,靶区高量D5GTV前两人降;较planITV的D95GTV分别?2.73/?6.99/?5.32 Gy但OAR更优:DmeanLung-GTV平均?0.42/?4.12/?3.13 Gy,患者2/3心D2Heart均降(7.48与30.01 Gy),仅患者1脊髓D2SC+2.36 Gy、三相位微超45 Gy限,患者3 V20GyLung-GTV 30.46%微超30%限。单步推理约2.6 ms(观测2 ms+前向0.6 ms)满足实时。讨论小节解释覆盖提升源于MidP训练学得的靶投影几何补偿,推理时随相位掩码偏移平移束位,但非路径长度/OAR形变/范围不确定性的多场景鲁棒优化,故大运动患者3收益最小且偶发OAR越界;局限含0.5 MU粗离散、单束角、2D观测理想化(假定荧光或MRI上游分割无误)、未含数据增强与多束角。结论小节翻译:本研究提出分次内RL适应输送框架,仅在单一静态解剖配置训练却动态调束位与光斑权,planRL较静态GTV计划改善靶覆盖、较ITV计划削减部分OAR照射;未来应加入不确定性场景与动态解剖变异训练、拓展多机架角、扩大队列,以迈向实时补偿分次内运动的适应性质子治疗流程。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号