基于知识引导的多边形顶点学习与Vision Transformer的肿瘤靶区勾画

《Knowledge-Based Systems》:Knowledge-guided polygon vertex learning with Vision Transformer for tumor target delineation

【字体: 时间:2026年07月31日 来源:Knowledge-Based Systems 8.0

编辑推荐:

  Polygon-ViT采用旋转位置编码(RoPE)嵌入多边形顶点序列的旋转对称性。卷积平滑损失(CSL)分配超出交叉熵损失的空间分级信号。Polygon-ViT在两个肿瘤数据集上优于所有基线,并确认了噪声鲁棒性。

  
Polygon-ViT采用旋转位置编码(RoPE)嵌入多边形顶点序列的旋转对称性。卷积平滑损失(CSL)分配超出交叉熵损失的空间分级信号。Polygon-ViT在两个肿瘤数据集上优于所有基线,并确认了噪声鲁棒性。
**论文解读:基于知识引导的多边形顶点学习与Vision Transformer的肿瘤靶区勾画**

癌症是当前全球健康面临的重大挑战,在放射治疗计划中,精确勾画靶区组织至关重要。现有深度学习方法,如基于卷积神经网络(Convolutional Neural Network, CNN)的U-Net及其变体,虽然推动了医学图像分割的发展,但存在根本性的认识论局限:它们将肿瘤勾画视为纯统计模式识别问题,忽略了临床医生依赖的结构化领域知识。这些知识体现在三个层面:几何层面,肿瘤轮廓应具有解剖学合理的平滑、简单连通边界;结构层面,多边形顶点序列具有旋转对称性,即顶点的循环排列对应同一轮廓,但标准序列模型将其视为完全不同;临床层面,不同像素偏移的顶点具有截然不同的临床后果,而标准交叉熵损失(Cross-Entropy Loss)同等对待所有误差,提供误导性监督信号。此外,CNN方法难以处理不规则形状,且易产生非简单连通区域。多边形方法(如Polygon-RNN)虽能生成顶点序列,但受限于递归神经网络(Recurrent Neural Network, RNN)的长程依赖及并行效率问题。为此,研究人员开展了本研究,旨在将结构化临床知识显式嵌入模型设计,实现更精确、鲁棒的肿瘤靶区勾画。

研究人员提出了Polygon-ViT,一种基于Vision Transformer (ViT) 的多边形顶点学习框架,该框架在架构层面和损失函数中系统地编码了三种临床知识:全局空间上下文(通过ViT自注意力)、旋转对称性(通过旋转位置编码,Rotary Positional Embedding, RoPE)和临床容忍度(通过卷积平滑损失,Convolutional Smoothing Loss, CSL)。研究在两个数据集上验证了方法:公开的MSD胰腺肿瘤数据集(由三维图像切片为二维切片,共21,375张训练图像和5,344张测试图像)和来自安徽癌症医院的去标识宫颈癌CT专有数据集(5,951张训练图像和743张测试图像,由资深放射肿瘤学家手动勾画临床靶区体积Clinical Target Volume, CTV和肿瘤总体积Gross Tumor Volume, GTV等作为金标准)。实验结果表明,Polygon-ViT在IoU和Dice系数上均优于经典CNN方法和近期Transformer方法,并具有噪声鲁棒性。该论文发表在《Knowledge-Based Systems》。

**主要关键技术方法**(不超过250字):
本研究的关键技术包括:1) **Vision Transformer编码器**:将图像分割为子图像块,通过自注意力机制提取全局特征;2) **旋转位置编码(RoPE)**:在解码器中替代绝对位置编码,通过编码顶点间的相对角度关系,捕捉多边形顶点序列的旋转对称性,提升不规则形状的勾画能力;3) **卷积平滑损失(CSL)**:将真值顶点的独热编码通过2D卷积核平滑,根据空间欧几里得距离分配分级监督信号,区分临床可容忍的小偏差与灾难性大误差,并采用课程学习策略逐步收紧卷积核;4) **训练策略**:分四个阶段,前三阶段使用不同大小卷积核的CSL,最后阶段使用交叉熵损失,渐进优化顶点定位;5) **推断策略**:采用束搜索(beam size=3)解码顶点序列,使用起始和结束标记控制序列长度。样本队列来源包括MSD胰腺肿瘤公开数据集和安徽癌症医院专有宫颈癌CT数据集(专家手动勾画金标准)。

**研究结果**(保留每个小标题):

**4.1 数据集**:研究使用了两个数据集,分别为MSD胰腺肿瘤数据集(来自公开资源)和宫颈癌CT专有数据集(来自安徽癌症医院,由资深放射肿瘤学家手动勾画CTV、GTV等作为金标准)。实验旨在评估方法在不同肿瘤类型和成像特征下的准确性与稳定性。

**4.2 对比实验**:与U-net、U-net++、MedT、SegNet、FCN(多种骨干网络)、Polygon-RNN、Polygon-RNN++及Segment Anything Model (SAM) 等基线方法对比。结果表明,Polygon-ViT在MSD胰腺肿瘤数据集上取得IoU 0.88、Dice 0.92,在宫颈癌CT数据集上取得IoU 0.90、Dice 0.93,均优于所有基线。SAM因任务不匹配(设计用于视觉显著边界而非临床靶区)仅做定性比较,显示其无法识别临床定义的靶区体积。Polygon-ViT的训练时间(6小时)显著短于MedT(92小时),且性能更高。

**4.3 消融实验**:设计两个实验分别评估CSL和RoPE的贡献。
- **4.3.1 实验设计**:第一个实验将CSL替换为标准交叉熵损失;第二个实验将RoPE替换为绝对位置编码。
- **4.3.2 结果与分析**:使用CSL时,IoU和Dice分别提升约0.03~0.05;使用RoPE时,性能提升约0.01~0.03,且不增加训练时间。证实CSL和RoPE均有效增强分割精度。

**4.4 鲁棒性分析**:向输入CT图像添加高斯噪声(标准差σ从0增至50),所有模型性能下降,但Polygon-ViT的IoU下降曲线更平缓,在高噪声区域(σ>30)稳定性优于Polygon-RNN++。这是因为ViT的全局感受野能利用长程依赖,而RoPE增强了轮廓对抗噪声的鲁棒性。

**总结讨论部分**:研究人员在讨论中指出,Polygon-ViT通过系统地编码三种结构化临床知识(全局空间上下文、旋转对称性、位置容忍度),在放疗靶区勾画中实现了精确且鲁棒的性能。其结构化多边形输出为放射肿瘤学家提供了直接编辑轮廓的灵活性,有望简化放疗计划流程。同时指出了当前局限性:单多边形范式仅支持简单连通边界,不适用于多叶肿瘤或卫星结节;小靶区和低对比度边界易出现误差。未来方向包括扩展至原生三维体表示、引入基于标注者一致性的可学习平滑核、研究多多边形解码策略以实现非简单连通拓扑、以及跨模态泛化至MRI和PET成像。此外,计划进行前瞻性临床验证,包括放射肿瘤学家的定性评估和观察者间变异性研究。

**研究结论翻译**:
本研究提出了Polygon-ViT,一种知识引导的语义分割框架,用于放射治疗计划中肿瘤靶区的精确勾画。通过系统地编码三种形式的结构化临床知识——即通过ViT自注意力编码全局空间上下文、通过RoPE编码旋转对称性、通过CSL编码位置容忍度约定——Polygon-ViT在MSD胰腺肿瘤数据集上达到IoU/Dice为0.88/0.92,在宫颈癌CT数据集上达到0.90/0.93,一致优于经典CNN方法和近期先进的Transformer方法。Polygon-ViT在勾画精度方面具有显著优势,同时简化了放射治疗计划工作流程。其结构化多边形输出为放射肿瘤学家提供了直接编辑轮廓的灵活性,使其适用于多种癌症类型和成像场景。未来工作将探索多个方向以解决当前框架的局限性:首先,扩展至原生三维体表示可实现直接勾画肿瘤体积而非逐层二维轮廓;其次,引入基于标注者一致性数据的可学习平滑核可进一步使监督信号与临床观察者间变异性对齐;第三,为拓宽至多叶或非简单连通肿瘤拓扑,计划研究多多边形解码策略和基于图的轮廓表示,这将消除当前单多边形范式中简单连通边界的假设;第四,将利用Polygon-ViT的模块化架构(分离图像编码与多边形解码)探索跨模态泛化至MRI和PET成像,通过模态特定的预处理或编码器适配实现。此外,将进行前瞻性临床验证,包括放射肿瘤学家的定性评估和观察者间变异性研究,以进一步确立该框架在实际放疗计划工作流程中的实践可信度。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号