综述:乳腺癌影像中的人工智能:检测、分割、可解释性与临床转化的系统综述

《Frontiers in Imaging》:Artificial intelligence in breast cancer imaging: a systematic review of detection, segmentation, explainability, and clinical translation

【字体: 时间:2026年09月04日 来源:Frontiers in Imaging

编辑推荐:

  摘要 引言:乳腺癌仍是全球女性中最常诊断的恶性肿瘤,2022年约有230万新发病例和67万死亡病例。人工智能(AI)正越来越多地应用于乳腺影像的检测、表征、分割、风险分层、可解释性和临床转化。 方法:本系统综述综合了2015年至2025年间发表的284篇符合纳

  
摘要
引言:乳腺癌仍是全球女性中最常诊断的恶性肿瘤,2022年约有230万新发病例和67万死亡病例。人工智能(AI)正越来越多地应用于乳腺影像的检测、表征、分割、风险分层、可解释性和临床转化。
方法:本系统综述综合了2015年至2025年间发表的284篇符合纳入标准的同行评审出版物,这些文献通过符合PRISMA 2020标准的四个索引数据库检索确定。补充的相关性排序Google Scholar筛查单独报告。还于2026年5月进行了一项针对近期前瞻性和实施研究的有针对性的叙述性更新,但未将这些记录纳入PRISMA分母。
结果:综述证据涵盖经典机器学习和影像组学、卷积神经网络、YOLO系列检测器、视觉Transformer以及混合CNN-Transformer架构、U-Net变体、Mask R-CNN、SAM和MedSAM,应用于乳腺X线摄影、断层合成、MRI、超声、对比增强乳腺X线摄影和新兴光声成像。证据凸显了可解释AI、多模态和影像基因组学融合、联邦学习以及开源部署方面的进展,而持续存在的挑战包括数据异质性、类别不平衡、域偏移、偏倚、校准不完善以及前瞻性验证有限。回顾性基准发现来自284项研究的系统语料库,而前瞻性临床效用和真实世界实施则由单独的2026年叙述性更新提供信息。
讨论:AI显示出增强乳腺癌影像的巨大潜力,但更广泛的临床转化需要稳健的外部验证和前瞻性验证、改进的校准、泛化性和偏倚评估,以及整合到临床工作流程中。补充数据表S1应被解释为带来源标记的证据图谱,而非正式的研究层面偏倚风险评估,其中38条条目经全文核实,48条基于摘要,198条基于DOI/来源页面或其他网络可获取记录。
1 引言
乳腺癌仍是全球女性中最常诊断的恶性肿瘤,2022年约有230万新发病例和67万死亡病例。由于人口老龄化、生育模式改变以及影像基础设施有限地区的晚期诊断,疾病负担持续增长。延迟诊断使肿瘤从局限性疾病进展为区域或远处转移,此时治疗变得更加复杂,生存率显著下降。局限期疾病的5年相对生存率接近99%,区域期为86%,远处期为28%,因此早期检测对改善预后至关重要。
人工判读是诊断误差的另一个主要来源。在回顾性审计中,感知错误估计占漏诊的60%?80%,高工作量报告期间的疲劳会降低放射科医生表现。搜索满足感偏倚、细微结构扭曲和细小微钙化进一步增加了诊断难度。阅片者间变异性(经验丰富的放射科医生Cohen's kappa约为0.4–0.6)影响召回和活检阈值。更广泛的乳腺影像生态系统增加了模态特异性复杂性:断层合成减少组织叠加;动态对比增强MRI提供高敏感性和中等特异性,但成本高昂;超声支持活检引导和补充筛查,但依赖操作者;对比增强乳腺X线摄影、分子乳腺成像和光声成像增加功能或血管信息。
人工智能,尤其是深度学习,已成为整个诊断谱系中的变革性辅助技术。方法学格局涵盖了过去十年中快速演进的多种架构范式。经典机器学习和影像组学在数据稀缺情境和可解释影像基因组学生物标志物发现中仍具相关性。卷积神经网络利用图像数据的空间结构进行层级局部特征提取,自ImageNet深度学习突破以来主导了乳腺影像AI。单阶段YOLO检测框架将病变定位表述为直接回归问题,实现快速推理,适合实时检测工作流。视觉Transformer对图像块序列应用全局自注意力,并推动了用于医学图像分析的混合CNN-Transformer方法。专门的编码器-解码器分割架构(包括U-Net和Transformer增强变体)已成为跨医学成像任务的病变边界描绘基础。
这些AI进展的转化潜力已日益从研究演示转向前瞻性临床评估和早期实施。多个AI影像系统已获得监管许可或被美国食品药品监督管理局列入AI/ML医疗器械清单。商业乳腺X线摄影AI系统的外部评估表明,AI可支持筛查判读,尽管前瞻性效用、工作流效应和部署环境仍是临床价值的关键决定因素。近期证据进一步强化了这一转化方向:最终MASAI随机试验报告AI支持乳腺筛查的非劣效间期癌发生率、更高敏感性和不变特异性;韩国AI-STREAM前瞻性多中心队列报告癌症检出率增加13.8%而无显著召回率增加;AITIC配对非劣效试验显示部分自主AI分诊将放射科医生工作量减少63.6%并提高癌症检出,尽管总体队列召回率增加。尽管监管取得进展,临床采用仍不均匀,受PACS和电子健康记录整合挑战、不明确的报销路径以及放射科医生对可解释性和泛化性的持续关切所制约。
可解释性方法(包括显著性图、病变定位输出、分割掩模、注意力可视化和基于案例的可解释性)因此成为乳腺影像AI评估的重要组成部分,支持空间透明度、失败分析和放射科医生审查,在高风险AI监管和医疗器械评估背景下尤甚。同时,算法公平性已成为监管和伦理要求,因为非代表性医学影像数据集可产生有偏分类器,而联邦学习框架解决了在不集中敏感患者数据的情况下跨机构构建泛化模型的补充隐私挑战。
开放获取资源也加速了该领域发展。公共数据集(包括CBIS-DDSM、INbreast、VinDr-Mammo、BUSI、Duke Breast Cancer MRI和EMBED)支持可重复基准测试和公平性审计。开源系统(如Mirai、nnU-Net和MedSAM)允许本地验证,而Streamlit、Flask、Gradio和TensorFlow.js支持轻量级或基于浏览器的部署。这些资源使乳腺影像AI民主化,尽管大多数研究仍为回顾性,且在外部验证、公平性评估、可解释性和工作流评估方面不一致。
本综述其余部分组织如下:第2节描述PRISMA指导的方法学、PICOS框架、检索策略、研究选择、数据提取和综合方法。第3节呈现结果和证据综合,包括临床依据、基准数据集、成像模态、从经典机器学习到视觉Transformer和分割架构的AI模型族、可解释性方法、多模态融合、网络部署平台以及结构化证据质量和方法学局限性评估。第4节讨论挑战、综述局限性和未来研究优先事项。第5节总结综述。
2 方法
2.1 报告指南和方案注册
本系统综述按照PRISMA 2020指南进行和报告。方案未前瞻性注册,这被承认为综述局限性。为在缺乏注册的情况下最大化可重复性,修订版手稿提供了完整的数据库特定检索字符串、检索日期、记录数、筛选流程、PICOS资格标准、数据提取字段、来源溯源规则以及预定义的证据质量和方法学局限性标准(见正文和补充材料)。只有报告定量乳腺影像AI结果的同行评审原创期刊文章和完整会议论文才有资格纳入284项研究的系统证据库。无结果方案、系统或叙述性综述、无预测模型评估的数据集或资源描述、预印本、部署框架、监管列表、通用算法和非乳腺特定方法学来源仅作为背景或技术背景引用,不计入PRISMA分母,并在适用时单独列于补充表S9。PRISMA 2020流程图见图1。
2.2 PICOS框架
资格标准按PICOS框架构建如下。人群:接受乳腺影像筛查、诊断或治疗监测的成年女性(年龄18岁及以上);排除儿科人群研究,详见表1。干预:任何应用于乳腺影像数据的人工智能、机器学习或深度学习方法,用于检测、分类、分割、风险预测或可解释性。比较:人类放射科医生表现、传统计算机辅助检测系统、经典机器学习基线或无比较;纳入单臂研究但解释为较低级别证据。结局:主要结局为诊断准确性指标,包括受试者工作特征曲线下面积(AUC)、敏感性、特异性和F1分数;次要结局为分割性能(Dice系数、Hausdorff距离和IoU)、风险预测性能(C指数、校准)和临床效用指标(工作量减少、阅读时间)。环境:任何临床或研究影像环境,包括单机构回顾性研究、多机构前瞻性试验和挑战赛基准。
2.3 检索策略和研究选择
在PubMed/MEDLINE、Scopus、IEEE Xplore和Web of Science核心合集中对2015年1月至2025年12月发布的出版物进行了系统检索,使用与乳腺癌、乳腺X线摄影、MRI、超声、深度学习、机器学习、YOLO、视觉Transformer、分割、可解释AI、影像组学和计算机辅助诊断相关的术语。每个数据库使用数据库特定语法和字段标签独立查询;完整逐字检索字符串、检索日期和检索记录数见补充表S7。公共数据集的持久访问链接或标识符列于补充表S3。四个索引数据库检索于2025年12月15日最后运行,去重前识别了8,580条记录。由于Google Scholar不支持稳定的布尔导出或可靠去重检索,仅将前300条相关性排序的Google Scholar记录作为补充来源进行筛选,以识别可能遗漏的研究,未加入主要PRISMA数据库分母。去除2,668条重复记录后,筛选了5,912条记录;标题/摘要筛除4,065条;寻求并评估了1,847篇全文;284项同行评审研究符合纳入标准。为直接解决补充Google Scholar筛选是否对定量语料库有贡献的问题,300条相关性排序的Google Scholar记录中无一产生符合条件的研究被添加到284项研究定量语料库。284项纳入研究完全来自四个索引数据库,Google Scholar筛选仅作为完整性检查;其发现的任何条目要么已被索引数据库检索捕获,要么(若未被索引)仅保留用于定性或叙述性背景化,并列入仅背景来源(补充表S9)。
修订期间,作为事后质量控制评估,两名研究者独立重新评估了计算机生成的5,912条标题和摘要记录中的随机样本591条(10.0%)以及1,847篇全文报告中的185篇(10.0%),使用预定义资格标准,每名研究者对另一名研究者的初始决定设盲。研究者间一致性根据共识讨论前记录的初始纳入和排除决定计算。研究者在591条标题和摘要记录中一致443条(75.0%),在185篇全文报告中一致157篇(84.9%)。所有提取差异在最终综合前通过共识解决。鉴于处理的记录量(识别8,580条;去重后筛选5,912条;评估全文1,847篇),对整个语料库进行完全独立的双重复筛选和提取(如Cochrane式系统综述所建议)对该单团队综述而言在操作上不可行。因此,主要筛选由一名研究者进行,并使用设盲的计算机生成随机双重筛选样本(标题/摘要和全文阶段各10%)来量化研究者间可靠性,而非重复整个筛选过程。这是资源驱动的有意偏离完全双重独立筛选,并承认为本综述的局限性;这也是为何评估被描述为结构化证据质量评估而非正式偏倚风险评估。未使用自动化筛选或AI辅助分诊工具。针对性叙述性更新于2026年5月20日检索,使用相同概念块但限于近期前瞻性、多中心和实施研究;这些记录在临床转化讨论中叙述性整合,未加入PRISMA分母。
2.4 数据提取和综合
对每项纳入研究,综述记录了出版年份、成像模态、数据集/来源、样本量、模型架构、任务类型、验证策略、比较者或参考标准、主要性能指标、可解释性方法、开源/代码可用性、部署状态、监管许可状态和方法学局限性。284项纳入研究的资格确定使用完整报告。全文资格审查和后续补充数据表S1的扩展是不同过程。补充数据表S1因此现在被描述为研究层面证据图谱和提取验证日志,而非完整全文提取数据集。证据图谱保留用于验证每行的来源,并包含明确的全文验证状态。284条条目中,38条经全文核实,48条基于摘要,198条基于DOI/来源页面或其他网络可获取记录。对于未经完整报告核实的条目,电子表格现说明信息受来源限制。在这些行中,“未报告”仅表示在咨询来源中未识别该项目;不解释为全文文章缺少该特征的证据。此类条目未被赋予确定性的研究层面方法学质量判断。
第二名研究者独立检查了284项纳入研究中的57项(20.1%),涉及预定义核心字段,包括成像模态、数据集、模型架构、任务、验证设计、比较者、性能指标和方法学局限性信息。此质量控制评估中识别的所有差异均通过共识解决。此研究者间可靠性检查不同于上述每研究全文验证状态:前者量化两名研究者在研究样本上的一致性,后者记录每行证据图谱咨询的来源类型(全文、摘要或来源记录)。由于未对全部284篇全文报告逐一应用经过验证的QUADAS-2或PROBAST工具,本综述不再将评估描述为正式偏倚风险评估。相反,证据使用预定义的综述特定标准进行背景化,涵盖人群和参与者选择、索引模型开发、参考标准、验证独立性、流程和时间安排、报告透明度、校准和亚组报告以及临床适用性。操作标准见补充表S1。由于模态、数据集、架构、终点、验证方案和报告质量存在显著异质性,未进行定量荟萃分析。发现以叙述性综合并按证据水平加权,前瞻性和外部验证研究比单机构回顾性基准更具解释权重。
3 结果和证据综合
除非另有说明,模型族部分报告的性能值代表回顾性、数据集特定基准,而非临床就绪证据;非汇总定量范围总结见补充表S4。代表性研究层面证据图谱条目见补充表S8,未来研究最低报告清单见补充表S6。为使每篇引用工作的约束条件明确,模型族文献表中研究的主要方法学局限性和证据质量背景报告于补充表S2。补充数据表S1提供所有284项研究的来源标记证据图谱字段,并识别哪些行经全文核实。
3.1 流行病学和临床依据
根据GLOBOCAN 2022,乳腺癌占全球所有新发癌症病例的11.6%,2022年约230万例和67万例死亡。发病率在澳大利亚和新西兰、北美和北欧最高,但死亡率与发病率之比在撒哈拉以南非洲和南亚部分地区显著更高,反映了早期检测和治疗基础设施获取方面的巨大全球不平等。经济负担估计每年直接医疗成本达880亿美元。基于人群的筛查在随机试验中使死亡率降低15%?25%,但在致密乳腺中性能显著下降,敏感性降至48%。每轮10%?12%的假阳性率产生不必要的手术和显著患者焦虑,而经验丰富放射科医生间的阅片者一致性仅为Cohen's kappa 0.4至0.6。前瞻性和实施研究表明,AI辅助筛查工作流可减少放射科医生工作量,同时维持或改善选定筛查性能指标,尽管获益幅度取决于研究设计、阈值设定和临床工作流。
3.2 乳腺癌AI的公开可用基准数据集
乳腺癌AI研究的可重复性和泛化性关键依赖于精心策划、开放可访问的基准数据集。标准化公共数据集可实现一致评估,促进跨研究比较,并允许资源有限环境中的研究者无需前瞻性数据收集的时间、成本和高复杂度即可开发和验证AI系统。本节按成像模态全面回顾主要公开可用数据集,随后提供快速参考汇总表。
3.2.1 乳腺X线摄影数据集
乳腺筛查数字数据库(DDSM)包含2,620项数字化胶片乳腺X线摄影研究,约对应10,480张图像,具有肿块和钙化标注,是基础CAD基准。CBIS-DDSM将DDSM的精选子集重新格式化为标准化DICOM,具有验证ROI、BI-RADS评估和病理标签,成为最广泛使用的乳腺X线摄影AI数据集之一。INbreast提供115例全视野数字乳腺X线摄影病例,410张图像,具有高质量XML标注。VinDr-Mammo包含5,000次四视图检查,对应20,000张图像,具有BI-RADS共识标签。RSNA 2022乳腺X线摄影数据集包含54,706张筛查乳腺X线摄影图像。EMBED约340万张乳腺X线摄影图像并链接人口统计学元数据,是公平性研究核心,而CMMD增加了活检证实的中国病例。
3.2.2 乳腺MRI和超声数据集
对于乳腺MRI研究,Duke Breast Cancer MRI数据集可通过TCIA访问,提供922次治疗前动态对比增强MRI检查,具有专家肿瘤分割、临床元数据和链接基因组数据,是病变分类和影像基因组学关联研究的主要基准。ISPY1和ISPY2试验数据集也可通过TCIA获取,提供新辅助化疗试验的纵向DCE-MRI,具有病理完全缓解标签,支持治疗反应预测研究。在乳腺超声方面,乳腺超声图像数据集(BUSI)包含780张正常、良性和恶性类别的图像,具有像素级分割掩模,已成为标准超声基准并在Kaggle上免费提供。UDIAT基准数据集包含163张B模式超声图像,具有西班牙UDIAT诊断中心的专家分割掩模,STU医院数据集包含733张超声图像和二元病变掩模,提供额外分割基准;两者均可通过机构请求或GitHub仓库获取。
3.2.3 组织病理学和多模态数据集
对于组织病理学图像分析,BreakHis数据集包含7,909张显微镜图像,覆盖巴西P&D实验室的八个肿瘤亚型和四个放大倍数,可从巴拉那联邦大学公开获取,提供乳腺组织病理学标准多类别分类基准。乳腺癌语义分割数据集(BCSS)托管于TCIA,知识共享许可,为TCGA全玻片图像提取的20,000多个补丁提供五个组织类别的像素级标注。CAMELYON16和CAMELYON17挑战赛数据集提供淋巴结切片全玻片图像,用于转移检测和患者层面分类。对于多模态和影像基因组学研究,TCGA-BRCA数据集提供1,098名乳腺癌患者的链接基因组、蛋白质组、临床和影像数据,支持影像表型与分子肿瘤谱的整合分析。
3.3 成像模态和AI增强
乳腺癌诊断路径中使用多种成像模态生态系统,每种模态为AI增强创造不同机会。数字乳腺X线摄影仍是基于人群筛查的基石,通常成为CNN、YOLO系列检测器、视觉Transformer和风险预测模型用于病变检测、分类、定位和筛查分诊的目标。数字乳腺断层合成将乳腺X线摄影扩展到准三维成像,AI可支持切片聚合、容积病变检测和阅读时间减少。动态对比增强MRI为浸润性癌症检测提供高敏感性,非常适合影像组学、动力学增强分析、CNN分类和多模态融合,尽管成本和方案变异性限制广泛部署。乳腺超声是补充筛查和活检引导的核心,AI应用集中于病变分类、边缘评估、实时检测和基于U-Net的分割。对比增强乳腺X线摄影、分子乳腺成像、PET/CT和光声成像作为公共AI基准较少建立,但提供可能支持未来多模态决策支持系统的互补功能、代谢或血管信息。
3.4 经典机器学习和影像组学
经典机器学习和影像组学在乳腺影像AI中仍然重要,因为它们提供结构化、基于特征的表征,通常比端到端深度学习模型更可解释。影像组学流程通常提取一阶强度、形状、纹理和高阶变换特征,然后应用逻辑回归、支持向量机、随机森林或梯度提升模型等分类器。van Griethuysen等人引入了PyRadiomics,一个用于标准化影像组学特征提取的开源Python包。尽管PyRadiomics不是乳腺癌特定诊断模型,它提供跨MRI、乳腺X线摄影、超声、CT和组织病理学的可重复影像组学特征提取,支持透明特征层面解释和可重复影像组学研究。它不报告诊断AUC、敏感性或特异性,因为它是特征提取框架而非训练分类器。
Saha等人使用922名浸润性乳腺癌患者和术前动态对比增强乳腺MRI开发了机器学习影像基因组学分析。其算法从肿瘤和周围组织提取529个影像特征,在461名患者上训练模型,并在剩余461名患者上评估以预测分子亚型、ER、PR、HER2状态和Ki-67增殖状态。研究证明MRI衍生定量特征与分子/基因组生物标志物之间存在中等关联,支持非侵入性影像基因组学评估的可行性。其优势是大队列和公共TCIA链接数据集,但不应呈现为临床部署的诊断系统;未提供网络应用或实时临床界面。
Grimm等人使用275名乳腺癌患者的常规术前乳腺MRI研究计算影像基因组学。研究使用计算机视觉衍生的MRI特征检查与分子亚型(特别是luminal A和luminal B疾病)的关联。发现显示乳腺MRI影像表型与分子亚型相关肿瘤生物学相关,支持乳腺MRI影像基因组学的理论基础。然而,该工作应描述为基于关联的影像基因组学研究而非独立诊断分类器;因此除非直接取自原始论文,不应指定单一AUC、敏感性、特异性或Dice分数。未报告临床网络应用或开源部署。
临床试验数据集和公共存储库(如Duke Breast Cancer MRI、I-SPY和TCGA-BRCA)为可重复乳腺影像组学和影像基因组学提供最强基础。这些资源允许影像特征与分子亚型、治疗反应和临床结局关联。然而,跨研究比较仍然困难,因为影像组学性能高度依赖于采集方案、分割质量、特征协调、模型选择和验证策略。因此,除非包括外部验证、透明特征选择程序和公开代码,应谨慎解释影像组学研究。
3.5 卷积神经网络
自AlexNet以来,CNN主导了乳腺影像AI。其使用局部感受野、权重共享和层级特征使其非常适合空间模式识别,而ImageNet迁移学习在标记医学数据集有限时仍是常见策略。
McKinney等人开发了深度学习乳腺X线摄影系统,并在英国和美国的独立筛查队列中回顾性评估。与历史临床判读相比,系统在英国假阳性绝对减少1.2%,美国减少5.7%,假阴性绝对减少分别为2.7%和9.4%。在涉及六名放射科医生的独立阅片者研究中,AI系统AUC为0.871,而平均阅片者AUC为0.750。模拟英国双重阅读工作流维持非劣效性能,同时将第二阅片者工作量减少88%。这些结果提供强有力的回顾性外部证据,但研究非前瞻性临床部署试验,训练代码和模型未公开发布。
Shen等人开发了端到端全卷积网络用于筛查乳腺X线摄影的乳腺癌检测。在独立DDSM测试集上,四模型平均实现每图像AUC 0.91、敏感性86.1%和特异性80.1%。在INbreast上迁移和微调后,相应AUC为0.98,敏感性86.7%,特异性96.1%。作者发布了实现资源,支持可重复性,尽管证据仍为回顾性和基于基准而非前瞻性临床验证。
Yala等人引入了Mirai,一种多视图深度学习模型,旨在从筛查乳腺X线摄影预测多个未来时间点的乳腺癌风险。模型使用马萨诸塞总医院数据开发,并在马萨诸塞总医院、瑞典Karolinska和台湾长庚纪念医院的持有队列上评估,C指数分别为0.76、0.81和0.79。Mirai在可获得直接比较时优于既定临床风险模型,并以MIT许可发布为开源实现。然而,研究为回顾性,专用病变层面解释非核心组件,临床使用前仍需本地校准和前瞻性工作流评估。
Ribli等人将Faster R-CNN应用于DDSM和INbreast组合数据集进行病变检测和恶性分类,使用ImageNet预训练的VGG-16骨干,实现AUC 0.95,FROC性能较先前最先进提高10%;边界框预测作为隐式空间解释,完整代码库和预训练权重在GitHub发布,实现乳腺影像最早的可重复深度学习基准之一,促进数十项后续比较研究;未开发专用网络应用,但GitHub实现已被多个研究环境改编用于临床评估。
Lu等人提出具有对象上下文注意力的多任务学习网络(MTL-OCA),用于乳腺超声图像自动联合分割和分类。模型使用Res-UNet骨干和对象上下文注意力模块细化病变分割掩模,分类分支预测正常、良性和恶性类别。方法在OASBUD数据集上使用5折交叉验证评估,并在UDIAT数据集上进一步测试。OASBUD上,MTL-OCA实现Dice 83.75%、IoU 72.03%和分类准确性91.67%。UDIAT上,实现Dice 84.85%、IoU 73.68%和分类准确性94.79%。对于UDIAT分类,模型报告良性类精确率、敏感性、特异性和F1分数分别为0.958、0.964、0.913和0.961,恶性类分别为0.931、0.943、0.962和0.937。使用Grad-CAM热图支持可解释性,但未报告独立临床网络应用。
Hu等人使用来自616名女性927个病变的DCE-MRI和T2加权MRI序列开发了多参数乳腺MRI的深度迁移学习计算机辅助诊断框架。使用预训练CNN进行特征提取,训练支持向量机分类器,使用单序列和多参数融合策略区分良恶性病变。研究报告DCE-MRI单独AUC 0.85、T2加权MRI单独0.78、图像融合0.85、特征融合0.87和分类器融合0.86,显示多参数MRI信息的特征层面整合较单序列分析改善诊断性能。未报告Grad-CAM++、CBAM模块、公共临床网络应用或前瞻性部署。
Leong等人使用自适应迁移学习深度卷积神经网络研究乳腺X线摄影微钙化判别。研究在模型训练前对含微钙化的感兴趣区乳腺X线摄影图像应用图像滤波以减少伪影和噪声。比较多种CNN架构,包括ResNet50、ResNet34、VGG16和AlexNet,进行超参数调优。最佳模型为微调ResNet50,准确性97.58%,其次ResNet34 97.35%、VGG16 96.97%和AlexNet 83.06%。使用混淆矩阵进行模型比较,但未报告显式临床网络应用、公共部署界面或Grad-CAM等XAI方法。此研究与早期乳腺癌检测相关,因为微钙化是筛查乳腺X线摄影中通常难以识别的小型空间分散异常。
Lotter等人展示了基于ResNet的注释高效检测方法用于乳腺X线摄影和数字乳腺断层合成,显示通过利用病例层面监督可大幅减少每个病变注释获得竞争性检测性能(乳腺X线摄影AUC 0.94,DBT AUC 0.93);报告Grad-CAM用于检测定位;方法在Nature Medicine中详细描述并附补充代码,支持复现;临床适用性在扩展AI开发到无大量注释预算中心的背景下讨论。
Calisto等人开发了BreastScreening,一种整合乳腺X线摄影、超声和MRI的多模态界面用于诊断工作流支持。用31名临床医生和566张图像评估,集中于可用性、可视化、工作量、阅读时间和BI-RADS相关决策支持而非自主分类。因此,AUC、敏感性、特异性、Dice和F1分数不适用。
Ha等人微调ResNet-50在216名患者的私有MRI数据集上预测分子亚型,报告luminal A与其他亚型AUC 0.87。可视化激活图,但未报告正式XAI、公共数据发布和代码共享。容积乳腺成像可能受益于3D CNN,但公共DBT基准、外部验证和标准化容积可解释性仍然有限。
3.6 基于YOLO的实时检测
You Only Look Once(YOLO)系列单阶段目标检测架构因其在快速推理流程中结合病变定位和分类而吸引乳腺影像应用。然而,证据应保守呈现:经核实的乳腺影像应用最强于乳腺X线摄影肿块检测/分类和较近期超声分割,而应避免对每个连续YOLO版本的主张,除非具体乳腺影像文章被独立核实。
Al-Masni等人提出了最早的基于YOLO的CAD系统之一,用于数字乳腺X线摄影同步乳腺肿块检测和良恶性分类。使用600张原始DDSM乳腺X线摄影和2,400张增强乳腺X线摄影,系统在五折交叉验证下实现99.7%肿块检测准确性和97.0%良恶性分类准确性。此研究证明统一YOLO检测-分类流程的可行性,尽管仍是回顾性基准研究而非前瞻性筛查证据。
Aly等人将基于YOLO的CAD扩展到全视野数字乳腺X线摄影,并在INbreast上比较YOLOv1、YOLOv2和YOLOv3配置。其最佳YOLOv3设置检测89.4%肿块,良性肿块平均精确率94.2%,恶性84.6%。当YOLO分类网络替换为ResNet和InceptionV3特征提取器时,总体分类准确性分别达91.0%和95.5%。此工作支持锚点优化和训练集增强对乳腺X线摄影肿块检测的有用性,但未报告外部临床验证。
Karaca Aydemir等人提出YOLOv5-CAD框架,使用跨CBIS-DDSM、VinDr-Mammo、INbreast、MIAS和私有队列的迁移学习。五折交叉验证中,从CBIS-DDSM到INbreast的迁移学习实现mAP 0.843、精确率0.855、召回率0.774和14.8 ms推理时间。从VinDr-Mammo到INbreast的迁移学习实现mAP 0.840、精确率0.829、召回率0.787和16.54 ms推理时间。外部数据集测试时,最佳模型在MIAS上mAP 0.756,私有队列0.816,显示有前景但仍为回顾性的泛化。
Lan等人提出改进YOLOv8-GHOST-P2模型用于MIAS和DDSM乳腺肿块病变区域检测。与标准YOLOv8相比,改进模型F1分数分别为98.38、98.80和98.57%,模型参数减少42.9、46.64和2.8%,取决于模型变体。这些结果表明高效乳腺X线摄影病变检测的计算优势,但证据仍为数据集特定。
Mostafa等人使用BUSI数据集评估改编YOLOv8用于超声图像乳腺肿瘤分割。研究比较组合类别训练和单独良性/恶性训练,报告改编YOLOv8在按病变类别分别训练时F1分数从93.44%提高至95.29%,Dice系数从82.10%提高至84.40%。此工作说明YOLO系列模型从乳腺X线摄影检测扩展到超声分割,尽管仍是研究原型而非部署临床软件。
因此,本综述将YOLO系列方法视为快速检测和定位框架,具有有前景的回顾性证据,但非统一验证的临床系统。报告性能应结合数据集大小、增强策略、病变类型、标注质量、成像模态和外部验证状态解释。特别是,在单一基准或重度增强数据集上报告的极高分类和检测准确性(例如增强DDSM上99.7%肿块检测准确性)应理解为内部、数据集特定基准值,具有过拟合和乐观偏倚的实质风险。此类数字不代表临床敏感性或特异性,不能假定转移到前瞻性多供应商筛查人群而无外部验证。
3.7 视觉Transformer和混合架构
视觉Transformer(ViT)将图像划分为固定大小补丁并作为令牌序列通过自注意力处理,重构图像分析。此设计非常适合乳腺影像,因为长距离空间关系、双侧不对称、多灶性疾病和容积上下文难以仅使用局部卷积滤波器捕获。然而,ViT本身应视为架构层面参考而非乳腺癌特定诊断模型,因其原始验证在通用计算机视觉基准而非乳腺影像数据集上进行。
应明确区分通用基准架构和直接在乳腺影像上评估的模型。ViT、Swin Transformer、TransUNet和Swin UNETR是基础架构,其原始验证使用通用计算机视觉或非乳腺医学基准(例如ImageNet、多器官CT、ACDC心脏MRI和BraTS脑MRI),此处仅作为架构层面参考引用。相比之下,CoAtUNet在乳腺超声(UDIAT和BUSI)上开发和评估,交叉注意力融合模型在乳腺X线摄影和临床数据上评估;这两个条目构成该表中的乳腺特定证据,后者仅报告为arXiv预印本。
Liu等人引入Swin Transformer,通过层级特征图和移位窗口自注意力提高基于Transformer的图像分析可扩展性。此架构与高分辨率医学成像特别相关,因为它减少全局自注意力的计算成本,同时保留长距离上下文建模。本综述中,Swin Transformer因此被引用为启发后来乳腺影像改编的基础架构,而非乳腺癌症临床诊断性能的直接证据。
Chen等人开发TransUNet,一种混合CNN-Transformer分割架构,整合卷积特征提取和基于Transformer的全局上下文建模。原始TransUNet工作引入用于医学图像分割的Transformer编码器,而后续Medical Image Analysis论文通过自注意力和交叉注意力重新思考编码器和解码器设计来扩展框架。这些研究与乳腺影像相关,因为它们提供经验证的病变分割设计模板。然而,其报告性能不应解释为乳腺特定,除非模型直接在乳腺数据集上评估。
Hatamizadeh等人提出Swin UNETR,一种使用层级Swin Transformer编码器通过跳跃连接连接到卷积解码器的3D Transformer分割框架。模型为脑肿瘤MRI分割开发,在BraTS 2021验证实验中位列顶级方法。它可用作3D成像任务(如乳腺MRI或数字乳腺断层合成)的容积医学分割参考,但除非在乳腺影像数据上外部验证,不应描述为乳腺特定模型。
Zaidkilani等人提出CoAtUNet,一种用于乳腺超声肿瘤分割的对称编码器-解码器架构。模型结合卷积层用于局部病变边界提取和Transformer风格注意力用于长距离上下文建模。在UDIAT和BUSI公共乳腺超声数据集上评估,Dice系数分别为79.12%和76.21%。研究直接与乳腺影像相关,因为它将混合CNN-Transformer设计应用于乳腺超声分割,且实现报告为公开可用。
Nantogmah等人提出交叉注意力多模态融合框架用于乳腺癌诊断,整合乳腺X线摄影特征与临床变量。研究比较特征拼接、共同注意力和交叉注意力策略,报告交叉注意力模型使用包括TCGA和CBIS-DDSM的公共数据集实现AUC-ROC 0.98、准确性0.96、F1分数0.94、精确率0.92和召回率0.95。由于该工作目前为arXiv预印本,应作为新兴证据而非同行评审临床验证谨慎引用。
总体而言,Transformer和混合CNN-Transformer模型最好呈现为全局上下文建模、容积分割和多模态融合的有前景架构,而非CNN的均匀优越替代品。其临床价值取决于乳腺特定验证、外部测试、校准、可解释性和工作流整合。
3.8 分割架构
精确病变分割是定量影像组学特征提取、手术规划、治疗反应监测和放疗靶区描绘的前提。乳腺影像分割面临包括病变边缘不清、背景实质异质性以及跨容积模态语义和实例层面描绘需求的挑战。从标准U-Net通过注意力机制、Transformer整合和基于基础模型的可提示分割的架构演进反映了向全局知情、注释高效分割系统的一致进展。
Ronneberger等人引入U-Net,其对称编码器-解码器结构和跳跃连接通过直接特征图拼接实现精确边界保持,最初应用于组织学细胞分割实现Dice 0.92;原始代码库在GitHub发布,已被分叉超过10,000次,作为几乎所有后续医学分割架构的基础模板;其对乳腺影像的直接临床相关性已在数百项后续研究将U-Net应用于乳腺X线摄影、超声、MRI和组织病理学任务中得到证明。
Vakanski等人将空间和通道注意力门添加到应用于BUSI超声数据集的U-Net,实现乳腺病变边界描绘Dice 0.87和Hausdorff距离5.8 mm;注意力机制选择性放大病变特征同时抑制超声成像特有的散斑噪声伪影;提供Grad-CAM改编注意力可视化,代码在GitHub发布并附详细训练说明;作者对涉及后方声影和后方声增强的失败案例进行系统分析,为AI辅助超声判读提供临床相关指导。
Douglas等人使用来自689名患者的994个病变评估2D和3D U-Net架构用于DCE-MRI乳腺病变分割。五折交叉验证比较U-Net分割与模糊c均值和放射科医生分割。作者发现2D U-Net在中心切片和容积分割上优于3D U-Net,并在中心切片分割上优于模糊c均值。研究未提供临床网络应用或正式XAI,但掩模支持下游影像组学和CAD。
Sani等人提出分组Mask区域卷积神经网络,结合Mask R-CNN与分组卷积以改善乳腺X线摄影图像乳腺癌分割。模型在INbreast和MIAS乳腺X线摄影数据集上评估,集中于病变分割而非全图像分类。通过纳入分组卷积,架构旨在提高特征提取效率和分割质量,同时保留Mask R-CNN的实例分割优势。研究报告Dice系数86.63%和Jaccard指数87.76%,表明预测病变掩模与参考标注之间强重叠。未报告Detectron2实现、公共GitHub仓库、临床网络应用或正式XAI模块。此论文是Mask R-CNN类乳腺X线摄影分割的较安全引用,而非涉及CBIS-DDSM或Detectron2部署的无支持主张。
Chen等人开发TransUNet,通过混合CNN-Transformer架构将Transformer编码全局上下文与U-Net编码器-解码器框架整合。原始TransUNet
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号