基于半监督与聚类驱动图学习的甲状腺超声视频数据关键帧提取

《Engineering Applications of Artificial Intelligence》:Extraction of key frames from thyroid ultrasound video data via semi-supervised and clustering-driven graph learning

【字体: 时间:2026年09月04日 来源:Engineering Applications of Artificial Intelligence 9.0

编辑推荐:

   **摘要** 医学超声成像被广泛应用于人类疾病的预防、诊断、治疗、康复、监测和筛查。尽管机器人超声(RUS)系统可以有效减轻临床医生的工作量,但由于固定的扫描模式,所获取的视频往往包含大量缺乏病理信息的冗余帧。本文提出了一种专为RUS系统设计的半监督视频帧过滤框架,该框架仅

  

**摘要**

医学超声成像被广泛应用于人类疾病的预防、诊断、治疗、康复、监测和筛查。尽管机器人超声(RUS)系统可以有效减轻临床医生的工作量,但由于固定的扫描模式,所获取的视频往往包含大量缺乏病理信息的冗余帧。本文提出了一种专为RUS系统设计的半监督视频帧过滤框架,该框架仅需稀疏的人工标注,因此更适合真实的临床场景。为了全面表征超声图像,我们充分利用了高层语义特征和放射组学特征。我们基于图像重建方案训练了一个特征编码器,将原始输入映射到一个目标潜在空间。利用降维后的特征,通过聚类和离群点检测消除了大量无效且冗余的帧,得到了一组关键帧候选。随后,我们构建了一个半监督图学习卷积网络(GLCN),将自适应图学习与图卷积相结合,在弱监督下优化图结构并生成精确的伪标签。在303段临床超声视频上的实验结果表明,仅需20%的标注数据,所提方法即可达到0.9206的F1分数和0.9190的平均精度(AP)。所提方法为原始扫描视频的预处理和分析提供了一种有效解决方案,从而促进了机器人超声系统在实际医疗应用中的部署。

**引言**

医学超声成像已成为现代临床实践中使用最广泛的诊断模式之一,在疾病预防、诊断、治疗、康复、监测和人群筛查中发挥着关键作用(Akkus等,2019;Huang等,2026;Wang等,2021)。为减轻超声技师的工作量、提高诊断效率、降低超声操作的技术门槛并扩大医疗资源的可及性(Li等,2026),研究人员开发了机器人超声系统(RUS),通过机械臂、视觉伺服和空间定位传感器实现扫描过程的自动化(Jiang等,2023)。根据扫描策略的不同,RUS系统一般被分为粗略定位和精细定位两类方法(Raina等,2023)。粗略定位依赖于预定义的扫描路径和固定的探头方向,而精细定位则需要临床医生进行实时引导,以精确定位解剖目标(Xue等,2022)。然而,由于精细定位仍然依赖于专家经验,目前大多数RUS实现方案都采用粗略定位方法(Huang等,2026)。这种盲目的栅格扫描不可避免地产生大量缺乏诊断内容的非信息帧,给医院的计算和存储基础设施带来巨大压力。此外,对这些冗长视频记录进行后续审阅也需要医生投入大量的时间和精力——这恰恰违背了RUS减轻临床负担的初衷。因此,迫切需要有效的方法来自动从RUS生成的视频中识别和提取关键帧,特别是那些包含具有诊断相关性的病灶视图的帧。

越来越多的研究专注于静态医学超声图像的分析(Zeng等,2026;Chen等,2019;Han等,2017;Huang等,2021),通常使用经过专业策划和标准化的数据集(Huang等,2026)。与可以根据视觉显著性或场景多样性轻松选择关键帧的自然图像不同,超声视频中包含病灶的帧的识别高度依赖于经验丰富的临床医生进行的人工标注(Gheflati和Rivaz,2022;Burgos-Artizzu等,2020)。医学数据集的构建高度依赖专家标注,这不仅效率低、成本高,而且受主观性影响,可能影响标注的一致性和数据的可靠性。因此,如何通过标准化和算法辅助减少对专家的依赖并提高构建效率,已成为当前研究的一个重要方向。

现有的视频帧选择技术主要分为两大类:关键帧提取和视频摘要。关键帧提取通常基于先验知识针对特定感兴趣片段,旨在捕捉主体状态或解剖外观的转变。相比之下,视频摘要生成整个视频的简明概要(Parihar等,2021),提供全局概览以便于快速理解。虽然视频摘要在自然视频分析中日益流行(Apostolidis等,2021),但医学应用,尤其是超声领域,往往更倾向于关键帧提取,以分离出目标结构具有诊断意义的关键视图。如图1所示,甲状腺超声视频通常包含两类内容:多视图病灶呈现,如显示微钙化和不规则边缘的纵切面和横切面;以及大量非信息帧,其特征为空白区域、运动模糊或接触不良。这种多样性凸显了RUS视频智能关键帧提取的重要性:它不仅必须保留病灶多样化的诊断视角,还必须有效过滤掉无关或低质量内容(见图2)。

现有的医学视频帧选择方法大致可分为监督式关键帧提取、半监督超声视频分析和基于图的半监督学习。监督式超声方法(Ciompi等,2011;Baumgartner等,2016;Stoean等,2021;Chen等,2017;Pu等,2021)通常将帧选择表述为对预定义标准视图的分类,在完全标注的数据集上可以实现很高的精度;然而,它们对密集专家标注的依赖限制了其在具有大量冗余和质量变化的冗长RUS视频上的应用。近期的半监督方法(Luo等,2024)通过移除相似帧并利用时序信息进行结节检测来减轻标注负担,但它们仍主要面向检测任务,通常将冗余减少视为一个独立的预处理步骤,而不是将其与关键帧标签推断相集成。GLCN(Jiang等,2019)等基于图的方法可以从特征相似性和稀疏标签中学习样本关系,但其通用的图构建方式并未针对RUS数据的聚类性和高度冗余特性进行定制,也没有明确地将聚类成员资格从粗略筛选传递到图初始化和正则化中。因此,现有方法未能联合优化帧的信息性、诊断视图的多样性和基于聚类的标签推断,这促使我们开发一种统一的低标注框架,将信息感知的候选生成与基于聚类先验的图精化相结合。

为解决这些局限性,我们提出了一种用于机器人甲状腺超声视频关键帧提取的三阶段半监督框架。该框架集成了互补的特征表示、熵引导的候选生成和基于聚类先验的图精化。与将冗余减少和标签推断视为独立操作的现有半监督方法不同,所提框架在其三个阶段之间明确传递信息:融合表示定义了熵引导聚类的特征空间;聚类阶段生成候选帧和聚类成员资格;随后这些成员资格被用于初始化并正则化图,以实现半监督精化。
* **互补的自监督表示**:我们开发了一个功能紧凑嵌入网络(fCEN),联合建模描述病灶形态的深度语义特征和表征细粒度纹理的手工放射组学特征。与现有关键帧提取方法中使用的单一来源特征表示相比,所提表示通过自监督重建和正则化潜在空间学习保留了互补的诊断信息,而无需额外的帧级标签。
* **熵引导的自适应候选生成**:我们引入了一种信息熵引导的聚类策略,称为ID-CAN,将帧的信息性纳入自适应邻域学习。与主要依赖特征距离的传统基于聚类的筛选方法不同,ID-CAN同时考虑特征相似性和信息内容。随后应用聚类级局部离群点检测来移除低质量帧,同时保留多样化的病灶相关候选,从而在半监督学习之前减少冗余并降低对手动指定邻域参数的敏感性。
* **稀疏标注下的基于聚类先验的图精化**:我们通过利用ID-CAN获得的聚类成员资格构建初始邻接矩阵,将GLCN适配于RUS关键帧提取任务。在自适应图学习过程中,通过学习得到的图与初始聚类信息图之间的显式一致性约束来进一步保留聚类先验。与主要基于特征相似性的通用图学习方法相比,这种设计利用了粗略筛选过程中产生的结构信息,并使得仅使用1%到20%的候选帧作为标注样本即可实现可靠的标签推断。

**相关工作**

视频帧选择通常作为关键帧提取或视频摘要来研究。关键帧提取从临床上相关的片段中识别代表性帧,而视频摘要则生成整个视频的简明概览。由于医学超声分析通常寻找用于诊断的病灶相关视图,关键帧提取更直接地契合临床需求。因此,现有研究可以根据其监督策略进行比较。

**方法**

为全面表征超声图像的多维特征,我们联合考虑了由深度网络提取的高层语义特征和手工放射组学特征。首先,采用一个自监督特征编码器学习鲁棒的特征嵌入,并应用一个无监督聚类算法过滤掉无关帧,得到一组关键帧候选。随后,利用一个半监督标签传播算法实现精确的……

**数据集**

本研究使用的视频数据来源于中山大学肿瘤防治中心和西北工业大学附属医院甲状腺超声科。所有数据均为2019年10月至11月期间采集的甲状腺彩色多普勒超声视频,使用了两种类型的超声诊断系统:西门子Sequoia和东芝Aplio 400。经过筛选和分类后,共获得303段甲状腺超声视频,包括……

**对比实验**

我们进行了实验以将我们的方法与现有研究进行比较,包括T-RNN(Chen等,2017)、FUSPR(Pu等,2021)、ABHG(Feng等,2024)、dppLSTM(Zhang等,2016)和SUM-GAN(Mahasseni等,2017)。T-RNN和FUSPR执行医学超声图像的关键帧提取,而dppLSTM和SUM-GAN是自然视频的视频摘要方法。我们在自己的数据集上评估了这些方法的公开可用实现,仅修改了图像特征维度……

**讨论**

应承认有若干局限性。首先,虽然纳入了一个额外的独立甲状腺超声数据集作为基于再训练的外部验证,但两项评估仍然具有回顾性和器官特异性;对其他扫描仪、采集方案以及器官特异性的外观和运动模式的零样本鲁棒性尚未得到验证。其次,当前的流程是离线运行的。特别是,候选生成和图构建是在完整的……上进行的。

**结论**

在本研究中,我们设计了一种用于稀疏标注临床环境中医学超声视频的关键帧选择的半监督三阶段工作流。实验结果表明,该框架能在有限标注的情况下,对甲状腺超声视频实现有效的关键帧检测。通过结合互补的表示学习、熵引导的候选生成和基于聚类先验的图精化,所提方法可以支持RUS视频的预处理并减少……

**CRediT作者贡献声明**

清华大学:方法论、资金获取、形式分析、概念化、调查。
王一鸣:数据整理、软件、验证、写作——审阅与编辑。
何怡辉:资源、调查、软件、方法论。
翟锦阳:验证、可视化、写作——审阅与编辑。
田浩哲:资源、调查。
柳春英:数据整理。
刘龙忠:资金获取、数据整理。

**利益冲突声明**

作者声明他们没有已知的竞争经济利益或个人关系可能影响本文所报告的工作。

**致谢**

本工作得到国家自然科学基金(批准号U25A20448, 12326609, 82030047, 82272020)、上海市经济和信息化委员会“AI for Science”项目(编号:2025-GZL-RGZN-BTBX-02010)以及广州市重点领域研发计划(批准号:2025B03J0125)的支持。

清华大学 | 王一鸣 | 何怡辉 | 翟锦阳 | 田浩哲 | 柳春英 | 刘龙忠
同济大学 机械工程学院,上海,中国,201800
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号