一种利用弥散式体内流式细胞术对循环细胞进行计数的机器学习方法

《Biophotonics Discovery》:Machine learning approach for enumeration of circulating cells with diffuse in vivo flow cytometry

【字体: 时间:2026年09月09日 来源:Biophotonics Discovery

编辑推荐:

   DiFC仪器。(a) DiFC探头示意图,经参考文献6许可转载。我们通常在(b)小鼠后肢或(c)尾巴上进行DiFC检测。(d)两个DiFC探头沿血管放置,从而能够以对应细胞速度的时间延迟检测荧光标记的细胞。(e)峰值具有特征形状,由DiFC探头的灵敏度函数决定。图中显示了在0

  

DiFC仪器。(a) DiFC探头示意图,经参考文献6许可转载。我们通常在(b)小鼠后肢或(c)尾巴上进行DiFC检测。(d)两个DiFC探头沿血管放置,从而能够以对应细胞速度的时间延迟检测荧光标记的细胞。(e)峰值具有特征形状,由DiFC探头的灵敏度函数决定。图中显示了在0.75 mm深度处的细胞示例峰值形状(由蒙特卡洛模拟14计算得出)。发现声明本研究利用扩散体内流式细胞术(DiFC)与卷积神经网络分类器相结合的方法,区分荧光时间序列数据中的真实循环肿瘤细胞信号与伪影。基于机器学习的方法在测试数据上实现了超过94%的准确率、灵敏度和特异性,提高了DiFC循环肿瘤细胞计数,增强了对噪声条件下伪影的鲁棒性。1. 引言转移灶是导致癌症相关死亡的主要原因,而外周血(PB)是癌症扩散的主要途径之一。因此,循环肿瘤细胞(CTCs)可作为疾病进展和治疗反应的重要指标。1,2 在临床实践中,传统的液体活检CTC计数方法需要采集并分析极少量(7.5 mL)的血液样本。然而,这些方法已知准确性较低(特别是在量化罕见CTCs时),且无法便捷地测量CTC数量随时间的变化。3–5 对于小鼠的术前研究,通常需要抽取全部外周血,这不允许对同一动物进行连续测量。为解决这些局限性,我们的实验室开发了"扩散体内流式细胞术"(DiFC),该技术能够在小鼠体内无创、连续监测荧光标记的CTCs。6–9 在系统中,经过特殊设计的光纤探头[图1(a)]放置在腿部或尾部大血管上方的小鼠皮肤上[图1(b)和1(c)]。与基于显微镜的体内流式细胞术方法不同,10–13 DiFC使用高度散射的光,能够检测组织内数毫米深处的CTCs荧光。当CTCs穿过仪器的视场(FOV)时,探头检测到瞬态荧光事件,称为"峰值"[图1(d)]。我们放置两个间隔3 mm的光学探头沿血管排列。通过要求信号峰值被两个探头依次检测,我们可以确定CTC流动方向,并将真实的CTC事件与可能产生类似峰值波动的随机运动或电子伪影区分开来(见2.3节)。我们之前的DiFC信号处理方法仅将超过固定振幅阈值(局部背景信号标准差的五倍,??bg)的荧光事件视为CTC峰值候选(Peakcand)。真正的CTC峰值表现出由DiFC探头空间灵敏度函数决定的特征波形,如图1(e)中通过蒙特卡洛模拟计算得出的Jacobian剖面所示。14 假设小鼠中平均血流速度为100 mm/s,推导出灵敏度剖面与时间的关系。6 因此,仅仅依赖简单的基于振幅的阈值策略忽略了信号时间形状中包含的有用特征。由于CTCs极为罕见(低至每1 mL外周血中1个CTC),15,16 假阳性信号问题十分严重。为减少随机信号噪声造成的错误检测,需要使用足够高的检测阈值来最小化假阳性,代价是可能会遗漏信噪比(SNR)较低的低于阈值的真实峰值。因此,一种改进的信号处理方法,融入信号形状中包含的信息,既能减少假阳性,又能提高真阳性计数。图1下载全尺寸图像DiFC仪器。(a) DiFC探头示意图,经参考文献6许可转载。我们通常在(b)小鼠后肢或(c)尾巴上进行DiFC检测。(d)两个DiFC探头沿血管放置,从而能够以对应细胞速度的时间延迟检测荧光标记的细胞。(e)峰值具有特征形状,由DiFC探头的灵敏度函数决定。图中显示了在0.75 mm深度处的细胞示例峰值形状(由蒙特卡洛模拟14计算得出)。为解决这一问题,我们提出了一种整合机器学习(ML)的方法,以更可靠地区分真实峰值与伪影,特别是在噪声数据集中。17 卷积神经网络(CNNs)是一类非常适合此任务的机器学习模型,因为它们具有从时间序列数据中提取局部特征的强能力,18 并已成功应用于相关信号处理应用。19–21 2. 方法 2.1. DiFC信号处理问题概述所测荧光由背景组织自发荧光、荧光标记CTC的瞬态峰值以及由动物运动(如呼吸和抽搐)和仪器电子噪声引起的假阳性信号组成。信号处理算法的目标是尽可能准确地区分真实CTC峰值与这些背景信号。图2(a)和2(b)比较了之前的基于阈值的流程[图2(a)]与本文引入的ML整合流程[图2(b)];后者的组件在2.2节和2.3节中有详细说明。在两种流程中,输入都是原始的探头荧光时间序列,输出是一组被标记为正向、反向、未匹配或伪影的检测事件。经过预处理后,在每个探头上独立识别超过检测阈值的峰值候选,生成每个探头的候选位置、高度和宽度列表。在基于阈值的方法中,这些列表直接传递给方向匹配算法。在ML整合方法中,首先将CNN分类器应用于每个候选项以排除伪影,仅保留的候选项传递给相同的方向匹配算法。2.2. 机器学习模型 2.2.1. 信号预处理与峰值候选的初步识别荧光数据以每秒2000个采样率的速率从两根光纤连续采集。我们首先对从两根光纤采集的原始数据应用预处理算法[图2(c)]。首先,通过使用窗口长度为2.5秒(5000个采样点)的滑动中值滤波器从信号中去除背景自发荧光,并从原始信号中减去它。接下来,对信号应用3毫秒(6个采样点)的移动平均滤波器进行平滑操作。然后使用Python中"scipy.signal"模块的"find_peaks"函数识别峰值候选,定义为振幅超过局部信号标准差固定倍数的瞬态信号(4???bg)。峰值检测在每个探头上独立进行,使得每个峰值候选对应于特定时间单个探头上的检测;记录这些候选的时间位置、宽度和高度以供进一步分析。然后使用每次扫描的最小值和最大值将数据归一化到[0, 1],以便于统一处理并防止与规模相关的偏差。在每个峰值候选周围,从两个探头在相同时间间隔内提取一个801个采样点的窗口(候选两侧各400个采样点加上中心采样点,对应约0.4秒),生成一个2×801的输入数组(2个探头 × 801个时间采样点),作为CNN分类器的单个输入(见2.2.2节)。801个采样点(0.4秒)的窗口长度是根据峰值候选宽度的分布选择的,其均值为474个采样点(≈0.24秒),中位数为476个采样点(≈0.24秒)。观察到的宽度在801个采样点窗口内,因此选择此大小以包含候选峰值的完整时间跨度,同时保持输入紧凑。图2下载全尺寸图像信号处理工作流程概述。(a) 在基于阈值的方法中,对原始数据进行预处理后,所有检测到的峰值候选(Peakcand)由方向峰值匹配算法处理。(b) 在ML整合方法中,峰值候选(Peakcand)首先由CNN分类器分析,仅被分类为峰值(PeakCNN)的候选由方向峰值匹配算法处理。(c) 数据预处理步骤(BG Sub = 背景扣除)。(d) 基于ML的峰值分类:在数据收集和预处理后,数据通过CNN进行训练阶段,得出每个峰值候选为真实峰值的概率。(e) 方向峰值匹配模型确定CTC移动方向。2.2.2. CNN分类器分类器由四个二维卷积层组成,每层包含八个滤波器,核高度为1(1×64,1×32,1×16和1×8)。逐层减少核大小,以提取逐渐精细的时间特征。由于核高度为1,每个滤波器在单个探头内沿时间轴进行卷积,滤波器权重在两个探头之间共享;两个探头信号直到全连接阶段才被合并。网络深度根据可用训练数据经验性地设定:当训练集扩大时,在初始三层网络中添加了第四个卷积层,以支持额外容量。除第一层外,每个卷积层后跟随一个使用1×4核的最大池化层以减少时间维度。第一层后未应用最大池化以避免过度下采样,否则将导致时间维度低于后续层的核长度并产生无效(负值)特征维度。第四个卷积层应用了L1核正则化(λ=0.01),并在卷积堆叠后添加了一个在训练期间随机将25%输入置为零的丢弃层以减少过拟合。22,23 然后输出被展平并传递给两个全连接层,一个32单元的非线性层后跟一个单单元输出层。卷积层和第一个非线性层使用修正线性单元激活,24,25 而最后一层使用S形激活产生0到1之间的值,代表输入窗口包含荧光标记或荧光表达细胞的真实峰值的概率。CNN在人工标注的窗口上(见2.2.3节)使用Adam优化器和二元交叉熵损失进行训练。训练使用批大小为4,最多50个epoch,学习率初始化为0.001,每10个epoch减小10倍。这些训练超参数通过在10折交叉验证期间比较配置并保留验证准确率最好的那些配置来经验性地选择。如果验证损失连续三个epoch未改善,则应用早停,并恢复表现最好的epoch的权重。26训练后的模型随后应用于未见过的DiFC数据。包含预测概率超过预设截止值的候选峰值的信号窗口被分类为"1"(CNN预测峰值或PeakCNN)并传递给方向匹配算法进行最终分类,而所有剩余窗口被分类为"0"或伪影。概率截止值根据受试者工作特征(ROC)分析和保留验证集上预测概率的分布来确定(见3.1节)。2.2.3. 峰值标注与CNN训练本研究使用的数据集来自我们之前发表的工作如下:(i) 多发性骨髓瘤(MM)播散异种移植模型(DXM):7 简言之,将8周龄雄性SCID-bg小鼠通过尾静脉注射MM.1S.GFP.Luc细胞。注射后,MM细胞快速归巢至骨髓龛并增殖,CTCs在约3周后开始进入血液。两组小鼠在注射后监测长达约5周。使用蓝绿GFP兼容的DiFC系统在2000 Hz下每两周扫描一次小鼠尾巴,每次扫描持续45分钟。(ii) L1210A白血病模型:8,9 简言之,雌性裸小鼠在6至8周龄时接受标记有近红外荧光造影剂(OTL3827)的L1210A白血病细胞。L1210A细胞要么在体外用OTL38标记后进行静脉注射,要么将L1210A细胞和OTL38分别注入同一只小鼠。然后使用近红外兼容的DiFC系统在2000 Hz下扫描尾巴或腿部1小时。总共使用来自18次CTC携带小鼠的扫描进行训练、验证和测试数据集的人工标注。这些包括来自MM DXM的11次扫描(来自7只SCID-bg小鼠)和来自L1210A模型的7次扫描(来自3只裸小鼠)。

此外,我们还获取了12组DiFC扫描数据,来自5只仅注射PBS的对照小鼠,其中包括2只使用GFP兼容DiFC系统7进行扫描的SCID-bg小鼠,以及3只使用近红外兼容DiFC系统进行扫描的裸鼠。8,9 单次扫描耗时从45分钟到1小时不等。预处理期间识别出的峰值候选值经人工检查和标注:若归因于荧光癌细胞通过光纤,则标注为"1";若归因于电噪声、运动或呼吸等伪影,则标注为"0"。标注工作由受训读者根据既定的形态学和时序标准进行,以区分真实峰值与伪影。真实峰值呈现特征性的钟形轮廓,具有可测量的宽度和明确的峰值面积[图3(a)和3(b)],而电噪声则表现为突变、尖锐的尖峰[图3(c)]。除峰值形状外,在另一探针信号中以预期时间延迟检测到的匹配峰值,也为真实阳性提供了进一步支持。相反,在探针1和探针2的信号中同时出现的并发峰值被视为伪影[图3(d)]。在对照小鼠扫描中识别出的所有峰值候选值均被自动标注为伪影,因为先验已知循环中不存在荧光标记细胞。总共标注了2200个真实峰值窗口("1")和4099个伪影窗口("0"),其中每个窗口是一个2×801数组,与一个探针上检测到的候选值相关联,且探针1和探针2的候选值合并处理。我们按扫描级别划分数据,使得给定扫描的所有候选值完全落入训练集、验证集或测试集中,且每种细胞系在各类中均有代表(11个训练扫描、5个验证扫描和14个测试扫描)。为构建平衡的训练集、验证集和测试集,在每个划分中从完整伪影集中随机选取伪影窗口。最终得到3054个训练窗口、540个验证窗口和806个测试窗口。图3下载全尺寸图像 示例数据窗口、数据增强和计算机模拟数据生成。以峰值候选值为中心的0.4秒示例数据窗口,展示了由(a)探针1和(b)探针2检测到的荧光标记细胞产生的真实峰值。虚假峰值候选值可能来源于(c)电噪声和(d)运动伪影。(e)代表性0.4秒DiFC数据窗口,显示探针1中的真实峰值、其翻转窗口版本和探针交换版本。(f)用于生成计算机模拟数据集的构件序列。从左至右依次为:背景噪声、探针2伪影、探针1真实峰值、探针2真实峰值、探针1伪影,以及背景噪声。我们通过下采样伪影来平衡类别,而非应用加权损失,因为平衡数据集方法能使预测概率在决策边界附近保持良好校准——这一点至关重要,因为工作阈值是根据预测概率分布和验证集上的ROC分析直接选择的(见3.1节)。2.2.4 数据增强 我们使用数据增强来扩展训练数据集并减少过拟合。28 我们采用了两种策略:"翻转窗口"和"交换探针"。29 在翻转窗口方法中,每个训练样本在时间上反转,同时保留其原始标签。在交换探针方法中,探针1和探针2的信号互换,使得原本存在于探针1中的真实峰值在交换后出现在探针2中,反之亦然。图3(e)展示了一个代表性真实峰值及其翻转窗口版本和探针交换版本。两种数据增强方法均应用于训练集中随机选择的25%子集,将训练集从3054个扩展到4581个样本。2.3 方向性峰值匹配 方向性峰值匹配算法按照先前描述的方法6,7 应用。首先,将并发峰值标注为"伪影"并排除进一步分析。然后,对于每个峰值候选值,利用根据峰值宽度估计的细胞速度,在另一探针上定义搜索区间。识别该区间内的潜在匹配项,并根据峰值宽度、高度和推断速度的相似性选择最佳匹配。每个匹配对根据两个峰值的相对时序被标注为"正向"或"反向",而没有合适匹配的候选值被记录为"未匹配"。在先前基于阈值的方法中,所有峰值候选值都传入方向性匹配,任何并发峰值都计为伪影。在ML集成方法中,仅将PeakCNN候选值传入匹配,其余数据处理流程保持不变。因此,ML集成方法中的伪影集既包括被CNN拒绝的候选值,也包括方向性匹配期间移除的并发峰值。2.4 评估数据集 为在未见过数据上评估ML集成算法的完整流程,并与基于阈值的方法进行比较,我们使用了来自计算机模拟数据集、对照小鼠和CTC携带小鼠的DiFC扫描,具体如下。这些评估扫描与2.2.3节中用于训练、验证和测试数据集的扫描不同,且不与之重叠。2.4.1 计算机模拟数据 在实验性DiFC数据上测试算法之前,我们生成了一组计算机模拟数据集,以在完全已知条件下评估模型性能。由于每个事件的精确数量、类型、方向和时序均由构造规定而非测量得出,因此该数据集是唯一能够验证完整流程方向性输出的数据集——这在CTC携带体内的活体扫描中无法实现。我们生成了三类构件库:背景噪声、真实峰值和伪影块,每个构件均从排除在所有训练、验证、测试和评估集之外的真实活体数据中提取。所有构件均为0.4秒窗口:真实峰值和伪影块以手动标注的峰值候选值为中心,而背景噪声块包含预处理后的微弱波动自发荧光信号。构件选取时端点值接近零且波动较小,以确保平滑拼接,然后拼接生成10分钟的计算机模拟扫描。我们使用了结构化片段序列:背景噪声、探针2伪影、探针1真实峰值、探针2真实峰值、探针1伪影,再次背景噪声[图3(f)]。我们此前观察到,当峰值和伪影在较窄时间窗口内同时被检测时,会发生错误匹配,导致假阳性和错误匹配。因此,我们故意设计了该序列,使真实峰值和伪影在两个探针上同时出现,复现了一种已知失效模式,即基于阈值的方法产生错误的方向性匹配。我们假设减少假阳性检测将改善方向性匹配结果。2.4.2 对照(非CTC携带)小鼠 对照、非CTC携带小鼠的扫描用于评估算法性能(因为按定义所有检测到的峰值候选值均为伪影)。我们使用了总共6次扫描,每次持续45分钟:3次使用GFP兼容DiFC系统获取,3次使用近红外兼容DiFC系统获取。2.4.3 CTC携带小鼠 我们分析了来自7次CTC携带小鼠扫描的360分钟数据,其中4次来自表达GFP的MM携带小鼠,3次来自注射标记L1210A细胞的小鼠(模型见2.2.3节描述)。与计算机模拟和对照数据集不同,CTC携带小鼠数据的真值并非先验已知;因此,每次扫描均经过人工审查和标注。2.5 评估指标 为评估CNN分类器的候选峰值分类性能(PeakCNN对比伪影),我们使用2.2.3节中描述的测试数据集,按式(1)至(4)计算准确率、精确率、敏感性和特异性:式(1)准确率=(真阳性+真阴性)/(真阳性+真阴性+假阳性+假阴性),式(2)精确率=真阳性/(真阳性+假阳性),式(3)敏感性=真阳性/(真阳性+假阴性),式(4)特异性=真阴性/(真阴性+假阳性)。我们还计算了ROC曲线下面积(AUC),该指标展示了不同分类概率阈值下真阳性率(TPR)与假阳性率(FPR)之间的关系。TPR衡量模型正确识别的真实峰值比例,等同于式(3)中定义的敏感性。FPR量化被错误分类为真实峰值的伪影比例,计算为假阳性数与伪影总数之比,定义见式(5):式(5)假阳性率(FPR)=假阳性/(假阳性+真阴性)。为在2.4节描述的评估数据集上评估方向性峰值匹配算法,我们检查了匹配项的方向分类是否正确。正确匹配是指被算法正确识别的真实正向或反向峰值对,而错误匹配是指被误分类为正向或反向的伪影或未匹配峰值。为明确ML集成方法的评估,关键分类术语在表1中进行了定义。表1 ML集成DiFC信号处理中使用的主要分类术语说明。F、R和U分别代表"正向"、"反向"和"未匹配"。术语 简要描述 峰值(真实峰值)CTC在视场内被检测到时产生的瞬时荧光信号 伪影 来自非生物源的信号波动(如噪声和运动) 峰值候选值 超过阈值的信号瞬变 PeakCNN 被CNN分类为峰值的峰值候选值 正向 指示CTC从第一个探针移动到第二个探针的峰值对 反向 指示CTC从第二个探针移动到第一个探针的峰值对 未匹配 在搜索区间内另一探针上无匹配的真实峰值 漏检 低于检测阈值、作为峰值候选值排除的真实峰值 真阳性 被CNN正确分类或被方向性匹配标注为F/R/U的真实峰值 假阳性 被CNN错误接受或被方向性匹配标注为F/R/U的伪影 真阴性 被CNN或方向性匹配正确拒绝的伪影 假阴性 被CNN或方向性匹配错误拒绝的真实峰值 正确匹配 被正确识别的正向或反向峰值对 错误匹配 被错误标注为峰值对的伪影或未匹配峰值 3. 结果 3.1 模型训练与特征表征 我们首先独立于方向性匹配,表征CNN分类器的性能。图4(a)显示了峰值候选值宽度的分布,该分布促成了0.4秒分类器输入窗口的选择;图4(b)总结了训练集(4581)、验证集(540)和测试集(806)的数据集大小。训练集和验证集在训练周期上的二元交叉熵损失如图4(c)所示。基于验证损失应用早停策略,耐心值为三个周期,在训练停止前恢复模型至最佳权重;此处,训练在第27个周期停止。由于训练期间应用了正则化和dropout以提高泛化能力,训练损失略高于验证损失。CNN分类器在配备18GB内存的Apple M3 Pro处理器上训练,总CPU时间约为31分钟。图4下载全尺寸图像 CNN分类器训练与性能。(a)峰值候选值宽度分布。(b)训练、验证和测试数据集大小。(c)训练和验证损失随训练周期的变化。训练在第27个周期停止,此时验证损失连续三个周期未改善。(d)CNN分类器在验证数据集上的ROC曲线。(e)验证集中峰值候选值预测概率直方图,蓝色表示真实峰值,红色表示伪影。真实峰值的预测概率接近1,而伪影的预测概率接近0。橙色虚线指示所选的CNN分类器概率阈值。(f)CNN分类器在测试数据集上的ROC曲线。(g)测试集中峰值候选值预测概率直方图。(h)在测试集上使用CNN分类器的峰值分类混淆矩阵,阈值设为0.6。"0"和"1"分别代表伪影和峰值。(i)CNN分类器在测试数据集上的准确率、精确率、敏感性、特异性和AUC,及其相应的95%置信区间。接下来,我们在验证数据集上评估训练好的CNN模型以选择概率阈值。通过在范围[0, 1]内变化分类器概率阈值生成的ROC曲线如图4(d)所示。验证集中真实峰值和伪影的预测概率分布也进行了分析[图4(e)]。如图所示,真实峰值(蓝色)的预测概率接近1,而伪影(红色)的预测概率接近0。通过检查ROC曲线和预测概率分布,我们选择0.6作为平衡低假阳性与高真阳性性能的峰值候选值阈值,尽管该阈值可根据需要调整以权衡两者。该阈值随后被固定并应用于测试集。测试集中的ROC曲线和预测概率分布如图4(f)和4(g)所示。在测试集上,模型的准确率、精确率、敏感性、特异性和AUC均超过94%,如相应的混淆矩阵和性能指标所示[图4(h)和4(i)]。

置信区间使用扫描级别集群自助法计算(2000次重采样,重采样单位=扫描,概率截断值=0.6)。

3.2 在DiFC数据集上的性能

3.2.1 计算机模拟数据

对于在体内携带循环肿瘤细胞(CTC)的小鼠中测得的DiFC数据集,一般而言,真实峰的数量和方向是未知的。为了评估我们的模型,我们首先按照第2.4.1节的描述,合成生成了一个包含80个伪影和80个真实峰的10分钟扫描数据(所有真实峰均为正向峰)。结果汇总于图5,其中第一行和中间行展示了我们此前文献中记录的基于阈值方法?、?的结果,阈值分别为5σbg和4σbg。最后一行对应于采用阈值为4σbg的机器学习集成方法的结果。

图5 下载 全尺寸图像

方向性峰匹配模型在10分钟计算机模拟数据上的性能比较。(a) 阈值为5σbg的基于阈值的方向性峰匹配的混淆矩阵。"A"、"F"、"R"、"U"和"M"分别代表伪影(artifact)、正向(forward)、反向(reverse)、未匹配(unmatched)和遗漏(missed)的缩写。(b) 使用(a)面板中相同模型的颜色编码预测标签。(c) 阈值为4σbg的基于阈值的方向性峰匹配的混淆矩阵。(d) 使用(c)面板中相同模型的颜色编码预测标签。(e) 对以阈值为4σbg检测到的峰候选进行CNN分类的混淆矩阵。"0"和"1"分别代表伪影和峰。(f) 阈值为4σbg的机器学习集成方向性峰匹配的混淆矩阵。(g) 使用(f)面板中相同模型的颜色编码预测标签。

阈值为5σbg的基于阈值方法识别出79个峰候选以进行进一步的方向性峰匹配算法分析,而如扩展混淆矩阵图5(a)最后一列所示,另有81个较低幅度的峰被遗漏。如图5(a)所示,较高的阈值还通过避免较暗的伪影降低了假阳性。

将阈值降至4σbg [图5(c)–5(d)]捕获了更多的峰候选,包括5σbg下被遗漏的低幅度真实峰以及低幅度伪影。由于这些伪影被传递到了方向性匹配算法中,许多伪影与真实峰配对,导致反向及其他不正确的匹配数量虚增。因此,正确分类的正向峰数量并未增加,反而相对于5σbg有所下降[从46降至42,见图5(a)和5(c)],同时假阳性上升至78,其中56个被错误标记为反向,1个被错误标记为正向,其余21个被错误标记为未匹配。

因此,在存在大量伪影的情况下,降低阈值并非改进了检测,而是降低了匹配算法的性能:伪影候选的大量涌入不仅产生了不正确的匹配,还取代了正确的正向匹配,导致与较高阈值相比,真阳性和正确匹配均减少。

接下来,在较低阈值4σbg下,我们在峰匹配算法之前应用了CNN分类器("机器学习集成方法")。如图5(e)中的峰分类混淆矩阵所示,CNN分类器正确分类了所有真实峰和伪影。只有被分类为"1"(PeakCNN)的峰候选被传递到方向性峰匹配步骤,从而将伪影从后续分析流程中移除。

经过方向性匹配步骤后,所有PeakCNN均被正确标记为正向,如图5(f)所示。因此,机器学习集成方法不仅增加了真阳性和正确匹配,还保持了较低的假阳性和不正确的匹配数量。

3.2.2 对照组(非CTC携带)小鼠

接下来,我们将机器学习集成方法应用于从非CTC携带小鼠测得的DiFC数据集,即已知先验条件下不存在真阳性峰的小鼠。

典型数据集的分析结果如图6(a)–6(g)所示。如图6(a)所示,应用我们此前报告的阈值为5σbg的基于阈值方法未检测到峰候选(因此无假阳性检测)。然而,当阈值降至4σbg时 [图6(c)],识别出72个伪影作为峰候选,其中4个被方向性匹配算法错误分类为正向,68个为未匹配。

图6 下载 全尺寸图像

对照组(非CTC携带)小鼠扫描上的性能。在两个对照扫描上比较基于阈值和机器学习集成的方向性峰匹配。(a)–(g) 代表性扫描。(h)–(n) 噪声特别大的扫描。每个扫描均采用相同的面板布局。(a)和(h) 阈值为5σbg的基于阈值的方向性峰匹配的混淆矩阵。(b)和(i) 对应面板(a)和(h)中模型的彩色编码预测标签。(c)和(j) 阈值为4σbg的基于阈值的方向性峰匹配的混淆矩阵。(d)和(k) 对应面板(c)和(j)中模型的彩色编码预测标签。(e)和(l) 对以阈值为4σbg检测到的峰候选进行CNN分类的混淆矩阵。(f)和(m) 阈值为4σbg的机器学习集成方向性峰匹配的混淆矩阵。(g)和(n) 对应面板(f)和(m)中模型的彩色编码预测标签。

在预处理后应用CNN分类器 [图6(e)],所有72个被捕获为峰候选的伪影均被分类为"0"(伪影),无一进入方向性匹配,从而实现了零假阳性 [图6(f)]。

我们分析了一个噪声特别大的对照数据集以评估CNN和方向性匹配算法的性能 [图6(h)–6(n)]。应用阈值为5σbg的基于阈值方法检测到42个峰候选,其中32个被方向性匹配算法分类为未匹配,10个通过重合峰去除被分类为伪影。

当阈值降至4σbg时,检测到160个峰候选,其中128个被分类为未匹配或重合峰。在剩余的峰中,20个和12个分别被错误匹配为正向和反向 [图6(j)]。相比之下,使用相同的4σbg阈值,CNN模型将所有峰候选准确分类为"0"(伪影),从而消除了错误的方向性峰匹配 [如图6(l)–6(m)所示]。这证明了机器学习集成方法即使在噪声条件下拒绝伪影的鲁棒性。

我们注意到,对于体内扫描(图6–8),颜色编码标签面板展示了每个扫描中具有代表性的5分钟间隔,以更清晰地展示各方法的行为;对应的全扫描图见补充材料。

3.2.3 CTC携带小鼠

对来自MM-DXM携带小鼠测得的DiFC扫描的分析结果汇总于图7。应用阈值为5σbg的基于阈值方法检测到46个峰候选,其中仅22个被正确正向匹配,14个被正确分类为未匹配峰。将阈值降至4σbg使检测到的候选数量增加至119个;使用基于阈值的方法,这产生了42个正确正向匹配和26个正确未匹配峰,但代价是假阳性大幅增加(40个伪影被标记为正向、反向或未匹配)和不正确的匹配(6个伪影被匹配为正向,4个被匹配为反向),方向性峰匹配后 [图7(c)]。使用阈值为4σbg的机器学习集成方法,CNN分类器将119个检测到的峰候选中的72个识别为PeakCNN(70个真实峰和2个伪影),并将剩余47个拒绝为伪影 [43个真实伪影和4个真实峰;图7(e)]。随后对72个PeakCNN进行方向性匹配,产生了42个正确正向匹配和25个正确未匹配峰,无不正确匹配 [图7(f)]。

图7 下载 全尺寸图像

方向性峰匹配模型在从MM携带小鼠收集的45分钟数据上的性能比较。(a) 阈值为5σbg的基于阈值的方向性峰匹配的混淆矩阵。(b) 使用(a)面板中相同模型的颜色编码预测标签。(c) 阈值为4σbg的基于阈值的方向性峰匹配的混淆矩阵。(d) 使用(c)面板中相同模型的颜色编码预测标签。(e) 对以阈值为4σbg检测到的峰候选进行CNN分类的混淆矩阵。(f) 阈值为4σbg的机器学习集成方向性峰匹配的混淆矩阵。(g) 使用(f)面板中相同模型的颜色编码预测标签。

图8 下载 全尺寸图像

方向性峰匹配模型在从L1210A携带小鼠收集的45分钟数据上的性能比较。(a) 阈值为5σbg的基于阈值的方向性峰匹配的混淆矩阵。(b) 使用(a)面板中相同模型的颜色编码预测标签。(c) 阈值为4σbg的基于阈值的方向性峰匹配的混淆矩阵。(d) 使用(c)面板中相同模型的颜色编码预测标签。(e) 对以阈值为4σbg检测到的峰候选进行CNN分类的混淆矩阵。(f) 阈值为4σbg的机器学习集成方向性峰匹配的混淆矩阵。(g) 使用(f)面板中相同模型的颜色编码预测标签。

这些结果突出了机器学习集成模型在不同阈值下解决基于阈值方法局限性的能力。

接下来,我们以相同方式分析了L1210A携带小鼠的数据。在基于阈值的方法中,将阈值从5σbg降至4σbg使峰候选数量从146增加至169,假阳性数量相应地从0增加至15(15个伪影被标记为未匹配),如图8(a)和8(c)所示。

在阈值为4σbg的机器学习集成方法中,169个峰候选首先由CNN分类器处理,该分类器过滤掉了9个候选(如图8(e)中2×2混淆矩阵的"0"列所示,其中包括7个真实伪影)。剩余160个峰候选随后被传递到方向性峰匹配算法。与基于阈值的方法相比,这将假阳性从15降至8,并将正确正向匹配数从107增加至118,方向性峰匹配后无不正确匹配 [图8(f)]。

我们注意到,体内评估数据集(图6–8)方向性峰匹配输出中显示的扩展混淆矩阵不包含"遗漏"行或列,这与图5中计算机模拟扫描的矩阵不同,这是因为真阳性峰的确切数量无法先验确定。

3.2.4 总体结果

图9汇总了所有对照组和CTC携带评估数据(第2.4.2和2.4.3节)上基于阈值方法和机器学习集成方法的算法性能。如图9(a)–9(c)所示,基于阈值方法中降低阈值使假阳性数量从55增加至873,而机器学习集成方法未产生假阳性,对照组扫描中的所有903个伪影均被正确分类。对于CTC携带扫描,虽然将阈值降至4σbg使基于阈值方法的正确匹配数量增加[从397个正确正向和4个正确反向峰增至599个正确正向和9个正确反向峰;图9(d)和9(e)],但也增加了假阳性(从11增至373)和不正确匹配(从15增至67)。在相同阈值下,机器学习集成方法不仅产生了可比的正确匹配数量(610个正确正向和10个正确反向峰),还保持了显著较少的假阳性(26个)和不正确匹配(26个),如图9(f)所示。

图9 下载 全尺寸图像

基于阈值和机器学习集成的方向性峰匹配性能,源自从对照组和CTC携带小鼠收集的经人工标注的评估扫描。(a)和(b) 对照组数据中阈值为5σbg和4σbg的基于阈值方向性峰匹配的混淆矩阵。(c) 对照组数据中阈值为4σbg的机器学习集成方向性峰匹配的混淆矩阵。(d)和(e) CTC携带数据中阈值为5σbg和4σbg的基于阈值方向性峰匹配的混淆矩阵。(f) CTC携带数据中阈值为4σbg的机器学习集成方向性峰匹配的混淆矩阵。(g) 正确与不正确匹配率柱状图。正确匹配定义为正向或反向峰被正确标记。不正确匹配定义为伪影或未匹配峰被错误标记为正向或反向。

最后,图9(g)展示了基于阈值方法(阈值为5σbg和4σbg)以及机器学习集成方法(阈值为4σbg)的正确与不正确匹配情况。这些结果基于对照组和CTC携带小鼠的所有评估扫描,如第2.4.2和2.4.3节所述。平均比率通过计算所有评估扫描的正确(或不正确)匹配总数之和除以总扫描时长(分钟)得出。

如图所示,机器学习集成方法实现了较高的正确匹配数(与4σbg阈值方法相当),同时保持了较低的错误匹配数(与5σbg阈值方法相当),有效解决了阈值模型存在的局限性。值得注意的是,将完整的训练好的机器学习集成流程(预处理、CNN分类和方向峰值匹配)应用于单个全长DiFC扫描(45分钟),在无GPU加速的笔记本电脑CPU上仅需约7.8秒的墙钟时间;一次性加载模型和数据总共耗时不到1秒。

**4. 讨论与结论**

在本研究中,我们开发并验证了一种用于DiFC峰值检测的CNN分类器。通过纳入两个癌细胞系、两种小鼠品系以及我们的蓝绿(GFP兼容)和近红外兼容DiFC系统的扫描数据,我们在多种荧光团、信号特征和仪器配置的范围内评估了该模型,并观察到在所有这些条件下性能表现一致。这种跨实验设置的稳健性凸显了该分类器在更广泛DiFC应用中的潜力。

结果一致表明,CNN分类器解决了我们先前报告的阈值方法的关键局限性。具体而言,当使用高阈值时,阈值方法虽降低了假阳性,但无法捕获低信噪比峰值,导致漏掉真阳性。相反,降低阈值虽能捕获更多真阳性,但显著增加了假阳性,尤其是在噪声数据集中。然而,CNN分类器同时考虑了候选峰值的形状和振幅,从而在捕获更多真阳性的同时保持了较低的假阳性率,实现了两者的平衡。

在噪声数据场景下,CNN分类器的优势尤为明显,因为在此类情况下信号伪影和波动较为普遍。阈值方法在这些条件下表现不佳,往往将伪影误认为候选峰值,产生大量假阳性。相比之下,CNN分类器能有效区分真实峰值与伪影,展现出在复杂环境下的优越性能。阈值方法的这一缺陷部分源于其仅在两个探针同时检测到峰值时才排除伪影。在噪声条件下,同时存在于两个探针中的波动可能在其中一个探针中超过检测阈值,而在另一个探针中则没有;所检测到的峰值候选因此没有匹配的对应物,可能被保留为未匹配峰值,从而导致假阳性。由于CNN基于每个候选的时域形状和振幅进行分类,它可以拒绝此类伪影,而不考虑另一个探针中是否存在低于阈值的对应信号。

尽管具有上述优势,本研究的一个局限在于缺乏CTC阳性小鼠数据集的独立金标准。如上文所述,对于对照组(非CTC阳性)小鼠,所有检测到的事件均可预先确定为伪影(因为不存在CTC),这提供了与标注无关的金标准。同样,对于模拟数据集,所有事件标签均由构造方式确定。因此,这两种情况均可提供独立的金标准来评估我们分析流程的性能。对于CTC阳性数据集,体内指标反映的是与专家手动标注的一致性,而非经核实的真实细胞检测。

此外,虽然其他架构也可应用于此任务,但我们选择CNN,是因为其适合DiFC峰值的局部时域形状特征,且在类似时间序列问题中已有成功应用的经验。系统性的架构比较超出了本文范围,留待未来工作完成。

我们还计划将此方法应用于清醒自由活动小鼠的DiFC扫描。在此类场景中,运动伪影给信号解读的准确性带来了重大挑战。阈值方法在此条件下容易失效,产生过多的假阳性,从而降低其可靠性。CNN分类器凭借处理复杂噪声数据的能力,非常适合应对这些挑战,强化了其在DiFC面向动态及真实实验场景的持续发展中的重要性。

同样,这种基于机器学习的增强型时间序列信号处理方法也可能对基于活体显微成像或光声设计的体内流式细胞术方法具有应用价值。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号