NucGen3D:一个用于大规模3D细胞核分割的合成框架,具有开源训练数据和模型

《Computers in Biology and Medicine》:NucGen3D: A synthetic framework for large-scale 3D nuclear segmentation with open-source training data and models

【字体: 时间:2026年09月04日 来源:Computers in Biology and Medicine CS11.3

编辑推荐:

  摘要:在3D显微镜图像中进行稳健的细胞核分割是定量细胞生物学中一个关键但尚未解决的挑战。主要挑战在于带注释的体积数据集的稀缺性和变异性。由于这些数据难以获得,大多数现有先进方法(包括Cellpose)对单个2D切片进行分割,然后通过启发式方法重建3D体积,从而

  
摘要:在3D显微镜图像中进行稳健的细胞核分割是定量细胞生物学中一个关键但尚未解决的挑战。主要挑战在于带注释的体积数据集的稀缺性和变异性。由于这些数据难以获得,大多数现有先进方法(包括Cellpose)对单个2D切片进行分割,然后通过启发式方法重建3D体积,从而丢失了关键的空间上下文。研究人员对专家注释者表现的分析证实,忽略3D上下文会在细胞核检测和注释中引入显著的变异性。尽管少数3D模型是在小型或玩具数据集上训练的,但目前尚无大规模、公开可用的资源来支持高容量3D分割网络的稳健训练。为了解决这一问题,研究人员提出了NucGen3D,这是一个可定制的模拟框架,可从有限的2D输入(特别是2018年Data Science Bowl数据集)生成大规模、带注释的3D显微镜数据集。NucGen3D可在多种生物学和成像场景中生成逼真的3D体积,包括细胞核形态、空间排列和成像噪声的变化。利用这些合成数据,研究人员从零开始训练了两个模型:一个在类似Cellpose的条件下训练的2D卷积神经网络,以及一个扩展了2D设置的完全3D卷积模型。研究人员在一个具有复杂核结构的挑战性独立真实世界数据集上评估了这两个模型。两个模型,尤其是3D模型,在性能上与现有先进方法(包括那些在更大注释数据集上训练或基于更复杂架构的方法)相当。这些结果表明,在大规模训练模型时,合成数据可以有效替代完整的3D注释。为了促进可重复性和进一步研究,研究人员将NucGen3D框架和完全训练的3D分割模型作为开源资源发布,使其成为首个用于大规模3D细胞核分割的端到端开放资源。
论文解读:NucGen3D:基于合成数据的大规模3D细胞核分割框架

1. 研究背景与问题

在定量细胞生物学中,从三维(3D)显微镜图像中准确分割细胞核是理解组织结构、细胞密度和表型异质性的基础。随着空间转录组学等技术的发展,在完整组织架构内可靠地解析细胞核对于解释空间定位的基因表达模式至关重要。尽管深度学习显著提升了二维(2D)细胞核分割的性能,但准确且稳健的3D分割仍是一个未解决的挑战。其主要瓶颈在于缺乏大规模、高质量且带注释的3D数据集。手动生成3D注释既耗时又存在内在主观性,尤其在细胞核边界模糊的致密组织中,这一问题尤为突出。现有数据集在规模和一致性方面均有限,制约了通用分割模型的开发与评估。此外,人工注释本身的可靠性也存疑,注释者之间的差异以及核边界定义的不确定性会引入偏差,直接影响模型训练和评估。因此,亟需替代方法来生成可扩展且一致的训练数据。合成数据生成提供了一种有前景的途径,通过程序化生成具有已知真值的显微图像,可克服注释瓶颈并控制数据多样性和复杂性。然而,现有合成方法在生成逼真3D核结构以训练体积模型方面仍存在局限。

2. 研究目的与贡献

针对上述问题,研究人员提出了NucGen3D,一个可定制的程序化模拟框架,能够从有限的2D注释输入(2018 Data Science Bowl数据集)生成大规模、带注释的3D显微镜图像。该框架旨在弥合有限真实数据与稳健训练集需求之间的差距。研究的主要贡献包括:(1) 提出可扩展的带注释3D核显微数据生成框架;(2) 通过2D、2.5D和3D训练策略的对比研究,证明在合成数据上训练分割模型可提升性能和泛化能力;(3) 量化人类注释的变异性和影响。

3. 主要技术方法

3.1 数据来源与样本队列

源数据集采用2018 Data Science Bowl(DSB)数据集,包含851张带注释的2D显微镜图像,约37,000个细胞核,覆盖多种细胞类型、成像模态和采集条件。评估数据集包括两个独立的3D荧光显微镜数据集:ScAT(小鼠皮下脂肪组织的共聚焦显微镜图像,DAPI染色)和Quadri(再生小鼠股四头肌骨骼肌的共聚焦图像,DAPI染色,涵盖损伤后时间过程)。所有动物实验均经区域伦理委员会批准并在法国“研究部”注册。肌肉损伤模型使用8-12周龄雄性C57BL/6J小鼠,通过甘油注射诱导。样本经4%多聚甲醛固定、琼脂糖包埋、振动切片机切成300 μm切片,DAPI染色后使用ZEISS LSM880共聚焦显微镜采集,体素分辨率为0.415 μm × 0.415 μm × 0.8 μm。

3.2 人类注释实验

为评估注释任务的局限性和复杂性,研究人员进行了两项专家注释实验。实验1(8名参与者)中,切片以随机顺序呈现,参与者无法访问相邻切片,缺乏深度上下文;实验2(9名参与者,其中6人参加过实验1)中,切片按原始顺序呈现,允许滚动堆栈以获取3D上下文。注释使用Fiji软件的多点工具标记细胞核中心。根据亮度(暗、中等、亮)和核在堆栈中的位置(中间、边界)对核切片进行分类,并计算注释者之间的一致性百分比。统计比较采用单因素方差分析和非参数Kruskal-Wallis检验。

3.3 NucGen3D生成框架

NucGen3D框架从DSB中提取11,353个细胞核及其掩膜,经标准化和增强(旋转、缩放、变形)构建包含99,535个细胞核的库。合成图像在600 × 600 × 8体素的3D背景上生成,背景使用Perlin噪声初始化以模拟荧光显微镜噪声模式。细胞核位置通过Perlin空间滤波器实现生物学上逼真的聚类分布。每个2D核通过迭代的腐蚀、压紧和亮度调制(伽马校正)外推为3D结构,模拟核沿z轴的演变。图像合成后应用边界平滑,将二值掩膜转换为Cellpose兼容的流场。噪声在训练时动态生成,包括泊松噪声(光子散粒噪声)、高斯噪声(读出噪声)、均匀噪声(暗电流)、结构噪声(Perlin各向异性模式模拟自发荧光)、量化噪声(位深度降低和恢复),以3D方式应用以保持层间相干性。最终生成40,000张带注释的3D图像(约1000万个核),生成一张图像需30秒至2分钟。

3.4 分割模型与评估指标

研究人员评估了多种模型:预训练的CellNuclei(在DSB和其他核数据集上训练的Cellpose)、CellCyto(多数据集训练的通用Cellpose)、CellSam(结合视觉Transformer骨干和SAM的先进Cellpose变体);以及自训练的DSBNet2D(在2D DSB上训练的注意力残差U-Net)、NucNet2D/2.5D(在NucGen3D的2D切片上训练的注意力残差U-Net)、NucNet3D(在NucGen3D上训练的完全3D注意力U-Net)。2D模型输入288×288,输出256×256×3;3D模型输入288×288×8,输出256×256×8×4。所有模型使用Cellpose损失函数(结合流场回归和分割目标),仅采用旋转增强。评估指标:对完整分割掩膜使用交集比(IoU),在0.5-0.95阈值范围内取平均;对点注释使用精确率、召回率和F1分数,基于实例级匹配。

4. 研究结果

4.1 人类注释变异性

实验1中,暗、中等、亮核的注释一致性分别为51.7%、82.6%、95.2%;实验2中分别提升至62.7%、87.4%、95.7%。对于中间切片和边界切片,实验1的一致性为89.4%和59.7%,实验2提升至92.1%和69.1%。除亮核外,实验间差异均显著(p < 0.001)。结果表明,人工注释具有内在变异性,受信号强度和空间上下文强烈影响,即使在最优条件下一致性也不超过95%。

4.2 2D评估

在DSB测试集上,NucNet2D的IoU达0.859,显著优于CellNuclei2D(0.816)和DSBNet2D(0.739),证明在NucGen3D生成数据上训练可提升2D分割性能。

4.3 2D迁移

在ScAT和Quadri融合的迁移数据集上,NucNet2D大幅优于CellNuclei2D(两者仅训练数据不同),略优于CellCyto2D;CellSam2D因模型复杂度更高而略胜NucNet2D。这表明合成数据训练出的模型具有良好的泛化能力。

4.4 3D迁移

在3D迁移任务中,NucNet3D(唯一完全3D模型)的F1分数达0.88,优于所有U-Net模型,并与CellSAM2.5D相当。在像素级分割指标上,NucNet3D的Binary IoU较低(因预测掩膜偏小),但CellSAM2.5D漏检更多核(F1分数更低)。定性比较显示NucNet3D与CellSAM2.5D视觉质量相当或略优,轮廓更平滑,拥挤核分离更好,噪声区域检测更稳健。

4.5 人类注释偏差

模型预测与人工注释的差异部分反映了人类注释的不一致性。例如,边界处部分截断的核常被人类忽略,极暗或高噪声核也易被遗漏;有时人类会将一个核误标为两个,或模型将两个相邻核欠分割为一个。这些偏差会负面影响对模型真实性能的评估,而NucGen3D训练的模型在低对比度或高噪声情况下能更一致地识别核。

4.6 消融研究

对NucNet3D的训练样本量消融显示,减少至20k和5k样本仍可保持较好性能,但增加数据量可进一步提升。移除Perlin噪声对性能影响巨大,因为基本合成图像无噪声且Perlin噪声模拟了自发荧光的可变性;泊松噪声的影响也显著但相对较低,因为DSB核图像已含有部分泊松噪声。

5. 讨论与结论

研究人员指出,NucGen3D目前依赖DSB的核库,可能无法完全覆盖不同组织、发育阶段、病理背景或成像模态的核形多样性。当前2D到3D外推模型仍未完全再现真实3D核组织,尤其缺乏组织特异性空间约束和染色伪影,可能导致域偏移。未来工作应扩展核库并加入更真实的组织及模态特定生成算法。

研究结论表明,3D数据的可获取性对专家注释过程及模型性能至关重要。NucGen3D框架从有限2D输入生成大规模带注释的3D显微数据集,使2D和3D模型能够从零训练,优于在大规模2D数据集上训练的模型,并能与更复杂架构竞争。合成数据可有效替代真实3D注释。NucGen3D框架作为首个端到端的开放生成数据资源发布,用于大规模3D细胞核分割。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号