瞳孔-DLC:一个用于跨意识和无意识状态的可扩展、无标记瞳孔动力学追踪的开源深度学习流程

《Journal of Neuroscience Methods》:Pupil-DLC: An open-source deep learning pipeline for scalable, marker-less tracking of pupil dynamics across conscious and unconscious states

【字体: 时间:2026年07月12日 来源:Journal of Neuroscience Methods 2.5

编辑推荐:

  研究人员介绍了一种基于DeepLabCut(DLC)的开源瞳孔追踪流程Pupil-DLC,该流程专为可扩展、无标记地追踪小鼠在意识和无意识状态下的瞳孔动力学而设计。该流程训练于21,909张手动标注的帧(来源于140多个视频,涵盖69只在头固定条件下的小鼠,处

  
研究人员介绍了一种基于DeepLabCut(DLC)的开源瞳孔追踪流程Pupil-DLC,该流程专为可扩展、无标记地追踪小鼠在意识和无意识状态下的瞳孔动力学而设计。该流程训练于21,909张手动标注的帧(来源于140多个视频,涵盖69只在头固定条件下的小鼠,处于多种药物诱导的意识状态,包括致幻剂和麻醉状态),旨在最大化训练数据集中瞳孔大小的变异性。Pupil-DLC提供了双模型框架:通用模型(General Model,GM)用于高通量分析,个体模型(Individual Model,IM)用于会话特异性精度。研究人员通过后处理工具(如椭圆拟合)提高了准确性并降低了噪声,同时该流程能稳健地泛化到未在标注数据集中包含的另一物种(如人类)的视频。与现有工具(EyeLoop、MEYE、OpenIris)相比,Pupil-DLC在准确性(平均像素差异:GM为1.28±1.09,IM为1.22±1.04,而其他工具为23.81–35.96)和帧保留率(接近100%,而MEYE和OpenIris约保留50%)上表现更优。GM的计算效率与OpenIris相当(每视频约11.40分钟),而IM尽管更精确,但计算成本增加约100倍。置信度指标与人类对帧质量的评估高度一致,并允许通过调整椭圆拟合阈值在数据完整性和准确性之间进行权衡。作为交叉物种泛化的二级展示,研究人员将仅在小鼠数据上训练的GM应用于人类瞳孔视频(良好质量下),无需重新训练即可产生与人工标注高度匹配的结果;在低质量视频中,IM或微调GM(GM-FT)仍能保持高精度。Pupil-DLC是一个开源的离线分析工具,为研究小鼠和人类中与瞳孔相关的脑状态动力学(如觉醒、认知、意识和无意识状态)提供了灵活的基础。
**论文解读文章**

**研究背景与问题**

瞳孔直径在经亮度和焦深校正后,已成为跨物种内部脑状态(brain state)的可靠指标。瞳孔波动能够追踪觉醒(arousal)、注意(attention)、情绪加工、认知负荷以及自主神经生理活动,反映了中枢与外周神经系统动力学之间的强耦合。在临床领域,瞳孔测量术(pupillometry)逐渐被用作意识障碍或意识丧失的无创生物标志物(biomarker),用于神经监测和预后评估。然而,现有的瞳孔追踪软件通常受限于专有或僵化的流程,缺乏跨实验范式的可扩展性(scalability)、可重复性(reproducibility)和灵活性。许多方法对光照变化敏感、需要手动校正,或未能与现代深度学习框架集成。近年来的深度学习工具(如MEYE)虽取得重要进展,但缺乏针对多样化状态训练和会话特异性模型优化的框架。因此,研究人员开发了一个基于DeepLabCut(DLC)的可定制、开源瞳孔追踪流程,旨在实现高通量、精确、无标记的瞳孔动力学分析,并验证其跨物种泛化能力。该论文发表在《Journal of Neuroscience Methods》。

**研究内容与结论**

研究人员构建了Pupil-DLC流程,采用双模型框架:通用模型(General Model, GM)和个体模型(Individual Model, IM)。GM训练于包含21,909张手动标注帧的大规模多样化数据集,这些帧来自140多个视频,涵盖69只头固定小鼠在多种药物诱导的意识和无意识状态(包括清醒、裸盖菇素给药、异氟烷麻醉、乌拉坦麻醉以及裸盖菇素联合酮色林预处理)下的瞳孔视频。训练数据特意选取了最大化瞳孔大小变异性的条件,以使模型具备跨实验条件泛化的能力。IM则针对每个新视频随机采样150帧进行手动标注并微调,以获得会话特异性精度。此外,研究人员还实现了会话特异性微调模式(GM-FT),从GM检查点(checkpoint)出发继续在少量新帧上训练,以平衡泛化能力与适应能力。

结论方面,Pupil-DLC能稳健捕捉状态依赖的瞳孔动力学:清醒和裸盖菇素条件下瞳孔较大且波动明显,奔跑时比静息时更扩张;乌拉坦和异氟烷麻醉下瞳孔较小且变异性显著降低;乌拉坦镇静过程中瞳孔在扩张和收缩两种亚状态间交替。在准确性评估中,GM和IM的瞳孔大小估计值与人工标注的地面真值(ground truth, GT)高度一致(GM平均像素差异1.28±1.09,IM为1.22±1.04),显著优于EyeLoop、OpenIris和MEYE(差异分别为23.81±16.85、27.43±23.11、35.96±19.73)。帧保留率方面,GM和IM接近100%,而MEYE和OpenIris仅保留约50%的帧。计算速度上,GM与OpenIris相当(平均每视频11.40分钟),IM则耗时约423.84分钟。置信度指标与人工帧质量评估高度吻合,且可通过调整椭圆拟合阈值(最小点数、置信阈值)在数据完整性和准确性之间进行灵活权衡。在跨物种泛化测试中,仅在小鼠数据上训练的GM直接应用于高质量人类红外瞳孔视频时能产生稳定跟踪,无需重新训练;在低质量视频或自然光照彩色视频中,IM或GM-FT(基于150帧微调)能恢复接近GT的精度,偏差仅约3像素。这些结果表明,Pupil-DLC在准确性、帧保留率和计算效率上均优于现有工具,并展现出从实验室小鼠到人类跨场景应用的潜力。

**主要关键技术方法**

1. **视频采集与实验范式**:使用红外相机(Mako G-032B PoE,30 Hz,640×480像素)记录头固定小鼠右眼,置于完全黑暗环境中。实验状态包括清醒(静息与奔跑)、裸盖菇素(1 mg/kg,腹腔注射)、异氟烷吸入麻醉(5%诱导,1–2%维持)、乌拉坦静脉麻醉(1.5–1.8 mg/kg)以及裸盖菇素联合酮色林预处理。还采用基于Devor和Zalkind(2001)的麻醉评分量表(0–16分)量化意识状态(≥11分为无意识)。所有小鼠(C57BL/6J,n=69,来自杰克逊实验室)经头框植入手术和3周习惯化训练后,连续三天进行记录。

2. **深度学习模型训练与微调**:基于DeepLabCut(ResNet-50骨架)进行无标记的关键点估计。每帧标注12个等距瞳孔轮廓点(顺时针排列)和4个眼睛参考点(内外眼角)。通用模型(GM)在21,909帧上训练1,000,000次迭代。个体模型(IM)对每个新视频随机采样150帧,微调500,000次迭代。GM-FT模式从GM检查点出发,使用三阶段学习率调度(5×10-4、10-4、5×10-5)进行最多200,000次迭代微调,训练早停于50,000次迭代。

3. **后处理与椭圆拟合**:仅保留置信度≥0.9的关键点,至少6个高置信度点时才进行椭圆拟合(采用scikit-image的EllipseModel,最小二乘法)。瞳孔大小定义为椭圆半长轴半径r=max(a,b)。帧缺失时记为NaN。推理速度优化采用自定义多线程流水线(预取批量至8个缓冲队列)和TensorFlow XLA编译(global_jit_level=ON_2)以及自动混合精度(FP16),在RTX 3090 Ti上达到最高350 Hz的吞吐量(批量大小64)。

4. **性能评估**:使用ImageJ手动标注帧作为地面真值(GT),比较Pupil-DLC与EyeLoop、MEYE、OpenIris的准确性、帧保留率和计算时间。统计检验使用Student’s t检验或Mann-Whitney U检验(正态性检验为Shapiro-Wilk,方差齐性为Levene’s检验)。跨物种泛化测试使用公开的人类红外瞳孔数据集(Tonsen et al., 2016)和自录的人类彩色视频(自然光照,帧率24–60 Hz),进行零样本(zero-shot)评估。

**研究结果**

**3.1 Pupil-DLC训练数据集涵盖意识和无意识状态下小鼠瞳孔动力学的完整范围**
通过对头固定小鼠在多种药物诱导意识状态下的视频进行标注,训练数据集中瞳孔大小表现出预期的状态依赖性差异:清醒和裸盖菇素条件下瞳孔较大且波动明显,奔跑时比静息时更扩张;乌拉坦和异氟烷麻醉下瞳孔较小且变异性降低;乌拉坦镇静期间瞳孔在扩张和收缩两种亚状态间交替。个体水平与群体水平均一致。数据集总计包括清醒记录95段、异氟烷麻醉35段、乌拉坦镇静32段、裸盖菇素给药(含或不含酮色林预处理)35段。

**3.2 Pupil-DLC相对于人类地面真值和现有方法达到高准确性**
相比地面真值,GM和IM的瞳孔大小估计误差(平均像素差异)分别为1.28±1.09和1.22±1.04,显著低于EyeLoop(23.81±16.85)、OpenIris(27.43±23.11)和MEYE(35.96±19.73)。帧保留率方面,GM和IM接近100%,MEYE和OpenIris仅约50%。计算时间上,GM平均11.40分钟/视频,与OpenIris(15.52分钟)相当,而IM耗时423.84分钟(约100倍增加)。

**3.3 Pupil-DLC置信度指标可靠地反映测量质量和准确性**
GM和IM的平均置信度分别为0.97±0.035和0.98±0.033,与人工帧质量评估高度一致(高质量帧置信度高,低质量帧置信度低)。置信度在休息和奔跑条件下无显著差异(Mann-Whitney U检验,p>0.05)。通过调整椭圆拟合的最小点数(≥5–12)和置信阈值(≥0.5–0.99),可平衡帧保留率与测量误差:更严格阈值提高准确性但增加帧损失。Pupil-DLC在休息和奔跑状态下均保持与GT一致的追踪准确性。

**3.4 Pupil-DLC泛化到未见过的不同记录条件下的人类瞳孔视频**
在高质量人类红外视频中,GM零样本应用时稳定追踪瞳孔,瞳孔大小估计值(GM: 57.55±11.15像素;IM: 57.50±11.09)与GT(59.18±11.64)高度匹配。在低质量视频中,GM无法检测瞳孔,但IM(偏差3.35±2.81像素)和GM-FT(3.42±2.82像素)均能准确跟踪。在3段自录的彩色视频(含静帧和头动条件)中,GM失败,而IM和GM-FT(基于150帧微调)与GT的偏差分别为GM: 11.32±7.39、IM: 0.89±0.79、GM-FT: 0.71±0.75;对于有头动的视频,GM: 4.92±5.10、IM: 0.62±0.47、GM-FT: 1.22±0.64。这些结果表明,GM在训练条件相近时可直接泛化,IM和GM-FT则适应更广泛记录条件。

**讨论与结论**

讨论部分指出,Pupil-DLC作为基于DeepLabCut的开源流程,克服了现有瞳孔测量软件的局限性,能够从视频中准确提取瞳孔动力学。其关键贡献包括:基于关键点的表示方法显式建模瞳孔边界,对部分遮挡、角膜反射和形状变形具有鲁棒性;GM/IM双模型框架平衡高通量处理与会话特异性精度;在覆盖多种药物诱导意识状态的独特多样化数据集上训练,最大化泛化能力。与MEYE相比,额外提供了后处理质量控制、可调置信度阈值以及通过少量帧快速微调的能力。置信度指标可指导参数选择,在数据完整性和准确性之间灵活权衡。跨物种泛化是一个意外且有价值的结果,表明仅用小鼠数据训练的模型在成像条件相似时能共享视觉和几何特征。GM、IM和GM-FT的补充角色为异构记录条件下保持高追踪保真度提供了实用策略。此外,Pupil-DLC以帧为单位推断瞳孔大小,与帧率无关,适用于不同帧率(24–95 Hz)。局限性包括:当前研究专注于头固定记录和特定红外成像几何;在自由运动、极端注视角度或变化光照下性能可能不同。瞳孔大小以像素为单位报告,转换为物理单位需要校准相机几何。总之,Pupil-DLC是一个开源、可扩展的瞳孔测量流程,主要设计用于小鼠神经科学,同时作为次要发现展示了向人类视频的稳健泛化能力,为可重复测量瞳孔相关的脑状态动力学提供了技术平台。

**结论部分翻译**
总之,Pupil-DLC是一个开源、可扩展的瞳孔测量流程,主要设计用于小鼠神经科学,结合了高准确性、最低帧丢失和可调质量控制,同时作为次要发现展示了向人类眼部视频的稳健泛化能力。通过降低稳健瞳孔追踪的技术障碍,该框架能够在多样化的实验情境中实现瞳孔相关脑状态动力学的可重复测量,涵盖小鼠基础神经科学和人类转化应用。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号