FGD-Net:面向课堂个体学生行为检测的细粒度门控细节网络

《Big Data and Cognitive Computing》:FGD-Net: A Fine-Grained Gated Detail Network for Individual Student Behavior Detection in Classrooms

【字体: 时间:2026年09月09日 来源:Big Data and Cognitive Computing 5.3

编辑推荐:

  课堂行为检测通过为学习参与度分析、课堂互动评估和教学评价提供客观视觉证据,在智能教育中发挥着重要作用。然而,在真实课堂环境中,由于行为相关线索细微、动作类别视觉相似、遮挡以及复杂背景干扰,对个体学生的准确行为检测仍具有挑战性。为解决这些挑战,该论文提出一种细粒

  
课堂行为检测通过为学习参与度分析、课堂互动评估和教学评价提供客观视觉证据,在智能教育中发挥着重要作用。然而,在真实课堂环境中,由于行为相关线索细微、动作类别视觉相似、遮挡以及复杂背景干扰,对个体学生的准确行为检测仍具有挑战性。为解决这些挑战,该论文提出一种细粒度门控细节网络(FGD-Net),用于课堂场景中个体学生行为的细粒度检测。所提出的网络从三个互补方面改进行为表示。首先,设计细粒度动态重校准卷积块(FDRC)以增强行为敏感局部区域,如手、手臂、头部和上半身姿势。其次,引入多路径门控上下文聚合块(MGCA),从多个特征路径聚合互补上下文信息,从而增强视觉相似的课堂行为的语义表示。第三,开发移位引导的细节重建上采样块(SDRU),以减轻多尺度特征融合过程中的空间细节丢失,并改善小尺度行为相关线索的重建。研究人员在SCB5和SCB3课堂行为检测数据集上进行了大量实验。实验结果表明,FGD-Net在两个数据集上均取得了优于近期检测器的检测性能。这些结果证明了FGD-Net作为可扩展课堂视频分析与智能教育应用的高效视觉感知模型的潜力。
课堂行为检测在智能教育中具有重要作用,可为学习参与度分析、课堂互动评估和教学评价提供客观视觉证据。然而,真实课堂环境存在行为相关线索细微、动作类别视觉相似、遮挡和复杂背景干扰等问题,使得个体学生行为检测面临挑战。传统课堂观察依赖人工监控或事后视频分析,耗时且主观;视频动作识别方法需要连续视频片段和密集时间标注,计算成本高;姿态估计方法在拥挤场景中易受关键点定位误差影响;基于目标检测的方法更利于实时部署,但仍需解决局部判别区域增强、上下文语义聚合和空间细节重建三个关键问题。为此,研究人员提出了细粒度门控细节网络(FGD-Net),用于复杂课堂场景中的个体学生行为细粒度检测。实验表明,FGD-Net在SCB5和SCB3课堂行为检测数据集上均优于近期检测器,且在保持实时推理速度的同时具有紧凑的模型规模,展示了其作为可扩展课堂视频分析与智能教育应用视觉感知模型的潜力。该论文发表在《Big Data and Cognitive Computing》上。

为开展研究,研究人员采用了以下主要关键技术方法。FGD-Net采用由骨干网络、颈部网络和三个多尺度检测头组成的层次化目标检测框架,并引入三个专用模块:细粒度动态重校准卷积块(FDRC),通过分裂-聚合结构和动态重校准注意力单元增强手、手臂、头部等行为敏感局部区域;多路径门控上下文聚合块(MGCA),通过多路径特征聚合和部分门控卷积混合器增强上下文语义;移位引导细节重建上采样块(SDRU),使用上采样和四方向移位通道混合器重建空间细节。实验使用SCB5数据集(5193张训练图像、1671张测试图像)和SCB3数据集(3418张训练图像、848张测试图像),二者均标注举手、阅读和写作三类行为;另使用KITTI数据集作为补充验证,均来自真实场景。

研究结果如下:

4.1 数据集:实验采用SCB5和SCB3两个课堂行为检测数据集,涵盖举手、阅读和写作三类行为。SCB5图像来自真实课堂教学场景,样本包含尺度变化、遮挡、人群密度和视角变化;SCB3规模较小,用于检验模型在不同样本分布下的有效性。另引入KITTI数据集作为外部验证,以考察模块的通用性。

4.2 实现细节:所有模型在相同实验设置下训练,采用PyTorch 2.2.2的YOLO框架、SGD优化器、固定输入分辨率和Mosaic等增强策略,以保证公平比较。

4.3 评估指标:采用Precision、Recall、F1-score、平均精度(AP)、均值平均精度(mAP)以及GFLOPs、参数量、模型大小和FPS等效率指标,全面衡量检测性能。

4.4 与最新方法的比较:在SCB5上,FGD-Net的Precision、Recall、F1-score均优于对比检测器,mAP50、mAP75和mAP50:95分别达到64.68%、54.20%和46.46%,超过最强基线2.19、1.57和0.73个百分点;在SCB3上也取得最佳整体性能。重复随机种子实验进一步验证了性能的稳定性。

4.5 尺度wise检测分析:按COCO尺度定义,FGD-Net在小、中、大目标上的AP和AR均最高,其中小目标AP相比YOLOv11n提高10.00个百分点,表明模型对远处小尺寸学生具有良好的检测能力。

4.6 可视化分析:使用Grad-CAM++生成激活热图,并引入激活定位比(ALR)和目标-背景激活比(TBR)定量评估。FGD-Net在目标区域产生更集中、更完整的激活响应,ALR和TBR均最高,说明其特征表示更具判别性。

4.7 在KITTI数据集上的补充评估:在KITTI数据集上,FGD-Net相比YOLOv11n基线将mAP50提高3.54个百分点、mAP50:95提高4.55个百分点,表明所提模块在显著不同的目标检测场景下仍有效。

4.8 消融研究:以YOLOv11n为基线,逐步加入FDRC、SDRU和MGCA,各项指标持续提升。完整FGD-Net相比基线将mAP50、mAP75和mAP50:95分别提高5.42、6.20和4.97个百分点。SDRU优于CARAFE和DySample等上采样策略,且四方向移位配置最佳。

4.9 失败与鲁棒性分析:失败案例显示高置信度误检、遮挡导致漏检以及手部交互部分遮挡造成的类别混淆。Precision-Recall曲线和混淆矩阵表明FGD-Net改善了阅读和写作的识别,但阅读仍是最具挑战的类别。

4.10 部署实验与实用应用:研究人员在NVIDIA GeForce RTX 3060平台上部署了课堂行为检测系统,实现了实时检测与可视化,并举例说明了将帧级检测结果聚合为教师可读的课堂活动比例统计的工作流,验证了实际应用的可行性。

讨论部分指出,联合建模局部判别区域、上下文语义和空间细节能够有效提升细粒度课堂行为检测;FDRC带来的初始提升最大,SDRU进一步改善定位,MGCA则抑制了背景干扰。FGD-Net不需要姿态或时间标签,推理流程简单,但无法完全替代时序或骨架信息。模型作为视觉感知组件,可将课堂视频流转化为结构化行为事件,其紧凑高效的特点有利于边缘-云端协同分析。同时,可观察行为不应直接等同于注意力或学习成效,实际应用需结合教学情境并重视数据治理与隐私保护。研究局限在于仅覆盖三类行为、数据集同源、缺乏对遮挡和距离的独立量化标注,且未建模时间信息;未来需要通过更丰富的数据集、结合多目标跟踪与时序建模,以及模型量化和隐私保护等方式进行扩展。

研究结论翻译如下:在本文中,研究人员提出了FGD-Net,一种面向复杂课堂场景中细粒度学生行为分析的课堂行为检测网络。为应对细微行为线索、视觉相似行为类别、多尺度姿态变化和背景干扰等挑战,FGD-Net引入了三个专门模块:细粒度动态重校准卷积块(FDRC)、多路径门控上下文聚合块(MGCA)和移位引导细节重建上采样块(SDRU)。在SCB5和SCB3数据集上的大量实验证明了FGD-Net的有效性。在SCB5数据集上,FGD-Net达到64.68%的mAP50和46.46%的mAP50:95,分别超过最强基线2.19和0.73个百分点。在SCB3数据集上,FGD-Net以70.78%的mAP50和50.52%的mAP50:95获得最佳整体性能,表明其在不同数据规模和课堂场景分布下的稳健性。需要强调的是,当前研究仅评估了FGD-Net在举手、阅读和写作三种课堂行为类别上的表现,因为这是所用SCB5和SCB3数据集标注的行为类别。因此,当前结果不应被解释为对全部课堂行为的综合识别。补充KITTI实验进一步表明,所提出的架构修改在截然不同的目标检测设置下仍然有效。消融研究验证了FDRC、MGCA和SDRU的正向贡献。将FGD-Net扩展到更广泛的课堂行为分类需要包含更丰富且充分平衡标注的数据集、针对扩展标签空间调整和重新训练分类头,并进一步评估视觉相似行为之间的类别混淆。对于可能强烈依赖时间演化和交互上下文的行为,如同伴互动、听讲、使用移动设备或其他活动,可能还需要额外的时间建模、学生跟踪和多帧信息。因此,未来工作将侧重于将当前的三类检测框架扩展至更全面的课堂行为分析。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号