《Journal of Imaging》:Open Long-Tailed Multimodal 3D Model Classification Based on Sample-Enhanced Category-Space Learning
编辑推荐:
随着三维(3D)感知技术的快速发展,多模态三维模型分类取得了显著进展。然而,现有多数方法建立在封闭且均衡的假设下,难以适用于存在稀少尾部类、模糊难分样本以及持续涌现新类别的开放长尾场景。为此,研究人员提出一种面向开放长尾多模态三维模型分类的样本增强类别空间学习
随着三维(3D)感知技术的快速发展,多模态三维模型分类取得了显著进展。然而,现有多数方法建立在封闭且均衡的假设下,难以适用于存在稀少尾部类、模糊难分样本以及持续涌现新类别的开放长尾场景。为此,研究人员提出一种面向开放长尾多模态三维模型分类的样本增强类别空间学习(SE-CSL)方法。该方法首先采用双分支模态编码器分别提取点云(point-cloud)结构表征与多视角(multi-view)语义表征,随后引入Mamba对异构模态间的全局依赖进行建模,生成统一的全局类别表征。为提升类别表征的鲁棒性,研究人员设计了一种类别空间学习策略,联合集成长尾学习、少样本表征稳定化与难分样本增强;进一步提出长尾平衡损失、少样本稳定损失与难分样本边界损失,以优化类内紧致性、类间分离性与边界判别性。为处理持续涌现的新类,研究人员引入增量类别空间扩展机制,能够区分新类、保留旧类信息并支持新旧类别的统一分类。在ModelNet40与ShapeNet55上的大量实验验证了SE-CSL的有效性与鲁棒性。
研究背景方面,开放长尾条件下的多模态三维(3D)模型分类面临三大挑战:尾部类样本极少导致决策边界模糊、单一模态证据不足、以及新类别持续涌现带来的类别空间扩展需求。现有方法多在封闭均衡假设下孤立处理多模态融合、长尾识别、难分样本判别与增量学习,难以在渐进扩展的多模态类别空间中联合优化。鉴于此,研究人员在《Journal of Imaging》发表该研究,提出样本增强类别空间学习(SE-CSL, Sample-Enhanced Category-Space Learning)框架,旨在构建平衡且可扩展的类别空间,从而提升开放长尾多模态三维分类的鲁棒性。
关键技术方法上,研究人员采用ModelNet40(40类12311个模型)与ShapeNet55(55类46513个模型)作为基准数据集,并为评估鲁棒性引入Occluded-ModelNet40与Rendered-ModelNet40变体。方法层面构建双分支特征提取器:点云分支以DGCNN(Dynamic Graph Convolutional Neural Network)为骨干,经四层EdgeConv输出512维嵌入;多视角分支以ImageNet-1K预训练ResNet50为骨干,各视角2048维特征经线性投影对齐至512维。异构序列送入Mamba(选择性状态空间模型,State Dim=16, Kern=6, Expan=2)栈式层建模全局依赖,全局平均池化与层归一化后得统一表征。类别空间学习模块联合长尾平衡损失Llong、少样本稳定损失Lfew与难分样本边界损失Lhard优化类内紧致与类间分离;增量学习模块通过共享类别空间变换函数与旧类中心保持项实现新旧类统一分类。
研究结果部分,第三章方法论述如下。双分支特征提取器小节指出,点云几何与多视角外观语义互补,统一512维嵌入空间为后续Mamba建模提供对齐输入。Mamba基于全局依赖建模小节表明,选择性状态空间递归以线性复杂度传播跨模态上下文,门控残差更新后全局平均得统一表征z,融合点云几何、多视角语义及异构长程依赖。类别空间学习模块小节中,Llong依头部/中部/尾部类分组加权(Alpha=0.6)抑制头部类主导;Lfew以原型稳定系数Proto=2拉近少样本与类心距离;Lhard以阈值τ=0.5筛选边界难分样本施以边界约束,三者联合提升分布平衡与边界判别。增量学习模块小节显示,第r阶段新类中心由少样本变换特征均值初始化,旧类中心沿用上阶段并加保旧损失项,Softmax分类器在全部已见类上预测,t-SNE可视化证实旧类结构保留与新类紧凑成簇。
第四章实验结果表明,在ModelNet40上整体准确率(OA)达94.16%、平均类准确率(mAcc)91.75%,ShapeNet55上OA 89.12%、mAcc 83.27%,超越ViT-GE、PEVA-Net、MV-CLIP等基线;计算量18.9G FLOPs、38.6M参数,优于CLIP类多视角方法。遮挡与渲染变异条件下OA仍达80.82%与88.53%,Mamba较Transformer变体省算力且精度相当。参数实验中Dim=16/Kern=6/Expan=2与Alpha=0.6/Proto=2/τ=0.5为最优。增量学习表10显示ModelNet40自基相96.29% OA渐降至末相94.16%,ShapeNet55自92.65%降至89.12%,遗忘值低。消融表11-12确认双模态、Mamba、CSL、增量扩展及各损失项均正向贡献,Llong+Lfew+Lhard联合最优。可视化与失败例分析指出flower_pot与vase因上部开口收缩轮廓互混率24.71%,容器类与局部结构缺失类为典型失败模式。
讨论与结论翻译部分,研究人员提出SE-CSL用于开放长尾多模态三维模型分类,从互补的点云与多视角表征构建平衡可扩展类别空间;Mamba依赖建模整合异构特征,类别空间学习联合处理长尾不平衡、少样本不稳定与难分边界,增量扩展纳入新类并保留旧类信息。ModelNet40与ShapeNet55实验表明该方法在类不平衡与增量引入下维持强分类性能,并改善少样本表征与旧类判别。局限在于全局轮廓相似且局部差异细微类性能下降,极稀新类中心估计不稳,长序列中原型保持无法完全阻累忘。未来工作将细局部表征、稳中心更新、强忘控制、轻量多模态部署及更大开放世界评测。