《Foods》:RiMS-FiLM: Non-Destructive Multimodal Screening for Fixed-Budget Re-Inspection Prioritization of Maize Kernels
编辑推荐:
快速、非破坏性的玉米籽粒优先排序有助于在收获后质量控制中将有限的复检能力进行合理分配。现有的深度学习方法主要优化整体分类精度,并未明确解决在验证资源受限时应优先检测哪些样本的问题。本研究提出了RiMS-FiLM,一种端到端的多模态筛查框架,该框架将籽粒的RGB
快速、非破坏性的玉米籽粒优先排序有助于在收获后质量控制中将有限的复检能力进行合理分配。现有的深度学习方法主要优化整体分类精度,并未明确解决在验证资源受限时应优先检测哪些样本的问题。本研究提出了RiMS-FiLM,一种端到端的多模态筛查框架,该框架将籽粒的RGB外观与轻量级物理属性(重量和尺寸)相结合,以生成复检优先级评分。特征线性调制(Feature-wise Linear Modulation,FiLM)机制能够根据物理测量值自适应地调节视觉表征,而原型引导模块则将融合后的嵌入向量组织成按类别划分的操作性质量优先级区域。风险层级源自原始的GrainSet-Maize缺陷类别,并作为筛查优先级标签使用,而非经实验室验证的毒理学终点。在单一公开数据集GrainSet-Maize的分层划分上,基于五个随机种子的内部评估结果显示,其宏平均F1分数(Macro-F1)达到0.9917 ± 0.0027,并在20%的复检预算内捕获了94.65 ± 0.21%的高优先级样本。此外,与代表性的融合方法和选择性筛查基线相比,该方法减少了严重的高优先级至低优先级的误判。这些结果证明了低成本多模态感知技术在资源受限、非破坏性谷物质量筛查及复检规划中的潜力。
一、研究背景、现存问题与研究意义
在规模化粮食仓储与收购过程中,吞吐量、检测成本及劳动力可用性限制了可进行详细检测的籽粒数量。基于机器视觉和基础物理测量的低成本、非破坏性筛查技术可以快速处理大量样本,而更深入的复检则受限于时间、成本和人力。因此,一个实用的检测系统不仅要预测质量标签,还需确定哪些籽粒应被优先复检。在固定的复检预算下,操作目标是将异常或高优先级籽粒排在筛查列表的前列,以便将有限的验证能力高效分配。
当前的研究存在三个主要问题:首先,大多数现有方法仍以优化整体分类精度为目标,隐式地将所有样本视为同等重要,未考虑有限复检资源的实际约束。其次,低成本筛查线索的多模态性质增加了风险优先级判断的复杂性。视觉外观主要指示霉变、表面变色和虫害等现象,而轻量级物理特性可能揭示完整性损失、变形程度及与杂质的关联,但这些信息无法肉眼直接观察。然而,当前多模态建模研究大多假设所有模态同样可靠,试图在融合过程中缩小模态间差异,未能显式建模样本级别的模态可靠性变化和跨模态冲突结构,从而影响模型在风险排序任务中的稳定性和判别力。最后,两阶段流水线建模范式(如先通过无监督聚类构建质量组别,再拟合独立预测模型)严重依赖初始分组的稳定性,表征学习过程与下游筛查决策相分离,容易引入误差累积和结构失配问题,难以建立稳定且预算感知的多层级风险排序框架。
为应对这些挑战,研究人员提出了RiMS-FiLM,一种端到端的风险筛查框架,旨在固定复检预算下优先发现高风险样本,而非仅仅追求传统分类精度。该研究将玉米籽粒的质量检测重新定义为在固定复检预算约束下的风险筛查问题,使模型优化目标与实际质量管理需求一致。实验结果表明,RiMS-FiLM在有限复检能力约束下提升了高风险发现率,优于传统的两阶段分层方法和代表性选择性筛查范式,展示了低成本多模态传感在资源受限的非破坏性谷物质量筛查与复检规划中的应用潜力。
二、关键技术方法概述
研究人员使用了公开的GrainSet-Maize数据集(约19,000个玉米籽粒样本),仅采用RGB图像、批次关联重量和单籽粒尺寸作为模型输入。核心技术方法包括:(1)基于Swin Transformer(Swin-T)的视觉编码器和基于多层感知机(MLP)的物理编码器,分别提取外观和物理属性的特征表征;(2)基于特征线性调制(FiLM)的冲突感知融合机制,利用物理特征对视觉表征进行逐通道的自适应缩放和平移,并显式量化跨模态差异以调整高风险类别的逻辑值;(3)原型引导的结构化风险空间学习机制,通过可学习的风险原型(Prototype)对融合后的嵌入向量施加结构化约束,使其形成对应低、中、高优先级的有序分布;(4)端到端联合优化框架,同时优化多模态表征学习、原型约束和基于高风险概率的连续风险评分,以实现稳定的优先级排序。
三、研究结果
3.1 固定预算筛查性能比较
在高风险优先召回方面,在5%预算下,RiMS-FiLM检索到23.75%的高优先级籽粒;在10%预算下达到47.50%,均接近理论最大值。在20%复检预算下,模型实现了0.9465 ± 0.0021的平均高风险召回率,在30%预算下达到0.9995 ± 0.0007。在筛查效率方面,RiMS-FiLM在操作预算范围(0–30%)内取得了最低的平均漏检高风险积分(pAUCMHR = 0.1056 ± 0.0001),接近理论下限。在分类鲁棒性方面,模型获得了最高的宏平均F1分数(Macro-F1 = 0.9917 ± 0.0027),表明其在低、中、高风险级别上具有均衡的识别能力。
3.2 与最强基线CCS的机制对比
基于五个种子重复实验,RiMS-FiLM在Macro-F1(0.9917 vs. 0.9858)和Micro-F1(0.9927 vs. 0.9877)上均优于置信度感知对比筛查基线(CCS)。在20%预算下,RiMS-FiLM的高风险召回率(0.9465)也略高于CCS(0.9420)。
3.3 多模态融合策略有效性
通过与特征拼接(Concat)、门控加权融合(GatedSum)和交叉注意力融合(Cross-Attention)三种典型策略对比,FiLM融合方法在边界敏感错误分析中表现最优,尤其是在最关键的“高风险误判为低风险”错误类型上,FiLM的错误率(0.005)远低于Concat(0.028)。基于五个种子的定量结果表明,RiMS-FiLM在所有融合变体中获得了最高的Macro-F1和Micro-F1,同时保持了接近饱和的固定预算筛查性能。
3.4 消融研究与结构解释
通过逐步移除核心组件进行消融实验:(1)移除原型引导结构导致Macro-F1小幅下降(从0.9917降至0.9908),其作用主要体现在提供显式的风险级别参考和扩大筛查边界的几何间隔。(2)移除物理特征分支产生了最显著的消融效果,Macro-F1降至0.9859,Recall@20%降至0.9420,pAUCMHR升至0.1060,表明物理属性提供了视觉外观之外的互补信息,有助于识别视觉正常但重量/尺寸异常的潜在高风险样本。(3)移除冲突感知调制机制对指标影响较小(Macro-F1降至0.9910,Recall@20%降至0.9463),但其冲突分数分布显示了跨模态不一致信号在决策路径中的作用。
四、讨论与结论
讨论部分指出,在固定复检预算下,筛查的有效性更多地取决于模型将高风险样本排在前列的速度,而非整体的分类精度。基于置信度或训练动态的方法在低预算范围内排名结构不稳定,而RiMS-FiLM通过结构化表征学习塑造排序空间,结合冲突多模态融合和原型风险结构约束,使得不同风险类型的样本在嵌入空间中具有更好的分离性,从而实现预算无关的稳定筛查行为。研究强调应从“基于预测”的模型开发范式转向“基于决策”的范式,将风险结构与排序目标对齐是最大化实际效用的途径。
结论部分总结道:在固定复检预算下,操作性谷物筛查不仅是分类任务,更是优先排序问题。RiMS-FiLM结合非破坏性RGB外观与轻量级物理元数据,对玉米籽粒进行后续验证的排序。在主要分层划分的五个随机种子上,模型实现了Recall@20% = 0.9465 ± 0.0021和Macro-F1 = 0.9917 ± 0.0027。由于风险层级是基于缺陷类别得出的操作性标签,而非实验室验证的毒理学终点,这些结果应被解释为质量控制中的复检优先级性能。消融与诊断分析表明,原型引导学习、物理元数据和FiLM条件调制三个主要组件发挥了互补作用,共同支撑了复检截止点附近的优先级排序。该研究展示了低成本多模态传感与机器学习在资源约束下进行非破坏性谷物质量筛查的潜力。研究的局限性在于仅使用了一个公开数据集,未包含独立外部验证、真实仓库测试、实验室确认终点或专门的传感器变异性分析。未来工作应在实验室测量的理化或安全终点上进行验证,评估外部批次和分布偏移,并探索动态检测预算、额外传感模态以及不确定性校准的决策规则。