利用不确定性引导的探索和证据校准方法来规范脑电图(EEG)数据增强过程
《Biomedical Signal Processing and Control》:Regulating EEG data augmentation with uncertainty-guided exploration and evidential calibration
【字体:
大
中
小
】
时间:2026年09月09日
来源:Biomedical Signal Processing and Control 5.7
编辑推荐:
**摘要**
数据增强技术被广泛用于解决基于脑电图(EEG)的神经评估中所面临的数据稀缺问题。然而,与图像处理不同,目前没有方法可以检验增强处理是否保留或破坏了具有诊断意义的神经特征。因此,现有的流程将所有增强后的样本视为同等可信的,从而在可能存在损坏的证据上自信地训练模型。
**摘要**
数据增强技术被广泛用于解决基于脑电图(EEG)的神经评估中所面临的数据稀缺问题。然而,与图像处理不同,目前没有方法可以检验增强处理是否保留或破坏了具有诊断意义的神经特征。因此,现有的流程将所有增强后的样本视为同等可信的,从而在可能存在损坏的证据上自信地训练模型。如果不加以控制,这一过程可能会导致过度自信的错误传递到下游决策中。这就引发了一个调节问题:哪些增强样本揭示了模型的真实弱点,以及应该如何谨慎地使用这些样本。本研究正式提出了EAGER(基于引导性证据调节的EEG增强)框架,该框架建立在证据驱动深度学习(EDL)的基础上。探索机制会保留那些预测正确且不确定性增强的样本,或者误分类但不确定性较低的样本。校准机制在Dirichlet训练目标中应用了信任折扣:转换强度控制保留的证据,而缺陷类型控制正则化强度。在三个EEG数据集(自闭症谱系障碍诊断、心算分类、癫痫检测)上的实验表明,EAGER比未增强的基线模型提高了3.0–5.7个百分点的准确性,并将平均预期校准误差(ECE)降低了14%–20%,优于其他最佳外部增强基线。这些改进效果在不同的骨干架构、增强操作和训练集大小中都得到了验证;在自闭症谱系障碍数据集上,Earger的训练时间比未增强训练增加了约45%。证据级别的折扣产生了比外部损失权重更强的强度-不确定性相关性(Spearman ??=0.64–0.88对比0.23–0.41),表明效果取决于折扣在目标函数中的位置。
**引言**
脑电图(EEG)提供了一种非侵入性的、时间精确的神经活动观察窗口,在神经评估(包括疾病诊断和认知状态分类)中得到了越来越多的应用[1]。深度学习模型通过从复杂信号中提取具有区分性的神经生理模式,推动了基于EEG的诊断技术的发展[2]。然而,带有标签的EEG记录仍然非常稀少。在自闭症谱系障碍(ASD)检测等任务中,数据采集资源消耗量大,而且由于该疾病的高度异质性,具有诊断意义的变化非常微妙[3]。EEG增强与其他模态的增强方法的一个根本区别在于:无法验证增强样本的真实性。在图像识别中,从业者可以直观检查增强后的图像,立即判断其语义内容是否得以保留。而EEG信号是潜在神经认知过程的间接、非平稳的痕迹。例如,区分ASD相关神经动态与典型模式的特征既不是视觉上显而易见的,也不能被当前神经科学完全描述[4]。因此,无论是通过噪声注入还是频带屏蔽来增强现有记录,还是从学习到的分布中生成新样本,最终信号可能无法保留具有诊断意义的成分[5]。研究人员无法评估单个增强样本保留了多少与任务相关的神经活动,也无法决定该样本应该用于训练还是作为噪声被丢弃。从贝叶斯的角度来看,这种不可验证性削弱了增强样本属于其分配类别的证据;损失了多少证据只能通过学习系统本身来推断。
**引言(续)**
脑电图(EEG)为神经活动提供了一个非侵入性的、时间精确的观察窗口,并在神经评估(包括疾病诊断和认知状态分类)中得到了越来越多的应用[1]。深度学习模型通过从复杂信号中提取具有区分性的神经生理模式,推动了基于EEG的诊断技术的发展[2]。然而,带有标签的EEG记录仍然非常稀缺。在自闭症谱系障碍(ASD)检测等任务中,数据采集资源消耗量大,而且由于该疾病的高度异质性,具有诊断意义的变化非常微妙[3]。EEG增强方法的一个根本挑战在于无法验证其增强样本的真实性。在图像识别中,从业者可以直观检查增强后的图像,并立即判断其语义内容是否得以保留。而EEG信号是潜在神经认知过程的间接、非平稳的痕迹。目前,区分ASD相关神经动态与典型模式的特征既不是视觉上显而易见的,也无法被当前神经科学完全描述[4]。因此,无论通过噪声注入还是频率带屏蔽来增强现有记录,或者从学习到的分布中生成新样本,最终信号可能无法保留具有诊断意义的成分[5]。研究人员无法评估任何单个增强样本保留了多少与任务相关的神经活动,也无法决定该样本应该用于训练还是作为噪声被丢弃。从贝叶斯的角度来看,这种不可验证性削弱了增强样本属于其分配类别的证据;损失了多少证据只能通过学习系统本身来推断。
**引言(再续)**
脑电图(EEG)为神经活动提供了一个非侵入性的、时间精确的观察窗口,在神经评估(包括疾病诊断和认知状态分类)中得到了越来越多的应用[1]。深度学习模型通过从复杂信号中提取具有区分性的神经生理模式,推动了基于EEG的诊断技术的发展[2]。然而,带有标签的EEG记录仍然非常稀缺。在自闭症谱系障碍(ASD)检测等任务中,数据采集资源消耗量大,而且由于该疾病的高度异质性,具有诊断意义的变化非常微妙[3]。EEG增强方法的一个根本挑战在于无法验证其增强样本的真实性。在图像识别中,从业者可以直观检查增强后的图像,并立即判断其语义内容是否得以保留。而EEG信号是潜在神经认知过程的间接、非平稳的痕迹。目前,区分ASD相关神经动态与典型模式的特征既不是视觉上显而易见的,也无法被当前神经科学完全描述[4]。因此,无论通过噪声注入还是频率带屏蔽来增强现有记录,或者从学习到的分布中生成新样本,最终信号可能无法保留具有诊断意义的成分[5]。研究人员无法评估任何单个增强样本保留了多少与任务相关的神经活动,也无法决定该样本应该用于训练还是作为噪声被丢弃。从贝叶斯的角度来看,这种不可验证性削弱了增强样本属于其分配类别的证据;损失了多少证据只能通过学习系统本身来推断。
**引言(终)**
脑电图(EEG)为神经活动提供了一个非侵入性的、时间精确的观察窗口,在神经评估(包括疾病诊断和认知状态分类)中得到了越来越多的应用[1]。深度学习模型通过从复杂信号中提取具有区分性的神经生理模式,推动了基于EEG的诊断技术的发展[2]。然而,带有标签的EEG记录仍然非常稀缺。在自闭症谱系障碍(ASD)检测等任务中,数据采集资源消耗量大,而且由于该疾病的高度异质性,具有诊断意义的变化非常微妙[3]。EEG增强方法的一个根本挑战在于无法验证其增强样本的真实性。在图像识别中,从业者可以直观检查增强后的图像,并立即判断其语义内容是否得以保留。而EEG信号是潜在神经认知过程的间接、非平稳的痕迹。目前,区分ASD相关神经动态与典型模式的特征既不是视觉上显而易见的,也无法被当前神经科学完全描述[4]。因此,无论通过噪声注入还是频率带屏蔽来增强现有记录,或者从学习到的分布中生成新样本,最终信号可能无法保留具有诊断意义的成分[5]。研究人员无法评估任何单个增强样本保留了多少与任务相关的神经活动,也无法决定该样本应该用于训练还是作为噪声被丢弃。从贝叶斯的角度来看,这种不可验证性削弱了增强样本属于其分配类别的证据;损失了多少证据只能通过学习系统本身来推断。
**本文的结构**
本文将增强处理分为两个基本方面:一是增强样本与原始记录之间的可追溯关联;二是信号偏差的连续、可参数化的测量方法。本文以基于变换的增强处理为研究起点:每个增强样本都对应一个原始记录,变换程度可以通过连续的强度参数来控制。生成式增强虽然也引发了类似的调节问题,但由于生成样本来自学习到的潜在分布而非特定记录,因此缺乏样本级的关联性,且需要大量的训练数据[6]。第5.7节将讨论如何将这一调节原则适应生成式增强的情况。许多EEG增强流程采用固定或随机强度的变换,并使用原始标签和权重对所有增强后的样本进行训练,这使得增强处理缺乏方向性,导致每个增强样本的影响相同,尽管其保留的任务相关信息无法被验证。最近的研究根据类别信息、模型响应、样本内容或变换程度调整了增强策略、候选样本选择或监督方式[7][8][9][10]。在EEG领域,CADDA学习了针对操作选择、应用概率和幅度的类别级策略[11]。这些进展部分解决了调节问题,但并未针对每个增强后的EEG样本同时回答两个问题:它揭示了模型的哪些缺陷以及应该如何处理其证据。
**本文的主要贡献**
1. **将增强处理的调节视为一个统一问题**:本文将无法验证增强后EEG样本的诊断相关性问题定义为两个相互关联的问题:增强处理在哪里暴露了模型的知识缺陷,以及鉴于其证据已被降低到未知程度,应该如何谨慎地使用每个增强样本。
2. **诊断缺陷的探索机制**:选择规则通过正确预测但不确定性显著增加的情况来识别证据不足,以及通过误分类但不确定性较低的情况来识别证据误导。其余结果都被排除。
3. **针对增强样本训练的信任折扣**:本文在增强样本训练中应用了证据级别的信任折扣:变换强度决定了Dirichlet分类项和证据正则化器中的信任因子,而缺陷类型控制了正则化强度。这改变了证据驱动的训练目标,而不是在完整损失中应用一个统一的标量(见附录A)。
**相关工作**
本节回顾了与所提出框架相关的三个研究领域:提供增强训练样本的EEG数据增强技术;确定单个样本如何影响学习的样本级训练策略;以及通过证据学习进行不确定性估计的技术。
**问题的提出与背景**
本节明确了第1节中介绍的调节问题,分析了模型评估增强样本时的可能结果,并定义了所提出框架所依赖的EDL接口的符号表示方法。
**方法部分**
本节详细介绍了所提出的EAGER框架,该框架满足了第3.1节中定义的两个要求。图1提供了该框架的概览,随后的内容将依次介绍每个组成部分。
**实验部分**
EAGER基于两个设计前提:针对知识边界的针对性增强可以提高探索效果;证据级别的折扣校准与外部损失重加权不同。评估 accordingly 组织了相关实验(见第5.2节)。
**结论**
由于无法通过检查EEG变换来验证它们是否保留了与任务相关的信息,因此学习系统必须自行解决如何控制增强样本进入学习过程的问题。EAGER通过结合基于不确定性的探索(确定模型证据结构在干扰下的破坏位置)和信任折扣(控制增强证据进入证据驱动训练目标的方式)来解决这一问题。三项实验结果支持了这一设计。
**作者贡献声明**
Zuo Yiping:撰写——原始草稿、方法论、调查、概念化;Wang Yaodong:撰写——审稿与编辑、可视化、软件;Chen Dan:撰写——审稿与编辑、项目管理、资金获取、数据管理;Gao Tengfei:资源协调、数据管理;Chen Jingying:资源协调、项目管理。
**关于生成式AI辅助技术的声明**
在准备本项工作时,作者使用Claude和GPT辅助完成了英文内容的重构。使用这些工具后,作者根据需要对内容进行了审阅和编辑,并对发表文章的内容负全责。
**关于利益冲突的声明**
作者声明没有已知的财务利益冲突或个人关系可能影响本文的研究结果。
**致谢**
本研究部分得到了国家自然科学基金重点科研项目“脑科学与类脑智能技术”[项目编号2021ZD02043000]、国家自然科学基金[项目编号62477035、62377018和62172304]、中国博士后科学基金[项目编号2025M771649]、教育部人文社会科学项目[项目编号25YJCZH053]以及中央高校基本科研业务费[项目编号……]的支持。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号