用于评估合成脑电图数据中保真度、多样性与隐私的可解释指标

《Discover Neuroscience》:Interpretable metrics for evaluating fidelity, diversity, and privacy in synthetic EEG data

【字体: 时间:2026年09月08日 来源:Discover Neuroscience

编辑推荐:

  合成脑电图(electroencephalography,EEG)数据的生成提供了一种有前景的策略,可缓解临床神经生理记录尤其是颅内脑电图(intracranial EEG,iEEG)数据可用性有限的问题,后者采集具有侵入性、复杂性,且仅限于小规模患者队列。尽

  
合成脑电图(electroencephalography,EEG)数据的生成提供了一种有前景的策略,可缓解临床神经生理记录尤其是颅内脑电图(intracranial EEG,iEEG)数据可用性有限的问题,后者采集具有侵入性、复杂性,且仅限于小规模患者队列。尽管生成模型可产生逼真信号,但该领域进展受限于缺乏一致且具生理学依据的评估实践。当前评估策略常依赖孤立的统计、视觉或下游任务指标,可能无法充分捕捉表征EEG信号的时间、频谱、非线性和空间特性。研究人员提出seege_,一个用于评估合成EEG/iEEG数据的开源Python库。该库将互补指标组织为三个评估维度:保真度、多样性和隐私。保真度在时域、频域、时频域、复杂度和空间域进行评估;多样性通过覆盖度、几何结构与内在变异性评估;隐私通过最近邻相似度和成员推断风险评估。为提升可解释性,该框架采用基于真实数据变异性的归一化策略、域级综合得分和可视化摘要,以识别一致性与失败模式。研究人员使用基于生成对抗网络(Generative Adversarial Network,GAN)模型生成的合成iEEG进行说明,并通过真实–真实、真实–合成、合成–合成比较、替代对照、受控扰动实验和生成失败模式验证。结果表明,所提工作流可捕捉真实与合成信号之间的域特定相似性与偏差,支持合成EEG质量的透明报告与比较。
研究背景方面,合成数据生成指创建复制真实世界数据统计分布与结构属性的人工数据集,在医疗中可扩展数据可用性或保护患者隐私。对于EEG等生物医学信号,合成数据可用于增强数据集、训练机器学习(machine learning,ML)模型并促进可重复性。GAN与变分自编码器(Variational Autoencoder,VAE)已被广泛用于合成EEG数据,但合成数据评估仍缺乏标准化且可解释的方法。稳健评估不仅需要统计保真度,还需反映EEG固有的生理特性,如频谱内容、时间动态、多重分形属性,以及由个体差异、电极放置和状态波动产生的被试内与被试间变异性。现有研究多只评估效用维度,少数研究如EpilepsyGAN虽涵盖保真度、多样性、隐私与效用,但整体领域仍缺少统一框架。因此,研究人员开展本研究以建立结构化、可解释的EEG/iEEG合成数据评估体系。
论文发表在《Discover Neuroscience》。研究人员开展的研究是提出seege_这一开源Python库,将已有指标系统组织为保真度、多样性、隐私三类,并提供基于真实数据变异性归一化、域级综合得分与可视化摘要的解释机制。结论是该框架能比孤立指标更具判别力和可解释性地评估合成EEG质量,并可揭示保真度、多样性与隐私之间的权衡。重要意义在于为癫痫监测、脑机接口(brain–computer interface,BCI)等应用提供透明、可复现的合成数据质量审计基础。
关键技术方法上,研究人员使用Mayo Clinic sEEG/ECoG数据集,包含25名药物难治性癫痫患者术前评估记录;合成数据由基于注意力机制的深度卷积Wasserstein GAN在病理段上生成。指标实现依赖NumPy、SciPy、PyWavelets、NeuroKit2、fathon、scikit-image、scikit-learn、PCA、UMAP与随机森林等工具。验证采用真实–真实(RR)、真实–合成(RS)、合成–合成(SS)配对、相位随机替代数据、受控扰动与六种质量控制失败模式。
研究结果如下。
相关工作中的合成时间序列评估:研究人员指出保真度、多样性、隐私与效用相互依赖,完美保真度会损害隐私,强隐私或过度多样化会削弱效用,因此需多目标联合评估。
相关工作中的EEG合成数据现状:对18项研究综述发现,多数仅评估效用,EpilepsyGAN评估较全面,但领域仍缺标准。
提出的EEG合成数据指标:研究人员提出seege_,含20个指标,分保真度、多样性、隐私;指标分核心层与扩展层,依据数据充分性、计算可扩展性、参数敏感性与冗余性分层。
保真度:时域用Hjorth活动、流动性和复杂度及Wasserstein距离(Wasserstein distance,WD)与马氏距离(Mahalanobis distance,DM);频域用Welch功率谱密度(power spectral density,PSD)、带功率差ΔP、主导频率差、谱相干Cxy与谱WD;时频域用连续小波变换(Continuous Wavelet Transform,CWT)标度图、彩色结构相似性(color structural similarity index,cSSIM)、均方根误差(root mean squared error,RMSE)与余弦相似度(cosine similarity,CS);复杂度用多重分形去趋势波动分析(Multifractal Detrended Fluctuation Analysis,MFDFA)、去趋势互相关分析(Detrended Cross-Correlation Analysis,DCCA)、多重分形去趋势互相关分析(Multifractal Detrended Cross-Correlation Analysis,MFDCCA)、样本熵(sample entropy,SEn)、排列熵(permutation entropy,PEn)与Lempel–Ziv复杂度(Lempel–Ziv complexity,LZC);空间域用通道相关矩阵Frobenius距离与SD归一化空间偏差zSC。研究人员通过RR、RS、SS比较得出各域综合得分可量化真实与合成信号一致性。
多样性:通过最近邻覆盖度与离群指数、PCA与UMAP几何重叠、质心重叠、标签混合、协方差形状,以及唯一性、全局离散度、局部离散度等内在变异性比率评估。研究人员得出乘法聚合可防止不同维度间相互补偿,并惩罚模式崩溃。
隐私:用欧氏(L2)与动态时间规整(Dynamic Time Warping,DTW)最近邻距离衡量记忆风险,用成员推断攻击准确率衡量披露风险。研究人员得出更大最近邻距离与更低攻击准确率代表更强隐私保护。
讨论与结论翻译:研究人员提出seege,一个将已有保真度、多样性和隐私指标组织为结构化工作流的开源库,通过真实数据归一化、域级得分与可视化提升可解释性。使用该框架对GAN生成iEEG的评估表明,该方法能捕捉时域、频域、时频域、复杂度与空间域中的生理特性保留情况,也能审计多样性与隐私风险。结论是:合成EEG评估应从孤立指标转向多域、可解释、基于真实数据变异性的框架;seege支持透明报告、跨研究比较与失败模式诊断,对癫痫、睡眠与BCI研究具有方法论意义。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号