量化特征驱动捷径对电路性能预测机器学习基准的影响
《Scientific Reports》:Quantifying the impact of feature-driven shortcuts in machine learning benchmarks for circuit performance prediction
【字体:
大
中
小
】
时间:2026年09月09日
来源:Scientific Reports 4.9
编辑推荐:
## 摘要
机器学习在电子设计自动化(EDA)中越来越被用于预测电路性能,但这些模型的可靠性可能会受到某些特征的影响——这些特征与目标变量的相关性在很大程度上反映的是目标变量自身的定义,而非真正可泛化的结构。本研究在 CktGNN 衍生的基准数据集中调查了这样一例情况,其中
## 摘要机器学习在电子设计自动化(EDA)中越来越被用于预测电路性能,但这些模型的可靠性可能会受到某些特征的影响——这些特征与目标变量的相关性在很大程度上反映的是目标变量自身的定义,而非真正可泛化的结构。本研究在 CktGNN 衍生的基准数据集中调查了这样一例情况,其中带宽特征与品质因数(Figure of Merit, FoM)目标变量几乎完全相关(*r* = 0.999619)。直接使用原始 CktGNN 数据,我们发现这种相关性在很大程度上可以解释为:FoM 本身是一个复合指标,带宽的权重约为其他组成项的 6 至 8 倍(线性拟合 fom ~ bw + pm + gain,R2 = 0.999992),这是该指标定义本身的属性,而非意外引入的数据泄漏。无论其来源如何,这种依赖关系仍然为将其纳入的特征型(非图结构)机器学习模型提供了一种平凡的捷径,而这正是本研究量化考察的实际重要后果。我们生成了 10,000 个样本的合成数据集,以在受控条件下测量该捷径的影响,评估了六种模型族——线性回归、随机森林、XGBoost、CatBoost、LightGBM 以及多层感知机——在 10 次重复随机划分和四种不同的品质因数权重配置下的表现。移除捷径特征后,线性回归的 R2 出现了统计显著的下降(相对下降最高达 37.8%,Wilcoxon *p* = 0.002,Cliff's delta = 1.00),多层感知机同样受到影响(最高下降 14.6%,*p* = 0.002–0.010),随机森林也有所下降(最高 13.2%,所有配置下 *p* < 0.02),而梯度提升树集成模型(XGBoost、CatBoost、LightGBM)则表现出较强的鲁棒性(下降幅度通常低于 5%,且往往不具有统计显著性)。全局置换和局部 SHAP 归因分析揭示,这种差异源于模型内部的机制:线性模型和并行集成模型几乎完全依赖该捷径特征,而序列式梯度提升器则将归因分布在次级参数交互上,从而在捷径被移除时提供了缓冲。我们进一步在原始 CktGNN 数据上直接验证了有无捷径特征的对比,尽管移除带宽后仅剩两个特征,同样的定性模式依然成立。本研究提供了一个基于真实数据的说明,展示了一个由公式驱动的特征依赖关系如何在基于特征的机器学习基准测试中仍然作为实用捷径发挥作用,并提供了一套可重复的统计协议——包含重复划分、效应量和置信区间——用于在其他 EDA 数据集中审计类似的依赖关系。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号