《Communications Medicine》:Introduction to using symbolic regression for interpretable machine learning in healthcare
编辑推荐:
过去十年间,机器学习在医学领域扮演着日益重要的角色。然而,许多正在开发和部署的最先进模型缺乏透明度,限制了其融入临床决策过程,并引发了对患者安全的担忧。在此,研究人员呼吁关注符号回归(symbolic regression, SR)——一种在很大程度上被忽视的
过去十年间,机器学习在医学领域扮演着日益重要的角色。然而,许多正在开发和部署的最先进模型缺乏透明度,限制了其融入临床决策过程,并引发了对患者安全的担忧。在此,研究人员呼吁关注符号回归(symbolic regression, SR)——一种在很大程度上被忽视的机器学习技术,它旨在通过学习数据中可读的数学模型来实现准确性与可解释性。近年来,该技术取得了快速进展,并成功应用于广泛学科领域中的各类问题。在本展望文章中,研究人员提供了一份通俗易懂的符号回归入门介绍,强调了其优势与局限性,并探讨了其在医学领域的潜在应用。
论文解读文章
研究背景与问题
在医疗健康领域,机器学习模型的应用日益广泛,但其“黑箱”特性导致临床医生和患者难以信任和理解模型的预测依据,这严重阻碍了模型的实际部署。现有模型虽然性能优异,但缺乏透明度和可解释性,无法满足临床决策对安全性和可信度的严格要求。此外,传统可解释模型(如线性回归)往往牺牲准确性,而复杂的深度学习模型则难以解释。因此,亟需一种既能保持高性能又能提供清晰数学表达式的建模方法。符号回归作为一种能够自动从数据中发现简洁数学公式的机器学习框架,有望填补这一空白,但其在医疗领域的认知度和应用仍十分有限。本研究旨在系统介绍符号回归的原理、优势、局限及其在医疗健康数据建模中的潜力,以促进该技术在医学信息学社区中的采用。
研究方法
研究人员主要采用了三种关键技术方法开展论述:遗传编程(Genetic Programming, GP),模拟自然选择过程,通过选择、交叉、变异和常数优化迭代演化候选公式;神经网络(Neural Network, NN) 方法,包括方程学习器(将函数表示为激活函数包含所有基元的神经网络)、深度强化学习(Deep Reinforcement Learning, DRL,利用循环神经网络智能体顺序构建表达式)和Transformer预训练模型(基于大规模方程数据集预训练后直接推理输出表达式);替代模型,如基于Meijer-G函数的数值优化方法和贝叶斯符号回归(Bayesian Symbolic Regression)。研究人员还引用了公开可用的软件工具PySR(基于Julia后端的高灵活Python库)和Deep Symbolic Optimization(DSO,统一深度符号学习框架)。
研究结果
什么是符号回归?
符号回归是一种从数据中发现最优符号数学表达式的机器学习框架,通过平衡符号复杂度(如项数或运算符数量)与损失函数来确保可解释性和预测准确性。与传统回归不同,它不预设函数形式,而是动态探索由用户定义的基元函数(如加法、乘法、指数、对数、三角函数等)构成的广阔空间。主流实现方式包括遗传编程和神经网络方法。遗传编程通过随机初始化公式种群,迭代进行选择、交叉、变异和常数优化,直至达到停止条件。神经网络方法包括方程学习器(利用梯度下降调整权重)、深度强化学习(通过强化学习策略构建表达式序列)和Transformer(基于预训练数据集的token级交叉熵损失进行推理)。
符号回归的优势
- •
实际应用便利性:PySR和DSO等软件包提供了用户友好的接口,仅需少量代码即可完成模型训练,并能实时审查候选方程。
- •
领域知识整合:尽管符号回归完全数据驱动,但可通过限定基元函数集融入领域知识。例如,在生长动力学研究中加入反双曲正弦函数以包含超弹性模型。
- •
可解释性:符号回归模型以数学公式呈现,允许手动计算和理解输出,优于依赖SHAP等事后解释工具的黑箱模型。此外,通过分析公式与已知知识的矛盾,可识别训练数据中的噪声或偏差。
- •
数据效率:在不超过250个样本的小数据集上,符号回归表现优于经典回归和树模型,适用于数据稀缺场景。
- •
外推能力:符号回归模型能够预测训练数据范围之外的值。实验表明,在抛球轨迹预测任务中,符号回归在外推和内插方面均优于线性模型、随机森林、简单神经网络和高斯过程,且能找到生成数据的真实函数。
- •
伦理、公平性与偏见:可观察的方程有助于识别偏见来源,多目标符号回归(MOSR)和多视图符号回归(MVSR)可直接将公平性指标纳入训练过程,提高跨群体一致性。
符号回归的局限性
- •
训练挑战:搜索空间随输入变量数指数增长,遗传算法易产生复杂表达式导致过拟合,且对超参数和随机种子敏感;神经网络方法存在灵活性差、可解释性降低的问题;深度强化学习和Transformer在整体性能上仍落后于遗传算法。
- •
可解释性限制:同一函数可有多种等价符号表示,非数学背景人员难以识别其等效性,可能影响模型理解。
- •
外推限制:缺乏领域知识约束时,外推性能可能不佳;高次多项式模型可能出现Runge现象(在极端值处剧烈振荡)。
- •
确认性分析不足:符号回归更适合探索性或预测分析,而非确认性数据分析,未来需扩展不确定性量化和正式推断能力。
- •
无通用方法:符号回归算法存在高方差,小数据变化可能导致完全不同解,且可能错过理想解。
将符号回归应用于医疗健康
医疗健康领域对不可解释模型接受度低,符号回归的可解释性为其提供了优势。已有研究表明,符号回归可应用于高血压分类、术后死亡率预测、ICU血流感染和抗菌药物耐药性预测等任务,且性能优于经典回归和树模型。研究人员提出了一个三阶段临床符号回归模型构建流程:数据集构建(选择结局变量、提取特征、预处理)→符号回归过程(应用遗传算法或神经网络搜索最优方程,迭代评估和调优,外部验证)→输出与临床应用(公式化风险评分、早期预警系统、治疗规划)。未来应用包括改进肾小球滤过率估算方程、揭示生活方式与血糖关系等。但需注意数据泄露、协变量偏移、监管验证等挑战。
讨论与结论
讨论总结
符号回归在医疗健康中的应用仍处于早期阶段,其可解释性优势有望提升临床信任度,但需谨慎对待模型复杂性、过拟合和外推失败等问题。研究人员强调,符号回归并非万能方法,应与其他可解释方法结合使用。实际部署前必须经过严格的监管审批、偏差评估和持续性能监控。符号回归的透明性有助于发现数据问题和新颖关系,但也可能因公式等价性造成误解。
研究结论
符号回归解决了机器学习模型可解释性的核心关切。尽管其性能存在波动,但在小数据场景下展现出更优的性能和泛化能力。在医疗健康数据建模中,符号回归值得被考虑,同时需认识到其局限性以及对领域知识的需求。与“黑箱”机器学习不同,符号回归生成透明、人类可读的方程,这在临床环境中极具价值——临床医生可利用方程解释风险并做出知情决策。符号回归还可揭示机制性关系,如生活方式与生理之间的关联。鉴于当前算法难以解释且信任问题普遍存在,卫生系统可考虑采纳经外部验证的、基于电子健康记录的符号回归模型。