EditSR:通过基于编辑的修正增强神经符号回归
《Neurocomputing》:EditSR: Enhancing neural symbolic regression via edit-based rectification
【字体:
大
中
小
】
时间:2026年10月11日
来源:Neurocomputing 6.7
编辑推荐:
•本工作从误差累积的视角重新审视神经符号回归,并探索通过少量语法约束编辑来纠正错误预测的方法。
•提出了EditSR,这是一个双层框架,将神经符号回归模型与纠正器结合,以实现高效的预测和事后纠正。
•纠正过程被建模为状态转移链,每次纠正决策都以当前状态为条件,从而抑制误差累积
•本工作从误差累积的视角重新审视神经符号回归,并探索通过少量语法约束编辑来纠正错误预测的方法。
•提出了EditSR,这是一个双层框架,将神经符号回归模型与纠正器结合,以实现高效的预测和事后纠正。
•纠正过程被建模为状态转移链,每次纠正决策都以当前状态为条件,从而抑制误差累积。
## 引言
符号回归旨在从稀疏且有噪声的观测数据集中发现一个将输入映射到输出的显式表达式。与传统的回归(在固定函数族内优化参数)不同,符号回归同时搜索表达式结构和参数,从而提供了更大的自由度。生成的表达式是可解析的,使得研究人员能够检验对称性和不变性、执行微分和积分运算,并将其直接部署到仿真器和控制器中。凭借这些特性,符号回归被认为是科学发现的一个强大工具[1]、[2]。
经典的遗传编程方法通过基于群体的进化来执行符号回归,其中表达式以树的形式表示,并通过变异和交叉进行进化[3]、[4]。在过去几十年中,遗传编程模型通过复杂度控制[5]、[6]、进化策略[7]、[8]、[9]和数值优化[10]、[11]的进步得到了增强,这些改进帮助遗传编程在现代基准测试中保持竞争力[12]、[13]。尽管如此,遗传编程模型长期以来面临效率挑战,因为搜索空间高度灵活,并随着表达式深度和算子集大小迅速增长。
深度学习代表了符号回归中的一个新范式[14]。一个具有代表性的深度学习方法模型是方程学习器(EQL),它用基本算子替换激活函数,使生成的网络具有符号形式,从而实现可解释性和基于梯度的训练[15]。然而,这类模型通常受限于预定义的深度,限制了它们的灵活性。另一类深度学习方法利用强化学习,将常量、算子和变量视为词元,通过策略梯度更新引导表达式搜索[16]、[17]。总体而言,通过引入可优化代理,基于深度学习的模型可以提高推理效率并降低对参数的敏感性。此外,由于优化过程可以自然地纳入结构约束,它们生成的表达式通常更简洁。然而,这些模型仍然执行针对特定问题的搜索,通常不跨问题迁移搜索轨迹。因此,效率与性能之间的权衡仍然存在。
另一条研究路线将大规模预训练引入符号回归,借鉴了机器翻译的思路。在这一范式中,基于Transformer的架构在大规模的"数据集-表达式"配对语料库上进行训练[14]、[18],使得符号回归可以被表述为一个从数据集到表达式的集合到序列任务[19]。因此,符号结构上的昂贵探索大部分被吸收到了预训练中,使得推理可以简化为单次前向传播[20]、[21]、[22]。此外,通过在预训练中引入噪声,这些模型还展现了对未见表达式形式的强零样本泛化能力和对噪声数据集的鲁棒性。
总之,符号回归的发展反映了在搜索能力和计算效率之间寻求平衡的持续努力。因此,神经模型有望在搜索能力和计算效率之间提供切实可行的平衡。然而,它们的一次性自回归解码范式通常受限于误差累积,从而阻碍了其生成复杂表达式的能力。尽管现有的事后纠正策略可以重用神经模型学习到的先验或表示来引导额外的搜索和优化,但这些过程可能产生大量推理成本,从而抵消了预训练带来的效率优势[23]、[24]。因此,我们研究了是否可以用一个轻量级的事后纠正模块在不牺牲效率的前提下纠正神经符号回归模型中的错误预测。
近年来,基于编辑的生成模型在多个领域中快速发展。在自然语言生成中,Levenshtein Transformer[25]和EDITOR[26]等模型用迭代的插入、删除和局部重写替换了一次性自回归解码,证明了不完美的草稿可以不经完整自回归重新生成而被高效改进。基于离散扩散的概念,后续研究进一步将生成过程本身建模为多步编辑序列[27]、[28]、[29]。这些模型的一个关键优势是允许误差被逐步纠正,类似于进化搜索中的迭代改进。这一特性对符号回归具有吸引力,因为许多表达式错误是局部的,大量子表达式通常可以保留。此外,基于编辑的模型支持预训练,这对于确保纠正效率至关重要。
为了实现高效的预测和纠正,我们提出了EditSR,它由两层组成。第一层是一个神经符号回归模型。我们将其实例化为NeSymReS[18],这是一种代表性架构。与其他一次性自回归解码器一样,NeSymReS一旦早期错误扭曲了下游的语法上下文,就无法恢复。因此,我们在第二层引入一个纠正器,对错误预测执行多步基于编辑的纠正。纠正器由标注器和编辑器组成,其中标注器确定编辑位置和编辑操作,而编辑器预测对应的编辑内容。我们定义了Keep(保留)、Replace(替换)、Delete(删除)、Rewrite(重写)和Insert(插入)这五种编辑操作,这些操作在子树级别而非词元级别执行,从而确保表达式在编辑后仍保持语法有效性。
纠正过程被组织为状态转移链,其中每个状态对应一个可解析的表达式,每次状态转移通过执行单个编辑操作来实现。我们受离散扩散模型[28]、[30]、[31]的启发,通过对目标表达式施加随机损坏来构建一组具有多样错误模式的表达式作为初始状态,然后使用状态转移算法将它们映射回目标,从而获得有监督的纠正链。纠正器在这些单步转移上进行训练,使其暴露于各种错误模式。在推理期间,每次决策都以当前状态而非历史为条件,这有助于减轻误差累积,并为后续编辑纠正早期错误留下空间。
本工作的主要贡献总结如下:
•我们从误差累积的视角重新审视了神经符号回归模型,并考察了是否可以通过少量预定义的编辑来纠正错误预测。
•我们提出了EditSR,一个双层框架,第一层是神经符号回归模型,第二层是纠正器。EditSR提供了一种新颖的预测与纠正机制,在保留神经模型推理效率的同时,通过语法约束的事后编辑纠正结构上不正确的表达式。
•我们将纠正表示为迭代的状态转移过程,其中每个状态对应一个可解析的表达式,每次状态转移通过执行单个编辑操作来实现。在我们的设定中,纠正器的每次纠正决策都以当前状态而非历史为条件,从而抑制误差累积,同时允许在早期步骤中犯下的错误被后续编辑纠正。
•通过在主流基准上的大量评估和消融研究,我们表明纠正器对长表达式生成有益,其中一次性自回归解码更容易发生误差累积。此外,纠正器改善了符号结构的恢复能力,因为其纠正目标始终指向目标表达式,而不仅仅是满足数值误差阈值。
本文的其余部分组织如下:第2节介绍所提框架的动机,第3节回顾相关工作。第4节介绍EditSR架构,第5节描述数据生成过程。实验评估报告在第6节实验设计和第7节结果中。最后,第8节给出本工作的结论。
## 章节节选
### 动机
近年来,神经符号回归模型因其能够在预训练期间摊销大部分结构搜索,将推理简化为单次前向传播而备受关注。然而,一个局限性源于教师强制训练与自由运行推理之间的不匹配。早期错误会改变后续词元所依赖的前缀,而解码器没有明确的机制来重新审视早期的决策。在符号回归中,这一问题——
### 相关工作
**迭代生成与基于编辑的模型。** 迭代生成近年来已被广泛研究,涵盖基于去噪的生成、掩码预测和基于编辑的改进[30]、[33]、[36]、[37]、[38]。这些方法的一个共同原则是,初始的不完美输出可以通过一系列中间状态逐步改进,这已在多个领域被证明有效。例如,在自然语言生成中,DiffusER将——
### 方法
本节介绍EditSR的架构及其优化和推理过程。图2提供了概览。在EditSR中,NeSymReS作为第一层的快速神经模型,被扩展以支持10个变量,而第二层由纠正器组成。我们定义s?为初始状态,即一个需要纠正的错误表达式。纠正器执行的每次编辑操作都会引发一次状态转移。我们记s?为——
### 数据生成
本节介绍用于生成训练数据的方法。每个样本分三个阶段生成:首先,通过骨架生成器采样一个表达式骨架;其次,通过采样常量实例化骨架以获得可解析的表达式;最后,采样变量值并评估表达式以形成数据集。为了提高模型的泛化能力,训练集包含1亿个随机生成的骨架。
### 实验设计
本节描述用于评估EditSR的实验设计,包括训练和测试细节、基准、基线和指标。这些设置共同为EditSR提供了广泛的评估。
### 结果
本节首先报告EditSR在各基准上的评估结果,以阐明它在哪些指标上有竞争力,以及是否在这些指标之间达到了预期的平衡。消融研究随后分析纠正器为何有效以及在哪种条件下最为有益。
### 结论
本文提出了EditSR以缓解神经符号回归模型中的误差累积问题。EditSR将事后纠正视为基于编辑的状态转移链,其中错误预测可以逐步向目标表达式纠正。通过将纠正的主要负担从推理转移到预训练,EditSR保留了神经模型的高效优势,同时保持表达式为可编辑状态,并限制在线纠正——
## CRediT作者贡献声明
Da Li:原稿撰写、方法论、调查研究、概念构思。
Xinxin Li:数据整理。
Xingyu Cui:方法论、数据整理。
Jin Xu:方法论。
Juan Zhang:审阅与编辑、方法论、调查研究。
Junping Yin:审阅与编辑、监督、经费获取。
## 利益冲突声明
作者声明不存在可能影响本文所述工作的已知财务利益或个人关系。
## 致谢
本工作受中国国家重点研发计划重大项目(项目编号2023YFA1009000、2023YFA1009002和2023YFA1009004)和中国国家自然科学基金(项目编号12292980和12292984)资助。
Da Li于2020年从齐鲁工业大学获得学士学位,2023年从广西大学获得硕士学位。Da Li的研究兴趣包括AI for Science(AI4Science)、符号科学和多模态学习。
Da Li | Xinxin Li | Xingyu Cui | Jin Xu | Juan Zhang | Junping Yin
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号