SHARD:面向冻结语言模型顺序知识编辑的基于插槽托管的可寻址残差增量
《Neurocomputing》:SHARD: Slot-based hosted addressable residual deltas for sequential knowledge editing in frozen language models
【字体:
大
中
小
】
时间:2026年09月28日
来源:Neurocomputing 6.7
编辑推荐:
• 冻结基座知识编辑方法(GRACE家族)通过将编辑存储在外部逐槽码本中,而非修改模型权重,来避免灾难性遗忘。
• SHARD替换了GRACE的三项设计选择:余弦路由固定阈值、加性残差写入,以及ROME风格的?2优化用于槽值。
• 在四个组合(CounterFact/zsRE
• 冻结基座知识编辑方法(GRACE家族)通过将编辑存储在外部逐槽码本中,而非修改模型权重,来避免灾难性遗忘。
• SHARD替换了GRACE的三项设计选择:余弦路由固定阈值、加性残差写入,以及ROME风格的?2优化用于槽值。
• 在四个组合(CounterFact/zsRE × Qwen2.5-0.5B/TinyLlama-1.1B)上,SHARD实现了更高的改写泛化能力。
• GRACE保留了冻结基线的特异性;SHARD也保留了;两种方法在帕累托前沿上互不占优。
• 跨Qwen2.5(0.5B–7B)的规模扫描显示SHARD的效果与规模无关,而MEMIT表现出清晰的规模涌现阈值。
## 引言
一个无法学习新事实的已部署语言模型,在某重要意义上,能力不如一个数据库。数据库可以在不干扰其他记录的情况下插入记录。而语言模型需要通过数千亿个参数的梯度下降来吸收一个新事实,且梯度不可避免地会干扰邻近的记忆。这是神经网络持续学习面临的核心障碍。重放缓冲区、参数冻结、低秩适配器、检索增强生成以及显式知识编辑器,是该领域逐步产生的各种变通方案。
当前的技术前沿是MEMIT家族[13]、[14]。因果追踪将一个事实定位到特定的中间层MLP,对该MLP的下投影施加秩一更新即可注入该事实。单独一次编辑可达到99%的效力且几乎没有附带损害,原论文报告了数千个事实的成功批量编辑。
但当编辑在已部署模型的生命周期内逐一到达时,情况就不同了:每次秩一更新都与之前每一次更新在支持域上重叠。扰动在MLP权重空间的同一低维子空间中不断累积,导致新事实和旧预训练知识的准确率均下降。
这种退化是结构性的,而非调参问题。任何将新信息写入参数集的方法都必须消耗该参数集的自由度。参数最终无法同时表示过去所知的全部内容和现在要求学习的全部内容。绕过这一问题的方法是不写入现有参数。新信息需要一个可独立寻址的结构,模型可以在不干扰其先有权重的情况下查阅该结构。
神经网络中的外部记忆并非新想法。增强记忆神经网络至少可以追溯到神经图灵机[6]和可微分神经计算机[7];记忆网络[21]和现代Hopfield网络[18]探索了同一主题的各种变体。最近,Berges等人[1]将乘积键记忆层扩展到万亿级token的训练预算,并证明它们在知识密集型评估中优于稠密FFN层。尚未探索的是在冻结的预训练主干上进行训练后的一次性顺序插入。问题不在于可寻址记忆是否能在预训练期间提供帮助,而在于这样的记忆能否在模型部署后替代MEMIT等基于梯度的编辑器。这正是我们研究的场景。
### 我们的贡献:
1. **我们提出了顺序事实插入基准(SFIB)**:一个预注册的合成知识库,包含2000条预训练三元组、500条插入三元组(不重叠的实体)和200条多跳组合查询。SFIB在插入流的每个检查点测量三个量:插入事实的准确率、预训练事实的准确率,以及结合一条旧事实和一条新事实的二跳问题准确率。实体从虚构音节池构建,以保证与模型的预训练分布无重叠。
2. **我们提出SHARD(基于槽的主机式可寻址残差增量)**:一种方法,用逐事实键值码本包装中间层的单个MLP。每个事实存储为一对键值,其中键是教师强制前向传播时在最后一个提示位置捕获的该层中间激活值,值是通过在目标token交叉熵上进行ROME风格?2优化得到的扰动。推理时,在最后一个序列位置通过余弦相似度将前向传播路由到匹配的槽,并将存储的值加到MLP的基础输出上。基础权重永远不会被修改。该方法在代码层面是家族无关的:同一条代码路径可以在GPT-2的原生MLP和Qwen2.5与TinyLlama的SwiGLU MLP上运行。在机制上最接近SHARD的先前方法是GRACE[8]:两种方法都冻结基础模型,都将编辑存储在附加到单个MLP上的逐槽码本中,并且都在最后一个序列位置通过硬阈值进行路由。SHARD在三个独立设计轴上与GRACE不同(路由度量、写入模式、值优化器);本文的实证贡献最好被理解为将其中一个轴——以余弦路由替代欧氏距离——作为改写泛化与特异性保留之间显著帕累托权衡的来源。受控消融实验(第7.8节)表明,路由几何选择完全解释了在两个测试单元上的实证差距,而写入模式和值优化器没有可测量的影响;因此,我们将基于槽的冻结模型编辑中的余弦路由定位为本文的狭窄机制性主张,而更广泛的SHARD框架(架构、机制、多位置扩展、插入程序)则定位为其整合工程载体。
3. **我们提供了架构消融,展示每个设计选择的贡献。** 最重要的是触发规则:当槽在每个序列位置而非仅在下一token预测位置触发时,准确率受到上限限制,因为上游token处的虚假槽触发会污染预测。将触发限制在每次前向传播的最后一个位置——这正是在结构上语言模型头读取的位置——在小规模下恢复了插入@N的量级级改进。
4. **我们展示了该架构可以跨模型家族和目标分词方案迁移。** 使用单位置优化,该基本原语在目标答案分词为单个子词时有效(这在GPT-2的BPE下对我们的合成名词来说是常见的)。对于BPE分词为多个子词的目标答案(在Qwen2的分词器下是常见的),单位置扰动仅能控制第一个生成的token。我们通过多位置优化扩展了该原语:在提示加目标序列中的每个预测位置捕获并优化一个槽。评估时,包装的MLP将每个生成token的中间状态与所有存储的键进行余弦匹配,该位置的槽确定性触发。通过此扩展,Qwen2.5-0.5B实现了插入@500 = 。
GPT-2 small上的头条数字(三随机种子验证)为 和 。最强基线(MEMIT,使用相同的v优化基础设施但保留秩一权重更新)达到 和 。次强基线(规范学习率下的顺序微调)达到 和 。在两个维度上同时考量,没有任何权重修改基线测试方法能在三倍范围内接近SHARD。
第2节涵盖相关工作。第3节回顾Transformer MLP如何存储事实关联。第4节引入可寻址记忆原语。第5节描述SFIB基准。第6节涵盖实验设置。第7节报告结果。第8节讨论局限性。第9节总结。
### 相关工作
冻结语言模型的顺序知识编辑最好通过四个运行场景的分类法来描述,而非单一的"技术前沿"。参数修改编辑器(ROME[13]、MEMIT[14]、MEND[15]、KnowledgeEditor[2])将每次编辑写入基础权重;它们是一次性和小批量编辑的主导场景,但在长时间顺序流下会退化,因为连续的秩一更新在MLP权重空间的同一低维子空间中重叠。
### 背景:Transformer MLP中的知识
Transformer的标准前置归一化解码块包含注意力子层和MLP子层,每个都包裹在残差连接中:
MLP可以取两种形式之一,取决于架构家族。对于GPT-2[17]和其他经典解码器:
其中 和 是1D卷积(等价于转置的线性层),是 非线性(GPT-2为GeLU)。对于Llama[20]、Qwen2[22]和其他现代SwiGLU家族解码器:
其中 是逐元素乘积, 通常是
### 架构
该原语是一个包装模块,替换选定层的MLP子模块。设 表示原始(冻结的)MLP。包装模块 维护一个外部记忆库:
以及一个槽计数器 。在训练输入 上的前向传播计算:
1. 正常运行基础MLP以获得中间状态 (形状 ,我们用于检索的键)和基础输出 (形状 )。
2. 如果 ,仅取最后一个序列位置 并计算余弦相似度
对每个批次元素 。设 和 ,其中 是
### SFIB基准
SFIB是我们评估的合成部分。它旨在在基准模型的先验知识完全已知的知识库上,对编辑器行为进行受控的、确定性的三方分解(插入准确率、预训练事实的保留、跨共享实体的组合)。因为事实是虚构的,且模型的"先验知识"本身由对同一合成语料库留出一部分的微调产生,SFIB最好
### 实验设置
我们的主干模型是GPT-2 small(1.24亿参数,12层,原生MLP)和Qwen2.5-0.5B-Instruct(4.94亿参数,24层,SwiGLU MLP,RoPE,GQA)。所有实验均使用公开发布的HuggingFace检查点,并加载时显式转换为float32,以避免?2优化中的bf16精度问题。
对于每个模型和每个随机种子,我们在SFIB预训练语料库上微调公共检查点,最多15个epoch,批次大小16,学习率 ,余弦调度,权重衰减 ,
### 主要结果:GPT-2 small,三随机种子
表2报告了在GPT-2 small上 处的四方法比较,在三随机种子上取平均。所提出的原语在两个维度上都优于所有基线。
相对于最强基线MEMIT:插入高 ;保留高 。相对于顺序FT:插入 ;保留 。种子间方差很小(插入 个百分点,保留 个百分点),表明结果是稳定的,并非由幸运的随机种子驱动。
保留率 ,与什么都不做的冻结基线相差不到5个百分点,这
### 为什么该架构有效
所提出的原语实例化了一个具体的理论主张:即顺序编辑中的灾难性遗忘是由新信息的目标位置造成的,而非由其来源造成的。基于梯度的编辑器将新信息存入已经承载旧信息的共享参数中;新旧信息必然争夺相同的自由度。通过存入独立自由度(每个事实一个槽,权重层面无交互),冲突被消除
### 局限性与未来工作
二跳组合查询在我们测试的每种方法上都只有 。第7.14节中的上下文预言机诊断显示,当两个必要事实都作为自然语言上下文提供时,Qwen2.5主干模型可以组合这两个事实,在同一 个组合对上达到预言机准确率 (0.5B)、 (1.5B)、 (3B)和 (7B)。因此SHARD下的 结果是检索机制的局限,而非主干容量的局限:SHARD针对的单跳目标不会产生
### 结论
我们提出了SHARD,一种用于冻结语言模型顺序知识编辑的方法。SHARD将每个新事实作为 槽存储在附加到单个中间层MLP上的外部码本中,通过最后一个序列位置的余弦相似度路由确定推理时哪个槽触发。基础模型永远不会被修改。
在合成基准(SFIB)、两个真实数据基准(CounterFact和zsRE)、两个模型家族(Qwen2.5和TinyLlama)以及从0.5B到7B的规模扫描上
### 代码和数据可用性
完整实现、评估框架和预注册超参数在可寻址记忆分支上公开提供,地址为 https://github.com/Minds-R-Lab/ComplexAttn 。仓库包含:SHARD方法(shard/);用于比较的GRACE、顺序微调、LoRA和MEMIT基线实现(baselines/);SFIB基准生成器和预注册评估框架(sfib/);以及CounterFact和zsRE的运行器(runners/)。确切的超参数
### 生成式AI和AI辅助技术在写作过程中的声明
在准备本工作期间,作者使用了Anthropic的Claude来辅助脚本编写和语言编辑。作者根据需要审查和编辑了输出内容,并对已发表文章的内容承担全部责任。
### 利益冲突声明
作者声明不存在可能影响本文工作的已知竞争性经济利益或个人关系。
### 致谢
本工作得到了卡塔尔大学与兵库大学之间的国际研究合作共同基金(IRCC)的支持(资助编号:IRCC-2025-633)。
Mohamed A. Mabrok是卡塔尔大学数学与统计系副教授。他于2015年在澳大利亚新南威尔士大学获得动力系统和控制博士学位。
他的研究兴趣涵盖控制理论、机器学习和应用数学,特别关注控制系统与现代深度架构之间的交叉领域:鲁棒与自适应控制、序列模型的状态空间方法,穆罕默德·马布罗克
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号