pDFL:基于知识感知的自适应聚合技术,用于实现个性化去中心化联邦学习

《Knowledge-Based Systems》:pDFL: Knowledge-aware adaptive aggregation for personalized decentralized federated learning

【字体: 时间:2026年08月11日 来源:Knowledge-Based Systems 8.0

编辑推荐:

  摘要:去中心化联邦学习作为一种实用解决方案,通过保持数据本地化而移动模型,逐渐成为下一代边缘智能的关键技术。它能够在资源异构的设备之间实现无服务器协作,无需传输原始训练样本。然而,现有的个性化联邦学习方法缺乏有效的结构化邻域知识融合机制,将异构的同伴模型视为同等可靠的知源。这种粗

  摘要:去中心化联邦学习作为一种实用解决方案,通过保持数据本地化而移动模型,逐渐成为下一代边缘智能的关键技术。它能够在资源异构的设备之间实现无服务器协作,无需传输原始训练样本。然而,现有的个性化联邦学习方法缺乏有效的结构化邻域知识融合机制,将异构的同伴模型视为同等可靠的知源。这种粗粒度的融合方式难以捕捉不同客户端之间的领域相关性,从而导致知识传递效果不佳、个性化程度下降,以及在高度非独立同分布环境中的学习动态不稳定。我们提出了pDFL,一种以个性化为导向的联邦学习框架,能够学习信任谁以及如何交换知识。首先,为量化不断变化的异构环境下的邻居价值,我们提出了一种多头注意力引导的加权聚合机制。该机制能够从知识表示中学习上下文感知的邻域影响,自适应地为分布式邻居分配权重,以抑制不匹配的同伴,从而减少有害的平均效应和模型漂移。其次,为弥补单向蒸馏的局限性,我们构建了一种双向知识蒸馏机制,将快速本地适配与共享表示对齐相结合。内部知识蒸馏通过选定的邻域校准软目标,快速实现分类器的个性化;而外部知识蒸馏则将每个客户端的领域专业知识反馈给同伴,以协调决策边界。同时,本地训练阶段通过先调整个性化头部,再协调共享表示,进一步稳定优化过程。在CIFAR-10、CIFAR-100和Tiny-imagenet数据集上进行的广泛实验表明,在狄利克雷划分和病态划分条件下,pDFL的收敛速度略快于现有最优基准算法,准确率提升约1%–2%,且达到目标准确率所需的训练轮数减少5%–20%。这些结果表明,基于注意力引导的聚合与双向蒸馏相结合,为去中心化且高度非独立同分布的边缘环境中的稳定个性化提供了有效改进。

引言:联邦学习作为一种在移动计算领域极具前景的范式,使得分布式移动设备能够充分利用本地感知数据的价值。通过协调多个设备共同执行机器学习任务,联邦学习能够在保留原始数据在本地设备上的前提下,生成训练良好的全局模型[1]、[2]。然而,移动和边缘计算中的联邦学习往往面临计算和通信资源异构以及易受单点故障影响的挑战。去中心化联邦学习通过设备间直接通信实现模型协同训练,无需依赖集中式协调,同时仍能保持原始数据本地化[3]、[4]。更重要的是,去中心化联邦学习逐渐成为一种去中心化的知识共享与传递范式:每个参与者从其本地数据中学习领域特定的表示,同时偶尔与同伴交换模型知识。在这种点对点协作模式下,核心挑战不再仅仅是如何通信,而是如何可靠地评估、融合和传递异构知识。在现实应用中,由于参与者在数据语义、任务目标及运行环境方面存在差异,这一挑战愈发突出。诸如NEBULA[5]、Swarm Learning[6]、MELLODDY[7]和Catena-X等近期推出的工业平台表明,去中心化基础设施能够在不集中存储原始数据的情况下支持大规模学习。不过,这些应用也暴露出一个共同的瓶颈:无差别的模型更新交换往往会混合具有不同可转移性的领域知识,这可能会稀释本地有价值的专长或传播不兼容的模式,从而限制跨领域泛化能力以及客户端层面的专业化发展。因此,实际应用中的有效去中心化联邦学习需要具备选择性和结构化的知识融合机制,能够判断应信任哪些邻居的知识、吸收多少以及何时反馈回去。与此同时,对于那些具有强烈本地专业特性的领域而言,传统的“一刀切”策略——即学习单一全局模型——往往不够适用,这就使得联邦学习中的个性化成为一个重要的研究方向。现有方法主要依赖于基于稀疏编码的本地训练[8]、元学习[9]、聚类[10]、邻居选择[11]、[12]以及知识蒸馏[13]、[14]。例如,稀疏编码方法利用分布式稀疏编码训练技术来实现轻量级的联邦学习训练,而元学习方案则能够自动对邻近知识进行加权与聚合。基于聚类和邻居选择的策略试图通过计算客户端间的距离(如模型参数差异或输出分布重叠度)来识别有用的同伴,知识蒸馏技术则通过聚合邻居的软预测来规范本地模型。尽管这些方法颇具潜力,但仍存在一些关键局限。稀疏编码和元学习往往会导致较高的计算或内存开销,而聚类和邻居选择策略则依赖于静态的距离度量,可能无法真正反映训练过程中邻居贡献的变化。同样,单向蒸馏忽略了相互反馈,容易稀释客户端特有的知识,导致在高度非独立同分布数据下收敛不稳定。在去中心化联邦学习中,由于缺乏中央协调器以及动态的点对点拓扑结构,这些局限会被进一步放大,使得静态或不对称的策略无法发挥作用。在这种情况下,无论是客户端数据还是网络异构性,都要求采用适应性个性化机制,在保持全局协调的同时调整本地目标。因此,引入能够根据每个客户的领域及其不断变化的邻居环境进行动态调整的个性化机制,对于实现稳定高效的去中心化联邦学习优化至关重要。为克服这些挑战,包括忽视动态邻居贡献的静态统一聚合、削弱客户端特定知识的单向蒸馏,以及在高非独立同分布条件下的不稳定收敛问题,我们提出了pDFL,这是一种个性化的去中心化联邦学习框架,能够自适应地将协作与个性化相结合。pDFL通过自主识别并赋予有价值邻居相应权重,打破了统一聚合的局限,使每个客户端能够根据上下文相关性有选择地从同伴那里聚合知识。具体而言,我们引入了一种双向知识蒸馏机制,建立了信息的双向流动。每个客户端从邻居那里获取经过校准的软知识,以加速本地个性化,同时将自己领域的专业知识反馈给邻居,以协调决策边界。这种相互交互不仅稳定了优化过程,还增强了客户端间的泛化能力。此外,我们还设计了一个多头注意力引导的聚合模块,能够动态量化多个表示子空间中邻居的影响,使模型在训练过程中能够专注于最具信息量和最可靠的合作伙伴。总之,我们的贡献如下:•我们提出了pDFL,这是一种去中心化的个性化框架,提升了聚合和学习效率,每轮只需一个加权教师模型来监督本地更新,从而在非独立同分布数据条件下提高计算/通信效率。•我们设计了一个多头注意力模块,能够以上下文感知的方式对邻居影响进行局部评分和标准化,聚合知识表示/逻辑值而非原始参数,从而抑制分布不匹配的同伴,减少有害的平均效应和决策边界冲突,降低模型漂移。•我们提出了双向知识蒸馏:通过来自选定邻域的校准软目标快速实现本地分类器的个性化(内部知识蒸馏),然后将特定领域的模型反馈传递回邻域,以协调决策边界(外部知识蒸馏)。这一流程形成了一个“吸收-对齐”闭环,既保持了性能提升和快速收敛,其隐私保护范围也仅限于原始数据的本地化,而非针对基于模型的推理提供正式保护。•在CIFAR-10/100和Tiny-imagenet数据集上进行的广泛实验,结合理论分析,表明pDFL比现有的强大去中心化基准算法更快、更稳定地收敛到邻域最优解,准确率高出约1%–2%,且所需训练轮数减少5%–20%。本文的其余部分结构如下:第2节介绍以往关于个性化联邦学习的研究;第3节描述所提出的pDFL框架的核心组件;第4节从理论上分析pDFL的收敛特性;第5节在真实世界数据集上评估pDFL相对于基准算法的性能;第6节探讨pDFL的隐私保护范围与局限性;第7节对全文进行总结。

片段摘录:个性化联邦学习在现实场景中,多源异构数据为有效知识整合带来了障碍。个性化联邦学习旨在通过去中心化学习为每个客户端生成高度个性化的模型,从而消除知识聚合过程中的障碍。个性化联邦学习主要运用知识蒸馏[15]、多任务学习[16]、元学习[17]、模型解耦[18]、[19]、模型插值[20]以及聚类[21]等技术来解决这一问题。

问题建模:我们考虑由N个移动设备构成的D2D无线网络,这些设备位于某一区域内。它们共同优化指定的训练任务,构成典型的去中心化联邦学习系统。在通信资源异构的环境下,D2D无线网络中的N个移动设备形成随时间变化的无向通信拓扑图Gt=(U,Et),其中U=1,2,…,N,Et?U×U分别表示第t轮时设备集合(即客户端)以及它们之间的通信链路。为简化问题,我们……

理论分析:我们在非凸环境中对pDFL进行了条件收敛性分析。该分析明确区分了内部知识蒸馏和外部知识蒸馏的效果,并将注意力项和教师漂移项与有界表示漂移、逻辑值平滑度以及拓扑变化联系起来。设?Fi(w)?Eξ~Di?(f(x;w),y)为局部目标,?F(w)?1N∑i=1NFi(w)为全局目标。在第t轮时,客户端i执行E次步长为η的本地迭代。内部知识蒸馏损失通过……计算。

实验设置:我们在配备Intel(R) Xeon(R) W-1390 @ 2.80 GHz/2.81 GHz处理器及64 GB内存的平台上,使用Pytorch实现了pDFL的相关组件。为了实现去中心化联邦学习的协同训练,我们将客户端总数固定为|U|=100,并将它们排列成厄尔多斯-雷尼随机通信拓扑结构。每个客户端的邻居数量在拓扑中随机变化,同时通过拓扑构造确保每个客户端至少有10个参与聚合的邻居。每……

讨论:隐私保护范围与局限性。pDFL是在原始数据本地化的前提下设计的:在注意力引导的聚合或双向知识蒸馏过程中,客户端不会传输原始样本、标签或本地小批量数据。不过,这不应被视为正式的隐私保障。该协议会在相邻客户端之间交换模型副本、紧凑的知识表示、逻辑值统计信息以及经过外部优化的模型副本。特别是,外部知识蒸馏步骤会更新邻居……

结论:在本文中,我们解决了去中心化联邦学习中实现稳健个性化的难题。我们提出了pDFL,这是一种完全去中心化的框架,首先通过注意力引导的加权聚合在表示空间中学习上下文感知的邻域影响。随后,我们利用内部知识蒸馏实现快速本地适配,通过外部知识蒸馏协调决策边界,从而在非独立同分布数据条件下实现稳定优化。在CIFAR-10/100和Tiny-imagenet数据集上进行的广泛实验……

CRediT作者贡献声明:王帅:写作——审稿与编辑、写作——初稿、方法论、研究、形式分析、概念构思。田友亮:写作——审稿与编辑、验证、监督、资源协调、项目管理。向阿新:写作——审稿与编辑、验证、监督。熊金波:写作——审稿与编辑、验证、监督、资源协调、项目管理。马建峰:验证、监督、资源协调。

利益冲突声明:作者声明不存在任何可能影响本文所述工作的已知财务利益或个人关系。王帅|田友亮|向阿新|熊金波|马建峰
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号