《Smart Agricultural Technology》:Distributed Machine Learning in Precision Agriculture: Methods, Applications, and Challenges
背景:随着农业日益数据驱动化,维护信息隐私与安全以及保护敏感农业数据,已成为农业生态系统中所有利益相关者的共同责任。分布式机器学习方法为解决该问题提供了一条途径,因为它能够管理作物生产、动物健康或经济产量等敏感数据,从而可能提高农业系统的生产力并改善可追溯性。目标:尽管已有不同研究探索了分布式机器学习在农业领域的应用,但该方法的基本特征和总体发现仍分散于各类文献中。据研究人员所知,尚未有综合性的尝试系统地归纳其特性、架构、技术考量及相关挑战。本研究开展了一项系统性文献综述(Systematic Literature Review, SLR),以识别文献中报道的农业系统中已实现的分布式机器学习方法。方法:本研究设定2015年至2025年共10年的发表时间范围,共识别出1,864篇文章,其中41篇被选为主要研究。研究人员对所选研究进行分析,以识别基于通信方式的分布式机器学习类型,以及所采用的系统架构和治理方法。结果与结论:在41篇文章中,有24篇发表于2025年,表明农业领域分布式学习的研究近年来日益重要。本研究呈现了基于通信方式的分布式机器学习类型,其中联邦学习(Federated Learning, FL)被确定为农业中研究最频繁的类型,出现在32项研究中。研究还讨论了所采用的系统架构和治理方法,表明二者之间存在紧密联系,并影响整个数据流。由于客户端-服务器模型是最常被提及的架构,有证据表明集中式权威是主导的治理方法。然而,研究人员也发现客户端-服务器架构应用了基于共识和协作的治理方式。这是因为作者将客户端-服务器架构与区块链架构相结合,在聚合来自本地节点的参数时,全局节点需要获得所有本地节点的共识。此外,还识别了其他架构,如对等网络(P2P)和分层分布式学习,在P2P拓扑中,没有单一服务器拥有控制系统的主导权。因此,选择合适的架构至关重要,因为它影响整个系统,包括其治理模型。意义:基于这些发现,本研究识别了分布式机器学习进一步发展的重大机遇,可供研究人员和相关利益相关者未来探索。这些见解提供了基础性理解,可指导未来研究和实际部署。
1. 引言
实现基本需求保障(包括粮食安全和食品安全)是推进可持续发展目标(Sustainable Development Goals, SDGs)的核心优先事项,特别是SDG 2,旨在实现零饥饿、改善营养并促进可持续农业。为了确保可持续农业实践,需要由先进技术支持的重大转型,以帮助农民更好地管理农场、提高产量并减少农业浪费。例如,人工智能、机器学习、物联网和区块链等技术可以通过提供更准确的数据帮助农民做出明智决策。随着农业日益数据驱动化,人工智能和机器学习正在成为变革农业部门的关键技术。传统上,机器学习模型在主服务器上训练,所有所需数据在单一位置收集、存储和处理。然而,单一服务器执行复杂机器学习任务存在若干局限性,包括单点故障、带宽延迟和隐私风险。此外,将数据存储在单一数据存储中会增加数据隐私危险,使敏感记录面临大规模泄露。与此同时,分布式学习范式提供了一种平衡的方法来管理这些局限性,允许去中心化设备协作训练共享模型,因为它能够管理作物生产、动物健康或经济产量等敏感数据,从而可能提高农业系统的生产力并改善可追溯性。
分布式机器学习使云平台或服务器能够组合来自多个参与者的模型,每个参与者本地训练自己的模型。将数据保存在本地,并仅通过通信网络交换模型参数,可提供重要好处,包括增强隐私、安全性、效率和可扩展性。在农业中,这种本地训练是有益的,因为农民现在面临数据不对称问题以及对农业技术提供商(Agricultural Technology Providers, ATPs)如何存储和使用其数据的担忧。保护敏感农业数据是农业生态系统中所有利益相关者的共同责任。分布式机器学习方法通过安全聚合、差分隐私和同态加密来强有力地保护数据,从而为解决该问题提供了途径。
随着分布式机器学习的重要性日益增加,先前研究已探索其在农业中的应用。例如,Saha等人提出基于分布式学习的智能虚拟感知(DLSense)用于精准农业,降低了服务成本和延迟,并提高了服务可用性。此外,Vimalajeewa等人引入了一种分布式机器学习方法来分析牛奶质量。分布式机器学习在智慧农业中的应用显著改变了数据的存储和分析方式。分布式机器学习使农民能够访问分布式设备网络的集体智能,在不牺牲数据机密性的情况下提高预测准确性、作物生产力和可持续农业方法。
尽管已有若干研究探索了分布式机器学习在农业领域的应用,但该方法的基本特征和总体发现仍散见于文献中。据研究人员所知,尚未有全面尝试系统地综合其特征、架构、技术考量和相关挑战。为填补这一空白,本文进行了一项系统性文献综述,以识别农业系统中实现的分布式机器学习方法。本研究增进了对分布式机器学习在农业研究中记录的最佳实践和局限性的有限理解。此外,详细阐述技术方面、功能和障碍对于旨在设计、部署或保护分布式系统的从业者以及推进该研究领域的研究人员至关重要。
2. 方法论
根据Kitchenham等人的观点,系统性文献综述研究必须是可复现、无偏见、彻底和透明的,以提供对特定研究问题的答案。因此,在进行调查之前,研究人员必须有一个明确的研究协议,规定每个程序。在本研究中,定义了研究问题及其动机,为综述提供明确目标。之后,以可复现的方式解释了搜索策略,包括搜索词、学术数据库、搜索日期和策略,以便其他研究人员理解该过程并进而复制。此外,建立了一套选择标准来评估相关论文,然后提取和综合文章以获得所需信息。在最后步骤中,将综合信息可视化。本SLR研究采用了Kitchenham等人提供的指南。
2.1. 主要研究选择
本系统综述考察了农业部门分布式学习实施的现有研究。研究问题根据研究目标制定。第一个研究问题旨在识别精准农业的应用领域,因为这是一个高度碎片化的领域,应用了分布式机器学习。该问题通过确定哪些农业领域已实施分布式学习(如作物管理、牲畜监测)来解决。第二个研究问题侧重于识别文献中采用的分布式学习类型,考虑到现有方法的多样性,包括联邦学习、去中心化对等系统和分层分布式模型。第三个研究问题考察所使用的架构结构,特别是所采用的拓扑和聚合机制。
此外,本研究通过识别治理方法来解决第四个研究问题,因为没有一种方法适用于所有情况。第五个研究问题识别所使用的数据集,而第六个研究问题关注所审查研究中采用的机器学习算法。第七个研究问题探索所采用的实现框架,以支持理解分布式学习系统中的治理模型。第八个研究问题调查所采用的研究基础设施,旨在揭示支持分布式学习的技术骨干。此外,本研究通过识别所使用的数据管理方法,分析了数据在整个分布式学习过程中如何处理。最后,本研究识别了挑战和可能的解决方案,以全面理解限制分布式学习采用的因素以及文献如何解决这些限制。
2.2. 搜索协议
采用系统搜索策略来识别相关文章,以回答研究问题。本研究从多个发表高质量文章的数字数据库中选择研究,如IEEE Xplore、ACM数字图书馆、Scopus、Science Direct、Wiley在线图书馆和Springer。本研究使用2015年至2025年共10年的发表时间范围,因为农业中的分布式学习应用是随着现代传感器技术、边缘计算和农业4.0创新而出现的,其中大部分是在过去十年中开发的,且本研究仅包括专门关注分布式机器学习的论文,因此2015年之前发表的研究相关性较低。为在数据库中进行自动搜索,使用搜索字符串查找相关文章。尽管每个数据库语法不同,但一般搜索查询如下:
(("distributed learning" OR "distributed machine learning" OR "distributed deep learning" OR "federated learning" OR "federated deep learning") AND (agriculture OR farming OR "smart agriculture" OR "precision agriculture"))
执行搜索查询后,本研究识别出1,864篇文章,然后使用排除标准进行筛选。在第一阶段,仅考虑期刊文章,并审查其标题和摘要。本研究仅包括期刊文章,因为与会议论文或书籍章节相比,期刊文章在发表前经过更严格和全面的审查过程。随后,使用排除标准评估其余研究。经过这些步骤,共确定43项主要研究。
2.3. 质量评估
在进行数据综合之前,评估了43项主要研究的质量。在审查文章期间,本研究应用了表4中概述的质量标准,该标准源自Kitchenham等人提出的工具。尽管最初为软件工程创建,但这些指南非常适合计算机科学和分布式学习。评估标准包括明确的研究目标和操作范围,确保每项研究的目的和背景得到明确定义。检查变量的有效性以确保发现可信,详细的文档允许其他人重复实验,而报告负面结果有助于突出现实系统的局限性和权衡。总体而言,该评估确保综述仅包含可靠、高质量和可复现的研究。在此阶段,每项研究的质量使用三点量表(是、部分、否)进行评估。得分低于八分之五的论文被考虑排除。几乎所有论文得分高于6.5,因此得分4和4.5的论文因质量低而被排除。因此,41项研究被纳入数据提取过程。为确保客观性和可复现性,质量评估过程由所有作者独立执行。
2.4. 数据提取
选择主要研究后,下一步是从这些研究中提取数据以回答研究问题。创建了数据提取表格,以系统地从每项研究中捕获必要信息。表格包括一般研究细节,如作者、标题、发表年份、发表场所和数据库来源。还包括与研究问题直接相关的具体元素,如应用领域、分布式学习类型、采用的架构结构、治理方法、使用的数据集、机器学习类型和算法、实现框架、研究基础设施、数据管理方法、挑战和提出的解决方案。
2.5. 数据综合与报告
SLR的最后一步是综合和报告从主要研究中提取的数据。对于数据综合,本研究使用描述性频率分析和伞概念方法。描述性频率用于衡量特定项目在主要研究中出现的频率。同时,伞概念方法用于对数据提取阶段生成的不同类型信息进行分组。为清晰呈现综合结果,使用表格和图表来可视化整合信息。
3. 结果
本节呈现数据提取和数据综合过程的发现。第一小节概述主要研究的一般特征,以下小节报告与每个研究问题对应的结果。
3.1. 一般统计
尽管搜索覆盖2015-2025年,但没有2020年之前发表的研究符合选择标准。所有41项主要研究均发表于2020年至2025年之间,其中2025年数量最高。这一发现表明,农业领域分布式学习的研究在过去五年中变得越来越重要,呈现明显上升趋势。
3.2. 研究问题1:分布式学习应用于精准农业的哪些应用领域?
研究识别出四个农业领域:作物管理、牲畜监测、土壤或水管理以及一般领域。作物管理是主要研究中最常被提及的领域,2025年有24篇论文。牲畜监测在2025年被提及三次,土壤/水管理仅在2024年被提及一次。未提及任何特定领域的论文被归类为一般框架,因为作者为通用智慧农业系统开发了分布式学习。
每篇论文开发分布式学习的具体目的被探索。文献中发现了约17项任务,包括疾病预测与分类、作物分类、作物推荐、作物健康监测、杂草分类与分割、产量预测、资源优化、异常检测、环境监测、灌溉预测与控制、水质监测、牛奶质量预测、蒸散量估计、鸟类检测、水稻品种聚类、成熟度分级和虾生长检查。其中,作物管理领域部署分布式学习用于大多数任务,而其他领域仅将分布式学习应用于更有限的任务。
3.3. 研究问题2:分布式学习类型
分布式系统是计算资源在多个设备或节点之间共享的系统,这些设备或节点协作工作,对用户表现为单一系统。在传统数据分析模型中,训练时需要将数据发送到云/服务器,但这些数据在上传过程中易受各种数字攻击。为解决数据隐私问题,数据分析在训练阶段利用分布式系统概念,将模型与用户设备共享,同时保持客户端数据私有,这种技术称为分布式学习。本研究识别出多种分布式学习类型。联邦学习是农业系统文献中最常被提及的分布式学习类型,其次为去中心化对等网络、分层分布式和基于区块链的分布式学习。
在分层分布式学习中,系统分为多层以减少通信开销、网络瓶颈和高延迟。系统需要中间管理器(如边缘服务器)来聚合来自本地设备的更新,并将组合后的更新发送到主云服务器。在基于区块链的分布式学习中,系统通常通过用去中心化账本替换中心服务器来消除对中心服务器的需求。当各个节点或本地设备更新其参数时,具有智能合约的区块链系统会自动验证、校验和聚合更新,然后将其添加到链中。此外,去中心化系统(包括对等架构)在没有中央协调器的情况下运行任务。分布式系统的性能完全由网络拓扑决定。此外,还发现两篇论文讨论了使用混合分布式类型,例如将联邦学习与区块链技术相结合用于作物管理中的害虫检测。
3.4. 研究问题3:采用的架构结构
在分布式学习中,拓扑指节点之间的关系,即通信和共享信息以训练模型的计算机或设备。本研究发现三种拓扑:集中式拓扑最为常见,有27项研究;分层架构有12项研究;只有两项研究使用对等或网状拓扑。此外,对聚合器进行了调查,聚合器是系统地综合各节点集体知识或参数的算法。聚合器的架构结构包括集中式、边缘/分层式、完全去中心化、基于领导者的和基于区块链的聚合。集中式聚合需要中心服务器协调整个过程;分层方法插入中间边缘服务器来协调附近的本地设备;完全去中心化系统完全移除中央协调器,所有节点平等通信;动态领导者节点选择工作节点之一成为领导者;基于区块链的模型用分布式不可变账本替换中心服务器。
3.5. 研究问题4:治理方法
在分布式学习系统中,很难确定适用于所有情况的单一治理模型。本研究识别出三种治理模型:集中式权威、协作/基于共识的治理和本地自主控制。集中式权威中,决策权、数据管理和治理集中在单一控制实体中。服务器支配代表更严格的集中形式,服务器不仅拥有权威,还支配所有操作规则、强制交互并控制通信和协调的每个方面。大多数客户端/服务器拓扑使用集中式治理,但一项研究使用协作治理,其中所有本地设备将本地模型发送到服务器,但需要本地节点之间达成共识来更新全局模型。树架构使用集中式治理方法。相比之下,对等拓扑倾向于依赖协作和本地自主治理。本地自主控制与集中式方法相反:没有中心服务器控制整个架构。
3.6. 研究问题5:采用的数据类型
分布式学习模型的实现是为了确保数据隐私,因为数据保留在本地设备上而不是上传到服务器。图像数据是最常被提及的数据类型,其次是数据库中的结构化/表格数据,时间序列数据和传感器流是最少被提及的数据类型。
3.7. 研究问题6:机器学习类型和算法
本研究还探索了主要研究中实现分布式学习系统时使用的分析算法。算法分为四类:深度学习(包括深度神经网络(DNN)、深度Q网络(DQN)、卷积神经网络(CNN)、长短期记忆网络(LSTM)以及基于变换器的模型如视觉变换器(ViT)和Swin变换器);机器学习(包括线性回归、线性判别分析、支持向量机、随机森林、决策树(集成/装袋)、K近邻和多层感知器);以及混合模型(如神经网络结合偏最小二乘回归(NNPLS))。聚合算法方面,联邦平均(Federated Averaging)出现27次,自定义加权平均出现6次,联邦近端聚合出现3次,其他算法各出现1次。
3.8. 研究问题7:实现框架
实现框架有助于建模者理解分布式学习系统的治理模型。框架提供同时管理多个设备之间通信的技术。表11列出了实现框架,其中TensorFlow出现12次,Keras和Flower各7次,PyTorch 6次,TensorFlow Federated 4次,PySyft 3次,MATLAB和scikit-learn各2次,iFogSim、Horovod和Open MPI各1次。
3.9. 研究问题8:采用的研究基础设施
本研究调查了开发分布式学习系统的计算基础设施。物联网(IoT)或边缘设备,如Raspberry Pi、Jetson和Arduino微控制器被发现。NVIDIA系列是文献中唯一报告的图形处理单元(GPU)。中央处理单元(CPU)被分为三组:台式机、服务器和仿真CPU。通过识别主要研究中采用的底层硬件配置,本研究旨在理解实现高效、可扩展和隐私保护的分布式学习的技术骨干。
3.10. 研究问题9:数据管理策略
数据管理对于开发分布式学习生态系统至关重要。本地存储是将数据存储在用户设备上的方法。加密传输用于保护设备间共享模型参数时的通信安全。差分隐私提供数学加密以防止链接攻击。
3.11. 研究问题10:挑战与解决方案
3.11.1. 挑战
研究人员和系统开发人员在开发分布式学习系统时遇到了系统挑战。主要研究中提到的挑战包括隐私泄露、通信瓶颈和数据异质性(非独立同分布数据,non-IID data)。隐私泄露发生在共享模型更新(如梯度或权重)暴露参与者数据的敏感属性时。通信瓶颈源于从局部到全局模型的持续大规模模型更新,网络传输时间超过本地硬件计算速度。非IID数据通常导致泛化全局模型的性能不如单个局部模型,并且全局模型隐含偏向多数数据分布,对少数客户端群体造成不公平偏差。
3.11.2. 可能的解决方案
为缓解隐私泄露,可采用的解决方案包括:差分隐私(向数据和模型更新添加噪声)、加密技术(如同态加密、安全多方计算、梯度加密)、以及区块链与去中心化标识符(DIDs)和可验证凭证(VCs)结合使用。针对通信瓶颈,可采用梯度压缩、量化、二值压缩、知识蒸馏、自适应传输、轻量级模型架构和模型剪枝。针对非IID数据,可使用的策略包括先进聚合算法(如FedProx、SCAFFOLD、自适应加权)、数据精炼技术(如重采样、零填充、数据增强)以及集成学习或基于原型的学习。
4. 讨论
4.1. 一般讨论
分布式学习研究在过去五年(2020-2025)在农业领域日益重要。分布式学习系统用于处理全局模型与客户端模型之间的数据通信,目的是将原始数据保留在客户端设备上以确保数据隐私。作物管理是主要研究中的主导领域,这与研究目的相一致。其他领域包括牲畜监测和水/土壤管理。未提及特定领域的论文被归类为通用框架。分布式机器学习类型包括联邦学习、分层分布式学习、去中心化对等学习、基于区块链的分布式学习和混合方法。联邦学习是最广泛使用的方法,用于解决每项任务。从数据角度看,联邦学习被视为分布式学习的一种形式,因为所有原始数据保留在本地设备上。然而,从治理角度看,大多数联邦学习模型是集中式的,因为存在中央服务器或协调器支配规则,即使数据是分布式的。有趣的是,客户端-服务器架构也应用了基于共识和协作的治理,这源于作者将客户端-服务器与区块链架构结合。分层分布式学习是一种多层级模型,本地设备首先与中间节点或边缘通信,边缘服务器聚合本地结果并将摘要发送到云服务器。相反,去中心化对等(P2P)学习没有中央控制,节点与邻居通信直到知识扩散到整个网络。基于区块链的模型类似P2P,但全局模型状态、数据历史和其他信息存储在区块链上。这些模型为添加新节点提供了高可扩展性。治理方法方面,集中式权威、协作/基于共识的治理和本地自主控制是识别的三种模型。集中式模型简单且管理更快,但主服务器失败则整个系统崩溃。去中心化模型在个别设备离线时仍能运行,但需要更多网络流量和时间保持同步。
数据分析表明,图像是最常用的数据集,与深度学习模型作为文献中最常见算法相一致。其他数据集包括表格、传感器和时间序列数据,可使用机器学习算法处理。聚合算法中,联邦平均、自定义加权平均和联邦近端聚合最常被提及。研究基础设施方面,计算平台具有高规格,用于开发处理图像数据的分布式学习系统,如GPU和云平台。本研究还识别了多个实现框架以及数据管理策略,如加密传输和差分隐私。最后,分析了挑战和潜在解决方案。基于结果,本研究提出了一个多维分类法,从领域、系统架构、学习方法、实现基础设施和系统挑战方面系统分类分布式学习系统,为未来研究提供了路线图。
4.2. 对有效性的潜在威胁
为确保SLR研究的质量,讨论了构念效度、内部效度、外部效度和结论效度威胁。为建立构念效度,作者之间深入讨论以制定搜索策略和识别相关论文。搜索过程迭代进行,并审查期刊数据库,选择发表高质量文章的数字数据库。为标准化提取过程,定义了提取表格,并由所有作者重复执行,进行试点测试以识别模糊问题。质量评估用于根据主要研究的严谨性权衡证据。对于外部效度,选择多个数字期刊数据库防止出版商偏见,并界定了搜索边界(2015-2025年、英文论文、讨论农业系统分布式学习实现)。对于结论效度,作者之间进行了广泛讨论以减少解释偏差,确保所有作者一致遵守研究协议。
5. 相关工作
本节讨论了解释分布式机器学习系统实现的若干研究。Tu等人综述了分布式机器学习的挑战、解决方案和未来工作,包括数据异构性、安全和隐私问题以及节点资源。Verbraeken等人展示了分布式机器学习的参考架构和分布式拓扑,表明其生态系统能够处理数据处理需求。另一种类型的分布式学习系统是联邦学习(FL),在过去十年中越来越受欢迎。存在六篇密切相关的FL综述文章。Guendouzi等人综述了FL的一般概念,关注其类别、挑战、聚合方法和实际开发工具,发现最困难的方面是昂贵的通信、系统异构性、统计异构性和数据隐私。Dembani等人综合了FL在农业系统中数据隐私应用的信息,强调了数据异构性、通信障碍、模型收敛和有限计算资源等技术挑战。Garro等人调查了FL、区块链和物联网在牲畜中的实现和集成,发现这些技术之间缺乏集成。?alik和?alik综述了农业部门中FL实现,比较了数据划分策略和FL类型(水平、垂直和混合/迁移FL),以及系统架构和联邦级别。Hiremani等人系统回顾了FL在作物产量预测中的应用,包括数学基础、机器学习模型、数据类型和性能指标。如上所述,虽然有关于农业FL实现的综述论文,但没有关于农业系统中分布式机器学习的综述。FL仅代表分布式学习的专门子集,依赖中央协调和稳定连接,而农业环境通常面临有限计算能力、多样设备和低互联网连接,因此需要更广泛的分布式学习方法。本研究的目的是提供关于农业中分布式机器学习的SLR,涵盖其技术方面、功能和相关障碍。
6. 结论与未来工作
本研究共纳入41项主要研究并进行了彻底系统的分析。研究呈现了基于通信方式的分布式学习类型,其中联邦学习是农业领域研究最频繁的类型。农业分布式机器学习研究在过去五年呈现有前景的趋势,特别是在作物管理领域,这表明其他领域仍有显著的发展空间。研究还讨论了系统架构和治理方法,表明架构与治理方法之间存在紧密联系,影响整个数据流。例如,客户端-服务器架构是最常提及的架构,集中式权威是主导治理方法。其他架构如P2P和分层分布式学习也被发现,在P2P架构中没有单一服务器拥有控制系统的主导权。因此,选择合适的架构至关重要。
研究结果表明,分布式学习系统增强了传统机器学习方法,在分布式机器学习中,数据保留在本地设备上,从而保护数据隐私。基于这些发现,本研究识别了分布式机器学习进一步发展的重大机遇,可供研究人员和相关利益相关者未来探索。隐私保护学习技术正变得越来越重要,本研究为基础理解做出了贡献,可指导未来研究和实际部署。
本研究存在若干局限性。首先,大多数主要研究侧重于作物管理,限制了对其他农业子领域治理和架构偏好的普遍性。其次,文献目前以客户端-服务器架构的联邦学习为主,因此本综述只能捕获关于完全去中心化(P2P)或分层模型性能、安全性和可扩展性的有限经验证据。基于这些局限性,提出了若干研究议程,包括开发农业系统中分布式学习系统的参考架构,以及将分布式学习扩展到作物管理以外的领域,如牲畜监测和精准水产养殖,这些领域存在多样化数据类型和动物移动性带来的独特架构挑战。
资助:本研究未获得任何资助。
作者贡献:概念化:N.K., B.T., C.C.;撰写原始草稿:N.K., B.T., C.C.;方法论:N.K., B.T., C.C.;调查:N.K., B.T., C.C.;审查与编辑:N.K., B.T., C.C.
人类和动物研究声明:本文不包含任何作者对人类参与者或动物进行的研究。研究基于文献分析、概念发展和/或计算分析,因此不适用伦理批准和知情同意。
CRediT作者贡献声明:Ngakan Nyoman Kutha Krisnawijaya:撰写-审查与编辑、撰写-原始草稿、方法论、调查、概念化。Bedir Tekinerdogan:撰写-审查与编辑、撰写-原始草稿、方法论、调查、概念化。Cagatay Catal:撰写-审查与编辑、撰写-原始草稿、方法论、调查、概念化。