基于人工智能与生物信息特征的商业园艺每日草莓产量预测:有限数据下的泄漏感知框架与跨年验证

《Smart Agricultural Technology》:Daily Strawberry Yield Forecasting using Artificial Intelligence in Commercial Horticulture

【字体: 大 中 小 】 时间:2026年09月25日 来源:Smart Agricultural Technology 7.1

编辑推荐:

  准确的产量预测对于商业化草莓生产至关重要,因为每日采收估算直接影响劳动力调配、物流规划和市场供应承诺。然而,农场尺度的预测运行在诸多显著约束之下,包括有限的多年度历史数据、季节性不连续、季节性零产量边界以及异构的操作数据来源。虽然大多数现有预测研究是在大规模数

  
准确的产量预测对于商业化草莓生产至关重要,因为每日采收估算直接影响劳动力调配、物流规划和市场供应承诺。然而,农场尺度的预测运行在诸多显著约束之下,包括有限的多年度历史数据、季节性不连续、季节性零产量边界以及异构的操作数据来源。虽然大多数现有预测研究是在大规模数据集上评估的,但本研究专门考察了有限数据条件下的产量预测性能。研究人员采用一种泄漏感知(leakage-aware)、基于生物学信息的框架,利用来自英国某商业农场的连续六个生产年度(2020–2025)数据进行每日草莓产量预测。该建模流程整合了滚动环境摘要和多时间尺度产量滞后特征,同时保留季节性边界并强制执行严格的时间对齐。一项全面的基准研究在三种验证方法下评估了线性模型、基于距离的方法、树集成、梯度提升框架、神经架构以及表格基础模型(TabPFN):随机训练–测试分割、留一交叉验证(Leave-One-Out Cross-Validation, LOOCV)和前向年泛化。结果表明,评估设计会实质性影响表观性能。在部署相关的前向年验证(训练2020–2024,测试2025)下,TabPFN取得了平均绝对误差(Mean Absolute Error, MAE)438.53和决定系数(coefficient of determination, R2)0.696,优于经典基线模型。基于树的集成模型也表现出较强的泛化能力,而从零训练的神经序列模型在有限数据下表现不佳。研究结果表明,受生物学启发的时序特征能够捕获大量可预测结构,并且在小型季节性数据集中,稳健的归纳偏置比架构复杂性更有益。
商业园艺中的产量预测一直是具有挑战性的问题,尤其是高价值、劳动密集型的草莓作物。每日产量估算直接影响收获调度、劳动力分配、物流规划、储存管理和合同供应承诺,即使每日分辨率下较小的预测误差也可能导致劳动力效率低下和采后浪费。全球鲜草莓市场2024年估计约207亿美元,预计2030年代中期超过300亿美元;英国2024年草莓作物价值3.89亿英镑,表明提高预测准确性的商业重要性。然而,农场尺度预测面临显著约束:可用的多年历史记录有限(通常仅数年),生产具有季节性不连续,季节边界存在真实零产量,数据源异构且来自日常运营记录而非受控试验。大多数现有草莓产量预测研究在大数据集上评估,本研究专门研究有限数据条件下的预测性能。

为此,研究人员开发了一个泄漏感知(leakage-aware)、基于生物学信息的每日草莓产量预测框架,使用英国商业软果农场2020–2025连续六个生产年度的真实数据。研究整合了每周计划表、每日预测记录和环境传感器数据,设计了保留季节性边界、严格时间对齐的建模流程,并系统评估了线性模型、距离方法、树集成、梯度提升、神经网络和表格基础模型TabPFN。主要结论是:前向年验证(训练2020–2024,测试2025)下,TabPFN取得最佳性能(MAE=438.53,R2=0.696),优于经典基线;树集成模型泛化良好,而从零训练的神经序列模型表现不佳。这证明在有限季节性数据中,稳健的归纳偏置比架构复杂性更重要,且受生物学启发的时序特征能捕获大量可预测结构。研究还证明评估设计会实质影响表观性能,随机划分高估泛化能力,前向年验证提供更保守、更贴近部署的评估。

主要技术方法方面,研究人员使用了来自英国某商业软果生产商的2020–2025六季数据,整合三类数据源:每周计划表(仅提取植物数),每日预测记录(含Actual_Daily_Yield目标),SoilMoistureSense平台的环境传感器(温度、相对湿度)。特征工程包括1/3/7/14/21天产量滞后滚动平均值、7/14天温度与湿度滚动平均值,并在收获周期前后填充7天零产量边界。模型涵盖Ridge、KNN、SVR-RBF、Random Forest、Extra Trees、HistGBR、XGBoost、LightGBM、CatBoost、MLP、TinyLSTM、TinyTCN和TabPFN。验证采用随机80/20分割、LOOCV和前向年验证(训练2020–2024,测试2025)。

研究结果部分:

5.1 随机80/20分割。作为标准基线,随机划分后TabPFN取得最低误差(MAE=340.18,R2=0.733);LightGBM、XGBoost、Extra Trees等梯度提升/树模型表现强,神经网络(MLP、TCN、LSTM)表现弱,序列模型R2为负。

5.2 零填充消融与敏感性分析。固定TabPFN,比较0/3/7/14天零填充,结果显示7天填充取得最高R2(0.733),14天虽进一步降低MAE(282.58)但R2降至0.646,说明7天边界填充是较优选择。

5.3 留一交叉验证。LOOCV下TabPFN仍最优(MAE=338.09,R2=0.709),树增强方法构成第二梯队,神经网络R2为负,说明有限数据下从头训练序列模型不可行。

5.4 时间保持:训练2020–2024,测试2025。这是最贴近部署的验证。TabPFN再次最优(MAE=438.53,R2=0.696);Random Forest在非TabPFN模型中MAE最低(469.57),HistGBR、Extra Trees也稳定;GPU梯度提升略逊;MLP R2仅0.217,LSTM/TCN为负。

5.5 跨方法比较。TabPFN在随机分割和LOOCV下MAE约340,前向年验证增至438.53,表明跨年预测更具挑战;树集成优于梯度提升,深度学习始终弱。

5.6 特征重要性结果。基于排列重要性的分析显示,短期产量滞后特征(Yield_lag1, Yield_lag3等)主导预测,温度/湿度及与产量交互项(Yield1_Temp, Yield1_RH)也有作用,符合生物学过程。

讨论部分指出,评估设计严重影响表观性能,前向年验证是季节性农场的可靠部署评估方式;在有限数据下归纳偏置比模型深度更重要。模型倾向于低估高峰产量,可能由于缺少太阳辐射、日长、灌溉和生长度日(Growing Degree Days, GDD)等变量。局限性包括数据来自单一农场,外部泛化需进一步验证。研究结论翻译:该项研究考察了真实商业条件下每日草莓产量预测,所建立的泄漏感知框架在前向年验证下由TabPFN实现最佳性能(MAE=438.53,R2=0.696),优于经典机器学习基线;树集成模型也可靠泛化,而从零训练的神经序列架构表现不佳。结论强调,在小到中等规模、具有季节断点的农场数据中,强归纳偏置和正则化比模型深度或时间复杂性更重要。明确证明评估设计会显著影响表现,随机划分会高估季节性农业数据的泛化性能,而严格前向年验证提供更保守且与部署相关的评估。保留真实零产量和因果特征对齐增强了评估可信度。从操作角度看,每日产量预测可集成到商业决策支持系统中,且树集成与表格基础模型在跨年漂移下的稳健性支持其在数据有限且不断演变的实际部署中的适用性。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号