← 最新论文
⚡ electrical engineering

Improving greenhouse fruit-production control by integrating reinforcement learning into short-horizon model predictive control

本文提出了一种轨迹选择型 RL-MPC 框架,该框架将强化学习中的长期经济见解集成到短时域模型预测控制中,旨在温室番茄生产中有效平衡果实产量与运营成本,同时遵守系统约束。

原作者: Bart van Laatum, Salim Msaad, Eldert J. van Henten, Robert D. McAllister, Sjoerd Boersma

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Bart van Laatum, Salim Msaad, Eldert J. van Henten, Robert D. McAllister, Sjoerd Boersma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心大局:温室的困境

想象你是一家高科技番茄温室的经理。你的目标很简单:种出尽可能多的番茄以赚取利润,同时尽可能减少在维持植物生存所需的加热、电力和二氧化碳方面的支出。

然而,你面临着一个棘手的难题:

  1. “近视”问题(短视): 如果你只看接下来的一个小时,你可能会为了省钱而关掉加热器。但如果你这样做,植物就会变冷,停止生长,导致你以后亏钱。你需要平衡今天的成本与明天的收成。
  2. “长周期”问题: 为了做出完美的决策,你应该观察未来几周的情况(因为番茄需要数周才能生长)。但计算出未来几周完美计划所需的数学运算极其复杂,计算机无法在实时状态下完成计算。
  3. “天气”问题: 你无法控制室外的天气。如果你为晴天做好了计划,结果却下雨了,你的计划就会失败。

两种旧方案(以及为什么它们并不完美)

研究人员研究了解决此问题的两种现有方法:

  • “计算器”(模型预测控制,简称 MPC): 这就像一个非常严谨的会计师。它观察接下来的一个小时,检查天气预报,并计算出此时此刻节省成本的最佳方式。
    • 缺陷: 它太短视了。它看不出今天关掉加热器会导致下周果实生长停滞。它今天省下了几分钱,明天却损失了几美元。
  • “直觉专家”(强化学习,简称 RL): 这就像一位见证过成千上万个季节的老农。它通过长期的学习,掌握了一种“直觉”(策略),知道如何在成本和生长之间取得平衡。
    • 缺陷: 它有点鲁莽。因为它专注于大局,可能会忽略严格的规则(比如“不要让湿度过高”)。此外,如果遇到它从未学过的奇怪天气,它可能会犯错。

新方案:“混合教练”(轨迹选择型 RL-MPC)

作者创建了一个结合了两者优点的新系统。可以将其想象为一个**“混合教练”**,它使用两名助手来做出每 5 分钟一次的最终决策。

以下是“混合教练”的工作原理:

  1. 长期愿景家(RL 助手):
    系统首先询问“直觉专家”(RL 策略)来构思未来一小时的路径。“如果我们遵循你的直觉,一小时后我们会处于什么状态?”专家会给出一个考虑到长期经济目标(例如确保果实持续生长)的计划。

  2. 严谨会计师(MPC 助手):
    接下来,系统要求“计算器”(MPC)规划未来一小时。但诀窍在于:计算器被告知,“你必须大致达到专家建议你达到的终点。” 这迫使计算器在履行其检查即时天气和严格安全规则(如湿度限制)职责的同时,必须尊重长期目标。

  3. 最终决策(选择机制):
    现在,系统拥有了两个关于未来一小时的计划:

    • 计划 A:专家的长期愿景。
    • 计划 B:会计师完善后的、遵守规则的版本。

    系统会计算这两个计划的得分。它选择得分较高的那个计划,并执行该计划的第一步。然后,5 分钟后,它利用新的天气数据重复整个过程。

为什么这行得通(结果)

研究人员在一个名为“GreenLight”的大型复杂番茄温室计算机模型上测试了该系统。

  • “专家测试”: 他们仅针对一个特定的天气日训练了专家。当他们在同一天测试混合教练时,它的表现与完全了解当天的专家一样出色,但比单纯的计算器要好得多。
    • 类比: 这就像拥有一个国际象棋特级大师(专家)和一个计算机引擎(计算器)。混合教练让特级大师设定策略,但由引擎来检查每一步是否合法且安全。
  • “全才测试”: 他们在许多不同的天气日训练了专家,然后在专家从未见过的新天气日进行了测试。
    • 结果: 混合教练比专家高出 54%,比计算器高出 80%
    • 原因: 专家擅长把握大局,但有时会违反规则(比如让湿度过高)。计算器擅长遵守规则,但过于短视。混合教练利用专家的长期愿景来引导计算器,而计算器的严格数学逻辑则保证了系统的安全性并节省了加热和电力的成本。

总结

这篇论文证明了你不需要在“长期智慧”和“短期安全”之间做选择。通过让聪明的 AI(RL)引导严谨的计算器(MPC),并每隔几分钟从中挑选出最佳计划,你可以更高效地运营温室,即使在天气难以预测的情况下也是如此。

核心要点: 该系统不仅仅是在猜测;它每隔几分钟就会模拟两种不同的未来,选出胜者,并执行第一步动作。这使得它能够在不被复杂的数学运算压垮的情况下,处理番茄缓慢生长的复杂性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →