← 最新论文
⚡ electrical engineering

Model-Free Adaptive Parameter Tuning for Efficient Multi-Robot Warehouse Operations

本文提出了一种基于极值搜索控制的无模型自适应参数调优框架,该框架能够实时持续优化多机器人仓库挖掘策略,通过动态适应变化的设施配置和运行条件,实现了相比固定策略显著的吞吐量提升。

原作者: Pratap Tokekar, Mouhacine Benosman, Rahul Chandan, Alexandre Ormiga Galvao Barbosa, Michael Caldara, Joseph W. Durham

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Pratap Tokekar, Mouhacine Benosman, Rahul Chandan, Alexandre Ormiga Galvao Barbosa, Michael Caldara, Joseph W. Durham

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在为现代电子商务提供动力的庞大且轰鸣的仓库内部,成千上万的小型机器人正以如同排练精良的管弦乐队般的精准度移动着。它们的任务是取回被称为“货架单元”(pods)的架子,这些架子上存放着客户订购的商品。为了节省空间,这些货架单元被密集地堆叠成网格状的区块。当机器人需要抓取埋藏在某个区块深处的特定货架时,它不能直接伸手进去;它必须先移动挡路的货架。这个过程被称为“挖掘”(digging out),需要中央计算机来决定最佳的移动序列。计算机使用一套规则(或称参数)来权衡不同的选项:是应该将阻碍路径的货架送到仓库完全不同的区域,还是在同一个区块内进行挪动?将它们送走会占用更多主通道中的机器人并可能导致交通拥堵,而局部挪动虽然避免了对通道的影响,但清理路径所需的时间更长。为这些规则寻找完美的平衡极其困难,因为仓库是一个充满变化且鲜活的系统。清晨安静时段的最佳设置,在繁忙的下午可能会变得糟糕;而且一种适用于某个仓库布局的配置,在另一个仓库中往往会失效。传统上,工程师必须在模拟环境中手动测试数千种组合以找到一个好的设置,这是一个缓慢且昂贵的流程,且仍无法跟上实时变化的节奏。

亚马逊机器人团队(Amazon Robotics)的研究人员开发出了一种解决此问题的新方法,使仓库软件能够进行实时自我调节。该方法不再依赖于人类去猜测正确的设置,也不再运行无止境的模拟,而是应用了一种称为“极值搜索”(extremum seeking)的控制技术。这种方法将仓库视为一个可以从自身错误中学习的系统。计算机会对决策规则进行微小的、有节奏的调整,就像手在测试淋浴水的温度一样,轻微地向上或向下拨动。然后,它观察这些微小的拨动如何影响整体速度,即每小时完成的商品取件量。通过将这些微小的变化与结果联系起来,系统可以弄清楚哪个方向能带来更好的性能,而无需理解每个机器人运动的复杂物理过程。这是一种“无模型”方法,意味着它不需要对整个仓库进行完美的数学描述即可工作;它仅仅是通过观察因果关系来进行判断。

研究人员在一个高度详细的计算机模拟中测试了这个自调优系统,该模拟模拟了真实的仓库运作,包括数百个机器人的移动和数千个订单的流转。他们想看看系统是否真的能在噪声中检测到信号。在真实的仓库中,改变一条规则的效果可能需要几分钟时间才会体现在总取件量上,因为机器人需要完成当前的各项任务,新计划产生的连锁反应才能在地面上展开。研究证实,这些有节奏的拨动确实产生了可衡于整体吞吐量的变化,证明了系统能够“听见”信号。他们还测量了延迟,发现规则改变对整体速度产生影响大约需要四分钟。基于这一认知,系统被编程为在进行下一次调整前会等待“尘埃落定”,从而确保其反应是针对正确的诱因。

当这个自适应系统与固定预设规则进行对比测试时,它始终表现得更为出色。在仓库布局或机器人数量发生变化的模拟实验中,固定规则往往表现挣扎,导致效率下降。然而,自调优系统会自动调整其参数以匹配新条件,平均恢复了 5% 的吞吐量。这听起来可能是一个很小的数字,但在处理数百万件商品的设施中,这种差异意味着每天可以多完成数千个订单。当研究人员模拟突发干扰(例如一半的人类工作站因换班而下线)时,这种优势变得更加显著。在这些动态场景中,自适应系统将整体吞效提升了 8% 以上,尤其是在干扰发生后的阶段,提升幅度超过了 14%。它通过自动增加工作站的允许队列大小来实现这一点,使得剩余的机器人能够更高效地工作,而不至于卡在等待人类协助的过程中。

研究还表明,无论初始状态如何,该系统都能自主找到最优设置。无论初始规则被设定得非常保守还是非常激进,系统都会持续向一个狭窄的最优值范围漂移。这表明该方法不仅能改善一个糟糕的起点,还能主动寻找当前环境下的真正最佳设置。研究人员发现,即使在拥有超过一千个机器人的大型仓库中,这种方法依然有效,并且系统在收敛至最佳解决方案时能保持稳定。通过消除手动调优的需求并允许仓库根据需求进行即时适应,这项工作为管理复杂的机器人集群提供了一种新的范式。它将一个静态、僵化的规划过程转变为一个流动的、响应式的过程,确保无论条件如何变化,仓库都能以巅峰效率运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →