← 最新论文
🤖 machine learning

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

本文介绍了 Eluna,这是一个已投入生产部署的智能体系统,它通过将标准作业程序(SOP)编码进图引导的多智能体工作流,并采用非对称情景蒸馏技术,在无需推理时开销的情况下实现高准确率和低延迟,从而实现复杂仓库作业的自动化。

原作者: Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Sherv
发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个规模宏大、高科技化的仓库,它就像一座繁忙的巨型城市,机器人穿梭在传送带上,每秒钟都有成千上万的包裹被分拣。在这座城市里,有着严格的规则手册,称为标准作业程序(SOP)。这些不仅仅是简单的清单,而是复杂的、具有分支结构的地图,充满了无数个“如果……那么……”的决策,就像一本“选择你自己的冒险”类书籍,走错一步就可能导致整个城市的交通瘫痪。

长期以来,人类必须阅读这些规则手册,检查数据并做出决策。这种方式效率低下,且人类会疲劳并犯错。后来,人们尝试使用超智能的 AI 机器人(大语言模型)来承担这项工作。但问题在于:当你一次性把一本长达 100 页的规则手册交给一个强大的 AI 时,它会被淹没。这就像是在试图一边读完一整个图书馆的书籍,一边还要解一道数学题;AI 会变得困惑、遗忘规则或走错路。

于是,诞生了 Eluna——一个由亚马逊构建的新系统,旨在解决这一乱局。你可以将 Eluna 视为不是一个单一的超级大脑,而是一个组织严密的施工队

施工队与蓝图

Eluna 并没有把整本规则手册交给一个人,而是将任务进行了拆解。

  • 蓝图: 复杂的规则手册被转化成了一张数字地图(图结构)。但 Eluna 不会一次性展示整张地图。它使用了一种“渐进式披露”的小技巧:它只展示施工队下一步需要看到的几步操作,就像 GPS 只显示下一个转弯处,而不是整个旅程。这能防止 AI 迷失方向。
  • 领班: 有一个主要的“领班”代理负责持有地图,并决定下一步要执行哪些任务。
  • 专家: 领班会派出更小的、专业化的“子代理”来处理特定工作。一个负责检查温度,另一个检查机器人速度,还有一个负责查询库存。这些专家在各自独立的房间(隔离的上下文)中工作,这样他们就不会被其他人的工作所干扰。他们甚至可以运行代码并即时检查实时数据。
  • 技能包: 每一种新类型的问题(比如修理卡住的机器人或处理损坏的包裹)都配有专属的“技能包”。你只需加载该技能包,施工队就会知道该使用哪些工具。你不需要为每一项新工作都重新训练整个施工队。

秘诀:从错误中学习

Eluna 最聪明的地方在于它的学习方式。团队并没有只是简单地告诉 AI“这是规则”。他们使用了一种巧妙的训练方法,叫做非对称情节蒸馏(asymmetric episodic distillation)

想象一位大师级厨师(“老师”)非常聪明但动作缓慢。这位厨师尝试烹饪一道复杂的菜肴,过程中犯了一些错误,然后将这些错误记录在一本特殊的笔记本(情节记忆)中以进行修正。通过查阅这本笔记本,厨师变得越来越擅长烹饪。

然后,一名快速成长的学徒(“学生”)观察了这段经过修正后的烹饪过程。学徒如此深刻地理解了食谱,以至于他们不再需要那本笔记本了。他们已经内化了这些教训。当学徒在真实的厨房里工作时,他们能够快速且完美地烹饪,无需停下来查阅笔记。

在论文中,“老师”是一个能够通过自我纠错来生成完美烹饪路径(轨迹)的庞大 AI 模型。“学生”则是规模较小、速度较快的模型(例如 320 亿参数的版本)。学徒通过学习这些完美的路径来成长。论文明确排除了仅仅让学生在工作时阅读笔记本的想法;那样会让系统变得缓慢且脆弱。相反,学生必须“记住”这些修正。

它真的奏效吗?

团队在真实的仓库任务(而非虚构的谜题)上测试了 Eluna。

  • 机器人救援: 在一次测试中,系统必须诊断为什么一台机器人传送带出现了故障。旧款的现成 AI 模型感到困惑并失败了。然而,Eluna 的表现却能媲美庞大的“老师”模型,而且速度更快。它正确识别了问题并在实时环境中解决了它。
  • 工单分拣: 在另一个测试中,系统需要阅读关于损坏包裹的杂乱人类笔记,并决定如何处理。一个 3550 亿参数规模的庞大版 Eluna 与人类专家的意见一致率达到了 94%。对于如此棘手的任务,这几乎接近完美。
  • 速度: 该系统不仅变得更聪明,而且变得更快。与那些缓慢的庞大模型相比,它将诊断机器人问题的耗时缩短了一半以上。

论文说了什么(以及没说什么)

作者非常明确地阐述了他们的发现。他们证明了对于这些规则密集型的仓库工作,一个经过良好训练的小型 AI 优于一个庞大但未经训练的 AI。他们证明了如果 AI 一次性接收过多的信息,仅仅通过扩大规模并不能解决问题。

然而,他们也指出该系统并非万能。如果原始规则手册(SOP)本身存在漏洞,或者来自仓库传感器的数据质量很差,AI 仍然会犯错。问题不在于 AI 的大脑,而在于指令和数据的质量。

论文建议,这种方法在仓库运营中效果极佳,但尚未证明它是否适用于完全不同类型的职业。他们同时也承认,训练这样一个系统需要大量的计算能力以及一个起步阶段就非常聪明的“老师”模型,这对规模较小的公司来说可能难以负担。

简而言之,Eluna 证明了通过正确的结构——将大问题拆解为细小、可管理的模块,并训练 AI 从修正后的示例中学习——你可以构建出一个既极其聪明又足够快速以运行真实世界仓库的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →