Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents
Hera 是一种面向长视野大语言模型智能体的新颖步骤级设备 - 云协调器,它采用模仿学习与成本感知强化学习相结合的两阶段训练范式,以优化任务成功率与计算成本之间的权衡,在显著降低云资源使用的同时实现了接近纯云方案的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明但昂贵的助手(云端),还有一位反应迅速、廉价但偶尔会健忘的助手(设备)。你需要它们协同工作,来解决一个漫长而复杂的谜题,比如规划为期一周的假期,或是在迷宫中导航。
问题在于:
- 如果让设备包揽一切,它既快速又免费,但在处理谜题的难点时可能会迷路或犯错。
- 如果让云端包揽一切,它能完美完成任务,但代价高昂,且由于距离遥远,沟通耗时很长。
大多数现有系统试图做出这样的决定:“我们是否应该为这个整个任务使用云端?”如果任务看起来很难,它们就付费使用云端;如果看起来容易,就使用设备。但这就像因为菜单复杂,就雇佣一位主厨在一整周内切所有蔬菜,尽管主厨其实只需要帮忙处理那些棘手的装饰部分。
Hera 登场了。
Hera 是一位新的“团队队长”,它不为整个任务做决定。相反,它逐步观察工作进程,并做出瞬间决策:“这一步容易吗?让设备来做。这一步棘手吗?呼叫云端帮忙。”
Hera 如何学会成为一位出色的队长
Hera 通过一个两阶段的训练过程来学会担任这一队长角色,就像体育教练训练运动员一样:
第一阶段:“影子跟随”阶段(模仿学习)
首先,Hera 观察云端完美地完成整个任务。然后,它让设备尝试完全相同的步骤,并以云端的答案作为指导。
- 如果设备能独立正确完成该步骤,Hera 就会学到:“好的,设备在这里有能力。无需调用昂贵的云端。”
- 如果设备感到困惑或做出了不同的选择,Hera 就会学到:“啊,这一步对设备来说太难了。我们需要云端的帮助。”
这为 Hera 提供了一份基础规则手册,指明设备在哪些地方会遇到困难。
第二阶段:“策略”阶段(强化学习)
现在,Hera 亲自参与游戏。它尝试通过混合设备和云端的步骤来完成任务。它的得分基于两点:
- 我们赢了吗?(任务是否完成?)
- 我们花费过多吗?(我们是否过于频繁地调用云端?)
Hera 学到,它并不需要为每一个困难步骤都调用云端。它学到,有时在漫长旅程的中间,仅调用云端处理一个关键步骤,就足以让整个计划保持正轨。它学会通过仅在绝对必要以避免失败时才调用云端,来节省成本。
结果:兼得两者之优
研究人员在三个不同的“谜题”上测试了 Hera:
- ALFWorld:一个机器人试图整理房屋。
- WebShop:一个智能体试图在网站上购买特定商品。
- AppWorld:一个智能体试图编写代码来管理应用程序。
关键数据:
- 成功率:Hera 达到了始终使用云端时**92.5%**的成功率。它几乎从不出错。
- 成本节省:它仅在**46.3%**的步骤中使用了昂贵的云端。其余步骤由设备处理。
- 速度:由于大量使用本地设备,整个过程比每次都等待云端要快得多。
核心启示
将 Hera 想象成一位聪明的经理,它确切地知道何时让初级员工(设备)处理常规工作,何时引入资深专家(云端)解决棘手问题。通过这样做,团队完成工作的效果几乎与专家包揽一切时一样好,但成本减半,速度翻倍。
该论文声称,这是首个能够逐步而非针对整个任务做出这些决策的系统,证明了要解决复杂问题,你并不需要为每一个动作都配备一台超级计算机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。