A Multi-Agent system for Multi-Objective constrained optimization
本文介绍了 MAMO,这是一个多智能体强化学习框架,它能够在动态环境中自主学习最优奖励权重,以平衡主要目标与约束违反,从而克服了传统基于拉格朗日方法中人工选择权重的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是某家繁忙咖啡店的经理。你有两个主要目标:
- 保持低成本: 不要雇佣过多的咖啡师,也不要买过多的牛奶,否则你会亏钱。
- 让顾客满意: 不要雇佣太少的咖啡师,否则排队会太长,人们会愤怒地离开(或者用技术术语来说,他们的订单会被“拒绝”)。
在现实世界中,顾客的数量不断变化。有时是安静的周二上午;有时是混乱的周五高峰期。
旧方法:猜测平衡点
传统上,试图解决这个问题的计算机系统使用一种叫做“强化学习”的方法。把这想象成训练一个机器人经理。为了教导这个机器人,你会给它一份计分卡。但问题在于,这份计分卡是一个通过混合你的两个目标而得出的单一数字。
- “如果你节省了钱,你得到 +10 分。”
- “如果一名顾客愤怒离开,你失去 -50 分。”
问题在于谁来决定 -50 是不是正确的数字? 在旧方法中,必须由人类来猜测并手动输入这些数字(称为“权重”)。
- 如果你猜测的惩罚太低,机器人就会变得鲁莽,虽然节省了成本,但惹恼了顾客。
- 如果你猜测的惩罚太高,机器人就会变得胆小怕事,仅仅为了一个顾客就雇佣 20 名咖啡师,从而浪费资金。
在一个变化的世界中(比如咖啡店在一天中不同时间变得更忙碌),“完美”的数字是在不断变化的。人类无法跟上节奏,无法每分钟都去输入新的数字。
新方法:MAMO(双智能体系统)
研究引入了一种名为 MAMO 的新系统。MAMO 不再使用一个试图猜测规则的单一机器人经理,而是使用两个协同工作的机器人组成的层级结构。
1. “执行者”(任务执行智能体)
这是在现场工作的机器人。它的任务很简单:“观察队伍情况,决定雇佣多少名咖啡师,并尝试根据我给你的规则获得最高分。”它不需要担心规则是什么,它只需要遵循规则。
2. “教练”(权重自适应智能体)
这是在办公室工作的机器人。它从不接触咖啡机。它的唯一工作就是观察“执行者”并调整规则。
- 教练观察过去 300 分钟的服务情况。
- 它看到:“嘿,我们节省了很多钱,但有 10% 的顾客愤怒离开了。这太冒险了。”
- 于是,教练改变了规则:“好吧,我要大幅提高对愤怒顾客的惩罚权重。”
- 它将这些新规则交给“执行者”。
- “执行者”根据新规则再次尝试。
它们如何共同学习
这个系统以一个循环的方式运作,就像教练和运动员一样:
- 教练挑选一套规则(权重)并说:“开始!”
- 执行者工作一段时间,尝试根据这些规则尽力而为。
- 教练观察结果。我们是否让顾客满意了?我们是否节省了成本?
- 教练微调规则,并开始下一轮。
随着时间的推移,教练学会了如何精确地平衡规则,使得“执行者”能够自然地找到那个“甜点位”(最佳平衡点),而不需要教练去微观管理每一份咖啡订单。系统通过经验自己找到了完美的平衡,即使在“高峰时段”发生变化时也能适应。
实验
研究人员在模拟的“边缘计算”系统(这基本上是一个小型服务器网络,类似于咖啡店)上测试了该系统。
- 他们尝试给“执行者”一个固定的规则(例如:“始终保持超级谨慎”)。当工作量变得巨大时,它失败了。
- 他们尝试了另一种固定规则(“始终保持廉价”)。它也失败了,因为顾客感到愤怒。
- 使用 MAMO 时: “教练”从一个随机规则开始。经过一段时间后,它找到了完美的平衡。即使在工作量嘈ậy且不可预测的情况下,该系统也能将“愤怒顾客”(拒绝率)控制在限额(5%)之下,同时保持尽可能低的成本。
核心结论
MAMO 是一种教导计算机如何在不需要人类不断调整设置的情况下进行权衡的方法。它将行动(执行工作)与策略(决定什么更重要)分离,使系统能够通过经验学习完美的平衡,就像一位经验丰富的经理那样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。