← 最新论文
🤖 machine learning

Robust Multi-Agent Bandits with Heavy-Tailed Rewards and Information Asymmetry

本文针对重尾回报以及三种不同的信息不对称机制下的多智能体多臂老虎机问题,提出了鲁棒的去中心化算法,在实现了几乎达到中心化速率的遗憾保证的同时,通过在帕累托分布环境下的实验验证了其性能。

原作者: Daphne Feng, Ricardo Parada, Lily Jiang, Sophia Yi, William Chang

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Daphne Feng, Ricardo Parada, Lily Jiang, Sophia Yi, William Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一支探险队的一员,正试图在一片广袤、大雾弥漫的森林中寻找最好的隐藏宝藏。一旦游戏开始,你们就无法互相交谈,也看不见队友在做什么。每当你选择一个地点挖掘,你都会得到一份奖励,但有时这份奖励只是一颗小石子,而有时却是一块巨大的、不可预测的巨石,会将你撞翻。这就是“多臂老虎机”(Multi-Armed Bandits)的世界——一个计算机科学和数学中著名的谜题,其中学习者必须在尝试新事物(探索)与坚持看似不错的事物(利用)之间取得平衡。通常,科学家们假设这些奖励是可预测的,就像掷出一个公平的骰子。但在现实世界中——想想股市崩盘、病毒式传播的网络帖子或突发的网络流量峰值——奖励可能是狂野的、重尾分布的,且充满了极端的惊喜。这个研究课题要解决的核心问题是:当奖励是混乱的,且团队成员无法交谈,甚至可能看不见彼此的行为时,一群聪明的智能体如何能够共同学习并找到最好的宝藏?

来自加州大学洛杉矶分校(UCLA)和加州大学河滨分校(UC Riverside)的研究团队致力于解决这个更接近现实世界、更混乱版本的寻宝问题。他们不仅研究了一种场景,还测试了三种不同程度的“信息不对称”——这是一个表达“你知道多少关于队友的信息”的专业说法。在第一种场景中,每个人都看到同一个宝箱开启(共同奖励),但看不见谁选了哪把锁(未观察到的动作);在第二种场景中,每个人都能看到谁选了哪把锁,但每个人得到的是各自独立的宝箱(独立奖励);在第三种,也是最难的一种场景中,没有人能看到关于其他人的任何信息;每个人对团队的行为都是盲目的,并且会得到各自随机的战利品。

该团队发明了三种新的“去中心化算法”——本质上就是代理人如何在不交谈的情况下行为的规则手册。针对前两种场景,他们创建了名为 mRUCB-A 和 mRUCB-Intervals 的方法。这些聪明的策略使用一种“鲁棒”的方法来计算平均值,这种方法会忽略那些疯狂、巨大的离群值(即那些巨石),以免团队产生困惑。他们发现,即使在无法交谈的情况下,只要团队能够看到共享的奖励或者看到彼此的动作,他们就能学得几乎和大家都在同一个房间里一样快。针对第三种情况,mHT-DSEE 算法处理了最困难的情况,即每个人都对彼此完全盲目。在这种情况下,智能体必须遵循一个严格的、预先商定的时间表来轮流进行探索,这种方法可行,但速度稍慢。

当他们在计算机模拟中使用“帕累托分布”(一种模仿那些由少数极端事件主导的狂野、重尾分布奖励的数学模型)进行测试时,他们发现这些理论是站得住脚的。这些算法成功找到了最好的宝藏,证明了即使没有完美的沟通或冷静、可预测的奖励,团队协作依然可以奏效。然而,实验也显示了一个权衡:依赖于观察彼此动作的方法(问题 B)起步较慢,因为它需要更多的数据来确保准确,但一旦掌握了规律,它就会完全停止犯错。完全盲目的方法(问题 C)启动成本较低,但探索的时间比实际需要的稍长。最终,这篇论文表明,即使在一个充满混沌、噪声且队友互为陌生人的世界里,通过聪明的、协调一致的策略,仍然可以引导团队走向最好的结果,尽管由于“不同步”而付出的代价,很大程度上取决于你们所能共享的微小信息量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →