← 最新论文
🤖 machine learning

Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions

本文提出了用于具有后置服务上下文、未知延迟和对抗性破坏的挥发性环境下鲁棒线性对决多臂老虎机问题的 e RCDP-UCB 算法,通过采用学习到的上下文近似器和自适应特征裁剪,实现了 O~(d(T+C+D))\widetilde{\mathcal{O}}(d(\sqrt{T} + \mathcal{C} + \mathcal{D})) 的近优遗憾界,从而避免了先前研究中典型的乘性退化。

原作者: Youngmin Oh

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Youngmin Oh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图寻找城市里最棒美食的餐厅评论家,但你正在玩一场非常困难的游戏,这个游戏带有三个主要的障碍。这篇论文介绍了一种名为 RCDP-UCB 的新策略,旨在帮助你在这种混乱中赢得比赛。

以下是这场游戏的拆解以及解决方案,使用了简单的类比:

游戏:“对决美食评论家”

在这种场景下,你不会得到一个分数(比如 1 到 10 分)来评价一顿饭。相反,你每次只能比较两道菜,并说:“我更喜欢菜品 A 而不是菜品 B。”这被称为对决强盗(Dueling Bandit)

然而,论文指出现实世界的反馈是混乱的。它引入了三个具体的问题:

  1. “上菜后”之谜(隐藏成分):
    通常,你会根据菜单上的描述(“上菜前”的情境)来评判一道菜。但真正的味道取决于你只有在吃完后才能发现的东西,比如食物实际有多热,或者送达的速度有多快(“上菜后”的情境)。

    • 问题所在: 在你知道食物是热是冷之前,你就必须做出选择。你在预测未来。
    • 论文的解决方法: 该算法使用了一个“水晶球”(学习到的近似器)来根据菜单描述预测这些隐藏因素,这样你就不会在盲目猜测。
  2. “慢邮”问题(未知的延迟):
    有时,餐厅老板不会立即告诉你你的意见。可能需要 5 分钟,也可能需要 5 天,或者延迟是随机的。更糟的是,一个敌人可能会故意扣留你的反馈,以此来迷惑你。

    • 问题所在: 你正在基于旧的消息,甚至是在没有消息的情况下做出新的决策。
    • 论文的解决方法: 该算法并不关心邮件为什么变慢。它有一个特殊的“权重”系统,将延迟的反馈视为“不太重要”,直到反馈真正到达,这样它就不会在等待期间感到恐慌或做出错误的猜测。
  3. “喷子”问题(对抗性破坏):
    想象一下有一个竞争对手在试图破坏你。他们可能会撒谎说:“其实你讨厌那道菜!”即使你明明很喜欢。他们拥有一定的谎言预算。

    • 问题所在: 如果你相信每一个谎言,你就会学到错误的教训。
    • 论文的解决方法: 该算法是“多疑的”。如果某条反馈看起来太奇怪或风险太大(因为延迟或数据看起来很诡异),它会自动降低对该特定信息的信任。这就像是忽略一个已知骗子的叫喊,而去倾听一个冷静的声音。

解决方案:RCDP-UCB

作者创建了一种智能策略,称为 RCDP-UCB(对破坏、延迟和上菜后情境具有鲁棒性的 UCB)。

把这看作是一个聪明的侦探,他为每一件证据都使用“信任分”:

  • 水晶球: 它预测餐食中隐藏的部分(上菜后),以便在用餐前做出更好的判断。
  • 怀疑过滤器: 它观察每一条反馈。如果反馈很迟(延迟)或者看起来像谎言(被破坏),侦探会说:“好吧,我会听听看,但我不会仅凭这一个不靠谱的线索就改变我的整个理论。”
  • “两全其美”的逻辑: 侦探不需要知道延迟是随机的(比如缓慢的邮政服务)还是恶意的(比如喷子),该策略对两者都完美适用,无需切换模式。

结果

论文从数学上证明了这个侦探是非常高效的。

  • 即使面对“喷子”的撒谎和“慢邮”的迟到,侦探学习真相的速度几乎与一切完美时一样快。
  • 他们还证明了你不可能做得比这更好;应对谎言和延迟的“代价”是不可避免的,而他们的方法达到了这个理论极限。

总结

这篇论文教会我们如何在以下情况下做出明智的决策:

  1. 在行动之后,你才了解完整的故事。
  2. 消息需要很长时间才能到达。
  3. 有人正试图欺骗你。

所提出的方法 RCDP-UCB 是一种稳健的方式,即使在数据混乱、延迟或虚假的情况下,也能从相对偏好(A 比 B 好)中进行学习。它通过预测缺失的拼图碎片,并谨慎对待它所信任的线索,来实现这一目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →