← 最新论文
🤖 AI

Online Algorithms with Unreliable Guidance

本文介绍了不可靠指导下的在线算法(OAG)模型,并提出了一种通用的“丢弃或盲目信任”编译器,该编译器将标准在线算法转化为具有强一致性与鲁棒性保证的学习增强型算法,在缓存、统一度量任务系统和二分图匹配等经典问题上实现了最优或更优的结果。

原作者: Julien Dallot, Yuval Emek, Yuval Gil, Maciej Pacut, Stefan Schmid

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Julien Dallot, Yuval Emek, Yuval Gil, Maciej Pacut, Stefan Schmid

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在玩一款复杂且快节奏的电子游戏,你需要在瞬息之间做出决策。你并不知道接下来会发生什么,但你有一位“聪明朋友”(一个 AI 预测器)在你耳边低语建议。问题在于?你的朋友有时非常英明,但其他时候却完全在胡言乱语或试图欺骗你。

本文介绍了一种处理这种情况的新方法,称为“带有不可靠指导的在线算法(OAG)”。作者提出了一套简单、通用的规则,指导我们如何听取这些建议,而不是试图弄清楚为什么你的朋友会犯错,或者如何衡量他们的错误。

以下是他们观点的分解,使用了日常类比:

1. 问题:那个“黑盒”朋友

在过去,研究人员试图构建利用 AI 预测的算法。但他们陷入了对细节的争论:

  • 预测意味着什么?(AI 是在猜测你将要访问的下一页,还是你即将离开的那一页?)
  • 如何衡量误差?(一个错误的猜测之所以“糟糕”,是因为它偏离太远,还是仅仅因为它错了?)
  • AI 的表现是否随时间变差?

这些争论使得很难为每种游戏创建一个通用的解决方案。作者表示:“让我们停止争论 AI 的内部大脑,只需关注它给出的建议。”

2. 解决方案:“向导”与“抛硬币”

作者提出了一个新模型,其中 AI 不提供复杂的分数或概率。相反,它给出一个直接答案(一个“向导”)。

  • 好情况: 向导说:“做 X。”如果向导是完美的,X 就是最佳举动。
  • 坏情况: 向导说:“做 X",但 X 实际上是最糟糕的举动,由一个骗子选出。

该模型假设,在你做出的每一个举动背后,都会发生一次有偏的抛硬币

  • 正面(概率 1β1-\beta): 你得到一位“好向导”(完美的答案)。
  • 反面(概率 β\beta): 你得到一位“坏向导”(骗子的答案)。

你不知道硬币哪一面朝上。你只需要决定多大程度上信任耳边的低语。

3. 神奇工具:“丢弃或盲目信任”(DTB)编译器

这是本文最大的发明。它是一个“通用适配器”,可以将任何标准计算机算法(完全忽略 AI 的那种)转化为 AI 增强的算法。

把它想象成一个带有新按钮的交通信号灯控制器

  • 旧方式: 控制器遵循自己严格的规则(例如,“绿灯亮 30 秒”)。
  • 新方式(DTB): 控制器拥有一个“信任参数”(τ\tau)。
    • 当请求到来时,控制器抛一次硬币。
    • 如果结果是“信任”(概率 τ\tau): 它盲目地遵循 AI 的向导,但前提是向导建议的是一个合法举动
    • 如果结果是“怀疑”(概率 1τ1-\tau): 它完全忽略 AI,遵循自己原本的安全规则。

这有什么酷之处?
你不需要知道 AI 今天是状态好还是状态差。你只需选择一个“信任级别”(比如 50%)。数学保证:

  • 如果 AI 是完美的,你的表现几乎等同于预知未来。
  • 如果 AI 很糟糕,你的表现几乎等同于从未听过它的建议。
  • 如果 AI“还行”,你的表现则介于两者之间。

4. “随时”保证

通常,计算机科学家会观察算法在整个游戏中的表现。但如果 AI 开始时很棒,中途却变得极差怎么办?
作者引入了“随时竞争性(Anytime Competitiveness)”。这意味着算法保证在每一个瞬间都表现良好,而不仅仅是在结束时。

  • 类比: 想象一个带着地图的徒步者。如果地图错了,一个“标准”算法可能会在整个旅程中迷路。而一个“随时”算法确保,无论你走了多久,你始终处于就你已走过的路段而言最接近最佳路径的位置。

5. 理论测试

作者在三个经典的计算机科学问题上测试了这个"DTB 编译器”:

  • 在线二分图匹配(“约会媒人”): 想象随着人们到来,将他们与工作进行匹配。
    • 结果: 他们找到了第一种方法,即使在工作到达混乱的情况下,也能平衡信任 AI 与保持谨慎。
  • 在线缓存(“冰箱整理师”): 想象一个只能容纳 kk 件物品的冰箱。当它满了时,你必须扔掉一件以腾出空间给新物品。
    • 结果: 他们的方法比之前的“智能”方法更简单,并实现了在“智能”与“安全”之间最佳可能的平衡。
  • 度量任务系统(“办公室职员”): 想象一名员工必须在不同办公室之间移动以完成任务。移动需要消耗能量。
    • 结果: 他们创建了一种新策略,能够高效地处理不可靠的建议,并达到了该问题已知的最佳结果。

总结

本文并不声称要修复有缺陷的 AI。相反,它提供了一个通用的安全 harness。它表示:“你可以使用这个简单的‘信任或忽略’开关,将任何AI 预测器插入任何标准算法中,并且无论 AI 变得多么不可靠,数学都保证你的表现绝不会低于某个水平。”

它将“猜测”(AI)与“执行”(算法)分离开来,使我们能够利用 AI 助手,而不会被它们的错误所挟持。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →