← 最新论文
🤖 AI

Multi-Objective Constraint Inference using Inverse reinforcement learning

本文介绍了多目标约束推断(MOCI),这是一个新颖的框架,能够从具有冲突目标的不同专家演示中有效提取共享约束和个体偏好,在保持计算效率的同时,其预测精度优于现有基线方法。

原作者: Syed Ihtesham Hussain Shah, Floris den Hengst, Aneta Lisowska, Annette ten Teije

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Syed Ihtesham Hussain Shah, Floris den Hengst, Aneta Lisowska, Annette ten Teije

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图弄清楚游戏规则和玩家的秘密动机,但你只能观察他们玩游戏。你不能向他们提问,也没有规则手册。你只有一堆不同人玩同一款游戏的视频录像。

本文介绍了一种名为MOCI(多目标约束推断)的新型侦探工具。其工作原理可分解为以下简单概念:

问题:一种方案无法适用于所有情况

大多数以往的侦探工具存在两大问题:

  1. 假设所有人都是相同的:它们认为视频中的所有玩家都遵循完全相同的策略,拥有完全相同的目标。
  2. 对“未访问”区域感到困惑:如果玩家从未踏过棋盘上的某个特定方格,旧工具无法判断该方格是“禁止陷阱”,还是玩家仅仅不喜欢那里。

在现实世界中,这就像观察一群司机。有些司机激进,有些谨慎。他们都必须遵守相同的交通法规(硬性约束,如红灯和墙壁),但拥有不同的个人偏好(有些人想要最快路线,有些人想要最风景优美的路线)。旧工具试图将所有这些不同的司机强行归入一个“平均”司机,效果并不理想。

解决方案:MOCI(聪明的侦探)

作者创建 MOCI 旨在通过同时完成两件事来解决这一问题:

  1. 对玩家进行分类:它审视杂乱的视频堆,自动将其分组。它会意识到:“啊,这三段视频显示了一位‘草爱好者’,他避开岩石;而这两段显示了一位‘岩爱好者’,他避开草地。”它根据玩家独特的喜好将他们区分开来。
  2. 发现隐形墙壁:一旦它知道谁喜欢什么,它就会观察整个群体,找出所有人都遵守的规则。如果没有人(无论是草爱好者还是岩爱好者)曾踏过蓝色水块,MOCI 就会得出结论:“那些蓝色方块必定是禁止通行的墙壁。”

“网格世界”实验

为了测试这一点,研究人员创建了一个包含不同地形的数字游戏棋盘(网格世界):

  • 草地:有些玩家喜欢它。
  • 岩石:其他玩家喜欢它。
  • 没有人会来这里。这是一个硬性约束(一堵墙)。

他们将“草爱好者”和“岩爱好者”的视频混合在一起,使计算机无法分辨谁是谁。MOCI 成功做到了:

  • 推断出存在两种不同类型的玩家。
  • 了解到草爱好者在行走于草地时会获得“奖励”。
  • 了解到岩爱好者在行走于岩石时会获得“奖励”。
  • 正确识别出水块为禁区,即使玩家从未明确说过“我不能去那里”。

关于“幻觉”的警告

论文承认存在一个小缺陷。如果玩家从未访问地图的某个特定角落,MOCI 可能会变得有些多疑,心想:“没人去过那里,所以那一定是堵墙!”它将此称为“假阳性”。然而,论文表明,如果你给侦探提供更多视频(更多数据),它就会停止猜测,变得准确得多。

为何它优于竞争对手

作者将 MOCI 与另外两种著名的侦探工具(MLCI 和 ICRL)进行了比较:

  • 准确性:MOCI 在猜测规则和偏好方面要准确得多(误差率为 0.027,而其他两者分别为 0.25 和 0.36)。
  • 速度:虽然 MOCI 比最简单的工具做了更多工作,但它仍然非常快。它不是一个缓慢笨重的机器;其效率足以满足实际需求。
  • 灵活性:与其他工具不同,MOCI 能够处理一群具有不同目标的不同人群。其他工具只能处理一群相同的机器人。

核心结论

MOCI 是一种新方法,通过观察不同人群的混合体,教会计算机理解安全规则和个人偏好。它将“通用规则”(例如不要走进水中)与“个人喜好”(例如我更喜欢草地)区分开来,其速度和准确性均优于以往的方法。

注:论文提到,该技术最终可用于医疗保健领域,帮助医生在共享安全规则与个体患者偏好之间取得平衡,但本文中的实际实验严格局限于数字网格游戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →