: Cooperative Takeover Games with Stochastic Human Override
本文提出了一种用于共享自主性的合作博弈框架,该框架将权限切换表述为一种同利动态博弈,并针对存在随机人类干预的线性二次型系统推导出具有闭式解的最优纯策略,旨在取代启发式的控制混合规则。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:Flip-Team:具有随机人类覆盖机制的协作接管博弈
问题陈述
共享自主系统在自动驾驶和辅助机器人等领域至关重要,这类系统需要建立原则性的控制权转移机制。现有方法通常依赖于控制混合或启发式切换规则,这些方法缺乏理论保证,且未能考虑到权限转移的动力学过程。此外,许多当前框架假设角色是对称的,或者要求完全了解人类的效用函数,这在现实中往往难以实现。一个特定的空白在于建模权限切换,即在随机条件下,人类保留一种不对称的“覆盖”(override)能力(即即使在智能体控制期间也能进行干预),同时双方都追求共同的任务目标。本文旨在解决如何构建一个协作框架,在不依赖于经验法则或连续人类参与的情况下,确定最优切换策略。
方法论
作者提出了 Flip-Team,这是一个被表述为同一利益动态博弈的协作博弈框架。其核心创新在于将切换决策直接嵌入到系统动力学中,而非将其视为外部仲裁机制。
博弈公式化:
- 状态空间: 系统状态 在人类控制 () 或自主控制 () 下演化。
- FlipDyn 状态: 离散状态 追踪谁持有权限。状态转移由智能体动作驱动:“闲置”(保持控制)或“接管/请求”。
- 随机覆盖: 一个关键特征是随机的人类覆盖。当自主智能体处于控制状态 () 且人类尝试干预 (),而智能体并未请求移交时,接管成功的概率为 。这捕捉了界面延迟以及人类权威虽优越但并非百分之百保证的仲裁机制。
- 代价函数: 智能体共同最小化总代价 ,该代价由状态代价(跟踪误差、能量消耗)和接管代价(认知负荷、转换风险)组成。由于反映了不同的控制有效性和切换负担,代价具有不对称性 (, )。
通用系统分析:
- 该问题通过动态规划求解。作者定义了针对两种 FlipDyn 状态( 和 )的价值函数和代价到期矩阵(cost-to-go matrices)。
- 定理 1 确立了纯策略下团队最优切换策略的存在性。它推导出了基于未来价值函数差异 () 并经由接管代价和覆盖概率 缩放后的显式权限转移阈值条件。
线性二次(LQ)扩展:
- 对于线性系统与二次代价函数,作者推导出了 推论 1,提供了最优切换策略和价值函数参数 () 的闭式递归公式。
- 至关重要的是,这种公式化使得在标量情况下,切换阈值的计算可以离线完成且独立于连续状态 ;而在多维情况下,其仅通过二次型形式依赖于状态。这确保了计算效率不受连续状态空间基数的影响。
核心贡献
- 协作接管公式化: 本文将人机接管问题表述为一个同一利益动态博弈,其中切换决策被嵌入到系统动力学中。这一统一框架捕捉了不对称权限、随机人类覆盖以及与状态相关的代价。
- 最优切换特征化: 作者确立了团队最优策略的存在性,并通过显式阈值条件对其进行了特征化。这些条件根据未来代价差异与切换概率成本之间的权衡,决定了权限何时发生转移。
- LQ 系统的解析解: 对于线性二次系统,本文推导了最优策略和价值函数的闭式递归。这使得在连续状态空间中高效计算协作接管策略成为可能,其切换阈值在标量情况下是独立于连续状态的,而在多维情况下则由矩阵不等式定义。
结果
该框架在标量和多维线性系统上进行了验证:
- 标量 LTI 系统: 在有限时界()下的仿真表明,切换行为对覆盖概率 非常敏感。研究识别出一个临界阈值 ;当 低于此值时,单方面的人类覆盖永远不是最优的。随着 的增加,最优覆盖的频率也随之增加,在中间阶段表现出非单调的策略演化。
- 车辆横向控制(2D): 在二维车辆车道保持任务中,Flip-Team 策略相比于“始终自主”的基准方案减少了 18.65% 的最坏情况代价,并优于固定间隔切换策略。
- 状态维度: 结果强调了标量系统与多维系统之间根本性的结构差异。在标量系统中,切换是与状态无关的。在更高维度中,切换条件涉及矩阵不等式 (),这意味着对于与价值差矩阵特定特征向量对齐的状态,覆盖可能是最优的,而对于其他状态则不然。
意义与主张
本文的主张是,将共享自主建立在协作博弈论基础上,为取代启发式混合或仲裁提供了一种原则性的替代方案。通过将人类和自主系统视为具有共同目标但角色不同的统一团队,Flip-Team 能够产生能够适应系统动力学、代价结构和人类干预可靠性的最优切换策略。该框架明确处理了人类适应性与自主效率之间的权衡。
作者指出了局限性:该框架假设利益一致(目标对齐)、假设覆盖概率已知(在部署时需要进行估计),并将闭式解限制在 LQ 系统内。未来的工作建议将框架扩展到具有私有信息的贝叶斯博弈、覆盖概率的在线学习,以及通过人机回环实验进行物理验证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。