← 最新论文
💻 computer science

Principled Authority Switching for Shared Autonomy in Human-Robot Teams

本文提出了一种用于共享自主性的协作博弈框架,该框架将权限切换表述为一种一致利益动态博弈,旨在为线性二次系统推导出具有理论保证的最优切换策略,从而有效地平衡人类接管能力与自主效率。

原作者: Sandeep Banik, Naira Hovakimyan

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Sandeep Banik, Naira Hovakimyan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:面向人机协作团队中共享自主权的原则性权威切换机制

问题陈述

信息物理系统(CPS)中的共享自主要求建立能够动态分配人类与自主智能体之间控制权的机制。现有方法通常依赖于控制输入的混合或启发式切换规则。这些方法存在缺乏理论保证、依赖准确意图预测以及给人类操作员施加持续认知负担(需要持续输入)等问题。此外,它们往往无法考虑到人类实际干预的可能性(覆盖倾向性),从而导致在自动驾驶和远程操作等安全至关重要的领域中协作效果不佳。

本文解决的核心挑战是如何将权威切换建模为一个协同的、团队最优的决策问题,并显式地对人类的覆盖能力以及切换成本进行建模,而非依赖于经验性的规则。

方法论:Flip-Team 框架

作者提出了 Flip-Team,一个将权威切换建模为一致利益动态博弈的协同框架。该系统在“人在回路”(human-on-the-loop)范式下运行,其中自主系统独立运行,而人类保留监督性的覆盖权限。

1. 系统动力学与状态

系统被建模为一个离散时间动态系统,其中在时刻 kk 的控制权由 FlipDyn 状态 αk{H,A}\alpha_k \in \{H, A\} 表示(HH 代表人类,AA 代表自主智能体)。

  • 人类控制: xk+1=FkH(xk,uk)x_{k+1} = F^H_k(x_k, u_k)
  • 自主控制: xk+1=FkA(xk,wk)x_{k+1} = F^A_k(x_k, w_k)
  • 接管动作: 智能体采取动作 πkj{0,1}\pi^j_k \in \{0, 1\}(空闲或请求接管)。
  • 转换逻辑: 状态转换是互斥的。至关重要的是,当自主智能体处于控制状态时,如果自主智能体没有请求移交,则人类的覆盖尝试以概率 pkp_k(人类的覆盖倾向性)成功。如果自主智能体请求了移交,则转换是确定性的。

2. 成本结构

目标是在有限时界 LL 内最小化总成本函数 JJ
J=gL+1(xL+1,αL+1)+t=1L(gt(xt,αt)+πtHht(xt)+πtAat(xt))J = g_{L+1}(x_{L+1}, \alpha_{L+1}) + \sum_{t=1}^{L} \left( g_t(x_t, \alpha_t) + \pi^H_t h_t(x_t) + \pi^A_t a_t(x_t) \right)

  • 状态成本 (gtg_t): 代表性能指标(例如,跟踪误差、能量),这些指标在人类控制与自主控制之间存在差异(gtHgtAg^H_t \neq g^A_t)。
  • 切换成本 (ht,ath_t, a_t): 代表人类和自主智能体的认知负荷、注意力切换或转换风险。

3. 最优切换策略(线性二次型情形)

对于具有二次型成本的线性动力学系统(LQ 系统),作者利用动态规划推导出了闭式解。

  • 价值函数: 待求代价(cost-to-go)由二次型价值函数 VkH(x)=xPkHxV^H_k(x) = x^\top P^H_k xVkA(x)=xPkAxV^A_k(x) = x^\top P^A_k x 表示。
  • 递推关系: 矩阵 PkHP^H_kPkAP^A_k 通过向后递推计算得出。
  • 定理 1(切换条件): 最优策略通过比较人类控制与自主控制的相对成本优势(由 P~k+1\tilde{P}_{k+1} 量化)以及切换成本和覆盖概率 pkp_k 来确定。
    • 当人类处于控制状态时: 如果人类控制的成本优势加上切换成本是可行的,则保留控制权;否则,会发生向自主控制的协调移交。
    • 当自主智能体处于控制状态时: 根据 pkp_k 出现三种机制:
      1. 保留: 如果人类控制的成本优势相对于 pkp_k 不足。
      2. 覆盖: 如果成本优势显著且 pkp_k 足够高,人类将单方面接管。
      3. 协调移交: 如果成本优势很大,双方达成一致进行控制权转移。

4. 阈值与估计

  • 定理 2(临界阈值): 本文推导出了一个决定人类干预是否具有成本效益的临界阈值 pk(x)p^*_k(x)。对于各向同性的切换成本,这可以简化为与状态无关的比例:p=h/(h+a)p^* = h / (h + a)
    • 如果人类的实际倾向性 pk<pp_k < p^*,则干预可能不具备成本效益。
    • 如果 pk>pp_k > p^*,则干预是合理的。
  • 在线估计: 由于在实际应用中 pkp_k 是未知的,作者提出了一种在线估计方法。这涉及跨回合追踪在特定条件下(自主控制期间,且无移交请求)发生的人类覆盖频率,或在回合内使用指数平滑法来自适应地估计 p^k\hat{p}_k

核心贡献

  1. 原则性的切换框架: 将权威切换表述为具有不对称成本和人类覆盖能力的协同博弈,从而产生最优策略,无需启发式调优。
  2. 覆盖阈值推导: 推导出了临界阈值 pkp^*_k,用于判定人类接管是否具有成本效益,提供了具有解释性的设计指南。
  3. 闭式解: 对于线性二次型系统,推导出了切换条件和价值函数递推的闭式解,实现了独立于连续状态维度的快速计算。
  4. 自适应估计: 提出了一种通过观察到的干预行为在线估计覆盖倾向性的方法,实现了无需预先标定的自适应切换。

评估与结果

该框架在 1D 四旋翼高度调节任务(双积分器动力学)上进行了评估,时界为 30 步。

  • 基准方法: 将 Flip-Team 策略与以下方法进行对比:
    1. 始终自主。
    2. 始终人类。
    3. 基于性能阈值的启发式方法(仅基于跟踪误差进行切换)。
  • 指标: 总成本、切换次数、人类控制时间占比。
  • 结果:
    • Flip-Team 实现了最低的总成本(40.5),优于始终人类基准(43.2)6%,优于始终自主基准(45.6)11%
    • 基于性能阈值的基准方法产生的成本最高(55.3),这表明如果不考虑倾向性或切换成本,仅根据误差进行反应式切换会降低性能。
    • Flip-Team 平均仅进行了 1.8 次权威切换,人类控制时间占比为 56%
    • 最优策略成功预判了人类干预既可能发生(高 pkp_k)又有益(成本优势)的阶段,避免了在低参与度阶段进行不必要的切换。

意义与主张

本文声称 Flip-Team 为共享自主提供了一种原则性的机制,能够在人类的可适应性与自主效率之间取得平衡。通过显式建模人类的覆盖倾向性和切换成本,该框架避免了启发式规则可能导致的过度负担人类或在需要干预时未能及时干预的缺陷。

作者强调,推导出的临界阈值提供了可操作的设计指南:

  • 设计者可以通过调整切换成本(Hk,AkH_k, A_k)来塑造参与环境。
  • 从业者可以通过调节人类的倾向性(通过警报或信任校准)来确保其在需要干预时保持在临界阈值之上。

作者指出,目前的研究范围较为有限,因为评估依赖于具有手工设定倾向性剖面的模拟人类模型以及 1D 任务。作者表示,未来的工作将通过人机在环实验验证该框架,扩展到状态相关的倾向性估计,并将该框架应用于更高维和非线性系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →