← 最新论文
💻 computer science

A Model for Mediating Multi-Modal Human Intent into Safe Maneuvers for UAVs

本文提出了一种需求驱动的模型,该模型通过将操作员输入视为经过环境与飞行约束验证的有界请求,并利用具有形式化安全规范的结构化“请求-评估-执行”流水线,将多模态人类意图中介为安全的无人机机动。

原作者: Sofia Nelson, Dalal Alrajeh, Pedro Antonio Alarcon Granadeno, Jane Cleland-Huang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Sofia Nelson, Dalal Alrajeh, Pedro Antonio Alarcon Granadeno, Jane Cleland-Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是这架超智能微型无人机的机长。你想通过声音、挥手或屏幕上的按钮来告诉它“向左走!”或“向上飞!”。在过去,科学家们认为:“太棒了!让我们直接听从机长的指令并严格执行。”但这篇文章说:停! 那是一个危险的游戏。

如果你站在山上大喊“向前走”,而无人机面前就是一个陡峭的悬崖,那么完全照做就意味着坠毁。或者如果你挥手示意“向右走”,但那里正有一架无人机在悬停,你就会导致碰撞。人类会分心、失去方向感或犯错。该论文认为,我们不能将人类的指令视为无人机必须立即执行的直接命令。相反,我们需要在中间设置一个安全裁判

“边界请求”的概念

作者索菲亚·纳尔逊(Sofia Nelson)及其团队提出了一种与无人机交流的新方法。他们称之为 M3R 模型(多模态操纵请求)。可以这样理解:

当你告诉无人机“向左走”时,你并不是在发出一个“移动”的命令,而是在发出一个带有严格限制的请求。这就像是问一位朋友:“你能走到那棵树旁吗?”但同时加上一句,“但前提是你不绊倒在石头上或撞到人。”

无人机不仅仅是倾听;它会在移动前检查规则。它将你的输入视为一种“受限的操纵请求”。这意味着无人机在说:“好吧,我听到你想向左走,但我只能向左走 1 米,而且我不能超过一定的速度,并且我必须确保地面平坦且没有其他无人机挡路。”

安全裁判的清单

在无人机实际移动之前,一个数字化的“安全监督员”会运行一份快速清单。它会检查四个大项:

  1. 地面情况: 前方是否有悬崖或树木?无人机会检查地形以确保不会撞向地面。
  2. 邻居情况: 附近是否有其他无人机?它会检查是否会撞到它们。
  3. 无人机自身的极限: 无人机真的能做到吗?它会检查动作是否过快或距离过远,以至于其引擎无法安全处理。
  4. 机长的清晰度: 无人机理解你了吗?如果你在强风中大喊或在黑暗中挥手,无人机可能无法 100% 确定你的意思。如果它没有把握,它就不会移动。

如果请求通过了所有这些检查,无人机会执行一个受限版本的操作。如果你要求走 5 米,但 2 米处有一堵墙,无人机只会走 2 米。如果墙就在跟前,它根本不会移动。它甚至可能会说“被阻挡!”然后保持不动。

“锚点”与“气泡”

为了保持安全,无人机在开始聆听你时会选择一个安全的点作为锚点(Anchor)。它会始终保持在那个点周围的 5 米气泡 内。每当你给出一个新指令,无人机会更新它的锚点,但它永远不会离开这个安全区域。这就像无人机是在一个随着它移动的巨大隐形游乐场里玩耍。

他们是如何测试的

团队构建了一个原型来观察这个想法是否可行。他们不仅编写了代码,还在实验室中使用模拟无人机进行了实际测试。他们使用了三种方式与无人机交流:

  • 语音: 使用名为 VOSK 的工具来倾听“向前走”或“向上飞”等词汇。
  • 手势: 使用摄像头和智能 AI(GPT-5.o)来观察人们挥手。
  • 按钮: 一个带有各种移动选项的简单屏幕。

他们发现该系统能够可靠地理解这些输入,更重要的是,如果操作不安全,它能够安全地停止或缩减移动幅度。例如,如果人类试图指挥无人机飞入模拟的墙壁,系统会拦截该指令或让无人机提前停下。

他们尚未解决的问题

了解这篇文章并非在声称什么非常重要。作者很诚实地说明了局限性:

  • 它还不是用于现实世界的成品。 他们是在实验室的模拟环境中进行的测试。他们还没有在有风、环境复杂、有真实障碍物和其他真实无人机的户外野外进行过飞行测试。
  • “转向”问题很棘手。 他们承认,告诉无人机“向左转”很难,因为如果无人机旋转了,人类可能会失去对“左”的方向感。他们在当前版本中并未完全解决这个问题。
  • “眼睛”还需要改进。 对于手势部分,他们使用了一个在实验室表现良好的强大 AI 模型,但他们知道该模型在恶劣天气或距离较远时可能会遇到困难。他们计划以后训练一个更好的模型。

核心结论

主要的发现是:安全性不能依赖于人类的完美。 人类会犯错、会分心或给出模糊的指令。该论文指出,让人类安全控制无人机的唯一方法,是在人类和无人机之间放置一个智能安全过滤器。这个过滤器将每一次“去!”转化为“去,但仅在安全的情况下去”。

作者认为这种方法为未来奠定了坚实的基础。他们已经证明了它在模拟和实验室测试中的有效性,并且拥有一套明确的行为规则(要求)。但他们谨慎地表示,这仅仅是第一步。真正的考验——在有风、有雨、有真实交通的野外飞行——仍然在前方。他们正在制定交通规则,然后再让汽车驶上高速公路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →