← 最新论文
🤖 AI

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

本文介绍了 FlowPilot,这是一种用于长时程人行道任务的无图导航策略,它利用锚定流匹配(anchored flow matching)在大规模车队数据上进行预训练,并结合人类在环偏好学习来增强社会合规性和反事实推理,从而仅通过单目 RGB 摄像头便实现了稳健的性能表现。

原作者: Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一台新的送货机器人如何在繁忙的城市人行道上导航。你希望它仅凭头上的一个单摄像头,就能走过数英里路程、躲避行人、避开停放的滑板车,并遵循社交规则(比如不横插他人路中)。

这篇论文介绍了一种名为 FlowPilot 的新型机器人“大脑”,它解决了当前技术面临的三大难题。以下是通过简单的类比对它的工作原理进行的解释。

问题所在:“过度自信的学生”

目前的机器人多采用**模仿学习(Imitation Learning)**进行训练。这就像一个学生在观看大师驾驶的数小时视频。

  • 问题: 如果学生只是单纯地模仿视频,当现实世界变得混乱时,他们可能会感到困惑。他们可能会犯下微小的错误并使其不断累积(就像雪球从山上滚下一样),或者因为遇到从未见过的场景而陷入僵局,亦或是因为没学到人行道的“社交规则”而表现得非常无礼。
  • 差距: 仅仅通过观察视频(模仿)并不足以让机器人同时具备安全性和社交礼仪。

解决方案:FlowPilot 的两步训练法

作者创建了一个两步走的训练过程来解决这个问题:第一步是“学习基础”第二步是“学习细微差别”

第一步:“锚定流”(学习基础)

机器人不应只是猜测一条单一的路径,它需要理解绕过障碍物有多种方式(例如:向左绕行、向右绕行或减速慢行)。

  • 类比: 想象河流绕过岩石流动。有时水流会分裂成多条溪流。旧方法试图预测仅仅“一条”溪流,或者表现得过于混乱。
  • 创新点: FlowPilot 使用了被称为**“锚定流匹配”(Anchored Flow Matching)**的技术。
    • 锚点(Anchors): 把这些想象成“思维书签”或不同的驾驶风格(例如:“激进的超越者”、“礼貌的让行者”)。机器人首先学习这些截然不同的风格。
    • 流(Flow): 有了这些书签后,它学习如何在这些风格之间平滑地“流动”。这使得机器人能够生成平滑、真实的路径,涵盖人类在处理棘手场景时可能采取的所有不同方式,而不是陷入单一、僵化的模式。

第二步:“人类在环”(学习细微差别)

即使掌握了优秀的理论基础,机器人在部署到具有特定摄像头和轮子的特定机器人上时,可能仍然显得有些笨拙或社交尴尬。

  • 类比: 想象机器人是一名新员工。它知道职位描述(来自第一步),但它还不了解你特定的办公室文化。
  • 创新点: 团队引入了一个**偏好学习(Preference Learning)**系统。
    • 一名人类监督员观察机器人在现实生活中的表现。
    • 如果机器人开始做出不安全或无礼的行为,人类会轻轻地将其引导回正轨。
    • 机器人学习到:“啊,人类更倾向于这种行为而非那种行为。”
    • 机器人不仅仅是记忆人类的纠正,它学习的是偏好。它理解了:“在这种情况下,礼貌比快速更重要。”这一步弥合了“模仿视频”与“符合人类价值观”之间的鸿沟。

结果:更聪明、更安全的机器人

团队在计算机模拟和真实城市街道中都对该系统进行了测试。

  • 在模拟中: FlowPilot 的基础版本成功率达到了 42%(相比其他方法是一个巨大的飞跃)。
  • 在现实世界中: 当加入“人类偏好”训练(FlowPilot-HP)后,机器人在遵守规则方面表现得更好。
    • 它需要人类干预的次数减少了 40%
    • 它做出需要人类介入的错误减少了 52%
    • 它在“社交合规性”方面表现出色,这意味着它不会横插他人路中,也不会离障碍物太近。

总结

可以将 FlowPilot 想象成一名机器人驾驶员:它首先通过海量的视频库学习复杂的驾驶物理规律(第一步),然后接受人类监督员的“导师指导”,通过纠正其坏习惯来教会它交通规则中那些不成文的规定(第二步)。其结果是,机器人能够仅凭单个摄像头,在繁忙的人行道上安全、平滑且礼貌地进行长距离导航。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →