← 最新论文
💻 computer science

Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles

本文提出了一种基于视觉的课程强化学习框架,通过结合多阶段课程学习、域随机化和多场景更新策略,成功训练出能够在充满随机障碍物的复杂环境中实现高速飞行且具有高鲁棒性的四旋翼无人机端到端控制策略。

原作者: Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

发布于 2026-03-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何让无人机像“职业赛车手”一样,在充满随机障碍物的复杂环境中高速飞行的故事。

想象一下,你让一个新手赛车手去跑 F1 赛道。如果赛道是空的,他很快就能学会。但如果赛道上突然到处都插满了路障,而且每次训练时路障的位置都不一样,这个新手大概率会撞得稀巴烂,根本跑不起来。

以前的研究大多只教无人机在“空荡荡”的赛道上飞,或者在固定的障碍物前飞。一旦遇到没见过的乱糟糟的环境,它们就“傻眼”了。

这篇论文的作者(来自上海交通大学等机构)提出了一套**“循序渐进 + 随机训练”**的独门秘籍,让无人机学会了在乱石堆里高速穿梭。

核心概念:三个“绝招”

为了教会无人机这项高难度技能,作者用了三个核心策略,我们可以用**“驾校练车”**来打比方:

1. 循序渐进的“教练课程” (Curriculum Learning)

  • 以前的做法:直接把新手扔进满是障碍物的赛道,让他自己摸索。结果就是:要么撞墙,要么根本不敢飞。
  • 这篇论文的做法:像教小孩学走路一样,分三步走:
    • 第一阶段(平地走):先在没有障碍物的赛道上,让无人机慢慢飞,熟悉怎么穿过门(Gate)。
    • 第二阶段(加路障):在赛道上随机放几个路障,让无人机在慢速下学习怎么绕开它们。
    • 第三阶段(高速冲刺):把障碍物变多、变密,并且要求无人机全速冲刺。
    • 比喻:就像驾校教练,先让你开直路,再让你开有锥桶的绕桩,最后才让你上高速。这样无人机就不会“吓破胆”了。

2. “随机生成器”与“多场景特训” (Domain Randomization & Multi-scene Updating)

  • 痛点:如果在模拟器里只练同一种路障排列,无人机就会“死记硬背”,换个地方就不会飞了(就像背熟了答案但不会做题)。
  • 解决方法:
    • 随机生成器:每次训练,电脑都会像“掷骰子”一样,随机生成路障的数量、位置和形状。确保无人机没见过完全一样的场景。
    • 多场景特训:想象一下,不是让一个学生练一道题,而是让 100 个学生同时练 10 种不同的题目,然后大家交换经验。这种方法让无人机学得更快、更灵活。
    • 比喻:这就像让无人机在“万花筒”里训练,不管路障怎么变,它都能迅速反应过来。

3. 聪明的“奖惩机制” (Reward Design)

  • 最大的矛盾:无人机有两个任务:
    1. 穿过门(要直着冲,速度要快)。
    2. 避开障碍物(要绕着走,甚至要急转弯)。
    • 这就好比你要一边“直线冲刺”一边“躲避飞来的砖头”,这两个目标其实是打架的。如果只奖励“避开砖头”,无人机可能为了安全,直接绕着门飞,根本不去穿门。
  • 作者的解法:设计了一套精妙的“积分系统”。
    • 穿门成功给大奖。
    • 撞墙了扣大分。
    • 最关键的是,给“避开障碍物”也设计了专门的分数,并且告诉无人机:“穿门的时候也要看路”。
    • 比喻:就像游戏里的任务,既要“吃金币”(穿门),又要“不被怪物打”(避障)。系统告诉无人机:只有既穿过了门又没撞墙,才是满分。

实验结果:真的行吗?

作者不仅是在电脑里模拟,还真的造了真飞机去飞:

  • 硬件:无人机上装了一个像“眼睛”一样的深度相机(Intel D435i)和一个像“大脑”一样的树莓派电脑。
  • 速度:在充满障碍物的真实赛道上,无人机能飞得最快达到 8 米/秒(约 28.8 公里/小时),这非常快!
  • 成功率:在三种不同形状的赛道(S 形、3D 圆形、J 形)上,成功率达到了 100%。
  • 对比:以前的方法在同样环境下,成功率只有 30%-40%,而且飞得慢。

总结

这篇论文的核心思想就是:不要试图一步登天,要像教孩子一样,分阶段、多变化地训练,并给它们一套聪明的“游戏规则”。

通过这套方法,无人机不再是只会走直线的“笨蛋”,而是变成了能在复杂环境中灵活穿梭、甚至能做出急转弯躲避障碍的“特技飞行员”。这为未来无人机在真实世界(比如灾难救援、快递配送)中自动飞行打下了坚实的基础。

一句话总结:作者用“分阶段教学”和“随机变题”的方法,教会了无人机在乱石堆里像 F1 赛车手一样高速、安全地穿门而过。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →