ハイブリッドの勝利: 3D RL-DWA ロボットが明確な優勝者でした。ほぼすべての経路を成功裏に navigated(ほぼ完璧な完了)し、トンネルに完璧にフィットするように体を伸ばすことを学びました。それは速く、安全であり、センサーデータが少しノイズを含んでいたりぼやけていたりしても対応できました。
問題定義 複雑で制約された 3D 環境における自律ナビゲーションは、特に疎なセンサ条件下で動作する場合、高自由度(DoF)ロボットシステムにとって依然として重大な課題である。従来のグローバルプランニング手法は、動的かつ部分的に既知の環境ではしばしば失敗し、標準的なローカルプランナであるダイナミックウィンドウアプローチ(DWA)は、固定されたパラメータ調整に依存しており、適応性が制限される。さらに、既存のハイブリッド強化学習(RL)と DWA のアプローチは、主に構造化された環境における 2 次元運動に焦点を当てており、血管ネットワークのような屈曲した構造をナビゲートする際に、運動と形状を同時に最適化しなければならない変形性高自由度ロボット(マイクロロボットなど)の 3 次元制御に対する解決策の欠如が残されている。
手法 著者らは、9 自由度の変形ロボットのためのローカルナビゲーション向けに、強化学習(RL)とカスタマイズされた 3D ダイナミックウィンドウアプローチ(DWA)を統合したハイブリッドフレームワーク「3D RL-DWA」を提案する。本システムは、姿勢(位置と向き)に 6 自由度、対称軸に沿った形状変形に 3 自由度を持つ楕円体としてモデル化される。
DWA パラメータ: エージェントは、速度、方向、障害物回避、目標への整合性をバランスさせる DWA コスト関数の重み付け係数(α,β,γ,ζ)を動的に調整する。
速度コマンド: エージェントは、角速度(ωx)と変形速度(δ˙)を直接出力する。 DWA モジュールは、これらのパラメータを利用して許容集合から最適線形速度を選択し、3D 動的ウィンドウ内での衝突フリー軌道を実現する。
強化学習の定式化: 本問題は、Soft Actor-Critic(SAC)アルゴリズムを用いたマルコフ決定過程(MDP)として定式化される。エージェントは、前進の促進、衝突回避、および血管内でのロボットの占有体積の最大化を促す密な報酬関数を最大化するように訓練される。観測空間には、ロボットの形状変形状態、正規化された速度、目標への変位ベクトル、および N 個のレーザースキャン距離が含まれる。
運動学: ロボットの運動は、磁性流体システムに着想を得た簡略化された運動学モデルによって支配される。重要な制約として、ロボットの x 軸が運動方向と一致しており、制御可能な回転自由度が単一の軸(ωx)に減少し、残りの回転成分は整列制約によって受動的に誘発される。
主要な貢献
新規ハイブリッドフレームワーク: 本論文は、高自由度変形ロボットの 3D ローカルナビゲーション向けに、RL-DWA ハイブリッドを初めて適用し、そのようなシステムの 3 次元運動制御におけるギャップを埋めるものである。
適応的パラメータ調整: 従来の DWA が手動調整を必要とするのに対し、提案手法は RL を用いて、環境条件やセンサの疎性に基づき、DWA コスト関数の重みをリアルタイムで動的に調整する。