← 最新の論文
💻 computer science

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

本論文は、操作成功率を高めるためにGrasp-Pretraining Augmentationを統合した新しいフレームワークであるGPA-RAMを提案し、効率的かつリアルタイムな行動生成のためにRobotic Attention Mambaアーキテクチャを採用することで、複数のロボットプラットフォームにわたって最先端の性能を達成している。

原著者: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに家事のやり方を教える場面を想像してみてください。家の中にあるあらゆる物体に対して、指をどう動かすべきかを一行ずつ、何百万行ものコードを書いて教えたいとは誰も思いません。そうではなく、親が子供にブロックを積み上げたり、スプーンをコップに入れたりする方法を教えるように、やり方を見せて教えたいはずです。これが「ロボット模倣学習(robot imitation learning)」の世界です。これは、ロボットが人間のデモンストレーションを見て、それを観察し、模倣することで学習するという科学の一分野です。大きな課題は何でしょうか? ロボットは腕を動かすことは得意ですが、最初のステップである「適切な方法で正しいものを掴むこと」においては、非常に不得意なことが多いのです。もしロボットがコップの取っ手ではなく縁を掴んでしまったり、ペグから数ミリメートルずれてしまったりすると、タスク全体が失敗してしまう可能性があり、ロボットはどうやって修正すればよいのか分からなくなるかもしれません。科学者たちは、散らかった部屋を認識し、物体を最適な方法で保持する方法を見極め、何にもぶつかることなく完璧に動かせるような、ロボットのための「脳」を構築しようと絶えず試みています。

ここで、まさにその「掴んで運ぶ(grab-and-go)」問題を解決するために設計された新しいロボットの脳、「GPA-RAM」を紹介します。このプロジェクトの研究者たちは、多くのロボットが失敗する理由は、動き始める前に「どのように物体を保持しているか」に対して十分な注意を払っていないからだと気づきました。彼らは2つの巧妙なトリックを組み合わせたシステムを構築しました。第一に、タスク全体を学習するために使用するビデオと同じものを用いて、物を掴む方法に関する「事前学習(pre-training)」をロボットに与えました。これは、エッセイを書くように指示する前に、鉛筆の持ち方についての小テストを学生に課すようなものです。つまり、ロボットはパズルを解こうとする前に、グリップ(握り方)を学ぶのです。第二に、ロボットの遅くて重い思考エンジンを、「RAM(Robotic Attention Mamba)」と呼ばれる新しく電光石火のような速いエンジンへと入れ替えました。RAMを、膨大な視覚情報のライブラリをスキャンして一瞬で正しい本を見つけ出す、非常に効率的な司書だと考えてみてください。従来のシステムでは、情報に圧倒されて動作が遅くなってしまうところです。

チームはこの新しい脳を、実機のロボットやシミュレーション上のロボットを含む4種類の異なるロボット構成でテストしました。その結果、「掴む事前学習」を加えることで、コップを積み重ねる、ペグを穴に差し込む、あるいは両腕の間で物体を移動させるといった難しいタスクにおいて、ロボットが格段に優れた能力を発揮することが分かりました。RLBenchという標準的なテストにおいて、この新システムは87.5%の成功率を記録し、これまでの最高手法を上回りました。さらに印象的なことに、立方体を移動させるデュアルアーム・ロボットのタスクでは98%の成功率を達成し、困難な両手挿入タスクでは成功率が16%から56%へと跳ね上がりました。最も素晴らしい点は、これらすべてを秒間約71フレームの速度で実行しており、立ち止まることなくリアルタイムに反応できるほど速く思考できることです。研究者たちは、「まず掴み、それから動く」というこのアプローチが、これまで失敗の原因となっていた繊細なタスクをこなせるようになり、実世界におけるロボットをより信頼できる助手にする可能性があると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →