Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
Zevaは、ロボットの物理的な経験から因果関係の相互作用を抽出して二重タイムスケールのメモリへと格納することで、勾配更新を必要とせずに、インコンテキスト学習を通じて凍結されたポリシーモデルがタスクを横断して自己進化し性能を向上させることを可能にし、汎用的な身体的マニピュレーションを実現する新しいフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットは長らく工場の床の達人であり、そこでは同じ動作を何千回も完璧な精度で繰り返してきました。しかし、彼らをその制御された環境から連れ出し、実際のキッチンや研究所に置くと、しばなくつまずいてしまいます。物理的な世界は混沌としています。物体は動き、表面は凹凸があり、グリッパーが水の入ったグラスを感じる感覚は、金属製のカップを感じる感覚とは異なります。長年、ロボットを教えるための主要なアプローチは、ラボを離れる前に膨大な量のビデオやデータを入力し、あらゆる事態に対処できるだけの一般的なルールを学習させることを期待するものでした。しかし、これらのロボットが未経験の状況に直面すると、内部の「脳」がその瞬間の新しい物理現象に適応できないため、頻繁に失敗します。彼らは与えられた知識に縛られ、起きている最中に自らの間違いから学ぶことができないのです。
清華大学とZ-Trans AIの研究チームは、異なる道を提案しました。それは、ロボットがリアルタイムで因果関係について考える方法を学ぶ道です。彼らは「Zeva」と呼ばれるシステムを導入しました。これは、基礎となるソフトウェアコードを一切変更することなく、ロボットが自身のパフォーマンスを向上させることを可能にするものです。ロボットの脳を再学習させることは、時間がかかりリスクも高いため、Zevaは高度に整理されたノートブックのように機能します。ロボットがタスクを実行しようとする際、それは特定の物体を見た、腕をこのように動かした、そして物体がそのまま留まったか、あるいは倒れたかという、動作に伴って何が起きたかを正確に記録します。システムはその単一の相互作用から、行動とその結果の間の因果関係という教訓を抽出し、それを保存します。ロボットが同じタスクを再度試みる際、このノートブックを参照して関連する教訓を見つけ出し、それを用いて次の動きを調整します。これは瞬時に行われるため、コアとなるプログラミングが凍結され変更されない状態であっても、ロボットは試行ごとに向上していくことができます。
研究者たちは、このアイデアを二つの非常に異なる世界でテストしました。第一に、ケトル、トースター、ミキサーといった複雑な物体で満たされた、洗練されたコンピュータ・シミュレーションによるキッチンを使用しました。この仮想環境において、Zevaはミキサーのヘッドを開ける、電子レンジのスイッチを入れるといった5つの異なるタスクに直面しました。結果は驚くべきものでした。他の高度なロボットシステムが60〜72パーセント程度の成功率にとどまった一方で、Zevaは76.8パーセントの成功率に達しました。より重要なことに、このシステムは明確な自己改善のパターンを示しました。タスクへの最初の試行では、成功率はわずか4分の1程度でした。しかし、失敗から得た教訓を次の動きの指針として使いながら同じシナリオを繰り返すうちに、成功率は着実に上昇しました。4回目の試行までには、73パーセントのケースで成功していました。これは、ロボットが単に運が良かったのではなく、自身の行動による物理的なフィードバックから真に学習していたことを証明しています。
これがコンピュータ・シミュレーションの結果に過ぎないことを確認するため、チームはシステムを実際の化学実験室へと持ち込みました。彼らは、試験管やビーカーなどの繊細なガラス器具を扱い、水の注入や化学物質の計量などのタスクを実行できる物理的なロボットアームを装備しました。この環境は、実際の重力、摩擦、そしてガラスが割れるリスクが存在するため、シミュレーションよりもはるかに予測不可能です。ここでも、Zevaは既存の最高水準のシステムを凌駕しました。試験管を拾うといった単純なタスクでは、100パーセントの成功率を達成しました。塩溶液の調製のようなより複雑な一連の動作においては、70パーセントの成功率を達成し、競合他社を大きく引き離しました。研究者たちは、タスク全体を完了できたかどうかだけでなく、プロセスをどの程度完了できたかも測定しました。タスクが困難な場合でも、Zevaは他のどのシステムよりも多くの工程を完了させており、相互作用から学ぶ能力が、混沌とした現実世界のナビゲートに役立つことを示しました。
Zevaの成功の鍵は、その記憶の整理方法にあります。このシステムは、これまでに行ったすべてのことを長いリストとして保存するわけではありません。それでは処理が速すぎてしまいます。代わりに、二種類のメモリを連携させて使用します。一つは、直近数秒間の動作を記憶する短期的なトレースであり、今まさに何が起きているかを理解するのに役立ちます。もう一つは、過去の試行が失敗したとしても、最も有用な教訓を保持する持続的なメモリです。ロボットが新しい試行を開始するとき、現在直面している状況に似た状況をこの持続的メモリから検索します。そして、その過去の経験をガイドとして使用します。例えば、以前水を注ごうとした際に、傾けすぎたためにグラスが倒れた場合、ロボットはその特定の因果関係を記憶します。次の試行では、このメモリを参照して傾ける速度を緩め、同じ間違いを回避します。このプロセスはロボットのメインソフトウェアに変更を加えることなく行われるため、ロボットは、脳全体を再学習させるという遅くて危険なプロセスを経ることなく、即座に学習し適応することができるのです。
研究者たちはまた、このシステムが自身のミスだけでなく、人間からも学べることを発見しました。ある実験では、人間が複雑なタスクの成功した一度の試行を通じて、ロボットア膜を物理的に誘導しました。システムはこの人間のデモンストレーションを記録し、因果的な教訓を抽出し、メモリに保存しました。その後、ロボットが自力でそのタスクを試みる際、その単一の人間による例を使用して学習を加速させました。この「ウォーミングアップ」により、ゼロから学習する場合と比較して、成功率を最大15パーセント向上させることができました。これは、ロボットが単一の人間によるデモンストレーションから新しいスキルを学び、その後、自身の繰り返される練習を通じてそのスキルを洗練させていけることを示唆しており、人間のガイダンスの最善の部分と自己進化の力を組み合わせることを可能にします。
この研究は、ロボットが学んだ教訓が、全く異なる別のタスクに役立つかどうかについても調査しました。彼らは、システムが新しいタスクにおける物理的な影響が、以前見たものと類似していることを認識できることを発見しました。例えば、水を注ぐために容器を傾ける動きは、目的や物体が異なっていても、化学物質を混ぜるために容器を傾ける動きと類似していると認識されました。このようなタスクを越えた知識の転移能力は、ロボットが新しい課題に直面するたびにゼロから始める必要がないことを意味します。ロボットは、時間をかけて構築してきた物理的な因果関係のライブラリを引き出すことができ、より多才で、幅広い状況に対応できる能力を備えています。
こうした成功にもかかわらず、研究者たちは自らの研究の限界についても明確に述べています。現在のシステムは、特定の仕事を完了しようとする試行からのみ学習します。世界を探索して新しいことを学ぶための「能動的な探索(アクティブ・エクスプロレーション)」と呼ばれる行動は、まだ備わっていません。著者らは、将来の研究の焦点として、物理的な世界についての不確実性を減らすために、意図的に異なる行動を試みるような、自ら実験を選択する学習方法を教えることに注力すると示唆しています。それまでの間、Zevaは、ロボットが賢くなるために再学習を受ける必要はないということを示す重要な一歩となります。自身の行動の結果に注意を払い、何がうまくいき、何がうまくいかなかったかを記憶することで、ロボットは自らの能力を進化させ、あらゆる失敗を次の試みのための教訓に変えることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。