← 最新の論文
🤖 machine learning

MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution

本論文は、LLMによる生成と進化した評価器からの構造化されたフィードバックを組み合わせることで、長期的な身体的タスクのための実行可能なコード・アズ・ポリシー(code-as-policies)を進化させ、既存のベースラインと比較して優れた性能とsim-to-real転移を実現する、メモリ誘導型のメメティック・フレームワークであるMEMENTOを導入するものである。

原著者: Alkis Sygkounas, Victor Aregbede, Amy Loutfi, Andreas Persson

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Alkis Sygkounas, Victor Aregbede, Amy Loutfi, Andreas Persson

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットにブロックの塔を積み上げたり、サンドイッチを作ったりといった複雑な家事を教えようとしていると想像してください。これは単にボタンを一つ押すだけのことではありません。すべての動きが前の動きに依存する、長い一連のステップです。もしロボットが間違ったブロックを掴んだり、間違ったドアを開けたりすれば、計画全体が台無しになります。これは、「エンボディドAI(身体性AI)」の世界であり、ソフトウェアが混沌とした物理的世界と出会う場所です。ここでの大きな課題は「クレジット割り当て問題(credit assignment problem)」です。ロボットが長いタスクの最後に失敗したとき、どの特定のステップが間違っていたのかをどうやって知ればよいのでしょうか?最初の動きが悪かったのか、それとも10番目の動きが悪かったのでしょうか?

これを解決するために、研究者たちは「コード・アズ・ポリシー(code-as-policy)」と呼ばれる巧妙なトリックを試みています。ロボットに漠然とした指示や試行錯誤による報酬で学習させるのではなく、ロボットの脳そのものを実際のコンピュータコードとして書き込むのです。これは、ロボットに「感覚」を与えるのではなく、「レシピ本」を与えるようなものです。もしレシピが失敗したら、そのレシピを読み、どの指示が混乱を招いたのかを正確に特定し、書き直すことができます。しかし、このレシピを手作業で書くのは大変ですし、正しいコードを推測するのはさらに困難です。ここで、エッセイを書いたり私たちとチャットしたりするAIの脳である「大規模言語モデル(LLM)」が登場します。彼らはコードを生成できますが、適切に修正するために、なぜそのコードが失敗したのかを理解するための助けを必要とすることがよくあります。

これは、MEMENTOと呼ばれる新しい手法の物語です。MEMENTOは、ロボットのコードを編集する、非常に賢い「記憶を持つエディター」として機能します。研究者たちは、AIにレシピを書かせ、テストさせ、そして「何がうまくいかなかったか」を記憶する特別な「メモリ(記憶)」を使うことで、より優れたロボットのレシピを進化させられるかどうかを検証したいと考えました。彼らはこれを、2つのトリッキーなゲームでテストしました。一つは、ロボットアームがルールを破らずにブロックを動かす「ハノイの塔」パズルであり、もう一つは、ロボットが仮想の家の中を移動してスナックを作るゲームです。

以下に、MEMENTOの仕組みと、チームが発見したことを説明します。

「当てずっぽう」の問題

プログラムを解くためのコードを書こうとしている場面を想像してください。AIにコードを書くよう頼みます。AIが何かを書き、実行しますが、失敗します。もしあなたが単に「もう一度やってみて」とAIに頼み、新しいランダムなアイデアを出させたとしても、それは単に少し違う失敗を生むだけで、本当の意味での学習にはなりません。それは、目隠しをしてダーツを投げながら、広大な野原の中に隠された鍵を探そうとするようなものです。

以前の手法では、一度に多くの異なるバージョンのコードを生成し、その中から最良のものを選択することでこれを修正しようとしました。しかし、研究者たちはこのアプローチでは的を外すことが多いことを見出しました。それは、100人の人々が水漏れしているパイプの修理方法を提案しているようなものですが、誰もが水が滴っている具体的な箇所を見ていないのです。彼らには、一つの優れたアイデアを取り出し、注意深く微調整し、失敗した微調整を記憶し、そして異なるアイデアの最良の部分を組み合わせる方法が欠けていました。

MEMENTOの登場:記憶を持つエディター

著者らは、MEMENTO(Memory-Guided Memetic Code-as-Policy Evolution)を紹介しました。名前は難しく聞こえますが、そのアイデアは驚くほど人間的です。MEMENTOを、ロボットの脳となる単一の「スター」ドラフトと共に働く、熟練のエディターと考えてください。

プロセスは主に2つの幕で構成されます。

第1幕:判定器(Judge)の構築
ロボットが学習を開始する前に、MEMENTOは特別な「判定器(Judge/評価器)」を作成します。この判定器は、ロボットの試行を監視し、スコアを与えるコードです。しかし、単に「合格」や「不合格」と言うだけではありません。「スコアは取れたが、ここでブロックを落とした」「ドアを開けるのが速すぎた」といった詳細な成績表を提示します。研究者たちは、まずこの判定器を進化させ、ロボットのパフォーマンスにおける正確な失敗箇所を特定できることを確認しました。

第2幕:3つの分岐探索
判定器の準備ができたら、本当の進化が始まります。MEMENTOはただダーツを投げるのではなく、過去の失敗を「メモリ」として保持しながら、ロボットのコードを改善するための3つの具体的な戦略を使用します。

  1. ヒルクライマー(慎重な微調整者): このブランチは、現在の最良のコードを取り上げ、極めて小さく慎重な変更を加えます。変更によってロボットが向上すれば、それを維持します。もし変更によって悪化した場合は、なぜその特定の変更が失敗したのかを記憶します。この「拒絶されたアイデアの記憶」により、AIは同じ間違いを二度繰り返すことがなくなります。これは、ある道を試して行き止まりを見つけ、地図に印を付け、別の道を探すハイカーのようなものであり、同じ茂みに再び入り込まないようにすることを保証します。
  2. マクロ・ミューテーター(大胆なアイデア生成者): 時には、小さな微調整だけでは不十分です。このブランチは、最良のコードを取り上げ、レシピの段落全体を書き換えるような、大きく大胆な変更を加えます。これは「全く異なるアプローチを試してみたらどうだろう?」という瞬間です。
  3. クロスオーバー(混合器): これが魔法の成分です。これは、慎重な微調整者による最良の結果と、大胆なアイデア生成者による最良の結果を取り上げ、それらを混ぜ合わせます。これは、2つの異なるレシピから最高の材料を取り出して、新しい超絶品料理を作るようなものです。

これら3つの経路を試した後、MEMENTOは次のラウンドのための「エリート(最良の結果)」となる単一の最高の結果を選び出します。このサイクルを繰り返し、ロボットがタスクを解決できるまで、コードを徐々に洗練させていきます。

結果:本当に効果があるのか?

研究者たちは、MEMENTOを2つの全く異なる世界でテストしました。

  • Robosuite Tower of Hanoi: 4つのブロックを積み上げるロボットアーム。
  • AI2-THOR: リンゴを電子レンジに入れ、パンを冷蔵庫に入れるために仮想のキッチンを移動するロボット。

彼らはMEMENTOを、他の2つの一般的な手法(EurekaおよびREvolve)と比較しました。結果は明白でした。MEMENTOの勝利です。

ハノイの塔のタスクにおいて、MEMENTOは 0.97 ± 0.06 の成功率(つまり、ほぼ毎回パズルを解いていることを意味します)を達成しましたが、他の手法は苦戦し、一方は 0.53 しか達成できず、もう一方は完全に失敗(0.00)しました。キッチンのタスクでは、MEMENTOは完璧な 1.00 ± 0.00 の成功率を叩き出しましたが、他の手法はそれぞれ 0.400.00 でした。

しかし、本当の魔法はトレーニングルームの外にありました。研究者たちは、ロボットが一度も見せたことのない新しい状況に対処できるかどうかをテストしました。

  • 新しい形状: ブロックを立方体から奇妙な形の円柱や非対称の物体に変更したとき、M still MEMENTOは 0.87 の割合でパズルを解きました。他の手法は 0.23 または 0.00 に急落しました。
  • 新しい部屋: キッチンロボットを、見たこともない全く新しい家のレイアウトに移動させたとき、MEMENTOは 0.78 の割合で成功しました。他の手法は 0.08 まで落ち込みました。

これは、MEMENTOが単に特定のブロックや特定のキッチンを暗記したのではなく、タスクの「論理」を実際に学習したことを示唆しています。

「アハ体験」の瞬間(アブレーション研究)

彼らの設計自体が「秘伝のソース」であることを証明するために、研究者たちはMEMENTOの一部を取り除いて、何が起こるかを試しました。

  • メモリなし: 「拒絶されたアイデアのメモリ」を取り除くと、ロボットは同じ間違いを何度も繰り返して行き詰まりました。
  • 大きな変化なし: もし「マクロ・ミューテーション(大胆な変化)」を行わず、小さな微調整のみを行った場合、ロボットは局所的な罠から抜け出すことができませんでした。
  • 混合なし: 最良のアイデアを混ぜるプロセス(クロスオーバー)を停止すると、ロボットは戦略を組み合わせることができませんでした。
  • 判定器の進化なし: 単純な未訓練の判定器を使用した結果、訓練された判定器を使用した場合に比べて、ロボットはどのように勝つべきかを理解できませんでした。

どの要素を取り除いても、パフォーマンスが大幅に低下したことは、システム全体が必要不可欠であることを証明しています。

シミュレーションから現実へ

最もエキサイティングな部分は?彼らは、コンピュータ・シミュレーション内でMEMENTOが進化させた最高のコードを、実物の物理ロボット(Frankaロボットアーム)に適用しました。彼らは再学習させたりコードを変更したりせず、ただ実行させただけです。

ロボットは、現実世界でもハノイの塔のパズルを 90% の確率(10回中9回)で成功しました。唯一の失敗は、コードが間違っていたからではなく、ロボットのカメラがブロックの位置を誤読したためでした。これは、「コード・アズ・ポリシー」のアプローチが単なるシミュレーション上のトリックではなく、現実の、混沌とした物理的世界でも通用することを証明しました。

これが何を意味するか

この論文は、ロボットが複雑で長いタスクを学習するためには、単なるランダムな推測以上のものが必要であると示唆しています。私たちは、何がうまくいかなかったかを記憶し、大小両方の変化を加え、そして最良のアイデアを組み合わせるシステムを必要としています。MEMENTOは、ロボットのコードを、過去の失敗の記憶と共に編集、テスト、精緻化できる「レシピ」として扱うことで、これまで困難であったパズルを解くようにロボットを教えられることを示しています。

著者らは、これが特定のタスクに対してテストされたものであり、使用した特定の言語モデルに依存していることに注意を促しています。彼らはこれが「あらゆる」ロボットの問題を解決すると主張しているわけではありませんが、ロボットにコードとして思考させるための、非常に有望な道筋を示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →