← 最新の論文
🤖 machine learning

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

本論文は、自己教師あり強化学習ループによってビジョン・言語・行動(VLA)ポリシーを強化し、ポリシー自身の成功および進捗の予測がアドバンテージ推定と失敗検知を駆動する、LeHome Challenge 2026において上位ランクを獲得した受賞歴のある両手による衣類畳みシステムを提示するものであり、そこではフローマッチング、分散学習、および堅牢なSim-to-Real転移を含む包括的なエンジニアリング最適化のスイートによって支えられている。

原著者: Ilia Larchenko

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Ilia Larchenko

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが、ぐちゃぐちゃになったTシャツやパンツを畳もうとしている場面を想像してみてください。私たちにとっては単純なことのように思えますが、ロボットにとって布地は、触れるたびに形を変える、混沌とした滑りやすいヘビのようなものです。この論文は、著者である Ilia Larchenko が、まさにこのタスクにおいて、シミュレーション・コンテストで1位、実世界のコンテストで2位を獲得した「ロボットの脳」をどのように構築したかを説明しています。

以下は、彼がどのようにしてそれを成し遂げたのかという物語を、シンプルな概念に分解したものです。

1. 問題点:機械の中の「ゴースト」

ロボットは、2本の腕を使って4種類の衣類(長袖/半袖のトップス、長ズボン/短パン)を畳む必要がありました。

  • 落とし穴: ロボットは自分が何を掴んでいるのかを知りませんでした。畳み始める前に、服を見て「これはTシャツか、それともパンツか?」を判断しなければなりませんでした。
  • 報酬: ロボットは、最後に服が完璧に畳まれた場合にのみ、「ゴールドスター(報酬)」を受け取ることができました。途中で失敗した場合、報酬は一切もらえません。これは、自転車の乗り方を学んでいる最中に、一度も転ばずにゴールに到達した時だけクッキーをもらえるようなものです。

2. 解決策:「自己学習」のループ

人間のデモンストレーションをただコピーする(それは、動画を見て泳ぎ方を学ぶようなものです)代わりに、著者は「やってみて、失敗して、また挑戦する」ことで学ぶシステムを構築しました。彼はこれを**「フライホイール(弾力のある回転体)」**と呼んでいます。

これは、工場で働く3人チームのようなものです:

  1. トレーナー(訓練者): データを研究し、ロボットの脳を更新する教師。
  2. ランナー(実行者): ビデオゲーム(シミュレーション)の中で、1日に何千回も服を畳もうと試行錯誤するロボットの群れ。
  3. ヒューマン・ヘルパー(人間の助け手): ロボットが行き詰まった時にだけ介入し、服を直し、ロボットが再挑戦できるようにする人。

これら3者は直接会話することはありません。共通のデジタル郵便受け(H型HuggingFace Hub)にメモを残し合うだけです。トレーラーはメモを読み、学習し、新しい「脳のアップデート」を箱の中に投げ入れます。ランナーはそれを受け取り、再び挑戦します。

3. 特秘のレシピ:ロボット自身がスコアラー

通常、ロボベティクスにおいては、「何をすべきか」を決める脳と、「どれくらい上手くいっているか」を推測する別の脳が必要です。しかし、著者はこれらを統合しました。

  • 魔法のトリック: 「袖を掴め」と判断するのと同じニューラルネットワークが、「成功する確率は80%である」や「工程の40%まで完了した」といった予測も行います。
  • なぜ役立つのか: ロボットがリアルタイムで自分のスコアを知ることができるため、学習が速くなります。もし失敗すると予測した場合、別の動きを試すべきだと判断できるのです。これは、テストを受けている生徒が、単に解答するだけでなく、即座に自分の答えを採点してどこで間違えたかを確認するようなものです。

4. 失敗から学ぶ(「リプレイ」戦略)

著者は、ただ練習するだけでは退屈であることに気づきました。必要なのは「難しい部分」を練習することです。

  • ハード・マイニング(困難の掘り起こし): ロボットが失敗したとき、システムはその瞬間の状態を保存します(ビデオゲームの「セーブポイント」のようなものです)。そして、その失敗した状態をロードし、今度は「ノイズ(照明や布の質感のランダムな変化)」を加えて、より難易度を上げて再挑戦させます。
  • 人間のタッチ: ロボットが本当に動けなくなったとき、人間が数秒間だけ介入して服を直し、制御をロボットに戻します。ロボットは、この小さな修正から学びます。これはDAgger(「人間の修正から学ぶ」という格好いい名前のメソッド)と呼ばれます。

5. 「魔法のメガネ」(推論の最適化)

賢い脳を持っていても、動きが速すぎたり遅すぎたりすると、ロボットは不器用になります。著者は、ロボットが最後の瞬間にどのように「考えるか」を微調整することで、パフォーマンスが劇的に向上することを発見しました。

  • 比喩: あなたが選択式のテストを受けていると想像してください。最初に思い浮かんだ答えをそのまま選ぶのではなく、頭の中で素早く3つの異なる答えを生成し、自分の直感(スコア)に基づいてどれが「ベスト」かをチェックしてから、その答えを選ぶのです。
  • トンプソン・サンプリング: 著者は数学的なゲーム(スロットマシンのようなもの)を使用して、あらゆる種類の服に対して最適な設定(例:「短パンの場合はゆっくり動き、長ズボンの場合は強く掴む」など)を、手動でテストすることなく自動的に導き出しました。

6. 実世界の挑戦:ビデオゲームから現実へ

最も困難だったのは、コンピュータ・シミュレーションから、現実の部屋にいる本物のロボットへと移行することでした。

  • 物理法則の「不気味な谷」: シミュレーションでは服は完璧に見えました。しかし現実では、照明が異なり、カメラはわずかに傾き、ロボットの腕には少しの「遊び(バックラッシュ)」がありました。
  • 解決策: 著者はロボットを完璧にしようとはしませんでした。代わりに、トレーニングデータを「混沌としたもの」にしました。暗い中、明るい太陽の下、傾いたカメラ、そして異なる速度で動くロボットを使って、服を畳むように教え込んだのです。
  • 結果: 混沌とした状況に慣れるように訓練されたことで、ロボットは現実の世界に直面してもパニックに陥りませんでした。それは、嵐の海でサーファーを訓練すれば、穏やかなビーチが簡単に感じられるようになるのと同じです。

7. 結果

  • シミュレーション: ロボットは**79.6%**の確率で服を畳むことに成功し、61のチームを打ち破りました。
  • 実世界: 最終コンテストで2位に入賞し、現実のロボットで実際の服を畳むことに成功しました。

大きな教訓

著者は、これが制御された変数を持つ完璧な科学実験ではなかったと認めています。これは「キッチン・シンク(何でも放り込む)」的なアプローチであり、あらゆる有用なツール(強化学習、人間のフィードバック、強力なデータ拡張、そしてスマートな推測)を鍋の中に投げ込み、うまくいくまで試したものです。

主な教訓は、ロボットが服のような乱雑で予測不可能なものを扱うためには、自分自身の成功を予測でき、人間の修正から学び、そして現実がビデオゲームと異なっていても混乱しないように、混沌とした多様な環境で訓練される必要があるということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →