← 最新の論文
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCALは、適応的な視覚・触覚融合と潜在的共想像を活用したMixture-of-Transformersアーキテクチャを利用することで、触覚センシングと物理ダイナミクスのモデリングを動的に統合し、接触の多い操作タスクにおいて最先端の性能を実現する、物理に根ざした器用な視覚・言語・行動モデルである。

原著者: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

公開日 2026-09-09
📖 1 分で読めます☕ さくっと読める

原著者: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長い間、工場の床の達人であり、予測可能な経路に沿って重い物体を硬い精密さで移動させてきました。しかし、電球をねじ込んだり、花瓶を拭いたり、ボトルのキャップを回したりといった、日常生活の繊細で面倒な作業を行うよう彼らに求めると、しばしば躓いてしまいます。世界は清潔で静的なグリッドではありません。それは、絶え間的で微細な摩擦が存在する場所なのです。成功するためには、機械は単に「見る」以上のことをしなければなりません。それは「感じる」必要があります。指が滑る瞬間、ノブを回すために必要な圧力、あるいは柔らかい物体が接触によってどのように変形するかといった、目に見えない接触の物理学を理解しなければならないのです。何十年もの間、科学者たちはロボットに「目」と「肌」の両方を与えることでこの溝を埋めようとしてきましたが、機械にこれらの感覚を一つの流動的な直感へと統合させることを教えることは、人工知能における最も困難な課題の一つであり続けてきました。

研究チームは現在、DeCALと呼ばれる新しいシステムによって、大きな一歩を踏み出しました。これは単に「見ること」と「触れること」ができるロボットではありません。物理的な相互作用の未来を、それが起こる前に「想像」するように設計されたシステムです。理解、想像、そして行動を統合するモデルを構築することで、研究者たちは、これまで見たことのないレベルの器用さで、人間による操作のような複雑で接触の多い世界をナビゲートできるロボットポリシーを作り上げました。このシステムは、花瓶を拭くことから小さな部品を組み立てることに至るまで、6つの異なるタスクでテストされ、既存の最も高度な手法を一貫して上回りました。これらの実世界の試行において、DeCALは単純なタスクでは最大100パーセントの成功率を達成し、環境が予期せぬ形で変化した場合でも、全6つの課題を通じて71パーセントという堅牢な平均成功率を維持しました。

研究者が取り組んだ核心的な問題は、視覚だけでは操作における最も重要な瞬間を見落としがちであるということです。ロボットの手が物体に手を伸ばすとき、指がカメラの視界を遮ってしまうことがあり、まさにロボットが最も情報を必要とする瞬間に「死角」が生じてしまいます。さらに、視覚データは、ロボットがどれほどの力で押しているのか、あるいは物体が滑りそうかどうかを伝えることはできません。以前のロボットへの触覚センサーの追加の試みは、それらを単なる「付け足し」として扱うことが多かったのですが、DeCALは触覚情報を思考プロセスの根本的な一部として統合しています。このシステムは、各指先に高解像度センサーを備えており、圧力がかかった際の物体の表面の変形や、加えられている正確な力を検出できます。これにより、ロボットは目で見ているものと同じくらい豊かで詳細な方法で、世界を「感じる」ことができるのです。

DeCALを真にユニークにしているのは、情報の処理方法です。現在の見えているものや感じているものに単に反応するのではなく、このシステムは次に何が起こるかを想像するように訓練されています。それは、3つの明確かつ連結された能力によって動作します。第一に、視覚的なシーンを観察し、言語指示を読み取り、接触点を感知することで、現在の状況を理解します。第二に、「共想像(co-imagination)」と呼ばれるプロセスに従事します。ここでは、視覚的なシーンと触覚的な感覚が数秒間にわたってどのように進化するかを予測します。本質的に、「今キャップを回したら、力はどう変化し、一瞬後には物体はどう見えるだろうか?」と自らに問いかけるのです。最後に、この想像された未来を用いて、タスクを完了するために必要な精密な動きを決定します。この先を見越したアプローチにより、ロボットは単に過去のパターンに基づいて推測するのではなく、相互作用の物理学に基づいて行動を計画することができます。

これを実現するために、研究者たちは、いつ触覚を信頼すべきかを判断するための特別な手法を開発しました。多くのタスクにおいて、ロボットは触覚が無関係な空間を移動していることもあれば、突然物体に接触することもあります。もしロボットが常に触覚信号に等しく注意を払っていたら、空気のノイズや接触の欠如によって混乱してしまうでしょう。DeCALは、触覚の感覚に対する「ボリュームノブ」のように機能するスマートなゲーティング機構を使用しています。ロボットが何も触れていないとき、システムは触覚信号のボリュームを下げ、主に視覚に頼ります。接触がなされた瞬間、システムは即座にボリュームを上げ、触覚データが動きを高い精度でガイドできるようにします。この動的な調整により、ロボットは適切な時に適切な感覚を使用し、感覚入力同士が衝突するのを防ぎます。

このシステムは、22本の指を持つ手を備えた一対のロボットアームを用いて、一連の厳格な実験によってテストされました。研究者はロボットに対し、花瓶を拭く、ホワイトボードを消す、部品を組み立てる、キャップを回す、液体をピペッティングする、電球をねじ込むという6つの異なる活動を課しました。これらのタスクは、微細な制御と絶え間ない物理的接触を必要とするため選ばれました。ロボットは、視覚のみに依存するものや、触覚を使用しているものの視覚的な未来の状態を想像する能力を欠くものなど、いくつかの最先端モデルと比較されました。結果は明白でした。DeCALは、他のどのシステムよりも頻繁にタスクを完了することに成功しました。例えば、視界が手によって遮られやすく、正確なトルクを必要とする電球をねじ込むタスクにおいて、DeCALは40パーセントの成功率を記録しましたが、次に優れたモデルはわずか35パーセントでした。花瓶を拭くタスクでは、DeCALは100パーセントの成功率を達成しましたが、最も優れた競合する視覚のみのモデルの成功率はわずか30パーセントでした。

さらに印象的だったのは、未知の状況に対処するシステムの能力でした。研究者は、異なる背景、ランダムな物体で散らかった環境、薄暗い照明、そして形状やサイズが異なる全く新しい物体を用いた環境でDeCALをテストしました。これら「分布外(out-of-distribution)」のシナリオにおいて、ロボットが記憶したパターンに頼ることができない状況でも、DeCALは強力なパフォーマンスを維持しました。未知のカップのキャップを回すよう求められた際、システムは75パーセントの成功率を達成し、競合を大きく引き離しました。これは、ロボットが特定の動きのセットを暗記しているのではなく、物体がどのように相互作用するかという基礎的な物理原則を実際に学習しており、それによって新しい課題に即座に適応できることを示唆しています。

研究者たちはまた、システムがどのように未来を予測することを学んだのかについても詳しく調査しました。ロボットの内部予測を分析した結果、相互作用中に発生する力や変形を正確に予測できることが分かりました。ロボットが、キャップを回すためにどれほどの力が必要か、あるいは柔らかい表面がどのように変形するかを予測するとき、それらの予測は実際の物理的現実と密接に一致していました。この、物理学を内部的にシミュレートする能力こそが、ロボットに「常識」を与えているのです。これにより、システムは「もし強く押しすぎれば物体が滑るかもしれない」、あるいは「もしゆっくり回しすぎればタスクに時間がかかりすぎる」といったことを理解できるようになります。視覚と触覚の組み合わせから導き出された、この暗黙的な物理学の知識こそが、ロボットに流動性と自信を持った行動を可能にしているのです。

こうした成功にもかかわらず、著者らは自らの研究の限界についても慎重に述べています。このシステムは触覚センサーの精度に大きく依存しており、もしセンサーにノイズが入ったり校正が狂ったりすれば、ロボットの性能は低下する可能性があります。加えて、現在のセットアップでは、人間がテレオペレーション・システムを使用してタスクを実演する必要がありますが、その際オペレーターには触覚が得られません。これは、もしオペレーターが物体を感じることができれば行うであろう微細な調整を、訓練データが完全には捉えきれていない可能性があることを意味します。また、研究者らは、現在のモデルは多様な触覚データに基づいて大規模に訓練されているわけではないことも指摘しており、将来的な改善は、より幅広い物理的相互作用にシステムをさらすことから得られる可能性があると示唆しています。

この研究は、ロボットの知能に対する考え方の転換を象徴しています。単に速い、あるいは強いロボットを作るのではなく、物理的な世界を動的で相互作用的な場所として理解できるマシンを作ることに焦点を当てています。行動の結果を想像し、状況に応じて感覚を適応させる能力をロボットに与えることで、研究者たちは、単にスクリプトに従う機械というよりも、真の相互作用が可能なエージェントとしての感覚を持つシステムを作り上げました。技術が成熟するにつれ、これらのシステムが、料理や掃除から高齢者の介護に至るまで、人間の生活を定義する複雑で接触の多いタスクを、私たちと同等の器用さで実行できるようになることが期待されています。前進への道筋は、センサーを洗練させ、訓練データを拡大し、「見る」「感じる」「行う」の間の溝を埋め続けることにあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →