← 最新の論文
🤖 AI

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexusは、学習、推論、および環境コンポーネントを分離することで、効率的なリソース共有、クロステナント・スケジューリング、およびグループバッチングを可能にし、従来の孤立したシングルテナント実行と比較して総GPU時間を削減し利用率を向上させる、事後学習型Vision-Language-Action (VLA) モデルのための統合されたマルチテナントサービスです。

原著者: Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai
公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが人間と同じように学習できる世界を想像してみてください。散らかった部屋を見て、「片付けて」という指示を理解し、どうやっておもちゃを拾うかを考え出すのです。これは、Vision-Language-Action (VLA) モデルと呼ばれるエキサイティングな分野です。これらのモデルを、ロボットの「脳」であり、目(視覚)、声(言語)、そして筋肉(行動)を組み合わせたものだと考えてください。ロボットに実際に役立つことをさせるためには、科学者はそれを「ポストトレーニング(事後学習)」しなければなりません。これは、一般的な知識を持つ賢い学生に、靴紐を結んだり瓶を開けたりといった特定のスキルを教えることに似ています。

しかし、こうしたロボットの脳を教えることは、非常にコストがかかり複雑です。現在、研究者がロボットを訓練したい場合、通常は自分専用の巨大で高価なコンピューター(GPU)をレンタルしなければなりません。それは、たった数回の腕立て伏せをするためだけに、プライベートなジム全体をレンタルしているようなものです。重りをセットしたり休憩したりしている間も、マシンはアイドル状態のままですが、それでも1時間分の料金を支払わなければなりません。この「1体のロボットに1つのジム」というアプローチは、無駄が多く、多くの人が同時にロボット学習を実験することを困難にしています。

そこで、JD AI Infraと複数の大学の研究者による新しいアイデア、JoyNexusが登場しました。彼らはロボットの脳のための「共有ジム」を提案しています。コンピューター全体をレンタルする代わりに、複数の研究者が同じ強力なマシンを安全かつ効率的に共有できるのです。この論文では、多くのチームが互いにぶつかることなく、同時に異なるロボットを訓練できるように、システムが「超スマートなコーチ」として機能する仕組みを紹介しています。作業を巧みに整理することで、JoyNexusは、高度なロボット学習をより速く、より安価に、すべての人にとって身近にできることを示唆しています。

ロボットの脳のための「共有ジム」

では、JoyNexusは実際にどのように機能するのでしょうか? 忙しくハイテクなジムを想像してみてください。従来の方法では、トレーニングをしたい場合、トレッドミル、ウェイト、鏡を備えた部屋全体をレンタルし、そこにはあなた一人しか入れませんでした。もしあなたが水を飲んだりスマートフォンをチェックしたりするために立ち止まっても、その部屋は空の状態のままですが、それでも全時間を支払う必要がありました。

JoyNexusはルールを変えます。ジムを以下の3つの主要なゾーンを持つ、活気ある共有スペースへと変貌させます。

  1. ブレイン・ゾーン(モデル・トレーニング・サービス): ここでは、最も重い作業が行われます。ロボットの「脳」(画像や言葉を理解する、大きく複雑な部分)は、中央の共有スポットに置かれます。これは、誰もが使える巨大で高価なトレッドミルのようなものです。
  2. マッスル・ゾーン(アクション・モジュール): 各ロボットには、独自の「筋肉」や特定のスキル(クローのためのグリッパーや、車の車輪など)があります。JoyNexusでは、これらの特定の部分は各チームごとに分離して保持されます。あなたは、共有のトレッドミルを使うために、自分自身のユニークなウェイトを持ち込むのです。
  3. 障害物コース(環境サービス): これはロボットが練習を行うシミュレーターです。仮想のキッチン、工場のフロア、あるいはリビングルームかもしれません。

JoyNexusの魔法は、その交通管理にあります。「マスター・サービス」(非常に整理整頓されたジムのマネージャーのようなもの)が、いつ誰がトレッドミルに乗るかを決定します。もしチームAがロボットのシミュレーション完了を待っており、チームBが計算の更新を行う準備ができている場合、マネージャーは瞬時に彼らを入れ替え、トレッドミルが止まることがないようにします。

「グループ・バッチング」のトリック

著者たちが**グループ・バッチング(集団バッチ処理)**と呼んでいる、非常に優れた機能があります。コーヒーショップを想像してみてください。もし一人がラテを注文したら、バリスタは、その一杯のためだけにマシンを起動し、豆を挽き、ミルクを蒸発させなければなりません。もし10人が同時にラテを注文したら、バリスタは10人分を一気に挽き、大きなピッチャーでミルクを一度に蒸発させることができるので、一杯あたりのプロセスがはるかに速くなります。

JoyNexusは、ロボットの訓練においてこれを行います。多くの場合、異なるチームは共有の「脳」(VLAモデル)に対して小さなリクエストを送信します。もしシステムがこれらを一つずつ処理しようとすると、コンピューターは開始と停止を繰り返して時間を浪費してしまいます。その代わりに、JoyNexusは、他のチームからのリクエストがあるかどうかを確認するために、ほんのわずかな時間を待ちます。もしリクエストがあれば、それらを一つにまとめます。システムは、共有の「脳」の部分を全員分一度に実行し、その後、結果を各チームに分割して、それぞれの「筋肉」の訓練を完了させるのです。

論文では、これが非常にうまく機能することが示されています。特に多くのチームが小さなデータバッチを送信している場合に効果的です。シミュレーションにおいて、8つの異なるチームからのリクエストをグループ化した際、共有の「フォワードパス」(脳がデータを見る部分)の速度が大幅に向上しました。一部のモデルでは、これにより共有部分の処理が、一つずつ行うよりも2.21倍速くなりました。

彼らが発見したこと(そして発見できなかったこと)

研究者たちは、4つの異なるチームをシミュレートするシナリオでJoyNexusをテストしました。3つのチームは仮想環境(LIBEROやManiSkillなどのシミュレーション)でタスクを行うロボットを訓練しており、1つのチームは静的なデータセットを用いて教師あり微調整(Supervised Fine-Tuning)を行っています。

彼らは、この「共有ジム」のアプローチを、各チームがタスクを順番に実行する従来の「プライベートジム」方式と比較しました。結果は有望でした。

  • 無駄の削減: 作業をオーバーラップさせることで、JoyNexusは総「GPU時間」(高価なコンピューターが稼働している時間)を**28.3%**削減しました。
  • 利用効率の向上: マルチテナント設定では、共有コンピューターは**41.3%の時間稼働していましたが、隔離された設定ではわずか20.8%**でした。これは、効率がほぼ2倍になったことを意味します!
  • 混乱の回避: 極めて重要なことに、システムはすべてを安全に保ちました。チームは巨大な脳を共有していましたが、彼ら独自の「筋肉」、データ、および進捗状況は完全に隔離されていました。論文は、各チームの学習曲線(ロボットがいかに早く上達するか)が、単独で訓練していた場合と全く同じであることを示しています。

これらの結果は、あくまでシミュレーションとワークロードのテストから得られたものであり、数千台のロボットを用いた実世界での展開によるものではないことに注意が必要です。著者らは、このアプローチがコストや時間を節約できる可能性があると示唆していますが、あらゆる現実世界のシナリオで完璧に機能することをまだ証明してはいません。また、システムはリソースの共有には優れていますが、現在はユーザーがデータのフォーマットに関する特定のルールに従うことに依存していることも指摘しています。もしあるチームが、標準的な「ジム」のルールに適合しない、全く風変わりでカスタムされたロボット設計を使用したい場合、参加するのが難しくなる可能性があります。

ロボット訓練の未来

論文は、JoyNexusがロボット学習を身近なものにするための大きな一歩であると結論づけています。研究者がプライベートなスーパーコンピューターを借りるために100万ドルを必要とする代わりに、使用した時間分だけのコストを支払って、他者と共有できる可能性があります。

しかし、著者らは現実的です。これが実世界で機能するためには、セキュリティ(あるチームが誤って別のチームのロボットを壊さないようにする)、価格設定(共有時間に対していくら請求するか)、および柔軟性(ユーザーが独自の変わったシミュレーターを持ち込めるようにする)に関するより優れた方法が必要であると認めています。彼らは、将来のバージョンのシステムは、ジムがどれほど混雑しているかに基づいてリソースを自動的に調整するなど、よりスマートになる可能性があると示唆しています。

要約すると、JoyNexusは、ロボット訓練の未来が、各研究者のために構築された巨大で孤立した要塞を作ることではないことを示唆しています。それは、誰もが共に学び、高価な設備を共有し、ロボットをかつてないほど速く動かすことができる、活気あるコミュニティセンターを築くことなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →