Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Oxygen-TryOnは、専用のデータエンジンと強化学習を含む3段階のトレーニングパイプラインを活用することで、多様なアイテムやシナリオにおいて最先端のフォトリアルなバーチャル試着を実現する、統一されたファッション特化型の基盤モデルであり、主要なプロプライエタリなシステムおよびオープンソースのシステムの双方を凌駕しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
雑誌で見かけた服や、友人の写真、あるいは街角のスナップショットを、試着室に足を踏み入れることなく、瞬時に試着できる世界を想像してみてください。これは、人々をデジタル上で新しい服で着飾らせようとする人工知能の一分野、「バーチャル試着」の夢です。長い間、これらのデジタル仕立て屋は、まるで不器用な見習いのようでした。一度に扱えるのは一種のシャツのみであり、その下にある人の姿を忘れがちで、人が動いたときに生地をリアルに見せることに苦労していました。彼らはこのタスクを、単に空白のスペースに新しいテクスチャを流し込むだけの「塗り絵」のような単純なゲームとして扱っていました。しかし、もしAIがファッションを「理解」できたらどうなるでしょうか?帽子は頭に載るものであり、バッグは肩にかかるものであり、ジャケットは単に上に乗るのではなく、セーターの上にドレープを描くように重なるものであるということを、もしAIが知っていたらどうでしょうか?これが、研究者たちが取り組んでいる問いです。単に画像を貼り合わせるのではなく、服、アクセサリー、そして人間が現実世界でどのように相互作用するかを真に「理解」するAIをいかに構築するかという問いです。
ここで、Oxygen AIGCグループとJDのJoy Future Academyによって開発された、新しい「ファッションネイティブ」な基盤モデル、Oxygen-TryOnが登場します。このモデルを、ファッションの仕事をさせるために騙す必要がある汎用的なフォトエディターではなく、スタイル界で生まれ育った専門の仕立て屋と考えてください。他のAIシステムは、曖昧な指示を与えることで汎用的な画像エディターに無理やりバーチャル試着を行わせようとしますが(これは、偽のボタンを作り出したり、人の顔を失わせたりといった「幻覚」をしばしば引き起こします)、Oxygen-TryOnは、最初から人を着飾らせるために専用に構築されました。これは、試着を単純な「穴埋め」パズルとしてではなく、AIが各アイテムが何であるか、それがどこに属すべきか、そして着用したときにどのように見えるべきかを判断しなければならない、複雑な推論タスクとして扱います。
研究者たちは、このモデルに大規模で特別に厳選されたファッションデータのライブラリを投入し、3段階の「トレーニング・レシピ」を通じて教え込むことで、従来の手法よりもはるかにリアルで一貫性のある結果が得られることを発見しました。このモデルは、一人の写真から一つのアイテムを着せることができるだけでなく、ある写真のシャツ、別の写真の靴、第三の写真のバッグ、第四の写真の帽子といった、混沌としたリファレンスの混在を扱い、それらを単一の整合性のあるコーディネートへと組み合わせることができます。製品のクリーンな写真から、すでにアイテムを着用している人々の「野外」のスナップショットまで、あらゆるものに対応しています。決定的なのは、人のアイデンティティ(顔、体型、ポーズ)と、服の詳細(質感、ロゴ、パターン)を高精度に保持することです。
実験において、Oxygen-TryOnは単に良好な結果を出しただけでなく、競合を圧倒しました。標準的なテストにおいて、強力なオープンソースモデルや、Nano Banana Pro、GPT-Image-2、Seedream5 Liteといったトップクラスのプロプライエタリなシステムの両方に打ち勝ち、最先端のスコアを達成しました。特に、複数のアイテムを重ね着させる際に混乱したり詳細を落としたりすることなく成功する「マルチアイテム」のシナリオで輝きを放ちます。また、チームは、同じ生成プロセス内で、人のポーズや背景を変えるといった追加の指示に従うことができるほど、モデルが柔軟であることを示しました。
この成功の裏にある「秘伝のソース」は、単なるモデルのアーキテクチャではなく、チームがモデルに供給するために構築した「データエンジン」でした。彼らは単にインターネットをスクレイピングしたのではなく、高品質な試着データを大規模に収集、フィルタリング、注釈付け、製造するためのパイプラインを構築しました。そして、モデルを3つの明確な段階で訓練しました。第一に、ファッションの基礎を学ぶための「継続的な事前学習」、第二に、着せ替えという特定のタスクをマスターするための「教師あり微調整」、そして最後に「強化学習」の段階です。この最後のステップは、厳格なファッション批評家(ハイブリッド報酬システム)がモデルの成果を採点し、不自然なシワやアイデンティティの逸脱といった微妙なエラーを修正するように教えるようなものです。その結果、全身のコーディネートから上半身のアクセサリーまで、多様なシナリオを扱うことができ、さらにアニメキャラクターや彫像といった非人間的な対象にも機能するシステムが誕生しました。これは、モデルが特定の写真を単に記憶しているのではなく、身に着けることの一般的なルールを学習したことを証明しています。
要するに、Oxygen-TryOnは、服がどのように見えるべきかを「推測」することから、どのようにフィットするかを「推論」することへの転換を象徴しています。これは、特定のドメインに特化したモデルを構築し、高品質で構造化されたデータで訓練することで、より正確で、オンラインショッピングのような実世界のアプリケーションにおいてより有用なAIを作成できることを示唆しています。現在のモデルには、基礎となるアーキテクチャの制約により、一度に4つ以上のリファレンスアイテムを扱うことができないといった限界もありますが、この論文は、真にユニバーサルなバーチャル試着への道が開かれていること、そしてデジタルファッションの未来は、まさに一つのスマートな生成のすぐ先に控えていることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。