← 最新の論文
💻 computer science

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Poly-OPDは、ピクセルレベルの再エンコーディングとDINOv2による教師あり学習を通じて潜在空間を橋渡しすることにより、相容れないテキスト・トゥ・イメージ・モデルからの相補的な強みを単一のコンパクトなフロー・マッチング・スチューデントへと集約する、ヘテロジニアスなマルチティーチャー・オンポリシー蒸留フレームワークであり、勾配互換性のあるアダプターとギャップを意識したカリキュラムを採用することで、構成的な指示への追従性と審美的な整合性の両面において優れた性能を実現している。

原著者: Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

機械が推測と修正によって学習する「テキストから画像への生成」として知られる分野によって、芸術が創造される世界を想像してみてください。このデジタル・アート・スタジオでは、「教師」とは言葉を絵へと変える巨大で複雑なモデルのことです。しかし、ここに落とし穴があります。人間の専門家と同様に、これらの機械にも異なる専門分野があるのです。あるものは、息をのむほど美しくリアルなシーンを作り出す名画家のマスターですが、「3匹の猫」や「左側にある赤いボール」といった細かな指示を見落とすかもしれません。また別のものは、指示には完璧に従うものの、生成される画像が少し平坦だったり、奇妙に見えたりする厳格な会計士のような存在です。大きな問題は、これらの専門家が内部的に異なる「言語」を話していることです。彼らは絵を描くために異なる設計図と数学を使用しているため、簡単にメモを交換したり、脳を結合させたりすることはできません。もし、美しさと正確さの両方を備えた画像が欲しい場合、通常は2つの巨大で高価なコンピュータを同時に走らせる必要があり、それは低速で無駄な作業となります。科学者たちは、これら異なる専門家を、混乱することなく両方の仕事をこなせる、より小さくスマートな一つのモデルへと融合させる方法を模索してきました。

この論文は、2つの非常に異なるAI教師を、単一のコンパクトな生徒モデルへと見事に融合させる、マスター・翻訳者兼コーチとして機能するPoly-OPDという巧妙な新手法を紹介しています。研究者たちは、「美しい」教師(FLUX.1-dev)と「正確な」教師(Z-Image)を取り上げ、より小さな生徒モデル(SD3.5の25億パラメータ版)にその両方を教え込みました。その魔法のトリックは、生徒に教師の内部的な思考(それらは互換性のない言語で記述されています)をそのままコピーさせるのではなく、生徒に一度絵を描かせ、その絵を誰もが理解できる共通の「ピクセル」言語に変換してから、教師にそれを修正させるという点にあります。教師は単に「よくできました」と言うだけではありません。教師は実際に絵を描き直し、間違いを正すのです。そして生徒はその修正から学びます。生徒が2つの異なるスタイルを同時に学ぼうとして混乱しないように、システムは脳の中に特別な「切り替え可能」なパーツを使用しています。全体像を見るような一般的な注意(アテンション)を扱う部分は共有しますが、数えたり色付けしたりといった特定のタスクのための部分は個別に保持します。さらに、このシステムは練習の内容についても賢明です。生徒がまだ苦手としているスキルを見極め、すでに習得していることに時間を浪費するのではなく、それらのスキルに重点を置いてトレーニングを行います。

結果は極めて印象的です。この手法を用いることで、小さな生徒モデルは単に平均的なレベルになっただけでなく、特定のタスクにおいて2つの巨大な教師の両方を上回る成果を上げました。「猫がテニスラケットの右側にいる」といった複雑な指示に従えるかをチェックするGenEvalというテストにおいて、生徒のスコアは67.3から73.3へと跳ね上がり、120億パラメータの教師と60億パラメータの教師の両方に打ち勝ちました。視覚的な美しさと人間の好みを測るテスト(HPSv3)では、スコアが9.34から11.35へと上昇しました。この成功は、生徒が教師の完璧な絵をただ暗記するのではなく、教師によって修正された自分自身のミスから学ぶという「オンポリシー」のアプローチによるものだと論文は示唆しています。研究者たちは、もし生徒に教師の内部データから直接学ぼうと強制すれば、「言語」が一致しないために失敗することを発見しました。また、特別な切り替え可能なパーツを使用しなければ、スキルが衝突してモデルの性能が悪化することも明らかにしました。最終的に、Poly-OPれるPoly-OPDは、2つの巨大なコンピュータを走らせることなく、美しい芸術家と正確な設計士の間を切り替えられる、単一の小さく切り替え可能なモデルを構築できることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →