COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows
本論文は、構築を型付きグラフ編集として扱い、修復のために視覚言語モデルによる検証器を活用し、過去の実行データを段階的に開示されるスキルライブラリへと蒸留することで、エージェントの信頼性と性能を大幅に向上させる自己進化型エージェントフレームワークであるCOMFYCLAWを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、友人の説明に基づいて、非常に具体的で複雑なケーキを焼こうとしているところだと想像してください。単に「ケーキを作って」とメモを書くのではなく、適切なオーブンを選び、生地を混ぜ、温度を設定し、デコレーションを行うといった、レシピの全工程を一から構築しなければなりません。もしケーキが焦げてしまったり、フロスティングの色が違ったりしたら、次に挑戦する前に、なぜそうなったのかを突き止め、レシピを修正しなければなりません。
これは、COMFYCLAWがやっていることと全く同じです。ただし、ケーキを作る代わりに、コンピューターのための画像生成ワークフローを構築します。
以下は、日常的な比喩を用いた、その仕組みの簡単な解説です。
1. 問題点:「一度きりの」シェフ
通常、AIが画像を生成しようとする時、それは一食ごとにすべてを忘れてしまうシェフのように振る舞います。もしあなたが「6つの青いドーナツ」と頼み、AIが5つしか作らなかった場合、AIは単に次の時に文章を書き直そうとするだけかもしれません。AIは、なぜ数を間違えたのか、あるいはなぜドーナツの見た目が変だったのかという理由を覚えていません。それは、トースターの設定を調整することを学ばずに、何度もパンを焦がし続けるシェフのようなものです。
2. 解決策:「自己進化する」マスターシェフ
COMFYCLAWは、AIを「学んだ教訓のレシピ本」を持つマスターシェフへと変えるシステムです。これには主に3つの構成要素があります。
ワークショップ(ハーネス):
単に文章を書くのではなく、AIは視覚的なワークショップ(ComfyUIと呼ばれます)の中で作業します。これは、巨大なレゴブロックのボードのようなものだと考えてください。各ブロックはプロセスの一ステップ(例:「色を加える」「形を変える」「質感を加える」)を表しています。AIはこのブロックを組み合わせたり、動かしたり、入れ替えたりすることができます。これにより、AIは単にプロンプトを入力するよりも、はるかに高い制御力を得ることができます。インスペクター(検証器):
AIがワークフローを構築し、画像を生成した後、別のAI(視覚言語モデル)が厳格な検査官として機能します。この検査官は、画像と元のリクエストの両方を確認します。- 例: もしあなたが「赤いマットの上にいる猫」と頼み、猫が青いマットの上にいた場合、インスペクターは単に「ダメだ」と言うだけではありません。「マットは赤ではなく青です。また、猫の足は3本ではなく4本あります」と伝えます。
- 重要なのは、インスペクターが、青いマットを修正するためにどのレゴブロックを変更すべきかを、構築者に対して正確に指示することです。
レシピ本(スキルの進化):
これが魔法の部分です。AIが間違いを犯してそれを修正したとき、あるいは素晴らしいコツを見つけたとき、COMFYCLAWはその経験をただ捨て去ることはありません。AIはそれを「スキル」としてデジタルレシピ本に書き込みます。- シナリオ: AIは、「6つのドーナツ」を得るためには、レゴボードに特定の「カウント用ブロック」を追加する必要があることを学びます。
- 進化: 次回、あなたが「6つのドーナツ」と頼んだとき、AIはゼロから始めることはありません。レシピ本を開き、「6つのドーナツ・スキル」を見つけ出し、即座に使用します。時間が経つにつれ、レシピ本にはこうした再利用可能なテクニックが何百ものスキルとして蓄積され、AIの仕事はより速く、より優れたものになっていきます。
3. 実践における仕組み
この論文では、このシステムを、複雑な画像のリクエスト(例:「正確に6つのベーグルを持った犬」や「3つのガラス製の豚」など)を含む4つの異なる「課題(ベンチマーク)」でテストしました。
- COMFYCLAWなしの場合: AIはレシピを推測しようとしますが、数や色を正しく指定できず、失敗することがよくあります。過去の教訓を記憶することなく、試行錯誤を繰り返します。
- COMFYCLAWありの場合: AIはレゴボードを構築し、インスペクターがチェックを行い、もし失敗した場合は、AIが特定のブロックを修正します。その後、その修正をレシピ本に書き込みます。テスト終了時までに、AIは318個のユニークなスキルを作り出しました。
4. 結果
論文では以下のことが判明しました。
- より優れた画像: COMFYCLAWが作成した画像は、記述に対する正確性(例:オブジェクトの正しい数など)がはるかに高く、よりリアルに見えました。
- 人間の好み: 人間が画像を見た際、スキルを記録するレシピ本を持たないシステムが作った画像よりも、COMFYCLAWが作った画像を好みました。
- 真の学習: システムは単に答えを暗記したのではなく、**手順(プロシージャ)**を学習しました。例えば、特定の「アニメスタイルの」キャラクターを扱う方法や、シーン内のオブジェクトを配置する方法を学習し、それらを将来のあらゆるリクエストに再利用できるようにしました。
まとめ
COMFYCLAWは、AIに自己更新型の取扱説明書を与えるようなものです。すべての試行の後に間違いを忘れるのではなく、間違いから学び、解決策を書き留め、その知識を使って毎回より良く、より複雑な画像を構築します。これは、一度限りの試行錯誤のプロセスを、継続的な改善のサイクルへと変えるものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。