← 最新の論文
🤖 machine learning

ff-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

本論文は、ff-ダイバージェンスすべてに平均二乗誤差アプローチを拡張する損失関数の一族であるff-軌道バランスを導入し、これにより対応するオンポリシーff-ダイバージェンス勾配の特定の最適化特性(モードカバリングなど)を保持しつつ、オフポリシーデータを用いて生成モデルや大規模言語モデルの訓練を可能にする。

原著者: Jake Fawkes, Jason Hartford

公開日 2026-05-18
📖 1 分で読めます☕ さくっと読める

原著者: Jake Fawkes, Jason Hartford

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

広大で暗い洞窟システムをロボットに探索させることを想像してください。この洞窟には多くの隠された部屋(「モード」と呼ばれる)があり、その中には金(高い報酬)が含まれているものもあれば、単に空っぽだったり危険だったりするものもあります。あなたの目標は、ロボットにたった一つの大きな金鉱を見つけてそれ以外を無視するのではなく、できるだけ多くの異なる金の部屋を見つけるように教えることです。

この論文は、新しい薬の開発のための分子生成、芸術の創造、あるいはコードの作成など、どのようなロボットを訓練する場合でも役立つ、新しい一連の「教育ツール」(損失関数)を紹介しています。

以下に、簡単なアナロジーを用いた論文のアイデアの概要を示します。

1. 問題点:「ゴールドラッシュ」対「探検家」

過去において、これらのロボットを教える標準的な方法は「ゴールドラッシュ」のようでした。ロボットは少しの金がある場所を見つけると興奮し、その場所でのみ時間を費やして掘り進めました。洞窟内の他の金鉱はすべて無視されたのです。

  • 技術的な用語では: これは「モード探索(mode-seeking)」と呼ばれます。モデルは少数の高確率の答えに収束し、残りの多様性を無視します。
  • この論文の目標: 私たちは「モード網羅(mode-covering)」を望みます。ロボットが広がり、小さなものも含めて洞窟のすべての金鉱を探索し、洞窟の完全な地図を得ることを望むのです。

2. 古いツール:「二乗 KL」損失

最近、研究者たちは「二乗誤差」法(ロボットが考えていることと、あるべきと考えていることの間の距離を測定する)を用いてロボットを教える巧妙なトリックを発見しました。

  • アナロジー: 教師が生徒を採点することを想像してください。生徒が答えを間違えた場合、教師は単に「不正解」と言うだけでなく、その間違いの「二乗」を計算します。
  • 利点: この方法は非常に安定しています。生徒が生きている授業ではなく、過去のノート(オフポリシーデータ)から学習している場合でも機能します。
  • 欠点: 安定しているとはいえ、この特定の「二乗」法は依然としてゴールドラッシュのように振る舞います。それは自然とロボットを少数の答えに集中させ、洞窟の多様性を見逃させてしまいます。

3. 新しい解決策:「f-軌道バランス」ファミリー

著者たちは、「二乗」法がはるかに大きな教育ツールのファミリーのたった一つの特定のバリエーションに過ぎないことに気づきました。彼らはこのファミリーをf-軌道バランスと呼んでいます。

このファミリーをラジオのダイヤル音量ノブだと考えてください。

  • ダイヤルを一方(低い数値)に回す: これにより、スーパー探検家のようなツールが得られます。これらのツールは、ロボットに到達が難しいものも含めて、ありとあらゆる金鉱を見つけ、広範囲に探索させるように強制します。これは、最も明白なものだけでなく、機能する可能性のある「あらゆる」分子を見つけたい創薬において非常に役立ちます。
  • ダイヤルをもう一方(高い数値)に回す: これにより、金掘りのようなツールが得られます。これらのツールは、ロボットに小さな鉱山を無視し、最大で最も明白な金の山に集中的に焦点を当てるよう指示します。これは、単一の最良の答えだけを望む場合に役立ちます。
  • 中間: ダイヤルをその中間のどこかに設定することで、探索と集中の両方を組み合わせた結果を得ることができます。

4. これが重要である理由

この論文は主に二つのことを証明しています。

  1. 「魔法のスイッチ」: 彼らは、標準的な「二乗」ツールをこれらの新しい「ダイヤル」ツールのいずれかに交換しても、数学的に完全に機能することを示しました。ロボットは同じように学習しますが、性格(より探検家的か、より集中的か)は異なります。
  2. 安定性: 古いツールと同様に、これらの新しいツールも、ロボットが過去のデータ(オフポリシー)から学習している場合でも機能します。これは、非同期(ロボットが少し前に生成されたデータから学習する)で訓練が行われることが多い大規模言語モデル(LLM)などの実世界での応用において不可欠です。

5. 実世界でのテスト(洞窟の地図)

著者たちは、これらのツールを三つの異なる「洞窟」でテストしました。

  • グリッドゲーム: 四隅に金がいっぱいある単純なコンピュータ迷路です。標準的なツールは一つの隅しか見つけませんでしたが、新しい「探検家」ツールは四隅すべてを素早く発見しました。
  • 分子発見(SynFlowNet): 彼らは新しい化学分子を生成しようと試みました。「探検家」にダイヤルを合わせることで、同じ数種類の化学物質の変種だけでなく、潜在的な薬となり得る、はるかに多様なユニークな分子を生成しました。
  • 言語モデル(LLM): 彼らは AI モデルを数学問題の解決に調整しました。新しいツールにより、AI は同じ答えを繰り返すループに陥ることなく、問題解決の異なる方法を探索できるようになりました。これは、訓練データが遅延している(非同期である)場合でも機能しました。

まとめ

この論文は、新しい種類のロボットを発明したわけではありません。代わりに、それらを訓練する方法に関する新しい一連の指示を発明しました。

  • 古い方法: 「最大の金鉱を見つけて、そこで掘れ。」(安定しているが、退屈)
  • 新しい方法: 「ここにダイヤルがある。金掘りにも、スーパー探検家にも、その中間の何にでもなれる。そして、どちらを選んでも、訓練は安定しており、過去のデータでも機能する。」

これにより、エンジニアは訓練プロセスを壊すことなく、AI モデルがどれほど創造的か、あるいは集中的であるかを制御するためのシンプルなノブを手に入れました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →