← 最新の論文
💬 NLP

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

本論文は、テキスト勾配を通じて表現の非効率性を制御することで大規模言語モデルにおけるプロンプト分布の過剰適合を軽減し、既存の最適化手法と比較して分布外汎化性能を著しく向上させる正則化フレームワークであるTextRegを導入する。

原著者: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの文字通り受け取るロボットにパズルの解き方を教える場面を想像してください。あなたはロボットに一連の指示(「プロンプト」)を与えます。

過去、研究者たちがロボット自身のフィードバックを用いてこれらの指示を自動的に改善しようとした際、奇妙な問題が発生しました。指示は次第に長くなり、「数が 7 の場合は X を行う」「対象がトマトの場合は Y を行う」といった、細かく具体的な規則で埋め尽くされるようになったのです。

当初、これは素晴らしいことのように思えました。なぜなら、ロボットは練習パズルで完璧なスコアを達成したからです。しかし、以前見たことのない新しいパズルを与えると、ロボットは惨めに失敗しました。まるで、特定の練習テストの答えを丸暗記したものの数学の原理を理解していない学生が、少し異なる問題に直面すると解けなくなってしまうようなものです。

著者らはこれを**「プロンプト分布的過学習(Prompt Distributional Overfitting)」**と呼びます。簡単に言えば、指示が特定の練習例に「固執」しすぎ、現実世界に対応する能力を失ってしまったのです。

解決策:TextReg(「賢い編集者」)

この論文では、TextRegと呼ばれる新しい手法が紹介されています。TextRegは、ロボットが指示を作成する過程を監視し、無秩序になるのを防ぐ、厳格で賢明な編集者だと考えてください。

TextRegの仕組みを、3 つの簡単な比喩を用いて説明します。

1. 「二重確認」フィルター(二重証拠勾配精製)

ロボットが新しい規則を提案すると想像してください。例:「トマトは常に野菜として数える」。

  • 従来の方法: ロボットは、練習テストの特定のトマトの例で機能したという理由だけで、この規則を採用するかもしれません。
  • TextReg の方法: TextReg は 2 つの質問を投げかけます。
    1. 「この規則は、この特定のトマトの例だけのために機能しただけではないか?」(局所チェック)
    2. 「この規則は、他の果物や対象物に対しても以前に機能したことがあるか?」(大域チェック)
      もし規則がトマトに対してのみ機能し、他の場所では確認されていなければ、TextReg はそれを破棄します。TextReg が保持するのは、「すべての果物を数える」のように、広範で有用な規則だけです。

2. 「フィットネストラッカー」(意味編集正則化)

指示が変更されるたびに、TextReg はプロンプトの「健康状態」をチェックします。それは 2 つの側面を見ます。

  • 長さ: 指示は不必要に長くなっていないか?(文に必要以上に多くの単語を追加するようなもの)
  • 範囲: 指示は狭くなりすぎていないか?(特定の曜日のみ適用される規則を追加するようなもの)
    指示が長くなりすぎたり、特定化されすぎたりすると、TextReg は「脂肪分を削ぎ、規則を広げよ」と伝える「修正信号」を生成します。まるでパーソナルトレーナーが「食事に加えるジャンクフードを止めろ!」と叫ぶようなものです。

3. 「誘導された書き換え」(正則化誘導プロンプト更新)

最後に、ロボットが指示を書き換える際、単にタスクのフィードバック(パズルの解き方)に耳を傾けるだけでなく、「フィットネストラッカー」の声にも耳を傾けます。

  • タスクが「トマトに関する規則を追加せよ」と言っても、フィットネストラッカーが「特定化しすぎないで」と言っている場合、TextReg はロボットに妥協点を見つけるよう強制します。例えば、トマトだけでなく「野菜」全般に関する規則に書き換えるかもしれません。

結果:なぜ重要なのか

著者らは、論理パズルや数学問題など、さまざまな推論タスクでこれをテストしました。その結果、以下が明らかになりました。

  • 従来の手法(TextGrad や REVOLVE など)は、練習テストでは機能するものの、同じタスクの新しいより困難なバージョンでは失敗する、長く無秩序な指示を作成することが多かった。
  • TextRegは、より短くクリーンな指示を作成した。規則が広範であり、特定の例に縛られていないため、ロボットは新しい未見の問題(研究者らが「分布外(Out-of-Distribution)」一般化と呼ぶもの)に対して、はるかに優れたパフォーマンスを発揮した。

実際、TextReg は困難なタスクにおいて、従来の手法と比較して最大**16.5%**の精度向上を実現しました。

結論

TextReg は、AI への指示作成を、良い教科書を書くことと同様に扱います。良い教科書は、これまで見たことのあるすべての例を単に列挙するのではなく、一般的な原理を教えるべきです。そうすれば、これまで見たことのない問題も解けるようになります。TextReg は、AI の指示がこれらの原理に焦点を維持し、練習テストを丸暗記するのを防ぐことを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →