Decoupling Task-Solving and Output Formatting in LLM Generation
本論文は、問題解決を厳格なフォーマット要件から切り離し、推論を妨げることなく遵守を保証する専用のフォーマット推定モジュールを通じて、複雑なタスクにおける大規模言語モデルの性能を向上させるデコーディング・フレームワークであるDeco-Gを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、非常に賢いロボットに難しい数学の問題を解かせようとしています。しかし、同時に「最終的な答えは42です」といった非常に厳格で決まった形式で書くよう要求もしています。通常、この「深く考える」部分と「完璧に書く」部分を一つの大きな指示に混ぜてしまうと、ロボットは混乱してしまいます。それはまるで、綱渡りをしながらジャグリングをするようなものです。多くの場合、ロボットはボール(数学)を落とすか、あるいはロープ(フォーマット)でつまずいてしまいます。
Haikang Deng氏とその同僚たちによる論文では、この問題を解決するために「DECO-G」と呼ばれる新しいシステムを紹介しています。DECO-Gを、二人のスペシャリストによる素晴らしいチームワークだと考えてください。それは、「問題解決者(Problem Solver)」と「フォーマット警察官(Format Police Officer)」です。
問題点:絡まり合った混乱
従来の方法では、「この数学の問題を解き、かつ、必ずJSONボックスの中に答えを書いてください」という一つの巨大なプロンプトをロボットに与えていました。論文では、この「絡まり合い(entanglement)」がロボットの脳に悪影響を与えると主張しています。ロボットがこれら両方を同時にこなそうとすると、フォーマットのルールを満たすために、数学の計算ミスをしてしまうことがあるのです。
著者らは、単にロボットに「注意してください」と言ったり、厳格な既成のテンプレート(例えば、ステップごとに厳格なJSONスキーマに従うよう強制すること)を使用したりすることが、最善の解決策ではないと明確に反論しています。これらの硬直した手法は、しば ولو フォーマットが完璧に見えたとしても、ロボットの思考を途中で遮断してしまい、一貫性のない回答や誤った数学的回答を招くことが多いことを彼らは発見しました。
解決策:二チーム戦略
DECO-Gは仕事を分割します。
- 問題解決者(LLM): これがメインのロボットです。これは数学の問題だけを受け取ります。フォーマットについては一切気にしません。ただ考え、推論し、自由に問題を解くだけです。
- フォーマット警察(FEM): これは別個の、より小さなヘルパーモジュールです。これは数学を解くことはありません。その唯一の仕事は、ロボットの出力を監視し、「おい、終わりが近づいているぞ。数字を出す前に『最終的な答えは』と言う必要があるぞ」とささやくことです。
魔法は、彼らがどのように会話するかで行われます。フォーマット警察は、特別な「確率的先読み(probabilistic lookahead)」(未来を予測するという高度な方法)を使用して推測します。「もしロボットがいま『The(その)』と言ったら、文章を正しく終わらせる確率はどのくらいか?」と。もし確率が低い場合、警察はロボットの思考を強制的に止めることなく、次の言葉の選択を優しく誘導して、軌道に戻るように導きます。
特殊な武器
このチームアップを高速かつコンピューターに負荷をかけずに機能させるために、著者らは3つのクールなトリックを導入しました。
- 指示認識蒸留(Instruction-Aware Distillation): フォーマット警察をランダムで退屈なチャットで訓練するのではなく、ロボットが実際に問題を解こうとしている時にどのように振る舞うかに特化して訓練しました。これにより、警察はロボットが次に何をしようとしているのかを知る上で、よりスマートになりました。
- 柔軟なトライ構築(Flexible Trie Building): 答えがどのような形になるかの全経路を描いた地図を想像してください。通常、答えの長さが異なる場合、これらの地図は巨大で乱雑になります。著者らは、パスを統合する「柔軟な」地図を構築することで、コンピューターがすべての可能性をチェックしようとしてオーバーフローすることを防ぎました。
- HMM状態プルーニング(HMM State Pruning): フォーマット警察は、数千の隠れ状態を持つ巨大な脳を持っています。著者らは、ほとんどの場合、ロボットはごくわずかな状態にしか関心を持っていないことに気づきました。そこで、警察にそれ以外の部分を無視するように指示したことで、精度をほぼ維持したまま、計算量を約13倍削減しました(1ステップあたり約1.08 GFLOPsから0.08 GFLOPsへ)。
数字が示す結果
チームはこの手法を3つの異なる課題でテストしました。
- 数学問題 (GSM8k): 小学校レベルの算数を解く際、DECO-Gは他の手法を一貫して上回りました。例えば、Llama-3.1-8Bモデルにおいて、DECO-Gは**85.2%**の正答率を維持しながら、**100%のフォーマット遵守率を達成しました。対照的に、「Outlines」と呼ばれる硬直した手法は81.3%の正答率であり、標準的な「プロンプトのみ」のアプローチは82.3%**の正答率でしたが、フォーマットの遵守には失敗することがほとんどでした。
- イベント抽出: ニュース記事から特定の詳細を抽出するよう求められた際、DECO-Gは「誰が何をしたか」を特定するスコア(Argument Id メトリック)を(Llamaにおいて39.4まで)向上させました。
- LLM-as-a-Judge: ロボットが要約を採点する場合、DECO-Gは人間による判定との整合性を高め、最高の平均相関係数(CoherenceについてはLlamaで0.418)を達成しました。
結論
この論文は、「思考」と「フォーマット」を分離することで、数学的に正しく、かつ完璧にフォーマットされた回答という、両方の良いとこ取りができることを示唆しています。著者らはこれを実際のデータセットを用いて測定し、DECO-Gが、一度にすべてを行おうとしたり、硬直した制約を課したりする方法よりも一貫して優れていることを明らかにしました。
ただし、いくつかの注意点もあります。このシステムは、あらゆるロボットに対して即座に機能する魔法の杖ではありません。使用する各ロボットモデルに対して、新しい「フォーマット警察」を訓練する必要があります。また、一部のモデル(Qwenシリーズなど)では、ロボットの集中力が非常に高いため、フォーマット警察に指示を聞かせるためには、より強く押し進める(制御係数 γ=2 を使用する)必要があります。
要するに、DECO-Gは、もしロボットを数学の天才であり、かつフォーマットの完璧主義者にしたいのであれば、同時に両方をさせるべきではないと教えてくれています。ルールを扱うためのパートナーを与えれば、その才能を最大限に発揮させることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。