← 最新の論文
🤖 AI

LZ Penalty: An information-theoretic repetition penalty for autoregressive language models

本論文は、LZ77の符号長に基づく情報理論的な反復ペナルティであるLZペナルティを紹介するものであり、これは、既存の業界標準のペナルティを凌駕しながら、自己回帰型言語モデルの推論能力を損なうことなく、貪欲デコーディング中の退行的な反復を効果的に排除する。

原著者: Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界には、言語モデルとして知られる強力なコンピュータプログラムのクラスが存在します。これらのシステムは、文章内の次の単語を予測するように訓練されており、それによって物語を書いたり、質問に答えたり、さらには長い推論の連鎖を生成することによって複雑な数学的問題を解決したりすることができます。これらの予測を行うために、モデルは膨大な可能性のリストの中から最も可能性の高い次の単語を選択するという統計的なプロセスに依存しています。しかし、ある執拗な問題がこれらのシステムを悩ませてきました。特に、困難なタスクを考え抜くよう求められた際、モデルはループに陥ってしまうことがあるのです。新しいアイデアへと前進する代わりに、モデルは同じ単語やフレーズを何度も繰り返し始め、その出力は無意味なものへと劣化してしまいます。この問題は「退行的反復(degenerate repetition)」として知られており、出力が一貫しており、エラーがないことが求められる信頼性の高い決定論的なタスクにおいて、これらのモデルを使用する際の大きな障壁となってきました。

長年、エンジニアたちは、モデルの選択に対して単純なペナルティを適用することでこれを修正しようと試みてきました。これらのペナルティは、モデルが最近使用した単語を再び選ぶことを抑制する、穏やかな「促し」のような役割を果たします。ある手法は、単語が何回出現したかをカウントしてその可能性を減少させ、別の手法は、単語が以前に出現したかどうかを単純に判定してペナルティを課します。これらの手法は日常的な会話にはうまく機能しますが、モデルが深い推論を行っているときにはしばしば失敗します。論理パズルを解くために非常に長いテキストシーケンスを生成する推論モデルは、標準的な修正策を用いても頻繁に反復のサイクルに陥ります。その結果、システムは勢いよく始まりますが、最終的には言葉の吃音のような繰り返しのループへと崩壊し、出力を役に立たないものにしてしまうのです。

Salesforce AI Researchのチームは、全く異なる分野からインスピレーションを得た新しい解決策を提案しました。彼らの研究は、「レンペル・ジヴ・ペナルティ(Lempel-Ziv penalty)」と呼ばれる手法を導入しており、これはモデルの思考能力を損なうことなく、これらの反復ループを阻止するように設計されています。その核心となるアイデアは、次の単語を予測することと、データファイルの圧縮することとの間の根本的なつながりに基づいています。コンピューティングの世界において、圧縮アルゴリズムはデータのパターンや反復を見つけ出し、ファイルをより小さくすることによって機能します。もし一連の単語が頻繁に繰り返されるのであれば、圧縮アルゴリズムはその記述を非常に効率的に行うことができ、より少ない情報ビットを使用できます。研究者たちは、モデルの現在のテキストストリームがどれほど容易に圧縮できるかを測定できれば、その情報を用いてモデルを反復パターンから遠ざけるように導けることに気づいたのです。

研究者たちは、テキストを生成する際にリアルタイムで特定の種類の圧縮アルゴリズムである「レンペル・ジヴ(Lempel-Ziv)アルゴリズム」をシミュレートするシステムを開発しました。このアルゴリズムは、直近のテキスト履歴の「スライディングウィンドウ」を振り返り、単語シーケンスの最も長い一致を探索します。モデルが新しい単語を検討するとき、システムはその単語が圧縮ファイルの総サイズをどれだけ変化させるかを計算します。もしその新しい単語が、圧縮アルゴリズムによって容易にエンコードできる冗長な長いパターンを作り出す場合、システムはその単語にペナルティを課し、選択される可能性を低くします。逆に、その単語が容易に圧縮できないような、新しく予測不可能な情報を導入する場合、ペナルティは低くなるか、あるいは存在しません。このアプローチは、単に単一の単語の出現回数を数えるのではなく、繰り返されるシーケンスの長さとそのシーケンスがどれくらい前まで遡るものかに注目しているという点で、従来の手法とは異なります。

この新しいアプローチをテストするために、研究者たちは320億パラメータを持つモデルと140億パラメータを持つモデルという、2つの高度な推論モデルにこれを適用しました。彼らは、この新しいペナルティの性能を、今日使われている業界標準の手法と比較しました。結果は驚くべきものでした。標準的な頻度ペナルティや反復ペナルティを使用した場合、研究者が反復を防ぐために設定を調整しようとしても、モデルは約4%の割合で依然として退行的反復ループに陥りました。対照的に、新しいレンペル・ジヴ・ペナルティは、これらの反復的な失敗の発生率を事実上ゼロにまで減少させました。モデルは、ループに陥ることなく、長く複雑な推論の連鎖を生成することができました。また、困難なベンチマークテストにおける精度も変わっていませんでした。このことは、新しい手法が、モデルの純粋な推論能力を妨げることなく、ループを引き起こす冗長性を効果的に除去できていることを示唆しています。

研究者たちはまた、この新しいペナルティを実行するための計算コストについても調査しました。システムは単語が生成されるたびに圧縮ステップをシミュレートする必要があるため、わずかな追加作業が必要となります。しかし、彼らはこのオーバーヘッドが驚くほど小さいことを見出しました。大規模なモデルにおいて、速度の低下は1%未満であり、実用においてほとんど気づかれないほど微細な差でした。この効率性は、この手法が即座に採用可能であることを示しており、大幅な新しい計算能力を要求することなく、推論モデルをより信頼性の高いものにする方法を提供しています。

チームが指摘した一つの限界は、この手法が自然言語向けに特別に設計されていることです。圧縮アルゴリズムは、言語が特定の統計的性質(例えば、単語が時間の経過とともに予測可能な方法で繰り返される傾向があることなど)を持っているという仮定に基づいています。そのため、この手法はテキストに対しては非常にうまく機能しますが、研究者たちは、特定の調整を加えない限り、画像や音声などの他の種類のデータには同様に効果的ではない可能性があると警告しています。さらに、このシステムはあらゆる想定されるシナリオに対して完璧というわけではありません。例えば、ユーザーが明示的に文字を100回繰り返すよう指示した場合、ペナルティがその特定の指示を妨害する可能性があります。しかし、一貫性のある非反復的な推論を目的とする大多数のタスクにおいては、この新しい手法は堅牢な解決策であると考えられます。

これらの知見は、人工知能を制御する方法についての考え方の転換を示唆しています。単に単語の数に基づいて単語を禁止するような「鈍器」に頼るのではなく、このアプローチは情報理論の数学的原理を用いて、テキスト自体の構造を理解します。テキストの生成を圧縮のプロセスとして扱うことで、研究者たちは、思考の信号を維持しながら、反復というノイズを自然にフィルタリングするツールを作り上げました。これにより、オープンソースの推論モデルは、以前は達成が困難であったレベルの決定論性を持って動作できるようになり、一貫性が極めて重要となる分野における、より信頼性の高いアプリケーションへの道を開きます。この研究は、データ圧縮のレンズを通して問題を見ることで、言語モデルを長年阻んできた頑固な不具合に対して、エレガントな解決策を見つけられることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →