← 最新の論文
💬 NLP

How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus

本論文は、OrthrusがFP32において正確な軌跡一致を伴うロスレスな投機的デコーディングを実現する一方で、その主張されるロスレス性はBF16精度下では著しく低下することを示しており、これは、ダウンストリームタスクの性能に影響がない場合であっても、数値精度が軌跡の等価性に決定的な影響を与えることを浮き彫りにしている。

原著者: Ilya Koziev, Leonid Sinev, Ivan Oseledets

公開日 2026-09-15
📖 1 分で読めます☕ さくっと読める

原著者: Ilya Koziev, Leonid Sinev, Ivan Oseledets

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

テキストを生成する現代のコンピュータ、いわゆる言語モデルは、情報の生成方法において支配的な力となっています。これらのシステムは、前の単語に基づいて次の単語を一つずつ予測することで機能します。この手法は信頼性は高いものの、本質的に低速です。なぜなら、コンピュータは最初の単語の計算を終えてからでないと、二番目の単語について考えることすらできないからです。モデルが大型化し、会話が長くなるにつれ、このステップ・バイ・ステップのプロセスがボトルネックとなり、技術の使用コストを高め、動作を鈍らせます。これを加速させるために、研究者たちは「投機的デコーディング(speculative decoding)」と呼ばれる手法を開発しました。このアプローチは、本を先読みする読者のように、将来の単語を一度に数個予測し、それらの推測が正しいかどうかをチェックしようとするものです。もし推測が正しければ、コンピュータは膨大な時間を節約できます。

最近では、「Orthrus」と呼ばれるシステムが、精度を損なうことなくこれを行うことを約束しました。これは、標準的な低速のテキスト生成器と、より高速な並列推測エンジンを組み合わせたものです。開発者は、組み込まれた検証メカニメントによって、高速エンジンが元の低速なエンジンと全く同じ単語のシーケンスを生成することを保証し、その加速を真に「ロスレス(損失なし)」にすると主張しました。ここでのロスレスとは、最終的な出力が、最後の文字に至るまで、元の低速なモデルが生成したのと同一であることを意味します。この約束は重要でした。なぜなら、並列推測によるスピードと、元のモデルが持つ完璧な信頼性の、両方の良いとこ取りができることを示唆していたからです。

ある研究チームが、この約束を独立して検証することに決めました。彼らは独自のバージョンのOrthrusシステムを構築し、コード作成、数学の問題解決、詩の作成を含む幅広いタスクにおいて、その出力を元のモデルと比較しました。彼らは、現代のコンピュータが効率化のために使用している標準的な数値精度を用いて、これらのテストを実施しました。研究者たちは、高速なOrthrusシステムが生成した単語シーケンスを、低速な元のシステムと比較したところ、驚くべき結果が出ました。両者は必ずしも一致しませんでした。実際、リリースされた元のモデルの場合、シーケンスが完全に一致したのはわずか45パーセントでした。研究者たちが独自に訓練したバージョンでは、一致率は43パーセントとさらに低くなりました。これは、半分以上のケースにおいて、高速なシステムが元のモデルとは異なる経路を辿り、異なる単語を選択していたことを意味します。

研究者たちは、なぜこのようなことが起こるのかを理解するために、さらに深く調査しました。彼らは、システムの不一致が、元のモデルにとってテキストの予測がいかに困難であるかと関連していることを発見しました。元のモデルが次の単語に対して非常に自信を持っているとき、高速システムは通常それに一致しました。しかし、テキストがより複雑になったり、モデルの確信度が下がったりすると、高速システムは逸脱しやすくなり、元のモデルとは異なる単語を選択する傾向がありました。このことは、「ロスレス」という主張が、標準的なコンピュータ計算の条件下では維持されていないことを示唆しています。また、研究者たちは、この逸脱が必ずしもテキストの質を悪化させるわけではないことも指摘しました。推論やコーディングに関する標準的なベンチマークでテストしたところ、高速なシステムは低速なものよりもわずかに高いスコアを出すことがあり、異なる経路を辿ることが必ずしも劣った結果を意味しないことを示しました。

なぜシステムが一致しないのかという謎を解くために、研究者たちはコンピュータが数値を扱う方法を変更しました。彼らは、コンピュータがより正確に数値を保存できる、より高いレベルの数値精度を用いて、実験全体をやり直しました。この切り替えを行ったところ、結果は劇的に変化しました。より精密な計算の下では、高速なOrthrusシステムは、全1,190のテストプロンプトにおいて、低速な元のモデルと完璧に一致したのです。この発見は、以前の不一致がOrthrusシステムの設計自体の欠陥によるものではなく、標準的で精度の低い数学を使用する際に発生する、微小な丸め誤差によるものであることを明らかにしました。

本研究は、「ロスレス」な加速という約束は、コンピュータで使用される数学的精度に完全に依存するという結論を下しています。Orthrusシステムは理論上は意図通りに機能しますが、標準的なハードウェアで実行するという現実的な側面においては、最終的な出力を変化させる小さな誤差が生じます。研究者たちは、科学者がシステムをロスレスであると主張する場合、使用されている数値精度を明示すべきであると論じています。なぜなら、ある設定で完璧に正確なシステムが、別の設定では異なる結果を生む可能性があるからです。この研究は、言語モデルを大幅に高速化することは可能であるが、元のモデルと全く同じ出力を保証するには、モデルのアーキテクチャだけでなく、基礎となる数学への細心の注意が必要であることを明確にしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →