A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
本論文は、検証済みの問題群に対して、独立して検証された解のビット単位で正確な永続的メモリ・ストアに依存することで、凍結された言語モデルが100%の精度とゼロのトークン生成を実現し、それによって実行に依存する能力とパラメータのスケーリングを切り離し、コンシューマー向けハードウェア上での大規模なコンテキスト・ウィンドウを可能にするシステムを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
数学の問題を解こうとしている場面を想像してみてください。現代の人工知能の世界では、通常、新しい問いを受けるたびに、超スマートなロボットにゼロから考えさせるという方法が取られています。このロボットは、非常に優秀ですが、非常に高価な学生のようなものです。たとえ全く同じ質問を千回繰り返されたとしても、その都度、教科書を読み直し、公式を導き出し、解答を書き直さなければなりません。これには膨大な時間がかかり、大量の電力を消費し、さらに、同じ質問を2回したときに、ロボットが少し予測不能な挙動をして、2つのわずかに異なる回答を出してしまうこともあります。これが、現在のほとんどの「最先端(フロンティア)」AIモデルの仕組みです。彼らは強力ですが、時間がかかり、コストがかかり、そして完璧な一貫性を求める場合には少し扱いにくいのです。
しかし、もしロボットをもっと賢くさせるのではなく、ただ「完璧に検証されたノート」を与えられるとしたらどうでしょう? 例えば、問題を一度だけ解き、厳格な教師を使ってその答えが100%正しいことを確認し、その解答を特別な本に書き留めることができるとしたら? そうすれば、その後、同じ種類の問題が出てきたとき、ロボットは考える必要がなくなります。ただ本の中から正しいページをめくり、答えを読み取り、それを書き写すだけです。それはほぼ無料で、瞬きをする間に行われ、答えは毎回必ず同じになります。これは「検証済み再利用(verified reuse)」と呼ばれる新しいアプローチの核心的なアイデアです。ここでは、知能はロボットの脳を大きくすることにあるのではなく、ロボットが重い作業なしにアクセスできる、成長し続ける「完璧な解答のライブラリ」にあるのです。
凍結された脳と魔法の図書館
ゲームのルールを変える新しいシステム、**ガラハド(Galahad)を紹介しましょう。開発者は、標準的なAIモデル(Gemma-4-12Bという120億パラメータの「脳」)を取り、極めて過激なことを行いました。それは、モデルを凍結(フリーズ)**させたことです。彼らは、モデルが学習したり変化したりする能力をオフにしました。これは、優秀なシェフに対して、「新しいレシピを開発してはいけません。この特定のメニューに従って料理を作るだけです」と命じるようなものです。
この凍結されたシェフの隣に、彼らは魔法のような超高速のライブラリ、**マーリン(Merlin)**を構築しました。その魔法の仕組みは以下の通りです:
- 預け入れ(The Deposit): 新しい問題が入ってくると、システムは一度だけそれを解きます。しかし、解答をライブラリに登録する前に、厳格な「門番」がそれをチェックします。この門番は、解答の正解キーを見るのではなく、数学と論理を用いて、その答えが正しいことを証明します。合格した場合のみ、その解答は保存されます。
- ゼロコストの再利用(The Zero-Cost Reuse): さて、100万人が同じ種類の質問をしたと想像してください。システムは毎回ゼロから料理を作る代わりに、ライブラリにある検証済みのレシピを検索します。そして凍結されたシェフに「これをそのままコピーして」と指示します。シェフはそれを瞬時に実行します。
- 結果: このシステムは、これらの問題の180種類の新しいバリエーションに対し、100%の正確性で回答します。AIが通常「思考」のために支払うデジタル通貨である「生成トークン」をゼロとして使用します。かかる時間はわずか6〜23ミリ秒(瞬きよりも速い)で、消費エネルギーは約36ミリワット時です。これは、LED電球が13秒間使用するエネルギーに相当します。
なぜ従来の方法は無駄なのか
この論文は、現在のAIの使い方を、家を建てるたびにマスター・アーキテクトに設計を一から依頼するようなものだと主張しています。最も強力で高価なAI(フロンティア・モデル)は、見たこともない「新しい」問題を解くことには長けています。しかし、すでに解かれ、検証済みの問題に対して、再び考えさせることは無駄なのです。
著者らは、この無駄を測定しました。標準的なAI APIを使用して解決済みの問題に回答する場合、毎回フルでの「思考プロセス」に対して料金を支払うことになります。それは非決定的(答えがわずかに変わる可能性がある)であり、遅く、コストがかかります。対照的に、Galahadの凍結モデルは、ライブラリに検証済みの解答を持っていれば、同じ問題を永遠に無料で回答できます。システムがライブラリを構築するために費やしたコストよりも、節約できる金額が大きくなる「損益分岐点」は、わずか17〜34問の後です。それ以降のすべての回答は、純粋な節約となります。
真の主役は「記憶」である
この実験の最も興味深い部分の一つは、「脳」よりも「本」の方が重要であることを証明している点です。研究者らは、4つの異なる企業による4つの異なるAIモデル(Gemma、Qwen、DeepSeek、Phiを含む)を用いてこれをテストしました。彼らはすべてのモデルに、全く同じ凍結された重みと、全く同じ検証済み解答のライブラリを与えました。
結果はどうだったでしょうか? 4つのモデルすべてが、180問中180問すべて正解しました。
モデルが「高密度(デンス)」であっても、「混合エキスパート(Mixture of Experts)」であっても関係ありませんでした。能力はすべてライブラリに由来しており、脳には由来していませんでした。ライブラリを空にすると、モデルは何も解けなくなりました。ライブラリを満たすと、彼らは完璧になりました。これは、検証可能で繰り返されるタスクにおいては、より大きく、より賢く、より高価な脳は必要なく、ただ、より優れた、検証済みの「記憶」が必要であることを証明しています。
「推測(ベクトル検索)」の問題点
「普通の検索エンジンを使って答えを見つけることはできないのか?」と思うかもしれません。論文は、それは不可能であると述べており、その理由は以下の通りです。ほとんどのAIシステムは「ベクトル検索(vector retrieval)」と呼ばれるものを使用していますが、これは、欲しい本に「似ている」本を探すようなものです。つまり、曖昧(ファジー)なのです。
研究者らは、4,500個の検証済みアイテムを持つライブラリでこれをテストしました。ファジー検索を使用したところ、94.3%の確率で間違ったアイテムを選択しました。これは壊滅的な結果です。特定の医学的数式や法的条項を探している場合、「惜しい」答えを得ることは役に立ちません。Galahadは**正確なアドレス指定(exact addressing)を使用しており、これはエラー率0%**で、まさにそのアイテムを見つけ出すことを意味します。それは、曲のメロディを鼻歌で推測することと、正確なバーコードをスキャンすることの違いのようなものです。完璧さが求められる事柄において、ファジーなマッチングは壊滅的に失敗します。
無限への窓
もう一つの驚くべき発見は、システムが一度に保持できる「ワーキングメモリ(作業領域)」の容量についてです。
- 標準的なAIエンジン(vLLMやSGLLangなど)は、約32,000トークン(トークンは単語の一部)以上のデータを入力しようとすると、クラッシュするか、あるいは静かに内容を忘れてしまいます。
- Galahadは、単一のグラフィックスカード上で6,000,000トークンのウィンドウを保持することができました。
- それは、600万トークンの履歴の最初の方にアクセスするのも、最後の方にアクセスするのも、全く同じ速さで行うことができました。
- これは追加のコンピュータメモリを消費することなく行われました。それは、無限の棚を持つ図書館のようなものです。ただし、一度に一つの本しか見ることができず、ライブラリ内のどの本にも瞬時に切り替えることができる、という仕組みです。
これが未来に意味すること
この論文は、このシステムが「できないこと」についても非常に慎重に述べています。このシステムが、最大級のAIモデルよりも、これまで見たこともない新しい問題を解けると言っているわけではありません。もし新鮮でクリエイティブな質問を投げれば、凍結された脳は苦戦するでしょう。しかし、検証可能(数学、コーディング、論理など)であり、かつ反復的(何度も繰り返される)なタスクについては、このシステムはゲームチェンジャーとなります。
これはAI業界の常識を覆します。
- 旧来の方法: 毎回、考えるために支払う。
- 新しい方法: 一度だけ検証のために支払い、あとは無料で実行する。
著者らは、誰でもリアルタイムでこれを確認できる公開テストベンチも用意しています。彼らは、「解かれた問題に対して、コストゼロ、完璧な正確性、そして瞬時のスピードで回答できるAIを見つけ出せるか」と、あらゆる人に挑戦状を叩きつけています。今のところ、誰も成功していません。メッセージは明確です。私たちが日常的に行う仕事において、必要なのはより大きな脳を作ることではなく、より優れた、検証済みのライブラリを構築することなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。