← 最新の論文
💬 NLP

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

本論文は、様々なオープンソースモデル(1.5Bから7Bパラメータ)および数学ベンチマークにおいて、同一のトークンコストで評価した場合、反復的なサンプリングが複雑な自己洗練やリフレクションの手法を一貫して上回るか、あるいは同等の性能を示すことを実証しており、後者の見かけ上の利得は、優れた推論戦略によるものではなく、生成量の増加に起因することが多いという事実を明らかにしている。

原著者: Iliya Mirzaei

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Iliya Mirzaei

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

偉大なるAI脳ブースト実験

想像してみてください。あなたは、非常に賢いけれど少し注意散漫な生徒を持っています。あなたはその生徒に難しい数学の問題を与え、生徒はそれを解こうとします。時には正解し、時には間違えます。人工知能の世界では、研究者たちは、これらの「生徒」(大規模言語モデルと呼ばれます)をゼロから作り直すことなく、より良く考えさせる方法を模索してきました。一般的なアイデアは、AIに「もっと一生懸命考えろ」と伝えることです。これは、AIにステップを計画させたり、自分自身と議論させたり、自分の間違いを批判させたり、あるいは回答を提出する前に書き直させたりすることを意味します。それはまるで、生徒に「ただ答えを書くだけでなく、なぜその答えが正しいと思うのかという理由についてエッセイを書き、自分のワークをチェックし、おそらくもう一度やり直してみなさい」と伝えるようなものです。

大きな疑問は、その余分な思考は本当に役に立っているのか、それとも単に時間を無駄にしているだけなのか、ということです。ここでの鍵となる概念は「トークン」です。トークンを、AIが費やす「言葉」や「努力の単位」と考えてください。AIが単語を書くたびに、トークンが消費されます。もしある手法が、100単語で解決できる問題を解くために1,000単語を書かせるとしたら、それは10倍の努力を費やしたことになります。科学的な論争は、その余分な努力が「戦略」(自己批判など)によるものなのか、それとも単にAIがより多くの言葉を書く機会を得たという事実によるものなのか、という点にあります。もし生徒に10倍の紙を与えたら、彼らがより高い成績を取るのは、突然賢くなったからではなく、単に試行錯誤するためのスペース(紙)が増えたからかもしれません。この論文は、まさにそのことをテストするために設定されました。異なる戦略に対して全く同じ量の紙(トークン)を与えたとき、実際に勝つのはどの手法なのか?

論文:サンプルを増やせ、リフレクション(内省)は減らせ

「Sample More, Reflect Less(サンプルを増やせ、内省は減らせ)」と題されたこの論文は、AIが賢くなるために自分の仕事に対して「内省」する必要があるという議論に決着をつけるために設計された、大規模な実験です。研究者たちは、AIに「もっと深く考えさせる」ための7つの異なる人気手法(AIが自分自身を批判したり、自分自身のコピーと議論したり、あるいはリストの中から最善の回答を選んだりする方法を含む)を取り上げ、それらを非常に単純で退屈なベースラインである「繰り返しサンプリング(repeated sampling)」と対決させました。

このベースラインは、コインを10回投げ、最も多く出た方を採用するようなものです。AIの用語では、同じ質問を10回行い、最も一般的な回答を採用することを意味します。研究者たちは、すべての手法が全く同じ数のトークン(生成された単語数)を使用するようにし、公平な土俵を整えました。彼らは、3つの異なるサイズのAIモデル(15億、30億、70億パラメータ)と、2つの数学ベンチマーク(GSM8KおよびMATH-500、それぞれ150問)を用いてテストを行いました。

大きな発見:
結果は驚くべきものでした。ほとんどのケースにおいて、AIに「内省」させたり、「批判」させたり、「議論」させたりする洗練された手法は、単に質問を何度も行い、票を集計するという単純な手法に敗北しました。

研究者がなぜ洗練された手法が負けたのかを詳しく調べたところ、明確なパターンが見つかりました。AIに自分の仕事を判断させる(回答を書き直させたり、リストから「最善」のものを選択させたりする)手法は、一貫してベースラインよりも成績が悪かったのです。例えば、15億パラメータの小さなモデルでは、「Best-of-N」(8つの回答の中から最善のものを選ぶ手法)と呼ばれる手法は、同じ8回の試行の中で最も一般的な回答をカウントするだけの方法よりも、約8〜11パーセントポイント低いスコアとなりました。70億パラメータのより大きなモデルにおいても、その差は消失しました。つまり、差は統計的にゼロと区別がつかない状態になり、「判定役」はもはや「カウンター(集計役)」より明らかに劣っているとは言えなくなりました。

この論文は、「もっと深く考える」ための「自己内省」が魔法の成分であるという考えを明確に否定しています。むしろ、これは**「別の試行にトークンを費やすことは、自己修正にトークンを費やすよりも良い投資である」**ということを示唆しています。つまり、自分の回答について長く批判的なエッセイを書くためのトークンがあるなら、そのトークンを使って2つまたは3つの新しい独立した回答を作成し、その中で最も一般的なものを選ぶ方が賢明なのです。

「ゴースト」手法と「サイズが重要」という教訓

この実験の中で、最も遊び心があり、かつ啓発的な部分の一つは、「Reflexion」と呼ばれる手法に関するものでした。この手法は、AIが問題を解き、次に自分自身に「私はこれを正しくできましたか?」と問いかけるというものです。もし「いいえ」と言えば、再試行します。もし「はい」と言えば、停止します。

研究者は、最小のモデル(15B)における面白いグリッチ(不具合)を発見しました。この極めて小さなモデルでは、AIは一度も「いいえ」と言いませんでした。たとえ間違っていたとしても、AIは自分の最初の回答をすべて「正しい」と判断したのです。そのため、Reflexion手法は実際には再試行をトリガーすることなく、静かに終了してしまいました。これは非常に安価であったため(追加のトークンを消費しなかったため)、あたかもうまく機能しているかのように見えました。しかし、研究者が強制的に3回再試行させたところ、パフォーマンスは著しく低下しました。これは、「内省」のメカニズム自体が、実際にはスコアを損なっていたことを証明しています。

モデルが大きくなるにつれ(15Bから7Bへ)、「票を集計すること」と「AIに判断させること」の差は縮まり始めました。70億パラメータの時点では、AIは判断を行うのに十分な能力を備えていたため、「有害ではなくなり」、その差は**「ゼロと区別がつかなくなりました」**。しかし、この論文は、このサイズになってもAIが判断において「集計」よりも優れていたわけではない、と述べています。単に「劣らなくなった」だけなのです。研究者たちは、AIが単純な「票の集計」法を打ち負かすためには、単にその場で判断を求められるのではなく、判断者として特別に訓練される必要があるかもしれないと示唆しています。

これが将来に意味すること

この論文は、これらのAIシステムを構築するすべての人に対し、強いメッセージを送って締めくくっています。「物事を複雑にしすぎるな」。もしトークン(単語)の予算があるなら、最も効率的な方法は、多くの異なる試行を生成し、多数決に任せることです。AIに自分の仕事を批判させたり書き直させたりすることではありません。

著者らはまた、一部の手法は見た目上は良くても、実際には失敗する可能性があると警告しています。なぜなら、それらは「真のコスト」を隠してしまうことがあるからです。もし手法が(Reflexionのように)自分で停止時期を決定する場合、すぐに停止してコストを節約し、あたかも効率的であるかのように見せることがありますが、それは設計された通りの仕事を実際には行っていないのです。

結局のところ、この研究は、数学のような明確な正誤がある問題において、自己内省の「魔法」は神話であることを示唆しています。最も強力なツールは、より賢い戦略ではなく、単に「もっと多くの回数を試すこと」です。研究者が述べたように、回答を再考するためにトークンを使うことは、同じトークンを使って別の試行を行うよりも、悪い投資なのです。AIに「もっと深く考えろ」と教える必要はありません。ただ、もっと多くのチャンスを与えるだけでよいのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →