← 最新の論文
💬 NLP

Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation

本論文は、洗練されたプロンプト技法が大規模言語モデルの性能を向上させるという仮定に異を唱え、包括的な実証研究を通じて、高度な専門知識や帰納的なフレーミングによるわずかな改善のみが見られるものの、基本となるプロンプトが複雑な手法を一貫して上回ることを示し、それによって、この分野はプロンプトエンジニアリングよりも真のモデルの進歩を優先すべきであることを示唆している。

原著者: Inder Preet, Shuxin Lin, Dhaval Patel

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Inder Preet, Shuxin Lin, Dhaval Patel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超高性能なロボットにパズルを解く方法を教えようとしていると想像してみてください。しばらくの間、誰もが「優れた答えを得る唯一の方法は、ロボットに非常に長く複雑な指示を与えることだ」と信じてきました。人々は、「ステップ・バイ・ステップで考え、地図を描き、あるいは特定の専門家になりきってくださいと伝えれば、ロボットはより賢くなる」と考えたのです。それは、学生に対して「ただ答えるのではなく、正しい文字を選ぶ前に、自分の気持ちについて5段落のエッセイを書きなさい」と命じるようなものです。この考え方は非常に普及し、研究者たちは、より精巧な「プロンプティング」のテクニックを次々と作り出し始めました。指示が精巧であればあるほど、ロボットの性能は向上するのだと想定していたのです。しかし、もしその余計なお喋りのせいで、ロボットが混乱してしまうとしたらどうでしょう? もし、最も単純な指示こそが実は最善なのだとしたら? これが、IBMの研究チームが調査することに決めた大きな疑問です。彼らは、大規模言語モデル(LLM)——現代のAIの背後にある「脳」——が、多肢選択式の質問をどのように処理するかを調べました。彼らは、それらの凝った新しいテクニックが本当に役に立っているのか、それとも単に不必要に複雑にしているだけなのかを知りたかったのです。

「Simplicity Paradox(単純性のパラドックス)」と題されたこの論文は、研究者たちが8つの異なる質問方法を10種類のトリッキーなパズルに対してテストした、大規模な実験です。彼らは27種類の異なるAIモデルを使用しました。彼らは明確な全体像を把握するために、43万回以上の評価を実行しました。そして、ここに驚くべき展開があります。複雑なテクニックは、通常、AIのパフォーマンスを低下させるか、せいぜい直接質問した場合と同じ程度の結果しか出さなかったのです。

このように考えてみてください。あなたがテストを受けていると想像してください。「ベースライン」という手法は、単に質問を読み、答えを選ぶだけです。「複雑な」手法は、「探偵になりきって、3つの手がかりをリストアップし、図解を描き、それから答えなさい」と言われるようなものです。研究者たちは、ほとんどのAIモデルにおいて、探偵のペルソナや図解が、むしろ彼らの動きを鈍らせることを発見しました。実際、公平に比較を行った場合(すべてのAIが全く同じ質問を見るようにした場合)、シンプルで直接的なプロンプトは、3番目に優れたパフォーマンスを示しました。それをわずかに上回ったのは、たった2つの微調整された手法でした。それは、AIに「信頼性エンジニア」のように振る舞うよう指示するか、「帰納的推論」を用いるという指示です。これらは約3パーセントポイントのわずかなブーストを与えました。しかし、本当に凝った手法、例えばAIに独自の例を生成させたり、類推によって問題を解決させようとしたりする手法は、無残に失敗しました。「自己類推(Self-Analogical)」と呼ばれる手法は、スコアがわずか21.38%にとどまり、ランダムに推測する場合とほとんど変わりませんでした。それはまるで、AIが指示の複雑さに絡め取られ、質問に答える方法を忘れてしまったかのようです。

この研究は、他にもいくつかの魅力的な特性を明らかにしました。第一に、Qwen3-30B-A3B-Thinking-2507という小規模なAIモデルが、直接対決において、より大規模で強力なモデル(中には13倍も大きいものもあります)を打ち負かすことに成功したことが分かりました。これは、より多くの「脳の力(パラメータ)」を持っていることが、必ずしも最高のスコアを保証するわけではないことを示唆しています。時には、適切に調整された小さなモデルの方が鋭いこともあるのです。第二に、彼らはモデルがどれだけの「思考時間(またはトークン)」を使用するかを調査しました。彼らは、単に「思考」スイッチをオンにするだけで、劇的な変化をもたらし、一部のモデルではスコアを最大22パーセントポイント向上させることを発見しました。しかし、一度スイッチが入ると、モデルに「より多くの時間」を考えさせること(予算を低から中へ増やすこと)は、計算能力を大幅に消費する一方で、精度にはわずか(1〜4ポイント程度)しか上乗せされませんでした。それは、ランナーが勝つために走り始める必要があることに気づいたものの、必要以上に8倍長く走らせても、それほど速くはならない、ということに似ています。

最後に、研究者たちはパズル自体の難易度についても調査しました。彼らは、AIがまだ完璧には程遠いことを発見しました。最も難しいパズルにおいて、最高のモデルでも正解率は約36%であったのに対し、最も簡単なパズルでは約83%でした。この大きな差は、AIが質問の仕方をより良くする方法を探すのではなく、実際に学習し、改善できる余地がまだ多分にあることを意味しています。論文は、AIコミュニティは物事を複雑にしすぎていた可能性があると結論づけています。複雑な指示マニュアルを作ることに全エネルギーを注ぐのではなく、モデル自体をより賢くし、より困難な問題に取り組むべきなのです。「Simplicity Paradox」とは、時には、最も強力なツールは、シンプルで直接的な質問であるという気づきなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →