Investigating LLM's Problem Solving Capability -- a Study on Statics Questions
本研究は、モデル蒸留手法を通じて静力学の問題を解決する大規模言語モデルの能力を評価しており、それらのモデルはテキストのみの質問には高い性能を示す一方で、図解や多段階の推論が求められる場合には、画像認識の限界というよりも視覚情報を一貫して適用することの困難さによって、精度が著しく低下することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、「ChatGPT」という名の、非常に賢く、博識な学生を想像してみてください。この学生は図書館にあるほぼすべての本を読み終えています。あなたは、この学生が「静力学(Statics)」と呼ばれる、非常に難しい工学の宿題を実際に解けるかどうかをテストしたいと考えています(静力学とは、橋やクレーンのように、静止している物体にかかる力のバランスを扱う学問です)。
研究者たちが行ったことを、分かりやすく説明します。
1. 「コピー&ペースト」問題
まず、研究者たちは当たり前のことから試しました。教科書にある実際の問題を抜き出し、ChatGPTにそれを解かせてみたのです。
- 結果: それは悲惨なものでした。学生(AI)は混乱し、特に問題が3D図形を含む場合に混乱が生じました。方向を間違えたり(例えば「右」であるべきところを「上」と言ったり)、計算ミスをしたりしました。
- 比喩: それは、ほとんど理解できていない言語で書かれた地図を読ませるようなものでした。単語は知っているものの、方向を判別することができなかったのです。
2. 「リバースエンジニアリング」のトリック(モデル蒸留)
教科書の問題が難しすぎたため、研究者たちは「モデル蒸留(Model Distillation)」と呼ばれる巧妙なトリックを試しました。他の人が作った問題を解かせるのではなく、学生自身に自分の問題を作成させることにしたのです。
- 論理: 彼らはこう考えました。「もしChatGPTが優れた問題を書けるのであれば、その特定のタイプの問題については、自身の学習データから答えを理解しているはずだ」と。
- プロセス: 彼らはChatGPTに50個の静力学の問題を作成させました。すると、学生は同じような単純な2D(平面)の問題を何度も繰り返し書いていることが分かりました。そこで、彼らはChatGPTがうまく理解できていると思われる、最も優れた25個のユニークな問題を選び出しました。
3. 3つのレベルのテスト
研究者たちは、これら25個の問題を用いて、学生の脳がどのように機能するかを見るために、3つの異なる「試験」を作成しました。
- 試験A(テキストのみ): ChatGPT自身が書いた問題を、言葉(テキスト)のみを使って解かせました。
- 結果:満点(100%)。 学生は自分で問題を書いたので、答えを知っていました!
- 試験B(図解あり): そのテキストのみの問題に対して、簡単な図を描き加えました。
- 結果:スコアは68%に低下しました。 学生は言葉を読むことはできましたが、図が邪魔をしました。図と数学的な情報を結びつけることに苦戦したのです。
- 試験C(「新しい数字」テスト): 試験Bの図面を使い、すべての数字を変更しました(例:10ポンドの力を15ポンドに変更するなど)。
- 結果:スコアは60%に低下しました。 これにより、学生が単に答えを暗記していたわけではないことが証明されました。学生は新鮮な状態で問題を解こうとしていましたが、途中のプロセスでミスを犯していました。
4. 彼らは何を学んだのか?
研究者たちは、ChatGPTを「Gemini」という別のAI学生と比較しました。
- 大きな発見: 問題は、AIが図を見ることができないことではありませんでした。問題は、AIがステップごとに考えることができないことでした。
- 比喩: レシピを完璧に読めるシェフを想像してください(テキストのみ)。もし、材料と料理の写真を手渡されたら(図解)、彼らはまだ料理を作ることができます。しかし、もし複雑なフルコースの料理を作れと言われ、途中でレシピを調整しなければならないとしたら(多段階の推論)、彼らは材料を落としたり、次の工程を忘れたりし始めます。
- 結論: AIは単純な一歩の計算には優れています。しかし、図を見て、情報を抽出し、その情報を使って最終的な答えにたどり着くまで、3つも4つも異なるステップを踏まなければならない場合、迷子になってしまいます。正しい「方法」は辿っていますが、最終的に間違った「数値」を出してしまうのです。
まとめ
この論文は、AIは読み書きに関しては非常に上手くなっているものの、視覚的な推論や、長く複雑な論理の連鎖に関しては、まだ少し不器用であることを結論付けています。それは、理論は完璧に知っているものの、変化する数値を含む現実世界の図面を適用するように求められると、立ちすくんでしまう学生のようなものです。
注記: 研究者たちは、これらの特定の工学問題のみをテストしました。これは医療診断、法的助言、または他の分野に適用されるという主張でも、将来のAIをどのように修正すべきかを示唆するものでもありません。彼らは単に、この特定の工学パズルにおいてAIがどのようにパフォーマンスを発揮したかを報告しただけです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。