Teaching Language Models to Think in Code
本論文は、言語モデルの推論を自然言語とコードの交互使用から、コード自体を主要な推論主体とするコード中心のパラダイムへ転換するフレームワーク「ThinC」を提案し、コード軌跡の蒸留と教師あり微調整に引き続く強化学習を採用することで、競技レベルの数学ベンチマークにおいて最先端の性能を達成する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に厄介な数学パズルを解こうとしていると想像してください。それを解くには、2 つの方法があります。
- 従来の方法(インタリーブ推論): 英語で自分自身に語りかけ、手順を考えます。「さて、まず 500 に 0.12 を掛ける必要がある…」それから少し不安になり、自分の作業を確認するために電卓(コードツール)に頼みます。しかし、ここには落とし穴があります。もし英語での思考にミスがあった場合(例えば、500 に 0.12 を掛けた結果を 60 ではなく 50 と言うなど)、その間違った数字をうっかり電卓に入力してしまう可能性があります。電卓は指示された通りに実行するだけで、あなたがミスをしたことは知りません。間違った数字に基づいて計算を行うため、間違った答えが得られてしまいます。
- 新しい方法(THINC): 戦略を英語で計画する(「この図形の面積を求める必要がある」)というごく短い瞬間を設けた後、即座にその作業全体をロボットプログラマーに引き渡します。ロボットはコードを書き、実行し、結果を確認し、その結果に基づいてさらにコードを書き、答えが導き出されるまでこれを続けます。あなたは頭の中で、あるいは英語の文章で計算を行いません。すべての重労働をロボットが行います。
この論文は、AI モデルに数学の問題を解かせるための新しい方法としてTHINC(Thinking in Code:コードで思考)を紹介しています。これは、AI が単に自分の作業を確認するために使うツールとしてコードを利用するのではなく、コード自体を思考させるというアプローチです。
従来の方法の問題点
著者らは、英語での思考とコードを組み合わせる現在の AI モデル(ツール統合推論と呼ばれる)には、彼らが「構造的な限界」と呼ぶ 3 つの主要な欠陥があると述べています。
- 事後検証者(Post-Hoc Verifier): AI はまず英語で解決策全体を書き出し、その後、コードを実行して「はい、合っています」と確認するだけのことが多いです。コードは実際に思考を行っているのではなく、最終的な承認のスタンプに過ぎません。
- 沈黙する誤り(Silent Error): AI が英語での思考の中で数学的なミス(例えば、500 の 12% を 60 ではなく 50 と計算するなど)を犯した場合、その間違った数字をコードにコピーしてしまう可能性があります。コードは間違った数字で計算を行い、AI はそれに気づきません。コードは指示に従うだけなので、この誤りは「沈黙」したままです。
- 二重作業(Double Work): AI はよく、問題を解く「方法」についての長い英語の説明を書き、その後、全く同じことを行うコードを書きます。料理のレシピを英語で書き、同じレシピをフランス語で書き直すことで、自分が料理のやり方を知っていることを証明するようなものです。これは冗長で混乱を招きます。
THINC の解決策
THINC はゲームのルールを変えます。AI が数学について語るのではなく、(コードを通じて)数学の中で語るのです。
- 計画: AI は戦略を設定するための短い英語の一文から始めます(例:「答えを見つけるために数字をループさせる」)。
- 作業: その 1 文の後、すべてがコードブロック内で実行されます。AI はコードの一部を書き、実行し、出力を確認し、その出力に基づいて次のコードの一部を書きます。
- 結果: 最終的な答えは、AI が英語で推測するのではなく、コンピュータの電卓(インタプリタ)から直接得られます。
AI をどう教えたか
研究者たちは AI にこれをさせるよう指示しただけではなく、3 段階のプロセスを通じて教えました。
- 蒸留(教師): 非常に賢く大規模な AI モデルに、この新しい「コードファースト」スタイルで数学の問題を解くよう求めました。これにより、12,200 件の完璧な「コードファースト」解決策のサンプルを収集しました。
- 教師あり微調整(生徒): 17 億の「脳細胞」と 40 億の「脳細胞」を持つ 2 つの小さな AI モデルに、これらのサンプルを模倣させるよう教えました。これにより、モデルはコードで思考する「習慣」を身につけました。
- 強化学習(コーチ): モデルに数千の数学の問題で練習させました。モデルが正解すると「報酬」が与えられ、失敗すると異なるコード戦略を試すよう学習しました。これにより、モデルはより賢く、信頼性のあるものになりました。
結果:小さなモデル、大きな勝利
この論文は、これらの新しいモデルを非常に難易度の高い、コンペティションレベルの数学コンテスト(AIME や HMMT など)でテストしました。
- 巨人を打ち負かす: 40 億パラメータの小さな THINC モデルは、平均して**78.1%**のスコアを記録しました。これは 17 億パラメータのモデルよりも優れており、他の「ツール統合」モデルよりも優れており、英語だけで思考する巨大な 2350 億パラメータのモデルさえも上回っています。
- 信頼性: 99.2% のケースで、最終的な答えはコンピュータのコード出力から直接引き出されました。AI は推測したのではなく、計算しました。
- 回復力: コードにミスがありクラッシュした場合(エラー)、THINC モデルは驚くほど、次のコードブロックで「話す」ことなくそれを修正することができました。英語とコードを混ぜる他のモデルは、コードエラーに遭遇すると崩れ落ちる傾向があります。
結論
この論文は、AI に数学について「語る」のをやめ、コードの中で数学を「行う」ように強制することで、モデルはより正確になり、愚かな算数のミスを減らし、難しい問題をより効率的に解くようになると主張しています。これは、頭の中で筆算をしようとする人間から、電卓をプログラミングして一歩一歩、精神的な計算ミスを一切犯さずにそれを代行させることのできる人間へと切り替えるようなものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。