The Effect of Scripts and Formats on LLM Numeracy
本論文は、大規模言語モデルが、過小評価されているスクリプトや形式における数値表現を処理する際に大幅な精度の低下に陥ることを明らかにしているが、標的を絞ったプロンプティング戦略がこの格差を効果的に緩和できることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたの目の前に、世界中のほとんどすべての本を読み終えた、非常に優秀な学生がいるとします。この学生は数学の達人であり、複雑な足し算や掛け算の問題を瞬時に解くことができます。しかし、一つだけ落とし穴があります。この学生は、私たちが英語で使う標準的な形式(例えば 1, 2, 3)で書かれた数字しか見たことがありません。
この論文は、その超天才的な学生に対して、彼らがあまり見たことのない異なる「言語」や「スタイル」で書かれた数字を使って数学の問題を出したときに、何が起こるかについて書かれています。
主な発見: 「スクリプト税(Script Tax)」
研究者たちは、標準的な数字を他の文字体系(例えば १, २, ३(デーヴァナーガリー)や ۱, ۲, ۳(ペルシア・アラビア文字))に置き換えると、学生の数学スキルが劇的に低下することを発見しました。
このように考えてみてください。もしあなたがシェフに完璧なステーキを作ってほしいと頼んだとします。彼はそれを簡単にこなせるでしょう。しかし、もしレシピが彼が読めない言語で書かれていたり、あるいは玉ねぎをナイフではなくスプーンで刻むように指示されたりしたら、彼は材料を落としたり、ステーキを焦がしたりしてしまうかもしれません。シェフは依然として「料理の仕方」を知っていますが、指示の「形式」が彼を混乱させたのです。
論文では、これを 「スクリプト税(Script Tax)」 と呼んでいます。これは、AIが異なる形の数字を目にすることに対して支払う「罰金」のようなものです。たとえ数学の問題自体が全く同じ(例:「5 + 5」)であっても、数字が標準的な英語のスタイルではない場合、AIの間違いは66%から87%も増加します。
なぜこのようなことが起こるのか?
論文では、主に2つの原因を挙げています。
- 「トレーニング・ダイエット(学習内容)」: AIはインターネット上の膨大なテキストを食べて育ちました。そのテキストの大部分は、標準的な英語の数字を使用しています。それは、学生がリンゴばかりを食べてきたようなものです。突然梨を与えられたとき、彼らはそれをどうやって適切に噛めばいいのか分からなくなります。
- 「トークン」の問題: AIは人間のように言葉を読むのではなく、テキストを「トークン」と呼ばれる小さな塊に分解します。
- 標準的な数字(123 など)は、1つまたは2つの塊になります。
- 一部の他の文字体系では、同じ数字が多くの小さく混乱を招く破片に分解されてしまいます。
- 論文では、数字がより多くの「塊」に分解されるほど、AIにとって数学が難しくなることが示されています。それは、絵を10個の大きなピースではなく、100個の極小のピースに切り刻まれたパズルを解こうとしているようなものです。
朗報: 「ヒント」を使えば解決できる
研究者たちは単に問題を見つけただけでなく、解決策も見つけました。彼らはさまざまな質問の仕方(プロンプティング)を試しました。
- ただ丁寧に頼むだけ: 「これを解いてください」 → 依然として失敗。
- 言語を伝える: 「これはタイ語で書かれています」 → 依然として失敗。
- 「カンニングペーパー」を与える(マッピング): 「この記号は1を意味し、これは2を意味します」といったリストをAIに見せる → 改善はしたが、完璧ではない。
- 魔法のトリック(Few-Shot Prompting): これが勝者でした。研究者たちは、最初にいくつかの例をAIに与えました。
- 例1: 「これはタイ語の問題です:1 + 1 = 2。これが答えです。」
- 例2: 「もう一つ別の例です……」
- さて、次はこれです: 「これを解いてください。」
これらの奇妙な数字のスタイルを扱うための例をいくつか示すことで、AIのパフォーマンスは急上昇しました。それは、本番のテストの前に、新しい言語での練習問題をいくつか学生に見せるようなものです。突然、彼らは数学を完璧にこなせるようになりました。
フォーマットのひねり
論文では、数字がどのようにグループ化されるかについても調査しました。アメリカでは、大きな数字を(3桁ごとにカンマを入れて)1,000,000 のように書きます。ヨーロッパでは、ドット(1.000.000)やスペース(1 000 000)を使うことがあります。
AIはこれらのスタイルにも混乱しました。アメリカのスタイルは完璧に扱えましたが、ヨーロッパのスタイルには苦戦しました。興味深いことに、AIはこれらの数字のフォーマットを、学習データによく登場するIPアドレス(例:192.168.1.1)などのものと混同することがよくありました。
結論
この論文は、これらのAIモデルが「数学が苦手」なのではないと結論づけています。彼らは実際には非常に優れた論理的思考を持っています。問題は、彼らが非常に**脆弱(fragile)**であるということです。彼らは、教え込まれた特定の、慣れ親しんだ方法で数字を見せることに強く依存しています。
もしAIに異なる言語や異なる数字のスタイルで数学をやらせたいのであれば、単に直接尋ねるだけでは不十分です。少しだけ後押しをする必要があります。まずいくつかの例を見せるか、あるいは記号がどのように機能するかを正確に説明してください。一度それを行えば、「スクリプト税」は消え去り、数学は再び容易なものとなるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。