← 最新の論文
💬 NLP

Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs

本論文は、大規模言語モデルの最大誤差ゼロの推論範囲を評価するための指標であるZero-Error Horizon(ZEH)を導入し、GPT-5.2のような最先端のシステムであっても基本的なタスクにおいて失敗することを明らかにするとともに、アルゴリズムの創発を分析する上でのZEHの有用性と、その評価をスケールアップするための効率的な計算手法を提案する。

原著者: Ryoma Sato

公開日 2026-01-23
📖 1 分で読めます☕ さくっと読める

原著者: Ryoma Sato

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、原子力発電所の運営、銀行の管理、あるいは手術の補助を行うために、非常に優秀で超知能的なアシスタントを雇おうとしています。そのアシスタントは、複雑なコンピュータコードを書くことも、量子物理学を説明することもでき、芸術について会話することもできます。しかし、そこには一つ落とし穴があります。そのアシスタントは、時として5歳児にできるようなことさえ失敗してしまうのです。

「GPT-5.2ですら5まで数えられない(Even GPT-5.2 Can't Count to Five)」という論文は、こうしたAIアシスタントをテストするための新しい手法、**「ゼロエラー・ホライゾン(Zero-Error Horizon: ZEH)」を紹介しています。ZEHを単なるテストの点数ではなく、「安全柵(セーフティ・フェンス)」**だと考えてください。

以下に、この論文の知見を分かりやすい比喩を用いて解説します。

1. 「安全柵」の概念(ZEHとは何か?)

ほとんどの人は、AIに対して簡単な問題と難しい問題を混ぜて出し、正解した割合(例えば95%といった成績)でテストします。著者らは、これは安全性が極めて重要な業務においては危険であると述べています。もしAIが数学の問題の99%を正解したとしても、特定の「一つの数字」で失敗してしまうなら、その一度の失敗が惨事を引き起こす可能性があるからです。

ZEHは、AIの「完璧な領域」を取り囲む「柵」です。

  • 柵の内側: AIは100%正確であることが保証されています。
  • 柵の外側: AIは間違いを犯す可能性があります。
  • 柵の高さ: もし掛け算におけるAIのZEHが10であれば、それは10までの数字の掛け算は完璧にできることを意味します。しかし、11の掛け算を求められた瞬間に、失敗する可能性があるのです。

2. 衝撃的な発見(「愚かな」ミス)

著者らは非常に高度なモデル(GPT-5.2)をテストしましたが、その「柵」は単純なタスクにおいて驚くほど低い位置にありました。

  • パリティ・テスト(奇偶判定): 11000 のような数字の列に「1」が奇数個あるか偶数個あるかを数えられるか? AIは、この5桁の数字で失敗しました。その柵は「4」にありました。
  • 括弧テスト: ((((()))))) がバランスの取れた括弧であるかを判別できるか? AIは、実際には「No(不均衡)」であるにもかかわらず、「Yes(均衡)」と答えました。
  • 数学テスト: AIは複雑な物理シミュレーションを書ける一方で、127 × 82 という単純な計算を間違えました。

比喩: マスターシェフが10コースの豪華なフルコースを作れる一方で、サンドイッチを作る際に塩を一粒床に落としてしまうようなものです。普通のキッチンなら、その一粒の塩は無視できるでしょう。しかし、原子炉や銀行においては、その一粒の塩(あるいは一桁の誤り)が壊滅的な結果を招く可能性があるのです。

3. なぜ「成績表」よりもZEHが良いのか

論文では、標準的な正解率(アキュラシー)による評価は、**「メニューを自分に都合よく選ぶ(チェリーピッキング)」**ようなものだと主張しています。

  • 罠: ある研究者が「我々の新しいAIは素晴らしい!掛け算の正解率は99%でした!」と言うかもしれません。しかし、彼らは20までの数字しかテストしていない可能性があります。もし100までの数字でテストすれば、AIは無残に失敗するかもしれません。
  • ZEHによる解決策: ZEHは、メニューの選択を許しません。AIに対し、ある一定の地点までは「すべて」を完璧にこなせることを証明させます。もしAIが13という数字で失敗するなら、柵は12に設定されます。平均スコアがいかに高くても、ZEHはその「危険地帯」がどこから始まるかを正確に教えてくれます。

4. AIはどうやって「学ぶ」のか(暗記 vs 理解)

著者らは、異なるサイズのモデルのファミリー(Qwen2.5)を調査し、規模によってどのように改善されるかを見ています。

  • 小さなモデル(コピー機): 小さなAIモデルは**「暗記」**に依存しています。彼らは学習データの中で 2 × 2 = 4 という答えを「見て」います。しかし、もし 2 × 3 を見たことがなければ、間違った推測をするかもしれません。彼らの「柵」は不安定で、穴だらけです。
  • 大きなモデル(数学者): モデルが大きくなるにつれ、彼らは単なる暗記をやめ、**「ルール(アルゴリズム)」**を学び始めます。
    • 手がかり: 著者らは、大きなモデルは「構造化された」間違いを犯すことを見出しました。例えば、答えが986であるとき、大きなモデルは1006と答えることがあります。その差は正確に20です。これは、人間が筆算で「繰り上がり」のミスをする様子に似ています。
    • 結果: これは、大きなモデルが単に答えを推測しているのではなく、実際に「計算」を行っていることを証明しています。ルールを用いているため、その「安全柵(ZEH)」は着実に、かつ予測可能な形で成長していくのです。

5. 「柵」を確認するコスト

著者らは、この「柵」を確認することがコストのかかる作業であることも認めています。AIが失敗する正確な地点を見つけるには、1, 2, 3...と、失敗するまで全ての問題をテストしなければなりません。

  • 解決策: 彼らは、このテストプロセスを最大10倍高速化するツールキット(ツリー構造やスマートなキャッシュ機能を使用)を開発しました。これは、階段の一段一段を歩いて確認する代わりに、ロボットが数秒で全てのステップをチェックするようなものです。

まとめ

この論文は、安全性に関わる重要な仕事(金融や医療など)において、単に「このAIはどれくらい賢いか?」と問うべきではないと主張しています。むしろ、**「このAIが完璧でなくなる正確な境界線はどこか?」**と問うべきなのです。

**ゼロエラー・ホリゾン(ZEH)**こそが、その境界線です。それは、最も賢いAIであっても、驚くほど単純なタスクにおいて「死角」を持っていることを明らかにし、間違いを始める前に、どの程度まで彼らを信頼できるかを判断するための、具体的かつ数学的な方法を提供してくれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →