← 最新の論文
🤖 machine learning

Efficient numeracy in language models through single-token number embeddings

本論文は、IEEE 754 二進浮動小数点表現に基づく新たな単一トークン符号化戦略「BitTokens」を提案し、これにより言語モデルは算術アルゴリズムをほぼ完全に学習し、マルチトークン数値分割や外部ツールに依存する既存手法よりも複雑な数値問題を効率的に解決できるようになる。

原著者: Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの、少し不器用なロボットに数学を教えることを想像してみてください。このロボットは**大規模言語モデル(LLM)**です。現在、このロボットに大きな 2 桁の数を掛け合わせるよう頼むと、それは単に答えを「知っている」わけではありません。代わりに、自分自身と会話をし、段階的な指示を書き留め、自分の作業を何度も確認することで答えを導き出そうとします。

この論文は、この「自分自身との会話」という方法が驚くほど非効率的であると主張しています。それは、単純な数字を得るために、4,314.97×4,080,0004,314.97 \times 4,080,000 を計算する際、すべての手順を説明する 10 ページの論文を書かせるようなものです。ロボットは、基本的な算数を行うだけで莫大な量の「脳空間(トークン)」を消費し、より難しい問題を解く余地を失ってしまいます。

問題:「単語ごとの」数学の罠

現在、これらのロボットは数字を単語と同じように扱っています。「4,080,000」と入力すると、ロボットはそれを「1」「2」「3」のように、本を 1 文字ずつ読むような、別々の部品(トークン)の長い列として認識します。

  • 比喩: 「123」という数字を「1」「2」「3」という 3 つの別々の文字として読んで数学を計算しようとするのを想像してください。足し算をするには、それぞれの文字を個別に処理し、十の位から「1」を繰り上げ、といった作業が必要です。これは遅く、ぎこちなく、エラーを起こしやすいものです。

このため、ロボットは単純な掛け算の問題を解くだけで、何千もの単語の「推論」を生成しなければなりません。

解決策:「魔法の ID カード」(BitTokens)

著者たちは、ロボットに数字を教える新しい方法として、BitTokensを提案しています。

数字を部品に分解するのではなく、BitTokens はすべての数字に1 つの固有の ID カードを与えます。

  • 比喩: 数字を、読む必要がある文章ではなく、パレット上の特定の「色」と考えてみてください。「赤」を「青と黄色の混合だ」と説明する代わりに、赤そのものである 1 枚のカードをロボットに渡すのです。
  • 仕組み: 彼らは、コンピュータが数字を格納する標準的な方法(IEEE 754、これはコンピュータが小数を格納する方法の普遍的な設計図のようなものです)を使用します。そして、この設計図を 1 つのトークン(ロボットにとっての 1 つの「単語」)に変換します。
  • 結果: ロボットが 4,080,000 という数字を見ると、長い数字の列が見えるわけではありません。その数字の大きさ、精度、符号についてすべてを即座に伝える1 つの記号が見えるのです。

これが重要である理由

この論文は、物事をシンプルで制御された状態に保つために、小さなロボットモデルでこれをテストしました。彼らが発見したことは以下の通りです。

  1. 速度と効率: BitTokens を使用すると、ロボットは数学を行うために 10 ページの論文を書く必要がありませんでした。基本的な加算、乗算、除算を、ほぼ完璧に、単一のステップで解くことができました。
  2. アルゴリズムの学習: 数字が構造化された論理的な方法(コンピュータチップと同じようにバイナリビットを使用)で符号化されているため、ロボットは実際に数学の規則を「学習」することができました。それは、子供に「5」を教える際、5 つの個別の小石を毎回数えさせる代わりに、「5」を表す単一のブロックを与えるようなものです。
  3. トレードオフ: この論文は、非常に複雑で多段階の問題(巨大な数字のリストの標準偏差を計算するなど)については、単一トークン方式が、一度にロボットが「思考」できる深さによって依然として制限されていると指摘しています。しかし、標準的な算術については、古い方法よりもはるかに優れていました。

この論文が主張していないこと

著者たちが実際に言ったことに忠実であることが重要です。

  • 彼らは、これがすぐに医療診断や金融アドバイスを修正するとは言っていません
  • 彼らは、これが現在世界で最も大きく高価なモデルで機能すると主張していません(彼らはより小さな「ナノ」モデルでテストしました)。
  • 彼らは、推論を完全にやめるべきだとは言っていません。彼らが提案するのは、基本的な数学を効率的にすることで、ロボットは本当に難しい問題に対して推論を使用するためのより多くの「脳空間」を余分に持てるようになるという点です。

結論

この論文は、AI モデルが基本的な数学でつまずくのをやめさせる、数字のための新しい「言語」を導入します。数字に長い混乱した説明の代わりに、1 つの効率的な「ID カード」を与えることで、これらのモデルはより速く、より正確に、無駄な努力を減らして計算できるようになります。これは、AI が数字の世界を「見る」方法への根本的なアップグレードです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →