← 最新の論文
💬 NLP

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

本論文は、数学的推論およびコード生成タスクにおける整数および浮動小数点数の予測精度を向上させるため、教師なしエントロピー最適化を教師ありかつ距離フリーの枠組みへと再定式化する新しい訓練目的であるDigit Entropy Loss(DEL)を導入する。

原著者: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの、少し混乱しているロボットに数学を教える状況を想像してください。そのロボットは物語を書いたり会話したりするのが得意ですが、数字になると、よく桁を間違えます。答えが「13」なのに「12」と言ったり、「12」の代わりに「14」と推測したりすることがあります。

香港理工大学のビジュアル・コンピューティング・ラボから発表されたこの論文は、このロボットが数字をより上手に扱えるように教える新しい方法を導入しています。彼らはこの新しい方法を**Digit Entropy Loss(DEL)**と呼んでいます。

ここでは、彼らがロボットの数学スキルを修正した物語を、簡単なアナロジーを用いて説明します。

1. 問題:ロボットの「最善の推測」の癖

伝統的に、これらの AI ロボット(大規模言語モデルと呼ばれる)を訓練する際には、**最尤推定(MLE)**と呼ばれる方法が使われてきました。

  • アナロジー: ロボットが多肢選択試験を受けていると想像してください。MLE はロボットに次のように伝えます。「あなたが最も可能性が高いと思う答えを選んでください。」
  • 欠点: ロボットはあまりにも丁寧です。ロボットは、「ええと、『12』が最善の答えだけど、『13』や『11』もまあ近いから、これらにも少しだけ確率を与えよう」と考えます。
  • 結果: ロボットは決断できなくなります。数字の間で揺れ動き、答えが整数でなければならないのに「12.4」と言ったり、自信が足りなかったために間違った桁を選んでしまったりするエラーを引き起こします。

2. 従来の修正法:「距離」の罠

研究者たちは、この問題を修正するために「ペナルティ」システムを追加しようと試みました。

  • アナロジー: 彼らはロボットに次のように言いました。「答えが 5 で、あなたが 4 と推測したなら、まあいいでしょう、近いのですから。しかし、9 と推測したなら、ひどいですね!」彼らは数字が一直線に並んだ地図を作成し、ロボットが推測した値が真実からどれほど離れているかによって罰を与えるようにしました。
  • 問題点: この論文は、この「距離マップ」は人工的なものであると主張しています。現実世界では、数字は単に線上の点ではなく、それぞれ固有の意味を持つ記号です。時には、ロボットは数字の「2」が数字の「3」よりも、文字の「Z」に似ていると学習してしまいます。ロボットに厳格な距離ルールに従わせることは、それを混乱させ、推測を硬直化(鋭利化)させたり、曖昧化(平坦化)させたりします。

3. 新しい解決策:「自信コーチ」(DEL)

著者たちはDigit Entropy Loss(DEL)を提案します。ロボットが答えからどれほど離れているかを測る代わりに、ロボットがどれほど確信を持っているかに焦点を当てます。

  • アナロジー: 推測と目標の間の距離を気にしないコーチを想像してください。代わりに、コーチはこう言います。「近いのか遠いのかは関係ありません。ただ、あなたの答えに100% 確信を持ってほしいのです。もしあなたが『5』に 90% 確信し、『6』に 10% 確信しているなら、あなたは優柔不断です。『5』に 100% 確信し、それ以外は 0% 確信してほしいのです。」
  • 仕組み:
    1. 監督された確信: 彼らはロボットに、すべての桁を単純な「はい/いいえ」の質問として扱うように教えます。「この桁は 5 ですか?はいかいいえか?」これにより、ロボットは曖昧な推測ではなく、鋭く明確な決定を下すことを強制されます。
    2. 距離ルールなし: 彼らは「距離マップ」を捨て去ります。人間が作ったルールを押し付けるのではなく、ロボットが見たデータに基づいて数字間の自然な関係性を学習させます。
    3. 小数の処理: 従来の方法は、整数(10 など)と小数(10.5 など)を別々に扱っていたため、ロボットがつまずく「崖」が生じていました。DEL は、整数部分と小数部分を、2 つの別々の島ではなく、1 つの滑らかな連続した流れ、つまり単一の長い数直線として扱います。

4. 結果:より鋭い数学

研究者たちは、CodeLlama、Mistral、DeepSeek、Qwen-2.5 という 4 種類の AI ロボットに対し、7 つの異なる数学ベンチマークを用いて、この新しい「自信コーチ」をテストしました。

  • 結果: DEL で訓練されたロボットは、間違いを減らしました。彼らは単に正解をより多く得ただけではなく、間違えた場合でも、その誤答は正解にずっと近くなりました(例:50 ではなく、13 の代わりに 12 と推測するなど)。
  • 視覚的証拠: 論文の例では、従来の方法では論理は正しかったが最終的な数字が間違っていたこと(買い物旅行の総費用を計算したが、最終的なドル額を間違えたなど)が確認できます。一方、DEL 手法では、論理も最終的な数字も両方とも正しくなっていました。

要約

要するに、この論文はこう述べています:AI ロボットに数字がどれほど「近い」かを推測させるのをやめ、代わりに、予測している正確な桁について絶対的な確信を持つように教えなさい。 人工的な距離ルールを取り除き、鋭く自信に満ちた予測を構築することに焦点を当てることで、ロボットは数学とコード生成において格段に上達しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →