← Derniers articles
💬 NLP

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

Ce papier introduit la perte d'entropie numérique (DEL), un nouvel objectif d'entraînement qui reformule l'optimisation de l'entropie non supervisée en un cadre supervisé sans distance pour améliorer la précision des grands modèles de langage dans la prédiction des nombres entiers et à virgule flottante, et ce, à travers des tâches de raisonnement mathématique et de génération de code.

Auteurs originaux : Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

Publié 2026-05-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez les mathématiques à un robot très intelligent, mais légèrement confus. Ce robot est excellent pour écrire des histoires et discuter, mais lorsqu'il s'agit de nombres, il commet souvent des erreurs de chiffres. Il pourrait dire « 12 » alors que la réponse est « 13 », ou deviner « 14 » au lieu de « 12 ».

Ce document, issu du Laboratoire d'Informatique Visuelle de l'Université Polytechnique de Hong Kong, présente une nouvelle méthode pour apprendre à ce robot à mieux gérer les nombres. Ils appellent leur nouvelle méthode Perte d'Entropie des Chiffres (Digit Entropy Loss, DEL).

Voici l'histoire de la façon dont ils ont corrigé les compétences mathématiques du robot, en utilisant des analogies simples :

1. Le Problème : L'habitude du robot de faire un « Meilleur Devin »

Traditionnellement, lors de l'entraînement de ces robots d'IA (appelés Modèles de Langage de Grande Taille), nous utilisons une méthode appelée Estimation de Vraisemblance Maximale (MLE).

  • L'Analogie : Imaginez que le robot passe un test à choix multiples. La MLE dit au robot : « Choisis simplement la réponse que tu penses être la plus probable. »
  • Le Défaut : Le robot est trop poli. Il pense : « Eh bien, '12' est la meilleure réponse, mais '13' et '11' sont un peu proches, alors je vais leur accorder un tout petit peu de probabilité aussi. »
  • Le Résultat : Le robot devient indécis. Il hésite entre les nombres, ce qui conduit à des erreurs comme dire « 12,4 » alors que la réponse doit être un nombre entier, ou simplement choisir le mauvais chiffre parce qu'il n'était pas assez confiant.

2. Les Anciennes Solutions : Le Piège de la « Distance »

Les chercheurs ont tenté de résoudre ce problème en ajoutant un système de « pénalité ».

  • L'Analogie : Ils ont dit au robot : « Si la réponse est 5 et que tu devines 4, c'est acceptable, c'est proche. Mais si tu devines 9, c'est terrible ! » Ils ont créé une carte où les nombres sont disposés sur une ligne, et le robot est puni en fonction de la distance entre sa devinette et la vérité.
  • Le Problème : L'article soutient que cette « carte de distance » est artificielle. Dans le monde réel, les nombres ne sont pas simplement des points sur une ligne ; ce sont des symboles avec leurs propres significations. Parfois, le robot apprend que le nombre « 2 » ressemble plus à la lettre « Z » qu'au nombre « 3 ». Forcer le robot à suivre une règle de distance stricte le confond et rend ses devinettes soit trop rigides (affûtées), soit trop vagues (aplaties).

3. La Nouvelle Solution : Le « Coach de Confiance » (DEL)

Les auteurs proposent la Perte d'Entropie des Chiffres (DEL). Au lieu de mesurer à quelle distance le robot se trouve de la réponse, ils se concentrent sur le degré de certitude du robot.

  • L'Analogie : Imaginez un entraîneur qui ne se soucie pas de la distance entre votre devinette et la cible. Au lieu de cela, l'entraîneur dit : « Je m'en fiche que tu sois proche ou loin. Je veux juste que tu sois certain à 100 % de ta réponse. Si tu es certain à 90 % de '5' et à 10 % de '6', tu es indécis. Je veux que tu sois certain à 100 % de '5' et à 0 % de tout le reste. »
  • Comment cela fonctionne :
    1. Certitude Supervisée : Ils enseignent au robot à traiter chaque chiffre comme une simple question « Oui/Non ». « Ce chiffre est-il un 5 ? Oui ou Non ? » Cela force le robot à prendre une décision nette et claire plutôt qu'une devinette floue.
    2. Pas de Règles de Distance : Ils jettent la « carte de distance ». Ils laissent le robot apprendre la relation naturelle entre les nombres en fonction des données qu'il a vues, plutôt que de lui imposer une règle créée par l'homme.
    3. Gestion des Décimaux : Les méthodes précédentes traitaient différemment les nombres entiers (comme 10) et les décimaux (comme 10,5), créant un « précipice » où le robot trébuchait. DEL traite la partie entière et la partie décimale comme un flux continu et lisse, comme une seule longue ligne de nombres plutôt que deux îles séparées.

4. Les Résultats : Des Mathématiques Plus Affûtées

Les chercheurs ont testé ce nouveau « Coach de Confiance » sur quatre types différents de robots d'IA (CodeLlama, Mistral, DeepSeek et Qwen-2.5) en utilisant sept benchmarks mathématiques différents.

  • Le Résultat : Les robots entraînés avec la DEL ont fait moins d'erreurs. Ils n'ont pas seulement obtenu la bonne réponse plus souvent ; lorsqu'ils se trompaient, la mauvaise réponse était beaucoup plus proche de la bonne (par exemple, deviner 12 au lieu de 13, plutôt que 50).
  • La Preuve Visuelle : Dans les exemples du document, on peut voir que les anciennes méthodes obtenaient souvent la logique correcte mais le nombre final incorrect (comme calculer le coût total d'une course d'achats mais se tromper sur le montant final en dollars). La méthode DEL obtenait à la fois la logique et le nombre final corrects.

Résumé

En bref, ce document dit : Arrêtez d'enseigner aux robots d'IA à deviner à quel point un nombre est « proche ». Enseignez-leur plutôt à être absolument certains du chiffre exact qu'ils prédisent. En éliminant les règles de distance artificielles et en se concentrant sur la construction de prédictions nettes et confiantes, les robots sont devenus beaucoup meilleurs en mathématiques et en génération de code.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →