← Nieuwste papers
💬 NLP

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

Dit artikel introduceert Digit Entropy Loss (DEL), een nieuw trainingsdoel dat ontoezichtbare entropieoptimalisatie herformuleert tot een toezichtbaar, afstandsvrij kader om de nauwkeurigheid van grote taalmodellen bij het voorspellen van zowel gehele als zwevendekommagetallen te verbeteren in wiskundige redenering en codegeneratietaken.

Oorspronkelijke auteurs: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slim, maar lichtelijk verward robot leert rekenen. De robot is uitstekend in het schrijven van verhalen en chatten, maar als het op cijfers aankomt, maakt hij vaak fouten in de cijfers. Hij kan "12" zeggen terwijl het antwoord "13" is, of hij kan "14" raden in plaats van "12".

Dit paper, van het Visual Computing Lab aan de Hong Kong Polytechnic University, introduceert een nieuwe manier om deze robot beter met cijfers om te laten gaan. Zij noemen hun nieuwe methode Digit Entropy Loss (DEL).

Hier is het verhaal van hoe ze de rekenvaardigheden van de robot hebben opgelost, met behulp van eenvoudige analogieën:

1. Het probleem: De "beste gok"-gewoonte van de robot

Traditioneel gebruiken we bij het trainen van deze AI-robots (zogenaamde Large Language Models) een methode genaamd Maximum Likelihood Estimation (MLE).

  • De analogie: Stel je voor dat de robot een meerkeuzetoets maakt. MLE zegt tegen de robot: "Kies gewoon het antwoord dat je het meest waarschijnlijk vindt."
  • De fout: De robot is te beleefd. Hij denkt: "Nou, '12' is het beste antwoord, maar '13' en '11' zijn een beetje dichtbij, dus ik geef ze ook een klein beetje waarschijnlijkheid."
  • Het resultaat: De robot wordt onbeslist. Hij zweeft tussen cijfers, wat leidt tot fouten zoals het zeggen van "12,4" terwijl het antwoord een geheel getal moet zijn, of gewoon het verkeerde cijfer kiezen omdat hij niet zeker genoeg was.

2. De oude oplossingen: De "afstand"-val

Onderzoekers probeerden dit op te lossen door een "straf"-systeem toe te voegen.

  • De analogie: Ze zeiden tegen de robot: "Als het antwoord 5 is en jij raadt 4, dat is oké, dat is dichtbij. Maar als je 9 raadt, is dat verschrikkelijk!" Ze maakten een kaart waar cijfers in een lijn zijn gerangschikt, en de robot wordt gestraft op basis van hoe ver zijn gok verwijderd is van de waarheid.
  • Het probleem: Het paper betoogt dat deze "afstandskaart" kunstmatig is. In de echte wereld zijn cijfers niet alleen punten op een lijn; het zijn symbolen met hun eigen betekenis. Soms leert de robot dat het cijfer "2" meer lijkt op de letter "Z" dan op het cijfer "3". De robot dwingen om een strikte afstandsregel te volgen, verward hem en maakt zijn gokken ofwel te star (gescherpt) of te vaag (afgevlakt).

3. De nieuwe oplossing: De "Zekerheidscoach" (DEL)

De auteurs stellen Digit Entropy Loss (DEL) voor. In plaats van te meten hoe ver de robot van het antwoord verwijderd is, richten ze zich op hoe zeker de robot is.

  • De analogie: Stel je voor dat een coach niet geeft om de afstand tussen je gok en het doel. In plaats daarvan zegt de coach: "Het maakt me niet uit of je dichtbij of ver weg bent. Ik wil gewoon dat je 100% zeker bent van je antwoord. Als je 90% zeker bent van '5' en 10% zeker van '6', dan ben je onzeker. Ik wil dat je 100% zeker bent van '5' en 0% zeker van alles anders."
  • Hoe het werkt:
    1. Supervised Certainty: Ze leren de robot om elk cijfer te behandelen als een simpele "Ja/Nee"-vraag. "Is dit cijfer een 5? Ja of Nee?" Dit dwingt de robot om een scherpe, duidelijke beslissing te nemen in plaats van een wazige gok.
    2. Geen afstandsregels: Ze gooien de "afstandskaart" weg. Ze laten de robot de natuurlijke relatie tussen cijfers leren op basis van de data die hij heeft gezien, in plaats van een door mensen gemaakte regel op te leggen.
    3. Omgaan met decimalen: Eerdere methoden behandelden gehele getallen (zoals 10) en decimalen (zoals 10,5) verschillend, wat leidde tot een "afgrond" waar de robot struikelde. DEL behandelt het gehele getal en het decimale deel als één vloeiende, continue stroom, zoals één lange getallenlijn in plaats van twee aparte eilanden.

4. De resultaten: Scherper rekenen

De onderzoekers testten deze nieuwe "Zekerheidscoach" op vier verschillende soorten AI-robots (CodeLlama, Mistral, DeepSeek en Qwen-2.5) met behulp van zeven verschillende rekenbenchmarks.

  • Het resultaat: De robots die met DEL werden getraind, maakten minder fouten. Ze kregen niet alleen vaker het juiste antwoord; wanneer ze het toch fout hadden, was het verkeerde antwoord veel dichter bij het juiste (bijvoorbeeld 12 raden in plaats van 13, in plaats van 50).
  • Het visuele bewijs: In de voorbeelden uit het paper zie je dat oudere methoden vaak de logica goed hadden maar het uiteindelijke cijfer fout (zoals het berekenen van de totale kosten van een boodschappenrit, maar het verkeerde dollarbedrag krijgen). De DEL-methode kreeg zowel de logica als het uiteindelijke cijfer correct.

Samenvatting

Kortom, dit paper zegt: Stop met het leren van AI-robots om te raden hoe "dichtbij" een cijfer is. Leer hen in plaats daarvan om absoluut zeker te zijn van het exacte cijfer dat ze voorspellen. Door kunstmatige afstandsregels te verwijderen en zich te richten op het bouwen van scherpe, zelfverzekerde voorspellingen, werden de robots veel beter in rekenen en het genereren van code.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →