← Nieuwste papers
💬 NLP

Unified Data Selection for LLM Reasoning

Dit artikel introduceert High-Entropy Sum (HES), een trainingsvrije metriek die hoogwaardige redeneringsdata efficiënt identificeert door de entropie van de top-tokens op te tellen, waardoor de prestaties van grote taalmodellen aanzienlijk worden verbeterd in de paradigma's van Supervised Fine-tuning, Rejection Fine-tuning en Reinforcement Learning, terwijl de rekenkosten worden verlaagd.

Oorspronkelijke auteurs: Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een briljante maar zeer jonge student (een Groot Taalmodel) te leren complexe puzzels op te lossen, zoals geavanceerde wiskundeproblemen. De student leert door duizenden voorbeeldoplossingen te lezen. Maar hier zit het probleem: niet alle oplossingen zijn even goed. Sommige zijn heldere, logische meesterwerken, terwijl andere een rommelige, verwarrende geintekst zijn. Als je de student alle rommelige oplossingen samen met de goede voert, kan dat leiden tot verwarring of het aanleren van slechte gewoontes.

Lange tijd probeerden onderzoekers de slechte voorbeelden eruit te filteren door te kijken naar simpele dingen, zoals hoe lang de oplossing was of hoe "verbaasd" het model gemiddeld leek tijdens het schrijven ervan. Maar het artikel betoogt dat deze methoden zijn als het beoordelen van een hele film op basis van de gemiddelde helderheid; ze missen de belangrijkste, dramatische momenten.

De Kernidee: Het Vinden van de "Plotwendingen"

De auteurs van dit artikel stellen een nieuwe manier voor om de beste trainingsdata te vinden, genaamd High-Entropy Sum (HES).

Stel je een redeneerproces (zoals het oplossen van een wiskundeprobleem) voor als een lange roadtrip.

  • Tokens met lage entropie: Dit zijn de saaie, voorspelbare delen van de reis. "Sla linksaf", "Rijd rechtdoor", "De lucht is blauw". Het model weet precies wat er als volgt komt. Het is op de automatische piloot.
  • Tokens met hoge entropie: Dit zijn de kritieke beslispunten. "Wacht, moet ik hier afslaan? Of misschien een omweg nemen? Wat als ik dit rare pad probeer?" Dit is waar het model echt nadenkt, opties afweegt en een moeilijke keuze maakt.

De grote ontdekking van het artikel is dat de kwaliteit van een redeneerpad niet gaat over hoeveel "saie" stappen het bevat, maar over hoeveel van deze "kritieke beslispunten" het succesvol navigeert.

De Nieuwe Metriek: De "High-Entropy Sum"

In plaats van het "verrassingsniveau" van de hele reis te middelen (wat de belangrijke momenten verwaterd met de saaie), hebben de auteurs een nieuwe score uitgevonden die HES heet.

De Analogie: Stel je voor dat je een filmcriticus bent die een film beoordeelt.

  • Oude Methode (Gemiddelde Entropie): Je beoordeelt de film op basis van het gemiddelde opwindingsniveau van elke seconde. Als de film 90 minuten saaie dialoog heeft en 5 minuten van een explosie, is de gemiddelde score laag. Je zou kunnen missen dat de explosie een meesterwerk was.
  • De HES-Methode: Je negeert de saaie 90 minuten. Je kijkt alleen naar de top 0,5% van de meest opwindende, onvoorspelbare momenten (de explosies, de plotwendingen). Je telt de intensiteit van alleen die momenten op. Als een film een paar ongelooflijke, hoog-risico scènes heeft, krijgt het een hoge score. Als een film gewoon een vlakke, saaie rit is zonder verrassingen, krijgt het een lage score.

Het artikel toont aan dat deze "som van de beste momenten" de perfecte manier is om een hoogwaardig redeneerpad te onderscheiden van een laagwaardig pad.

Hoe Ze Het Gebruikten (De Drie Trainingsstijlen)

Het team testte deze "HES-filter" op drie verschillende manieren om AI te leren, en het werkte geweldig in allemaal:

  1. Supervised Fine-Tuning (SFT) - "De Leerboekmethode":

    • Scenario: Je hebt een enorme bibliotheek met opgeloste problemen. Je wilt de beste eruit kiezen om de AI te leren.
    • Resultaat: Toen ze HES gebruikten om alleen de top 20% van de beste voorbeelden te kiezen, leerde de AI net zo goed alsof ze de hele bibliotheek had gelezen. Sterker nog, als ze de slechtste 20% (laagste HES) kozen, werd de AI veel slechter. Het bewees dat minder meer is, zolang je maar de juiste "minder" kiest.
    • Bonus: Ze ontdekten dat ze een klein, goedkoop computermodel konden gebruiken om te filteren voor een groot, duur model, waardoor enorme hoeveelheden geld werden bespaard.
  2. Rejection Fine-Tuning (RFT) - "De Meerkezemethode":

    • Scenario: De AI genereert 32 verschillende antwoorden op één vraag. Je moet het beste eruit kiezen om te behouden.
    • Resultaat: In plaats van willekeurig te kiezen of gewoon het langste antwoord te kiezen, gebruikten ze HES om het antwoord met de meeste "kritische denkmomenten" te kiezen. Dit sloeg consequent het raden.
  3. Versterkingsleren (RL) - "De Proef-en-Foutmethode":

    • Scenario: De AI probeert een probleem op te lossen, krijgt een beloning als het goed is, en leert van de ervaring.
    • Resultaat: Ze lieten de AI veel pogingen genereren. Ze gebruikten HES om alleen de beste 50% van de succesvolle pogingen te selecteren om de AI te leren. Hierdoor leerde de AI veel sneller en beter dan als ze alle pogingen hadden gebruikt (inclusief de middelmatige).

Waarom Dit Belangrijk Is (Zonder Hype)

Het artikel beweert dat deze methode een "geünificeerde" oplossing is. Het vereist niet het trainen van een nieuwe, dure AI alleen om te filteren. Het is een simpele wiskundige berekening gebaseerd op de eigen interne "verrassingsniveaus" van het model.

  • Het is Snel: Het vertraagt het trainingsproces niet.
  • Het is Goedkoop: Je kunt een klein model gebruiken om data te filteren voor een groot model.
  • Het is Effectief: Het helpt de AI consequent betere redeneervaardigheden aan te leren door te focussen op de "kritieke splitsingen in de weg" waar echt denken plaatsvindt, in plaats van de saaie, voorspelbare delen.

Kortom, het artikel zegt: Beoordeel een redeneerpad niet op basis van de lengte of de gemiddelde kwaliteit. Beoordeel het op de intensiteit van de moeilijkste, meest kritieke momenten. Door uitsluitend op die momenten te focussen, kunnen we AI leren beter, sneller en goedkoper te denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →