← Nieuwste papers
🤖 AI

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

GRACE is een schaalbare, beloningsmodelvrije methode voor datacuratie die de efficiëntie van post-training verbetert door redeneringsdata op stapniveau te scoren en te selecteren aan de hand van met gradiënten uitgelijnde signalen, waardoor prestaties op het niveau van de volledige dataset worden bereikt met slechts 5% van de dataset.

Oorspronkelijke auteurs: Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: "Het Geheel is Niet Gelijk aan de Som van de Delen"

Stel je voor dat je een student probeert te leren hoe je een complex wiskundig probleem oplost. Je geeft hen een pagina uit een leerboek die de volledige oplossing toont: Stap 1, Stap 2, Stap 3, tot aan het uiteindelijke antwoord.

De oude manier (Huidige Methoden):
De meeste AI-trainingssystemen behandelen die hele pagina als één enkele "goede" of "slechte" les. Als het uiteindelijke antwoord correct is, krijgt de hele pagina een gouden ster. Als het antwoord fout is, krijgt de hele pagina een rode X.

  • De Tekortkoming: In werkelijkheid zijn sommige stappen op die pagina briljante inzichten, terwijl andere slechts de student zijn die herhaalt wat ze drie regels eerder zeiden, of afdwalen naar een verwarrende zijweg die nergens toe leidt. Door de hele pagina als één eenheid te behandelen, verspillen AI-systemen tijd aan het bestuderen van saaie of verwarrende delen en missen ze misschien de briljante inzichten die verborgen zitten in het midden.

De Oplossing: GRACE (De "Stap-voor-Stap" Coach)

De auteurs hebben een methode ontwikkeld genaamd GRACE (Gradient-aligned Reasoning dAta Curation). In plaats van de hele pagina te beoordelen, fungeert GRACE als een super-observante coach die de student stap voor stap bij het oplossen van het probleem observeert.

Hier is hoe GRACE werkt, met behulp van een Wandel-Analogie:

Stel je voor dat de AI een wandelaar is die probeert een bergtop te bereiken (het Correcte Antwoord). De redeneringspiste is het pad dat de wandelaar aflegt.

  1. Het "Antwoord-uitlijning"-Signaal (Kijken naar de Top):

    • GRACE vraagt: "Wijst deze specifieke stap in de richting van de bergtop?"
    • Als een stap de wandelaar dichter bij de top brengt, krijgt het een hoge score.
    • Als een stap de wandelaar in een cirkel laat lopen of naar een afgrond leidt, krijgt het een lage score.
  2. Het "Traject-consistentie"-Signaal (Kijken naar het Pad Achter):

    • GRACE vraagt ook: "Maakt deze stap zin gezien waar de wandelaar net vandaan kwam?"
    • Als de wandelaar een steile helling beklimt en plotseling probeert in een rivier te zwemmen, is dat een vreemde sprong. Zelfs als de rivier mooi is, breekt het de flow van de klim. GRACE straft stappen af die los lijken te staan van de vorige stappen.

Het Geheime Ingrediënt: De "Magische Spiegel" (Geen Teruglopen Nodig)

Normaal gesproken zou je, om te weten of een stap goed is, het hele trainingsproces moeten simuleren, stoppen, terugspoelen en precies berekenen hoe die ene stap het brein van de AI heeft veranderd. Dit is als proberen de wind te meten door een raceauto te stoppen, de motor uit elkaar te halen en de versnellingen te controleren. Het duurt eeuwen en is te traag voor enorme datasets.

GRACE's Innovatie:
GRACE gebruikt een slimme truc genaamd een "Représentatie-niveau Gradiënt Proxy".

  • De Analogie: In plaats van de auto uit elkaar te halen, kijkt GRACE naar de "uitlaatgassen" (de interne signalen) die uit de motor komen terwijl de auto vooruit rijdt.
  • Door deze signalen te bekijken tijdens een enkele doorloop (gewoon het tekst één keer lezen), kan GRACE precies inschatten hoe nuttig een stap was zonder ooit te hoeven "terugspoelen" of complexe achterwaartse berekeningen uit te voeren. Het is als het oordelen over de vaardigheid van een chef door de geur van het eten te ruiken terwijl het kookt, in plaats van elke hap te proeven nadat de maaltijd klaar is.

De Resultaten: Minder Data, Betere Prestaties

Het artikel testte deze methode uit op een enorme dataset van wiskundeproblemen (MMathCoT-1M) met behulp van een visueel-taalmodel (Qwen3-VL).

  • De Oude Manier: Om geweldige resultaten te krijgen, moet je de AI meestal alle data voeden (100%).
  • De GRACE-Manier:
    • Met slechts 20% van de data (de beste 1 van de 5 stappen) presteerde de AI 8,8% beter dan wanneer het was getraind op 100% van de data.
    • Met slechts 5% van de data presteerde de AI net zo goed als met de volledige dataset.

Waarom werd het beter met minder data?
Trainen op alles is als een student dwingen om elke pagina van een bibliotheek te lezen, inclusief de pagina's met typefouten, saaie herhaling en verkeerde afslagen. Dit verwarde de student. GRACE filtert de "ruis" eruit en voert de AI alleen de "pure goud" stappen aan. Dit voorkomt dat de AI in de war raakt door slechte voorbeelden en helpt het sneller en slimmer te leren.

Samenvatting

  • Het Probleem: Huidige AI-training behandelt elke stap in een redeneerketen als even belangrijk, waardoor tijd wordt verspild aan slechte stappen.
  • De Oplossing: GRACE scoort elke enkele stap individueel op basis van of het helpt het antwoord te bereiken en of het past bij het verhaal tot nu toe.
  • De Truc: Het gebruikt een "alleen voorwaartse doorloop"-shortcut om stappen direct te scoren, zonder dat er langzame, complexe berekeningen nodig zijn.
  • Het Resultaat: Je kunt een slimmere AI trainen met een klein fractie van de data, waardoor tijd en rekenkracht worden bespaard terwijl de prestaties daadwerkelijk verbeteren.

Het artikel concludeert dat de waarde van redeneringsdata niet alleen gaat over of het uiteindelijke antwoord juist is; het gaat erom of de reis naar dat antwoord een constructief, logisch pad was. GRACE vindt die constructieve paden en gooit de rest weg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →