← Nieuwste papers
💬 NLP

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

Het artikel introduceert TextReg, een regularisatiekader dat prompt-distributie-overfitting in grote taalmodellen tegengaat door representatieve inefficiëntie te beheersen via tekstuele gradiënten, waardoor de generalisatie buiten de oorspronkelijke verdeling aanzienlijk verbetert in vergelijking met bestaande optimalisatiemethoden.

Oorspronkelijke auteurs: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

Gepubliceerd 2026-05-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme maar letterlijk denkende robot leert een raadsel op te lossen. Je geeft het een set instructies (een "prompt").

In het verleden, toen onderzoekers probeerden deze instructies automatisch te verbeteren met behulp van de feedback van de robot zelf, trad er een vreemd probleem op. De instructies werden langer en langer, volgepropt met kleine, specifieke regels zoals: "Als het getal 7 is, doe X," en "Als het object een tomaat is, doe Y."

Aan het begin leek dit geweldig omdat de robot perfecte scores behaalde op de oefenraadsels. Maar wanneer je het een nieuw raadsel gaf dat het nog nooit had gezien, faalde het op erbarmelijke wijze. Het was als een student die de antwoorden van een specifieke oefentoets had uit het hoofd geleerd, maar de wiskunde niet begreep, waardoor hij een iets ander probleem niet kon oplossen.

De auteurs noemen dit "Prompt Distributional Overfitting". In eenvoudige termen: de instructies werden te "vastgeklemd" op de specifieke oefenvoorbeelden en verloren hun vermogen om de echte wereld te hanteren.

De Oplossing: TextReg (De "Slimme Redacteur")

Het artikel introduceert een nieuwe methode genaamd TextReg. Denk aan TextReg als een strenge, wijze redacteur die het proces van het schrijven van instructies door de robot in de gaten houdt en het ervan weerhoudt rommelig te worden.

Hier is hoe TextReg werkt, met behulp van drie eenvoudige analogieën:

1. De "Dubbelcheck"-filter (Dual-Evidence Gradient Purification)

Stel je voor dat de robot een nieuwe regel voorstelt: "Tel tomaten altijd als groenten."

  • De Oude Manier: De robot zou dit misschien gewoon accepteren omdat het werkte voor het specifieke tomatenvoorbeeld in de oefentoets.
  • De TextReg Manier: TextReg stelt twee vragen:
    1. "Werkte deze regel alleen omdat van dit ene specifieke tomaat?" (Lokale Check)
    2. "Hebben we deze regel eerder zien werken voor andere vruchten of objecten?" (Globale Check)
      Als de regel alleen werkt voor tomaten en elders niet is gezien, gooit TextReg het weg. Het behoudt alleen regels die breed en nuttig zijn, zoals "Tel alle vruchten."

2. De "Fitness Tracker" (Semantic Edit Regularization)

Elke keer dat de instructies veranderen, controleert TextReg de "gezondheid" van de prompt. Het kijkt naar twee dingen:

  • Lengte: Zijn de instructies onnodig lang geworden? (Als het toevoegen van te veel woorden aan een zin).
  • Bereik: Zijn de instructies te smal geworden? (Als het toevoegen van een regel die alleen geldt voor één specifieke dag van de week).
    Als de instructies te lang of te specifiek worden, genereert TextReg een "correctiesignaal" dat de robot vertelt om het overtollige vet te trimmen en de regels te verbreden. Het is als een personal trainer die roept: "Stop met het toevoegen van junkfood aan je dieet!"

3. De "Geleide Herschrijving" (Regularization-Guided Prompt Update)

Tot slot, wanneer de robot de instructies herschrijft, luistert het niet alleen naar de taakfeedback (hoe het raadsel op te lossen). Het luistert ook naar de "fitness tracker".

  • Als de taak zegt: "Voeg een regel toe over tomaten," maar de fitness tracker zegt: "Maak het niet specifiek," dwingt TextReg de robot om een middenweg te vinden. Het kan de regel herschrijven zodat het gaat over "groenten" in het algemeen in plaats van alleen tomaten.

De Resultaten: Waarom Het Belangrijks Is

De auteurs hebben dit getest op verschillende redeneertaken (zoals logica-raadsels en wiskundeproblemen). Ze ontdekten dat:

  • Oude methoden (zoals TextGrad of REVOLVE) vaak lange, rommelige instructies creëerden die goed werkten op oefentoetsen maar faalden op nieuwe, moeilijkere versies van dezelfde taken.
  • TextReg creëerde kortere, schonere instructies. Omdat de regels breed waren en niet gekoppeld aan specifieke voorbeelden, presteerde de robot veel beter op nieuwe, onbekende problemen (wat onderzoekers "Out-of-Distribution" generalisatie noemen).

In feite verbeterde TextReg de nauwkeurigheid met tot 16,5% ten opzichte van eerdere methoden op moeilijke taken.

De Conclusie

TextReg behandelt het schrijven van instructies voor AI als het schrijven van een goed schoolboek. Een goed schoolboek zou niet alleen elke enkele voorbeeld moeten opsommen die je ooit hebt gezien; het moet de algemene principes leren zodat je problemen kunt oplossen die je nog nooit eerder hebt gezien. TextReg zorgt ervoor dat de instructies van de AI gefocust blijven op die principes, waardoor het voorkomen wordt dat het de oefentoets uit het hoofd leert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →