← Nieuwste papers
💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

Deze paper introduceert CalibAdv, een methode voor het kalibreren van voordelen in GRPO die de training van diepe zoekagenten stabiliseert en de prestaties verbetert door de onevenwichtige en grove toewijzing van negatieve voordelen te corrigeren op basis van de juistheid van tussenstappen.

Oorspronkelijke auteurs: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Gepubliceerd 2026-04-21
📖 2 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

`) om te denken. In de oude methode werden deze tekens ook gestraft of beloond op basis van het antwoord.

  • Het probleem: Als de robot denkt "Hmm, wat moet ik doen?" en dat wordt gestraft omdat het antwoord fout was, leert de robot dat nadenken slecht is.
  • De oplossing: Ze zeggen: "Deze denk-tekens tellen niet mee voor de straf." Zo blijft de robot veilig nadenken zonder bang te zijn voor straf, wat voorkomt dat hij in een cirkel van onzin terechtkomt.

3. Het Resultaat: Een Stabilere Robot

Door deze aanpassingen zien ze drie dingen gebeuren:

  1. Geen ineenstorting meer: De robot crasht niet meer halverwege de training. Hij blijft stabiel leren.
  2. Beter presteren: Omdat de robot niet meer gestraft wordt voor goede tussenstappen, leert hij sneller en geeft hij betere antwoorden (ongeveer 12% beter in tests).
  3. Natuurlijk taalgebruik: De robot blijft menselijke zinnen maken in plaats van te veranderen in een machine die alleen maar tekens herhaalt.

Samenvatting in één zin

CalibAdv is als een slimme trainer die niet meer zegt "Je bent een slechte kok" als de maaltijd mislukt, maar zegt: "Je hebt de groenten perfect gekookt, maar de saus verbrand; laten we de saus verbeteren zonder je te straffen voor je goede werk," zodat de kok gemotiveerd blijft en nooit de moed opgeeft.

Dit maakt het mogelijk om slimme zoekrobots te bouwen die betrouwbaar en stabiel blijven werken, zelfs bij complexe vragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →