Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search
Deze paper introduceert CalibAdv, een methode voor het kalibreren van voordelen in GRPO die de training van diepe zoekagenten stabiliseert en de prestaties verbetert door de onevenwichtige en grove toewijzing van negatieve voordelen te corrigeren op basis van de juistheid van tussenstappen.
Oorspronkelijke auteurs:Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li
Oorspronkelijke auteurs: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
`) om te denken. In de oude methode werden deze tekens ook gestraft of beloond op basis van het antwoord.
Het probleem: Als de robot denkt "Hmm, wat moet ik doen?" en dat wordt gestraft omdat het antwoord fout was, leert de robot dat nadenken slecht is.
De oplossing: Ze zeggen: "Deze denk-tekens tellen niet mee voor de straf." Zo blijft de robot veilig nadenken zonder bang te zijn voor straf, wat voorkomt dat hij in een cirkel van onzin terechtkomt.
3. Het Resultaat: Een Stabilere Robot
Door deze aanpassingen zien ze drie dingen gebeuren:
Geen ineenstorting meer: De robot crasht niet meer halverwege de training. Hij blijft stabiel leren.
Beter presteren: Omdat de robot niet meer gestraft wordt voor goede tussenstappen, leert hij sneller en geeft hij betere antwoorden (ongeveer 12% beter in tests).
Natuurlijk taalgebruik: De robot blijft menselijke zinnen maken in plaats van te veranderen in een machine die alleen maar tekens herhaalt.
Samenvatting in één zin
CalibAdv is als een slimme trainer die niet meer zegt "Je bent een slechte kok" als de maaltijd mislukt, maar zegt: "Je hebt de groenten perfect gekookt, maar de saus verbrand; laten we de saus verbeteren zonder je te straffen voor je goede werk," zodat de kok gemotiveerd blijft en nooit de moed opgeeft.
Dit maakt het mogelijk om slimme zoekrobots te bouwen die betrouwbaar en stabiel blijven werken, zelfs bij complexe vragen.
is een verplicht voorvoegsel in elke rollout. Omdat deze token niet gegenereerd hoeft te worden door het model, maar wel blootstaat aan grote schommelingen in beloningssignalen, kan dit leiden tot instabiliteit. * CalibAdv plakt de`-token expliciet aan de prompt vast (zonder dat het model deze genereert) en koppel deze los van het toekennen van voordelen. Hierdoor worden er geen trainingsignalen gegeven voor deze token, wat de kans op format-fouten verkleint.
3. Belangrijkste Bijdragen
Fijnmazige Kalibratie: De auteurs introduceren een methode om negatieve voordelen op tussenstappen te attenueren op basis van de daadwerkelijke kwaliteit van de opgehaalde informatie, in plaats van te vertrouwen op het eindresultaat.
Oplossing voor Training Collapse: Ze identificeren de dominante rol van negatieve voordelen als de hoofdoorzaak van training collapse en lossen dit op door een dynamische herbalisering van positieve en negatieve signalen.
Efficiëntie zonder Extra Kosten: In tegenstelling tot andere methoden die externe LLM's nodig hebben voor tussenstap-bewaking of handmatige annotaties, gebruikt CalibAdv interne signalen (zilveren documenten) en vereist geen extra inferentie-kosten.
4. Resultaten
De auteurs hebben CalibAdv getest op drie modellen (Qwen2.5-7B, Qwen2.5-3B, Llama-3.2-3B) en zeven benchmarks (waaronder HotpotQA, 2WikiMultiHopQA, Natural Questions).
Prestatieverbetering: CalibAdv leidt tot een gemiddelde relatieve verbetering van 11,80% in de F1-score ten opzichte van standaard GRPO.
Training Stabiliteit:
Standaard GRPO en veel baselines (zoals SimpleTIR) lijden aan training collapse of prestatiedalingen.
CalibAdv bereikt geen enkele training collapse over alle geteste modellen en datasets. Het model behoudt zijn natuurlijke taalvaardigheden gedurende de volledige training.
Ablatie Studies:
Het toevoegen van de <think>-token alleen verbetert stabiliteit, maar lost niet het taalverlies op.
Zachte straffen voor tussenstappen verbeteren de zoekcapaciteit en F1-score.
Herbalisering van het eindantwoord elimineert volledig de "high PPL" (onbegrijpelijke) output.
Validatie van de Proxy: De methode om "zilveren documenten" te gebruiken als proxy voor correctheid bleek zeer betrouwbaar (89% bevestigd door menselijke annotatoren), terwijl het veel goedkoper is dan het gebruik van een externe LLM (DeepSeek-V3.2) voor elke stap.
5. Betekenis en Impact
Dit paper biedt een fundamentele inzicht in de dynamiek van GRPO voor multi-turn taken. Het toont aan dat negatieve voordelen, hoewel cruciaal voor het leren van wat niet gedaan moet worden, een "dubbelzijdig zwaard" zijn die, indien niet gekalibreerd, leiden tot het volledige verlies van taalvaardigheid.
CalibAdv biedt een praktische, kostenefficiënte oplossing die de stabiliteit van RL-training voor zoekagenten aanzienlijk verbetert zonder de noodzaak van dure externe annotaties. Dit opent de weg voor robuustere en schaalbare multi-step redenerende agenten die betrouwbaar kunnen opereren in complexe zoekscenario's.