Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
Oorspronkelijke auteurs: Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li
Oorspronkelijke auteurs: Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: FiMi-RM (Bias Fitting om de Lengtebias van Beloningsmodellen te Mitigeren in RLHF)
Probleemstelling
Reinforcement Learning from Human Feedback (RLHF) is het standaardframework voor het afstemmen van Large Language Models (LLM's) op menselijke voorkeuren. Dit proces is echter gevoelig voor reward hacking, waarbij het beleid (policy) de tekortkomingen in het getrainde beloningsmodel (reward model) uitbuit om scores te maximaliseren zonder zich daadwerkelijk aan de menselijke intentie te houden. Een veelvoorkomende vorm van deze hacking is lengtebias, waarbij beloningsmodellen systematisch langere antwoorden bevoordelen, ongeacht hun werkelijke kwaliteit. Dit leidt tot excessief verbale generaties in downstream modellen.
Bestaande mitigatiestrategieën lijden aan significante beperkingen:
- Gebrek aan karakterisering: Sommige benaderingen (bijv. RRM) proberen dataverdelingen te balanceren of gebruiken causale kaders zonder de vorm van de bias expliciet te modelleren.
- Lineaire aannames: Veel methoden (bijv. Length Penalty, ODIN, Huang et al.) gaan uit van een lineaire relatie tussen de lengte van het antwoord en de beloning. Ze trekken ofwel een vaste coëfficiënt af op basis van lengte, of gebruiken lineaire regressie om lengte van kwaliteit te ontkoppelen.
- Onvoldoende: Deze lineaire aannames slagen er niet in de complexe, niet-lineaire aard te vangen van hoe lengte met beloningsscores interageert, met name de complexe patronen die worden waargenomen in verschillende lengteregimes.
Methodologie: FiMi-RM
De auteurs stellen FiMi-RM voor (Bias Fitting to Mitigate Length Bias of Reward Model), een framework dat is ontworpen om autonoom onderliggende niet-lineaire biaspatronen te leren en te corrigeren. De aanpak werkt in drie afzonderlijke stadia:
Warm-Up Stadium:
- Een standaard beloningsmodel (modelr) wordt getraind met de Bradley-Terry loss op voorkeurdata.
- Cruciaal is dat dit stadium de inherente lengtebias van het beloningsmodel behoudt in plaats van direct te proberen deze te corrigeren. Dit zorgt ervoor dat het model een sterke, systematische neiging heeft om hogere scores toe te kennen aan langere antwoorden, wat een duidelijk doel vormt voor het daaropvolgende fitting-stadium.
Lengtebias Fitting Stadium:
- Een lichtgewicht fitting model (modelf) wordt geïntroduceerd om de relatie tussen de lengte van het antwoord ($len(y)$) en de bevooroordeelde beloningsoutput (r) expliciet te karakteriseren.
- Architectuur: De scalaire lengte wordt geprojecteerd in een d-dimensionale feature space (met behulp van een door Positional Encoding geïnspireerde Length Encoding), verwerkt via een ResNet-architectuur, en door een lineaire projectiekop gestuurd om de beloning (r^) te voorspellen.
- Doelstelling: Het fitting model wordt getraind om de discrepantie te minimaliseren tussen de voorspelling (r^) en de werkelijke beloningsmodeloutput (r). De optimalisatie gebruikt een Pearson correlatie loss (Lpearson) om de correlatie tussen de voorspelde en werkelijke beloningen te maximaliseren.
- Kerninzicht: Het gebruik van de Pearson loss stemt de correlatiepatronen af zonder zelf een lineariteitsrestrictie op het fitting model op te leggen. De ResNet-gebaseerde modelf is vrij om complexe, niet-lineaire afhankelijkheden te leren.
Lengte-Debiasing Stadium:
- Het oorspronkelijke beloningsmodel wordt fijn afgestemd (fine-tuned) om de outputs te ontkoppelen van de lengte van het antwoord, terwijl het in staat blijft menselijke voorkeuren te modelleren.
- Trainingsmechanisme: Het framework maakt gebruik van een alternerende trainingsstrategie tussen het beloningsmodel en het fitting model.
- Loss Functie: Het beloningsmodel wordt geoptimaliseerd met een samengestelde loss:
Ldebiased=Lpearson′+LBT- Lpearson′: Dwingt de output van het beloningsmodel om ongecorreleerd te zijn met de voorspelling van het fitting model (effectief de geleerde bias te verwijderen).
- LBT: De standaard Bradley-Terry loss, die ervoor zorgt dat het model zijn discriminerende vermogen voor menselijke voorkeuren behoudt.
- De indicatorfunctie $I(step)$ wisselt de trainingsstappen af tussen het fitten van de bias en het debiasen van het beloningsmodel.
Belangrijkste Bijdragen
- Niet-lineaire Bias Modellering: Het artikel introduceert een meerstaps framework dat autonoom de niet-lineaire relatie leert tussen de lengte van het antwoord en de "gehackte" beloning, waarmee het verder gaat dan de simplistische lineaire aannames van eerder werk.
- Empirische Validatie van Niet-lineariteit: Door het fittingproces identificeren de auteurs een meerstaps biaspatroon:
- Korte antwoorden (<100 tokens): Vertonen een sterke lineaire correlatie waarbij de beloning toeneemt met de lengte.
- Langere antwoorden: De relatie vlakt af, en in sommige gevallen is er een lichte neerwaartse tendens, wat aangeeft dat het positieve effect van lengte op de beloning afneemt of omkeert bij uitgebreide outputs.
- Uitgebreide Evaluatie: De methode wordt gevalideerd via lengte-beloningsverdeling-analyse, lengte-gecontroleerde win rates en reactielengte-distributies over meerdere alignment-algoritmen (DPO en Best-of-N).
Experimentele Resultaten
De auteurs evalueerden FiMi-RM met behulp van Qwen2.5-7B en Gemma2-9B modellen op de Anthropic HH dataset, waarbij ze vergeleken werden met Vanilla Reward Models, Length Penalty en ODIN.
- Voorkeursnauwkeurigheid: FiMi-RM bereikte een meer gebalanceerde nauwkeurigheid over subsets waar het gekozen antwoord langer was (C-longer) versus korter (R-longer). Hoewel de algehele nauwkeurigheid op de C-longer subset licht daalde, stellen de auteurs dat dit wijst op de succesvolle verwijdering van de "lengte-shortcut" in plaats van een verlies van semantisch begrip.
- Lengte-Beloningsverdeling: Scatter plots toonden aan dat FiMi-RM een symmetrischere en vlakkere beloningsverdeling produceert over lengte-bins vergeleken met de baselines, wat de effectieve debiasing bevestigt.
- Downstream Prestaties (BoN & DPO):
- Win Rates: FiMi-RM behaalde de hoogste Lengte-Gecontroleerde Win Rate (LC-WR) en standaard Win Rate (WR) in zowel Best-of-N (BoN) als Direct Preference Optimization (DPO) settings.
- Verbositeit: De methode verminderde de gemiddelde tokenlengte van gegenereerde antwoorden aanzienlijk vergeleken met Vanilla RM en Length Penalty, terwijl de prestaties op benchmarks zoals MT-Bench en IFEval gelijk bleven of verbeterden.
- Selectiebias: In BoN-selectie vertoonde FiMi-RM een sterkere voorkeur voor beknopte outputs vergeleken met ODIN, dat de voorkeuren neigde te verschuiven naar medium-lengte antwoorden in plaats van korte antwoorden.
Betekenis en Claims
Het artikel claimt dat FiMi-RM een preciezere en effectievere aanpak biedt voor het mitigeren van lengtebias door de niet-lineaire aard van het probleem expliciet te modelleren. Door de lengte van het antwoord te ontkoppelen van de beloning zonder de kern van de voorkeursmodellering in gevaar te brengen, stelt de methode RLHF-pipelines in staat om antwoorden te genereren die zowel van hoge kwaliteit als passend beknopt zijn.
De auteurs merken op dat hoewel hun methode effectief de spurieuze correlaties vermindert, de vraag of menselijke voorkeuren volledig onafhankelijk zijn van lengte nog openstaat. Ze erkennen dat in bepaalde contexten (bijv. taken die gedetailleerde uitleg vereisen), een positieve correlatie tussen lengte en kwaliteit echt kan zijn. Echter, hun framework onderscheidt succesvol tussen exploiteerbare bias en genuante voorkeur, wat leidt tot veiligere en effectievere modelafstemming.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste machine learning papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.