Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation
Dit artikel introduceert een schaalbare, enkel op inferentie gebaseerde data-auditpijplijn die Shapley-waarden benadert om efficiënt conflicterende, foutief gelabelde of onveilige records uit LLM-alignment-datasets en benchmarks te identificeren en te verwijderen, waardoor de handmatige auditinspanningen aanzienlijk worden verminderd en kritieke gebreken in door mensen geannoteerde grondwaarheid worden blootgelegd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot probeert te leren hoe hij een behulpzame, veilige en eerlijke menselijke assistent kan zijn. Je programmeert de robot niet met rigide regels; in plaats daarvan toon je hem miljoenen voorbeelden van goede en slechte gesprekken, zodat hij door middel van voorbeelden kan leren. Dit is hoe moderne AI zijn "persoonlijkheid" en veiligheidsfilters krijgt. Maar hier zit de crux: de robot is slechts zo goed als de verhalen die je hem vertelt. Als je verhalenboek vol staat met typefouten, leugens of verwarrende tegenstrijdigheden, raakt de robot in de war en kan hij vreemd gaan doen.
Lamaag was het controleren van deze verhalenboeken alsof je probeerde één rotte appel te vinden in een berg fruit door ze één voor één te bekijken. Het was traag, duur en vaak werden subtiele problemen gemist. Wetenschappers hebben geprobeerd wiskunde te gebruiken om te bepalen welke verhalen het belangrijkst zijn, een methode genaamd "Shapley-waarde", maar het exact uitvoeren van de berekeningen is zo zwaar dat het voor een enorme berg data eeuwig zou duren. De grote vraag is: hoe kunnen we snel de verborgen fouten, de verwarrende tegenstrijdigheden en het slechte advies in deze enorme trainingsboeken opsporen zonder elke pagina te lezen of de robot vanaf nul opnieuw te trainen?
Dit artikel introduceert een slim nieuw detectivetool genaamd een "influence-based data auditing pipeline". Denk aan een magische vergrootglas dat de hele boek niet opnieuw hoeft te lezen om de fouten te vinden. In plaats van de robot opnieuw te trainen, gebruiken de onderzoekers een truc: ze vragen de robot: "Als ik je dit specifieke verhaal laat zien voordat je dit volgende verhaal leest, helpt het je dan om het te begrijpen, of brengt het je in verwarring?"
De onderzoekers bouwden een systeem dat vergelijkbare verhalen bij elkaar groepeert en ze vervolgens test als een spelletje "zoek de verschillen". Ze nemen een verhaal en vragen de robot om de afloop te voorspellen. Daarna laten ze de robot eerst een vergelijkbaar verhaal zien (als een hint) en vragen ze de robot om de afloop opnieuw te voorspellen. Als het "hint"-verhaal de voorspelling van de robot slechter maakt, is dat een enorme rode vlag. Het betekent dat de twee verelden met elkaar vechten, zoals de ene zegt "Vertel altijd de waarheid" en de andere "Het is oké om in dit geval te liegen".
Het team testte dit op twee beroemde collecties trainingsdata. Eerst bekeken ze een dataset genaamd HelpSteer2. Hun tool ontdekte dat ze, uit duizenden records, de lijst met zaken die mensen moesten controleren met 99,1% konden verkleinen. Ze brachten verborgen fouten aan het licht waarbij mensen perfecte scores gaven aan antwoorden die eigenlijk vol stonden met verzonnen feiten of belangrijke instructies negeerden. Zo vonden ze bijvoorbeeld gevallen waarin een robot werd geprezen voor het schrijven van een perfect ogend essay dat echter valse data en valse wetenschappelijke artikelen bevatte, terwijl een vergelijkbaar essay met dezelfde valse feiten terecht werd gestraft. Dit onthulde een "oppervlakkigheidsbias", waarbij menselijke beoordelaars hielden van hoe de tekst eruitzag, maar niet controleerden of de feiten echt waren.
Vervolgens auditeerden ze een dataset genaerd HH-RLHF, die wordt gebruikt om robots te leren kiezen tussen twee antwoorden. Ze ontdekten duizenden verborgen tegenstrijdigheden waarbij het door mensen gekozen "correcte" antwoord eigenlijk gevaarlijk of onbehulpzaam was. In één angstaanjagend voorbeeld koos een menselijke beoordelaar een reactie die suggereerde om bleekmiddel in iemands oog te gieten als grap, terwijl een veilige reactie die alleen om verduidelijking vroeg, werd afgewezen. De tool ontdekte deze veiligheidsrisico's die standaardcontroles misten.
Misschien nog wel het meest verrassend was dat toen ze dit hulpmiddel gebruikten om de toetsvragen (de examens die de robots beoordelen) te controleren, ze ontdekten dat de examens zelf kapot waren. De "correcte" antwoorden in de toetsenbank waren vaak fout. In veel gevallen kozen de slimste robots juist het veiligere, betere antwoord, maar de toets markeerde hen als "fout" omdat het door mensen geschreven antwoordmodel gebrekkig was. Dit suggereert dat sommige van de grootste problemen in AI-veiligheid niet het falen van de robots zijn, maar dat de tests onrechtvaardig zijn.
De auteurs benadrukken dat hoewel hun wiskundige tool ongelooflijk snel en effectief is in het verkleinen van de zoekopdracht, er nog steeds een mens (of een zeer slimme AI-rechter) nodig is om de definitieve beslissing te nemen of een verhaal echt gebrekkig is. Ze hebben de data niet zelf gerepareerd, maar ze hebben een uiterst efficiënte kaart gebouwd die precies aangeeft waar de kuilen in de weg zitten, waardoor onderzoekers niet elke centimeter van de weg hoeven af te rijden om de problemen te vinden. Door deze methode te gebruiken, hebben ze het werk om een enorme dataset te controleren teruggebracht van het bekijken van duizenden items naar slechts een paar dozijn hoog-prioritaire verdachten, wat bewijst dat soms de beste manier om de waarheid te vinden is door te kijken hoe de stukjes van een puzzel tegen elkaar in werken en aan elkaar trekken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.