Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information
Dit artikel introduceert het -Soft-NC- en -Soft-NS-evaluatiekader om te controleren voor behouden woordtellingen bij het beoordelen van de toewijzingsgetrouwheid in decoder-only LLM's, naast de Grad-ELLM-methode die effectief gradiënt- en attentiesignalen combineert om sterke prestaties met een focus op volledigheid te bereiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: Appels met Peren Vergelijken
Stel je voor dat je een rechter bent die moet beslissen welke rechercheur beter is in het oplossen van een mysterie. Je hebt twee rechercheurs: Rechercheur A en Rechercheur B.
- Rechercheur A vindt 5 aanwijzingen, maar ze zijn allemaal zeer belangrijk.
- Rechercheur B vindt 50 aanwijzingen, maar slechts 5 zijn echt bruikbaar; de rest is gewoon ruis.
In het verleden probeerden onderzoekers "trouw" (hoe goed een AI haar eigen gedachtegang uitlegt) te meten door te kijken hoeveel het antwoord van de AI veranderde wanneer je de aanwijzingen die de rechercheur aanwees, verwijderde.
De Fout: De oude manier van meten was als volgt: Als Rechercheur B je een lijst met 50 aanwijzingen gaf en je verwijderde er 45, zou het antwoord van de AI misschien veel veranderen, simpelweg omdat je zoveel woorden verwijderde, niet omdat de aanwijzingen slecht waren. Als Rechercheur A je een korte lijst met 5 aanwijzingen gaf, zou het verwijderen daarvan het antwoord misschien minder veranderen, gewoon omdat er minder woorden waren om mee te beginnen.
De oude maten waren onrechtvaardig. Ze vergeleken een rechercheur die veel informatie bewaarde met een rechercheur die zeer weinig bewaarde, waardoor het leek alsof degene die meer informatie bewaarde "beter" was in het uitleggen van dingen, zelfs als hun logica rommelig was.
De Oplossing: De "Gelijke Behoud"-Regel
De auteurs van dit artikel stellen een nieuwe regel voor het spel voor: Iedereen moet exact dezelfde hoeveelheid informatie bewaren.
Ze introduceren een nieuwe methode genaamd -Soft-NC en -Soft-NS. Denk aan (Pi) als een "volume-knop" voor informatie.
- Als je de knop op 0,5 zet, moeten zowel Rechercheur A als Rechercheur precies 50% van de woorden in de zin bewaren.
- Als je hem op 0,1 zet, moeten beiden slechts 10% bewaren.
Door beide methoden te dwingen om dezelfde hoeveelheid informatie te "bewaren", kun je eindelijk zien wie de juiste woorden heeft gekozen om het besluit van de AI uit te leggen, in plaats van wie gewoon de meeste woorden heeft gekozen.
De Nieuwe Rechercheur: Grad-ELLM
De auteurs hebben ook een nieuwe rechercheursmethode gebouwd, genaamd Grad-ELLM, om deze nieuwe regel te testen.
- Hoe het werkt: Stel je voor dat een AI een verhaal woord voor woord schrijft (zoals een kettingreactie). Om te begrijpen waarom de AI het volgende woord koos, kijkt Grad-ELLM tegelijkertijd naar twee dingen:
- De "Attention"-kaart: Naar welke woorden keek de AI? (Zoals naar wie de AI in een kamer naar staart).
- De "Gradient"-kaart: Hoeveel veranderde het resultaat daadwerkelijk door die woorden te veranderen? (Zoals hoeveel de temperatuur in de kamer verandert als je een specifieke kachel verplaatst).
Grad-ELLM combineert deze twee perspectieven. Het kiest niet zomaar het enkele "belangrijkste" woord; het creëert een gladde, continue kaart van belangrijkheid over de hele zin. Het is als een warmtekaart die precies aangeeft waar de "hitte" (belangrijkheid) zit, in plaats van alleen met een vinger naar één plek te wijzen.
Wat Ze Vonden
De auteurs testten hun nieuwe regel en hun nieuwe rechercheur op beroemde AI-modellen (Llama en Mistral) met taken zoals:
- Sentimentanalyse: Beslissen of een filmrecensie positief of negatief is.
- Open Generatie: Antwoorden op vragen schrijven of een verhaal voortzetten.
De Resultaten:
- De Oude Regel was Bevooroordeeld: Toen ze de oude maten gebruikten, leken methoden die veel woorden bewaarden kunstmatig goed.
- De Nieuwe Regel Onthult de Waarheid: Onder de nieuwe "Gelijke Behoud"-regel bleek Grad-ELLM uitstekend in het vinden van brede bewijslast. Het toonde aan dat het besluit van de AI werd ondersteund door een breed scala aan woorden die samenwerkten (zoals een koor van stemmen).
- Geen Eénwinnaar: Interessant genoeg was geen enkele methode de beste in alles.
- Sommige methoden waren geweldig in het vinden van het één of twee meest kritieke woorden (zoals het vinden van het "rookend pistool").
- Grad-ELLM was geweldig in het tonen van het hele plaatje van hoeveel woorden bijdroegen aan het antwoord.
De Conclusie
Dit artikel is als een nieuwe set schalen voor een bakkerij. Vroeger, als je een cake weegde met een zware schaal en een koekje met een lichte schaal, kon je niet vertellen welk dessert eigenlijk zwaarder was. De auteurs voegden een standaard schaal toe aan beide kanten.
Ze bakten ook een nieuw soort cake (Grad-ELLM) die zijn smaak gelijkmatig door het hele gerecht verspreidt, in plaats van slechts een paar zoete plekken te hebben. Hun nieuwe schalen tonen aan dat terwijl sommige methoden goed zijn in het vinden van de "zoete plekken", hun nieuwe cake beter is in het tonen hoe het hele dessert in elkaar zit.
Kort samengevat: Ze hebben de manier waarop we AI-verklaringen testen opgelost, zodat we niet worden bedrogen door het aantal woorden, en ze introduceerden een nieuwe methode die een vollediger, eerlijker beeld geeft van hoe de AI denkt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.