← Nieuwste papers
💬 NLP

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

Dit paper introduceert de 'prefilling attack', een efficiënte methode waarbij een gestructureerde voorvoegseltekst wordt gebruikt om de betrouwbaarheid en nauwkeurigheid van eerste-token-probabiliteitsevaluaties bij meerkeuzevragen in grote taalmodellen aanzienlijk te verbeteren zonder de modelparameters aan te passen.

Oorspronkelijke auteurs: Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

Gepubliceerd 2026-04-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat verwarde robot hebt die je vragen stelt over de wereld. Je wilt weten of hij het antwoord echt weet. De robot heeft vier opties: A, B, C of D.

In de wereld van kunstmatige intelligentie (AI) kijken onderzoekers vaak alleen naar het eerste woord dat de robot zegt om te zien of hij het juiste antwoord heeft gekozen. Dit heet "First-Token Probability".

Het probleem is dat deze robot soms een beetje te beleefd of te creatief is. In plaats van gewoon "A" te zeggen, begint hij met een lange zin: "Ik denk dat het antwoord A is, maar laten we eerst even kijken..."

Hier zijn twee manieren waarop dit misgaat:

  1. De verkeerde start: De robot begint met een woord dat niets met het antwoord te maken heeft, zoals "Ik". De computer denkt dan: "Oh, hij koos 'Ik', dus dat is zijn antwoord!" (terwijl hij eigenlijk D bedoelde).
  2. De verkeerde interpretatie: De robot begint met een geldig lettertje, maar gebruikt het op een rare manier. Hij zegt: "A possible answer could be C" (Een mogelijk antwoord zou C kunnen zijn). De computer ziet het 'A' en denkt: "Gefeliciteerd, hij koos A!" Terwijl hij eigenlijk C bedoelde.

De Oplossing: "Output Prefilling" (Het voorvullen van het antwoord)

De auteurs van dit papier hebben een slimme, simpele truc bedacht. Ze noemen het Output Prefilling.

Stel je voor dat je de robot niet alleen de vraag geeft, maar dat je alvast een stukje van zijn antwoord voor hem uitspreekt. Je zegt tegen de robot: "Het juiste antwoord is: " en laat de robot dan pas zijn eerste woord zeggen.

In de taal van de onderzoekers is dit een "prefilling attack", maar dan gebruikt voor iets goeds. In plaats van de robot te misleiden (zoals hackers dat doen om beveiliging te omzeilen), gebruiken ze deze techniek om de robot in de juiste richting te duwen.

Waarom werkt dit zo goed?

  1. Het is als een trainingswiel: Door de zin "Het juiste antwoord is: " alvast in te typen, weet de robot precies wat er verwacht wordt. Hij hoeft niet meer te bedenken hoe hij moet beginnen. Hij moet gewoon het volgende woord kiezen: A, B, C of D.
  2. Geen hersenspoor nodig: Je hoeft de robot niet opnieuw te trainen of zijn hersenen (de parameters) aan te passen. Het is alsof je een knop op de afstandsbediening drukt om de TV op het juiste kanaal te zetten, in plaats van de hele TV te vervangen.
  3. Sneller en goedkoper: Andere methoden vragen de robot om een heel lang verhaal te schrijven en gebruiken dan een andere AI om te kijken wat het antwoord was. Dat is traag en duur. Met deze truc is het antwoord er direct, en het is veel betrouwbaarder.

Wat hebben ze ontdekt?

De onderzoekers hebben deze truc getest op veel verschillende vragenlijsten en met veel verschillende robots (zoals Llama, Gemma en Mistral). Het resultaat?

  • De robots gaven veel vaker het juiste antwoord.
  • Ze waren betrouwbaarder: ze twijfelden minder en maakten minder "slordige" fouten.
  • Het werkte zelfs beter dan het laten schrijven van een heel verhaal, terwijl het veel sneller ging.

Samenvattend

Stel je voor dat je een examen doet. Normaal gesproken mag je je antwoord op een manier schrijven die jij wilt. Soms begint iemand met "Ik denk dat..." en dat kan de docent (de computer) verwarren.

Met deze nieuwe methode zeg je tegen de student: "Schrijf alleen het lettertje van het juiste antwoord." Door die instructie alvast in de tekst te zetten, weet de student precies wat er van hem verwacht wordt. Het resultaat is dat de cijfers (de nauwkeurigheid) van de AI-examens veel hoger en eerlijker worden, zonder dat je de student hoeft te herscholen.

Het is een simpele, gratis truc die ervoor zorgt dat slimme machines eindelijk doen wat we van ze verwachten: gewoon het juiste antwoord geven, zonder gedoe.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →