← Nieuwste papers
💬 NLP

High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning

Het paper introduceert HALT, een methode voor het finetunen van grote taalmodellen die hun antwoorden beperkt tot momenten van hoge zekerheid door onzeker fragmenten te verwijderen of te markeren, waardoor de nauwkeurigheid aanzienlijk stijgt ten koste van een beheersbare afname in volledigheid.

Oorspronkelijke auteurs: Tim Franzmeyer, Archie Sravankumar, Lijuan Liu, Yuning Mao, Rui Hou, Sinong Wang, Jakob N. Foerster, Luke Zettlemoyer, Madian Khabsa

Gepubliceerd 2026-02-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Tim Franzmeyer, Archie Sravankumar, Lijuan Liu, Yuning Mao, Rui Hou, Sinong Wang, Jakob N. Foerster, Luke Zettlemoyer, Madian Khabsa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, maar soms overmoedige assistent hebt. Deze assistent kan over van alles praten: van wiskundige formules tot het leven van beroemdheden. Het probleem is dat deze assistent altijd een antwoord geeft, zelfs als hij het niet weet. Hij verzint dan gewoon iets, wat we "hallucinaties" noemen. In een creatief verhaal is dat leuk, maar als je een arts of een advocaat bent, kan zo'n verzonden feit levensgevaarlijk zijn.

Deze paper introduceert HALT (High Accuracy, Less Talk). Het is een slimme manier om die assistent te trainen om stil te blijven als hij het niet zeker weet, in plaats van te verzinnen.

Hier is hoe het werkt, uitgelegd met een paar creatieve vergelijkingen:

1. De "Gouden Kooi" van de Assistent

Stel je voor dat de assistent een kooi heeft die precies past bij zijn kennis en vaardigheden. Alles wat binnen die kooi valt, kent hij perfect. Alles daarbuiten is voor hem onbekend.

  • Huidige modellen: Ze rennen tegen de muren van hun kooi op en proberen eroverheen te springen. Als ze er niet in slagen, vallen ze en maken ze een lelijke klap (een fout antwoord).
  • HALT: Dit trainingsprogramma leert de assistent om binnen de kooi te blijven. Als hij merkt dat een vraag buiten zijn kooi valt, zegt hij niet "Ik ga het proberen", maar "Ik weet het niet zeker".

2. Hoe werkt HALT? (De "Snij-en-Plak" Methode)

De onderzoekers gebruiken een slimme truc om de assistent te leren wat hij wel en niet kan. Ze doen dit in vier stappen:

  1. De Eerste Poging: Ze laten de assistent een antwoord geven op een vraag (bijvoorbeeld: "Hoe los je deze wiskundeprobleem op?").
  2. Deel het op in blokken: Ze snijden het antwoord op in kleine stukjes.
    • Bij een biografie zijn dit losse feiten: "Obama had een hond", "De hond heette Bo".
    • Bij wiskunde zijn het logische stappen: "Vul de getallen in", "Bereken de wortel", "Het antwoord is X".
  3. De Scharreleer (De Evaluator): Een super-slimme "rechter" (een ander AI-model) kijkt naar elk blokje en vergelijkt het met de waarheid.
    • Blokje 1: "Obama had een hond." -> Goed.
    • Blokje 2: "De hond heette Bo." -> Fout (Het was Sunny!).
    • Blokje 3: "De hond was een Duitse Herder." -> Fout (Ook fout).
  4. De HALT-Regel:
    • Bij losse feiten (zoals een biografie): Ze gooien de fouten weg. Het antwoord wordt korter, maar alles wat overblijft is 100% waar.
    • Bij logische stappen (zoals wiskunde): Zodra de eerste fout wordt gevonden, stopt de assistent. Hij zegt: "Ik heb de eerste stap goed, maar bij stap twee ben ik niet zeker." En dan voegt hij de zin "Onzeker vanaf hier" toe.

3. De Afweging: Volledigheid vs. Betrouwbaarheid

HALT geeft de gebruiker een knop om te draaien. Dit is als een dimmer voor een lamp:

  • Lamp fel (Veel antwoorden): De assistent probeert alles te zeggen. Hij is vaak onvolledig, maar soms wel fout.
  • Lamp zacht (Weinig antwoorden): De assistent zegt alleen wat hij helemaal zeker weet. Hij zegt minder, maar wat hij zegt, is gegarandeerd waar.

De onderzoekers hebben getoond dat ze de lamp zo kunnen dimmen dat de assistent 87% van de tijd correct is (in plaats van de gebruikelijke 51%), terwijl hij nog steeds de helft van de informatie geeft die hij normaal zou geven.

4. Waarom is dit zo belangrijk?

Vroeger dachten we dat we een AI moesten trainen om altijd het langste en meest complete antwoord te geven. HALT leert ons dat kwaliteit belangrijker is dan kwantiteit.

  • Voorbeeld: Stel je vraagt aan een arts-AI: "Wat zijn de symptomen van ziekte X?"
    • Normale AI: Geeft een lijst van 10 symptomen, waarvan 3 verzonnen zijn. Je bent in paniek omdat je denkt dat je die 3 ook hebt.
    • HALT-AI: Geeft 7 symptomen die hij zeker kent. Hij zegt: "De andere 3 ken ik niet zeker, dus die noem ik niet." Je bent gerust, want wat hij zegt, klopt.

Conclusie

HALT is geen magie om de AI slimmer te maken; het is een manier om de AI eerlijker te maken. Het leert de machine om te zeggen: "Ik weet het niet" in plaats van "Ik denk het wel".

In de taal van de onderzoekers: "High Accuracy, Less Talk". Beter een kort, waar antwoord dan een lang, leugenachtig verhaal.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →