← Nieuwste papers
💬 NLP

Enhancing LLMs through human feedback: a journey towards self-improvement

Dit artikel stelt een nieuwe human-in-the-loop-methodologie voor die een aanvullend feedback-RAG-systeem integreert om de prestaties van een primair RAG-systeem iteratief te verfijnen door middel van continue gebruikersfeedback, waarbij significante verbeteringen in nauwkeurigheid en relevantie over diverse benchmarks worden aangetoond via LLM-als-rechter-evaluatie.

Oorspronkelijke auteurs: Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme robotbibliothecaris hebt genaamd RAG. Deze bibliothecaris is geweldig in het vinden van boeken (documenten) en het schrijven van antwoorden op basis daarvan. Maar soms krijgt de bibliothecaris het fout, of voelen de antwoorden een beetje stijf en robotachtig aan. Traditioneel gezien, als je niet tevreden was met een antwoord, gaf je gewoon een duim omlaag. Dat is als een binaire schakelaar: aan of uit. Het vertelt de robot "slecht", maar het vertelt hem niet waarom of hoe hij het moet verbeteren.

Dit artikel introduceert een nieuwe manier om deze bibliothecaris te onderwijzen, genaamd FLARE (Feedback-driven LLM Adaptive RAG Enhancement). In plaats van alleen een duim omlaag, laat FLARE gebruikers gedetailleerde aantekeningen, correcties en zelfs stijltips achter. Denk aan het verschil tussen een student die een rood "X" krijgt op een toets versus een docent die een opmerking achterlaat als: "Je hebt de datum goed, maar je bent vergeten het land te vermelden, en je toon was te chagrijnig."

De Twee-Stappen Dans: Offline Voorbereiding en Online Magie

FLARE werkt als een twee-stappen dans die op de achtergrond plaatsvindt terwijl de bibliothecaris aan het werk is.

Stap 1: De Offline Voorbereiding (De Studierit)
Wanneer een gebruiker een gedetailleerde aantekening achterlaat, slaat FLARE deze niet alleen op in een archief. Het voert de aantekening door een proces van "contextuele verrijking". Stel je voor dat een gebruiker zegt: "Fout, het is Donald Trump." FLARE neemt dit fragment en maakt er, met behulp van de chatgeschiedenis, een heldere, volledige zin van: "De huidige president van de VS is Donald Trump in 2025."

Vervolgens sorteert een speciale AI (de "rechter") deze aantekeningen in twee bakken:

  1. Feitenchecks: "Hé, update de database, de president is veranderd!"
  2. Stijlgidsen: "Hé, wees de volgende keer beleefder en voeg meer geschiedenis toe."

Deze aantekeningen worden vervolgens omgezet in digitale "zoektags" en opgeslagen in een speciale bibliotheek (een vectordatabase). Dit is het "offline" gedeelte waar het systeem leert van het verleden.

Stap 2: De Online Magie (De Live Show)
Nu stelt een nieuwe gebruiker een vraag. Voordat de bibliothecaris antwoordt, doet FLARE een snelle zijcontrole. Het vraagt: "Is er eerder iets soortgelijks gevraagd? Is er een aantekening achtergelaten?" Als het antwoord ja is, pakt FLARE die aantekeningen en injecteert ze direct in het brein van de bibliothecaris terwijl deze het antwoord schrijft. Het is alsof de bibliothecaris plotseling een plaknotitie herinnert van een vorige klant die zegt: "Vergeet de extra details niet!"

Het Bewijs: Werkte het?

De auteurs hebben dit idee getest in drie verschillende "speeltuinen" om te zien of het de bibliothecaris slimmer maakte.

  1. De Fictieve Speeltuin: Ze gebruikten verzonnen dialogen over fictieve personages. Zonder FLARE was de bibliothecaris een beetje in de war en scoorde hij slechts ongeveer 1 uit 5 wanneer de context ontbrak. Met FLARE behaalde de bibliothecaris bijna perfecte scores (5 uit 5) op bijna elke vraag.
  2. De Trivia Speeltuin: Dit was het lastige deel. Ze stelden vragen over gebeurtenissen in 2024 en 2025—zaken die de robot nog niet zou moeten weten omdat zijn trainingsdata eerder stopte.
    • Zonder FLARE: De bibliothecaris gokte fout of gaf vage antwoorden, met een gemiddelde score van 3,06 uit 5.
    • Met FLARE: De bibliothecaris gebruikte de feedback van eerdere gebruikers om de nieuwe feiten te leren. De gemiddelde score sprong naar 3,91 uit 5.
    • Voorbeeld: Wanneer er naar de Oscars van 2025 werd gevraagd, gaf de basis-bibliothecaris de winnaar fout. FLARE corrigeerde dit naar de juiste persoon en voegde zelfs het coole detail toe dat het een historische overwinning was voor een specifieke demografie.
  3. De Tech Support Speeltuin: Ze testten dit op echte vragen over draadloze netwerken (interne data van Intel). Hier ontdekten ze dat FLARE erg goed was in het vinden van de juiste feedback (het slaagde in 95% van de gevallen). Echter, het systeem slaagde er alleen in om die feedback te gebruiken om het uiteindelijke antwoord te verbeteren in 61% van de gevallen.

Wat FLARE NIET is (En wat het nog wel nodig heeft)

Het is belangrijk om te weten wat dit artikel niet beweert. De auteurs zijn voorzichtig in hun bewoordingen en zeggen dat FLARE geen toverstaf is die alles direct oplost.

  • Het is geen perfecte oplossing: In de tech support-tests, hoewel het systeem de juiste aantekeningen 95% van de tijd vond, gebruikte het deze aantekeningen slechts in 61% van de gevallen om het antwoord te verbeteren. De auteurs suggereren dat dit komt doordat de manier waarop ze de aantekeningen "injecteren" (het in de tekst plakken) ervoor zorgt dat de robot soms de belangrijkste delen negeert.
  • Het is nog niet volledig autonoom: Het systeem behandelt momenteel alle feedback als gelijkwaardig. Het weet niet of een aantekening afkomstig is van een wereldexpert of een verwarde gebruiker, of dat een aantekening van gisteren of van vorig jaar is. De auteurs geven toe dat ze een slimmere manier moeten bouwen om te beslissen welke aantekeningen het meest relevant zijn.
  • Het is geen "opgelost" probleem: Het artikel stelt expliciet dat er "mogelijkheden zijn om het systeem verder te verfijnen". Ze zijn van plan functies toe te voegen zoals het controleren van wie de feedback heeft geschreven en het opnieuw lezen van de aantekeningen als het antwoord zwak lijkt.

De Kern van het Verhaal

De belangrijkste bevinding is dat het de robotbibliothecaris veel beter maakt in nauwkeurigheid en behulpzaamheid door hem gedetailleerde, geschreven feedback te geven—en hem vervolgens die aantekeningen te laten lezen terwijl hij nieuwe vragen beantwoordt. In de simulaties en tests die ze uitvoerden, veranderde deze "human-in-the-loop"-aanpak een goed systeem in een geweldig systeem, vooral bij het omgaan met nieuwe informatie die de robot voorheen niet kende. Maar, zoals de auteurs opmerken, de reis naar een volledig zelfverbeterende robot is nog niet voltooid; ze moeten nog uitzoeken hoe ze de robot de beste aantekeningen kunnen laten beluisteren, en niet zomaar elke aantekening.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →