← Nieuwste papers
💬 NLP

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

Dit paper introduceert WildFeedback, een nieuw raamwerk dat automatisch voorkeursdatasets genereert uit in-situ gebruikersfeedback tijdens gesprekken met grote taalmodellen, waardoor de uitlijning met menselijke voorkeuren wordt verbeterd zonder de beperkingen van traditionele, handmatig geannoteerde methoden.

Oorspronkelijke auteurs: Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

Gepubliceerd 2026-04-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat koppige robot hebt die je helpt met alles: van het schrijven van een e-mail tot het uitleggen van de kwantumfysica. Je noemt hem "De AI".

Nu is het probleem: Hoe leer je deze robot precies wat jij leuk vindt?

Tot nu toe hebben onderzoekers dit op twee manieren geprobeerd, maar beide hadden grote haken en ogen:

  1. De dure methode: Ze betaalden duizenden mensen om te kijken wat de AI deed en te zeggen: "Dit is goed, dit is slecht." Dit is extreem duur, langzaam en soms zijn die mensen gewoon niet representatief voor de rest van de wereld.
  2. De zelflerende methode: Ze lieten de AI zichzelf beoordelen. Maar dat is als een kind dat zichzelf mag beoordelen op school; het leert snel dat het slim is, maar het mist de echte wereld.

WildFeedback is een nieuw, slim idee dat deze problemen oplost. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De "Live" Feedback (In-situ)

In plaats van mensen te vragen om later te zeggen wat ze vonden, kijkt WildFeedback naar wat mensen terwijl ze met de AI praten, doen.

Stel je voor dat je met de AI praat en je zegt: "Nee, dit is te kinderachtig, maak het wat serieuzer." Of: "Bedankt, dit is precies wat ik zocht!"
Deze zinnen zijn goud waard. Ze zijn echte feedback, direct uit de mond van de gebruiker, in de echte situatie.

2. Het Detectiesysteem (De Radar)

De onderzoekers hebben een systeem gebouwd dat als een supergevoelige radar werkt. Deze radar scannt miljoenen gesprekken en zoekt naar twee soorten signalen:

  • SAT (Satisfaction): Gelukzaligheidssignalen. Denk aan "Bedankt", "Leuk!", of "Ja, precies zo!".
  • DSAT (Dissatisfaction): Onrustsignalen. Denk aan "Probeer het nog eens", "Dat klopt niet", of "Dit is te vaag".

Het systeem pikt deze signalen eruit, alsof het een visser is die de beste vissen uit de zee haalt.

3. Het Bouwen van de "Liefdesbrief" (Data Constructie)

Zodra het systeem een "Onrustsignaal" (DSAT) vindt, doet het iets magisch:

  • Het kijkt naar wat de AI eerder zei (de fout).
  • Het leest wat de gebruiker daarna vroeg (de correctie).
  • Het laat een supersterke AI (GPT-4) een nieuwe, perfecte versie van het antwoord schrijven, gebaseerd op wat de gebruiker eigenlijk wilde.

Het resultaat is een paar:

  • De slechte versie: Wat de AI eerst gaf (en waar de gebruiker niet blij mee was).
  • De goede versie: Wat de AI had moeten geven (gebaseerd op de echte wens van de gebruiker).

Dit proces wordt herhaald tot er een enorme bibliotheek is van "Goed vs. Slecht" voorbeelden, allemaal gebaseerd op echte mensen, niet op theorie.

4. De "Checklist" (De Nieuwe Toets)

Normaal gesproken wordt gekeken of een AI goed is door hem vragen te laten beantwoorden en te kijken of het antwoord "langer" of "slimmer" klinkt. Maar dat is vaak vals gespeeld.

WildFeedback introduceert een Checklist.
Stel, een gebruiker zei: "Ik wil een kort antwoord, geen lange lappen tekst."
Wanneer we de AI nu testen, geven we de beoordelaar (een andere AI) deze checklist mee: "Kijk, dit antwoord is kort? Dan is het goed. Is het lang? Dan is het slecht."

Dit zorgt ervoor dat we de AI niet beoordelen op wat wij denken dat goed is, maar op wat de gebruiker echt wilde.

Waarom is dit belangrijk?

Vroeger leerden we AI's met een boekje vol regels dat door een paar mensen was geschreven. Nu leren we AI's door te kijken naar wat miljoenen mensen echt doen en zeggen in het dagelijks leven.

  • Het is schaalbaar: Je hoeft geen mensen te betalen; je gebruikt de data die al bestaat.
  • Het is eerlijker: Het weerspiegelt de echte wereld, inclusief de rare en specifieke wensen van mensen.
  • Het is veiliger: Door te kijken naar echte feedback, leren we de AI sneller wat mensen niet willen (zoals onzin of gevaarlijk advies).

Kortom: WildFeedback is als het verschil tussen een kok die kookt op basis van een oud receptboek, en een kok die direct kijkt naar de borden die de gasten terugsturen naar de keuken en daaruit leert wat ze écht lekker vinden. Het resultaat? Een AI die niet alleen slim is, maar ook echt begrijpt wat jij wilt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →