← Nieuwste papers
💬 NLP

Do LLMs Adhere to Label Definitions? Examining Their Receptivity to External Label Definitions

De studie concludeert dat grote taalmodellen niet altijd consequent externe labeldefinities integreren en vaak terugvallen op hun interne kennis, hoewel expliciete definities met name bij domeinspecifieke taken de nauwkeurigheid en verklaarbaarheid kunnen verbeteren.

Oorspronkelijke auteurs: Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

Gepubliceerd 2026-02-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat Large Language Models (LLMs), zoals de slimme chatbots die we vandaag de dag gebruiken, als zeer goed opgeleide studenten zijn. Deze studenten hebben jarenlang miljoenen boeken gelezen (hun "trainingsdata") en hebben daardoor een enorme kennis in hun hoofd opgeslagen.

De vraag die deze onderzoekers zich stelden, is eigenlijk heel simpel: Luisteren deze studenten echt naar wat de leraar nu juist zegt, of vertrouwen ze alleen maar op wat ze al in hun hoofd hebben?

Hier is het verhaal van hun onderzoek, vertaald in alledaagse taal:

1. Het Experiment: De "Verkeerde" Lesbrief

De onderzoekers gaven deze studenten (de AI-modellen) een taak: ze moesten zinnen beoordelen. Maar ze deden iets heel slinks. Ze gaven de AI een definitie van wat een bepaald antwoord betekende, maar ze veranderden die definitie op drie manieren:

  • De juiste definitie: De leraar geeft de perfecte uitleg.
  • De verwarrende definitie: De leraar zegt iets dat bijna klopt, maar net niet.
  • De complete onzin: De leraar zegt dat "rood" eigenlijk "blauw" betekent.

Wat gebeurde er?
Soms luisterde de AI heel goed naar de leraar en gaf het het juiste antwoord op basis van de nieuwe regels. Maar vaak? Dan keek de AI alsof de leraar een grapje maakte en zei: "Nee, ik heb dit al duizend keer gelezen, ik weet dat het anders is." De AI negeerde de nieuwe instructie en deed het gewoon zoals hij het altijd had gedaan.

2. De Grote Ontdekkingen

A. Het hangt af van het onderwerp (De "Allesweter" vs. de "Specialist")

  • Bij algemene dingen (zoals "Is deze zin logisch?"): De AI's zijn als kenners die alles al weten. Als je hen een nieuwe, simpele definitie geeft, denken ze: "Ik hoef niet naar jou te luisteren, ik weet het al." Hier helpt het geven van definities soms zelfs niet, of maakt het ze verward.
  • Bij specialistische dingen (zoals "Is dit haatzaaiende taal?" of "Wat betekent dit in de psychologie?"): Hier zijn de AI's als studenten die net beginnen. Ze hebben die specifieke kennis niet in hun hoofd. Als je hen dan een duidelijke definitie geeft, zijn ze ongelooflijk dankbaar en presteren ze veel beter. Ze vertrouwen de leraar volledig omdat ze zelf geen referentiekader hebben.

B. De "Grote" vs. de "Kleine" AI

  • De grote AI's (zoals GPT-4): Dit zijn de voorzichtige professoren. Als je hen een definitie geeft die in strijd is met hun eigen kennis, zeggen ze soms: "Ik kan dit niet beantwoorden, want jullie instructies kloppen niet met de feiten." Ze weigeren om fouten te maken.
  • De kleinere AI's (zoals Phi-3 of Mistral): Dit zijn de vlijtige maar onervaren leerlingen. Ze zijn heel gevoelig voor wat je zegt. Als je hen een definitie geeft, volgen ze die blindelings, zelfs als de definitie gek klinkt. Ze hebben minder eigen "kennis" om tegen te spreken.

C. De "Uitleg" vs. het "Antwoord"

Dit is misschien wel het gekste deel. Soms kon de AI een prachtige, logische uitleg schrijven die perfect paste bij de nieuwe definitie (alsof het de leraar begreep), maar gaf het toch het verkeerde antwoord op de vraag.

  • Analogie: Het is alsof iemand een perfect verhaal schrijft over waarom je rechts moet rijden, maar dan toch per ongeluk links de weg op rijdt. De AI kan praten over de regels, maar handelen doet het nog steeds op zijn oude manier.

3. Wat betekent dit voor ons?

De onderzoekers concluderen dat we niet zomaar kunnen verwachten dat AI's alles doen wat we in een prompt (instructie) zetten.

  • Voor alledaagse taken: We moeten de AI niet overladen met definities; die weet het al.
  • Voor speciale taken (zoals medische diagnose of juridisch advies): We moeten de AI heel specifieke, duidelijke definities geven. Zonder die "handleiding" is de AI te onzeker.
  • Voor veiligheid: Als je een AI gebruikt in een belangrijke situatie, moet je oppassen. Kleine AI's volgen je instructies blindelings (wat gevaarlijk kan zijn als je instructies fout zijn), terwijl grote AI's soms weigeren te antwoorden als ze in de war raken.

Samenvattend

Deze studie laat zien dat AI's niet zomaar "slimme machines" zijn die alles perfect doen. Ze zijn meer als studenten met een eigen karakter. Soms luisteren ze naar de leraar, soms denken ze dat ze het beter weten, en soms schrijven ze een mooi verhaal terwijl ze de verkeerde weg opgaan.

De boodschap is duidelijk: Als je een AI wilt gebruiken voor specifieke taken, moet je de instructies (de definities) heel zorgvuldig en op maat maken, net zoals je een goede lesbrief zou maken voor een student.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →