← Nieuwste papers
💬 NLP

Revisiting the Reliability of Language Models in Instruction-Following

Deze paper introduceert IFEval++ en de metric 'reliable@k' om aan te tonen dat huidige taalmodellen, ondanks hoge scores op bestaande benchmarks, aanzienlijke betrouwbaarheidsproblemen vertonen bij het volgen van instructies met subtiele nuanceverschillen, met prestatiedalingen tot wel 61,8%.

Oorspronkelijke auteurs: Jianshuo Dong, Yutong Zhang, Yan Liu, Zhenyu Zhong, Tao Wei, Chao Zhang, Han Qiu

Gepubliceerd 2026-04-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jianshuo Dong, Yutong Zhang, Yan Liu, Zhenyu Zhong, Tao Wei, Chao Zhang, Han Qiu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Waarom slimme chatbots soms vergeten wat je precies vraagt (en hoe we dat oplossen)

Stel je voor dat je een zeer getalenteerde kok hebt die bekendstaat om het perfect maken van een specifieke taart: de "Blauwe Aardbeientaart". Als je hem vraagt om die taart te bakken, doet hij het elke keer perfect. Hij is een ster in de keuken. Maar wat gebeurt er als je de vraag een klein beetje verandert?

Vraag je: "Bak een taart met aardbeien en blauwe kleurstof," dan lukt het hem.
Vraag je: "Bak een taart met aardbeien en een beetje blauwe tint," dan verbrandt hij de taart.
Vraag je: "Ik wil graag een dessert met aardbeien, en het moet blauw zijn," dan geeft hij je een bord met alleen aardbeien.

Deze kok is slim, maar hij is niet betrouwbaar als het gaat om de nuances van je vraag. Hij is te gefocust op de exacte woorden die hij eerder heeft gehoord, in plaats van te begrijpen wat je echt bedoelt.

Dit is precies wat onderzoekers van de Tsinghua Universiteit en Ant Group hebben ontdekt met de nieuwste generatie kunstmatige intelligentie (AI), zoals de grote taalmodellen (LLMs). Hun nieuwe paper, getiteld "Revisiting the Reliability of Language Models in Instruction-Following", pakt dit probleem aan.

Het probleem: De "Kusinen" (Cousin Prompts)

In de wetenschap noemen ze dit "nuance-gerichte betrouwbaarheid". Om dit te testen, hebben de onderzoekers een slimme truc bedacht. Ze nemen een originele vraag en maken er een hele familie van "kussen" van.

Stel, de originele vraag is: "Schrijf een blogpost over slapen van minimaal 400 woorden."
De "kussen" zijn variaties daarop:

  • "Kun je een artikel maken over hoe je goed slaapt, met ongeveer 450 woorden?"
  • "Ik wil een blog over slaap, maar zorg dat het niet langer is dan 500 woorden."
  • "Schrijf iets over slapen, en voeg een grappige opmerking toe aan het einde."

Al deze vragen vragen om hetzelfde: een tekst over slapen met een bepaald lengte-eis. Maar de manier waarop ze het vragen, is subtiel anders. De onderzoekers noemen dit Cousin Prompts.

De verrassende bevinding: Ze zijn niet zo betrouwbaar als we denken

De onderzoekers hebben 46 verschillende AI-modellen getest (zowel de bekende dure modellen van bedrijven als de gratis open-source versies). Ze gebruikten een nieuwe meetlat, genaamd reliable@k.

Dit werkt als volgt: Als een AI een set van 10 "kussen-vragen" krijgt, moet hij ze allemaal goed beantwoorden om een perfecte score te krijgen. Als hij er één fout doet, zakt de score.

Het resultaat was schokkend:

  • Veel modellen die op de standaard tests (waar ze maar één vraag krijgen) een 95% halen, zakken op deze "kussen-test" dramatisch.
  • Sommige modellen verloren wel 60% van hun prestatie!
  • Zelfs de allerbeste modellen, zoals GPT-5, zagen hun score met bijna 20% dalen.

Het lijkt erop dat AI-modellen vaak "leren" om de exacte testvragen te raden, in plaats van echt te begrijpen hoe ze instructies moeten volgen als de woorden een beetje veranderen. Het is alsof een student de antwoorden van het examen uit zijn hoofd leert, maar faalt zodra de leraar de vraag net iets anders stelt.

Hoe kunnen we dit oplossen?

De onderzoekers hebben drie manieren onderzocht om deze modellen betrouwbaarder te maken:

  1. Voorspellen (Prediction): Kunnen we de AI vragen: "Ben je zeker dat je deze vraag goed kunt beantwoorden?" Helaas, de AI is vaak te zelfverzekerd en zegt "ja", terwijl het antwoord fout is. Dit werkt niet goed.
  2. Oefenen (Training): Kunnen we de AI laten oefenen met duizenden "kussen-vragen"? Ja, dit helpt een beetje, maar het is niet de wonderoplossing. Het is alsof je iemand laat oefenen met een paar specifieke puzzels; hij wordt er beter in, maar niet noodzakelijk slimmer in het algemeen.
  3. Meer tijd en kracht (Test-Time Scaling): Dit bleek de beste oplossing. In plaats van dat de AI direct antwoordt, laten we hem een paar keer proberen (bijvoorbeeld 10 keer) en kiezen we het beste antwoord. Of we laten hem eerst "nadenken" (redeneren) voordat hij schrijft.
    • De analogie: Stel je voor dat je een moeilijke wiskundetaak hebt. Als je direct het antwoord schrijft, maak je misschien een fout. Maar als je het drie keer uitrekent en het antwoord vergelijkt, is de kans op een fout veel kleiner. Door de AI meer "rekenkracht" en tijd te geven om te zoeken, wordt hij veel betrouwbaarder.

Wat betekent dit voor jou?

Dit onderzoek is een belangrijke waarschuwing. We denken vaak dat AI's perfect zijn omdat ze hoge scores halen op officiële tests. Maar in het echte leven, waar mensen vragen op duizend verschillende manieren stellen, zijn ze nog niet volledig te vertrouwen.

De boodschap is duidelijk: Om AI echt betrouwbaar te maken voor belangrijke taken (zoals medische adviezen of juridische hulp), moeten we niet alleen kijken naar hoe slim ze zijn, maar ook hoe stabiel ze zijn als de vraag net even anders klinkt.

De onderzoekers hebben hun code en de nieuwe testset (genaamd IFEVAL++) openbaar gemaakt, zodat iedereen kan helpen om deze "kussen-vragen" te testen en AI's te trainen om niet alleen slim, maar ook echt betrouwbaar te zijn.

Kortom: AI's zijn net als getalenteerde kinderen die nog moeten leren dat de wereld niet altijd precies zo klinkt als in hun schoolboek. Met de juiste oefening en de juiste aanpak, kunnen we ze leren om echt te luisteren, ongeacht hoe je het vraagt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →