← Nieuwste papers
💬 NLP

Learning When to Trust via Selective Context Preference Optimization

Het artikel introduceert MIST, een benchmark voor selectief vertrouwen, en stelt SCOPE voor, een trainingsmethode die modellen optimaliseert om weerstand te bieden aan misleidende context terwijl hun vermogen om nuttige of irrelevante informatie correct te benutten behouden blijft, waardoor de beperking van het simpelweg negeren van alle externe signalen wordt aangepakt.

Oorspronkelijke auteurs: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

Gepubliceerd 2026-08-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante detective bent die elk mysterie kan oplossen door alleen naar de aanwijzingen op tafel te kijken. Je bent zo goed in logica dat je het antwoord op een raadsel direct in je hoofd kunt uitrekenen. Maar dan fluistert er iemand een hint in je oor. Soms is die hint nuttig en wijst hij naar de juiste oplossing. Andere keren is het een truc — een zeer overtuigende, plausibel klinkende leugen die bedoeld is om je van gedachten te doen veranderen en de verkeerde keuze te laten maken.

Dit is de wereld van moderne "Large Language Models" (LLM's), de superintelligente AI-hersenen die met ons chatten, code schrijven en wiskundige problemen oplossen. Deze modellen zijn als onze detective: ze zijn ongelooflijk krachtig, maar ze hebben een lastige gewoonte. Als je ze een vraag geeft en er vervolgens een zin aan toevoegt die lijkt op een nuttige hint, maar eigenlijk fout is, raken ze vaak in de war en geven ze het verkeerde antwoord, zelfs als ze het juiste antwoord al wisten. Wetenschappers noemen dit "susceptibility" (vatbaarheid). De grote vraag is: hoe leren we deze AI-detectives om de leugenaars te negeren terwijl ze nog steeds naar de vertellers van de waarheid luisteren? Als we ze gewoon vertellen om naar iedereen niet te luisteren, worden ze nutteloos omdat ze dan ook stoppen met luisteren naar de goede hints.

Dit artikel introduceert een nieuwe manier om deze AI-hersenen te testen en te trainen, waarbij het probleem niet wordt behandeld als "hoe moet je koppig zijn", maar als "hoe moet je selectief zijn". De onderzoekers creëerden een speciale speeltuin genaamd MIST (Misleading Signal Testbed). Denk aan MIST als een grote spelshow waarin elke deelnemer (de AI) hetzelfde raadsel vier keer krijgt. In de eerste ronde zijn er geen extra hints. In de tweede ronde fluistert een sluwe leugenaar een fout antwoord. In de derde ronde fluistert een behulpzame vriend het juiste antwoord. In de vierde ronde praat een prater over iets totaal ongerelateerds. Door te kijken naar hoe de AI op elk van deze vier scenario's reageert, konden de onderzoekers precies zien wie slim genoeg was om de leugenaar te herkennen zonder de vriend te negeren.

Ze ontdekten iets verrassends: bijna elk AI-model dat ze testten, van de grootste superintelligente tot de kleinere open-source modellen, trapte in de val. Wanneer een plausibele maar foutieve hint werd toegevoegd, daalde hun nauwkeurigheid aanzienlijk. Zelfs de "slimste" modellen werden bedrogen. Dit bewees dat het probleem universeel is; de AI is niet gewoon onvoorzichtig; het worstelt echt met het verschil tussen een nuttige hint en een misleidende hint.

Het artikel betoogt dat de oude manier om dit op te lossen — het trainen van de AI om "resistent" te zijn of om alle externe hints te negeren — een slecht idee is. Het is alsoast een detective trainen om alle getuigen te negeren, zelfs de eerlijke, om een leugenaar te vermijden. Het resultaat is een detective die veilig is voor leugens, maar nutteloos bij het oplossen van zaken.

In plaats daarvan stellen de auteurs een nieuwe trainingsmethode voor genaamd SCOPE (Selective Context Preference Optimization). Stel je voor dat je een hond traint. Als je hem alleen straft wanneer hij een slechte opdracht opvolgt, kan het zijn dat hij niemand meer opvolgt. Maar als je hem beloont voor het opvolgen van de goede opdrachten, het negeren van de slechte en het kalm blijven wanneer iemand over het weer praat, leert hij slim te zijn over wie hij moet opvolgen. SCOPE doet precies dit voor AI. Het neemt de fouten van de AI (waar de AI door een leugenaar werd bedrogen) en koppelt deze aan de momenten waarop het goed ging (wanneer het de leugenaar negeerde of de helper beluisterde). Het leert de AI vervolgens om de "slimme" keuze in alle vier de situaties evenveel te verkiezen.

De resultaten zijn veelbelovend. Wanneer ze SCOPE gebruikten om sommige populaire AI-modellen te trainen, werden de modellen veel beter in het herkennen van de leugenaars. Ze lieten zich niet meer bedriegen door de foutieve hints, maar ze verloren ook niet het vermogen om de juiste hints te gebruiken of de saaie gesprekken te negeren. Sterker nog, de modellen werden zelfs beter in het oplossen van de oorspronkelijke raadsels. De onderzoekers testten dit op andere puzzels die de AI nog nooit had gezien, en de vaardigheid van "selectief vertrouwen" bleef behouden. De AI leerde wanneer hij moest vertrouwen, in plaats van alleen maar te leren alles te wantrouwen.

Kortom, het artikel suggereert dat de toekomst van betrouwbare AI niet ligt in het bouwen van muren om alle informatie buiten te houden. Het gaat erom de AI te leren een kritische denker te zijn: om naar de waarheid te luisteren, de leugens te negeren en gefocust te blijven wanneer de ruis luid wordt. Ze hebben het probleem niet perfect opgelost (sommige slimme leugens bedriegen de AI nog steeds), maar ze hebben een duidelijke weg vooruit aangetoond: probeer de AI niet koppig te maken, maar leer hem wijs te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →