← Nieuwste papers
💬 NLP

Retrieved In-Context Principles from Previous Mistakes

Het artikel stelt Retrieved In-Context Principles (RICP) voor, een leerkracht-studentkader dat fouten van het studentenmodel analyseert en clusterd om op maat gemaakte, taakspecifieke principes te genereren voor het verbeteren van de prestaties van grote taalmodellen op diverse redeneerbenchmarks.

Oorspronkelijke auteurs: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een student (het Student Model) te leren hoe je lastige puzzels oplost. Normaal gesproken leren we door hen perfecte voorbeelden te tonen van hoe het goed moet. Maar dit artikel stelt dat we hen nog beter kunnen leren door hen te laten zien waar ze fout gingen en uit te leggen waarom.

De auteurs noemen hun nieuwe methode RICP (Retrieved In-Context Principles). Denk hierbij aan een slim, tweestaps tutorsysteem met een Leraar en een Student.

Zo werkt het, met een eenvoudige analogie:

Het Probleem: Het "Eén-maat-voor-alles" Leerboek

Vorige methoden probeerden te leren van fouten, maar dat was alsof je de student een generiek hoofdstuk uit een leerboek gaf met de titel "Hoe je fouten voorkomt".

  • De Tekortkoming: Als de student vastloopt op een wiskundeprobleem over pizza, helpt het lezen van een generieke regel over "je werk controleren" misschien niet genoeg. Omgekeerd is een regel over "pizzawiskunde" nutteloos als de student een logische puzzel oplost.
  • Het Resultaat: Het advies was ofwel te vaag, of het dekte niet genoeg verschillende soorten fouten.

De Oplossing: De "Gepersonaliseerde Tutor" (RICP)

De RICP-methode werkt als een meesterleraar die de student een oefentoets ziet maken, hun specifieke fouten analyseert en vervolgens een op maat gemaakt studiegids maakt voor de volgende toets.

Stap 1: De "Foutenautopsie" (Inzichtgeneratie)

Eerst probeert het Student Model een aantal oefenopgaven op te lossen. Het Teacher Model (een slimmere AI) bekijkt diegene die de Student fout heeft.

  • Wat de Leraar doet: In plaats van alleen "Fout" te zeggen, schrijft de Leraar een rapport. Het identificeert de Oorzaak (bijvoorbeeld: "Je bent vergeten de fooi aan de pizzaprijs toe te voegen") en geeft specifieke Inzichten (bijvoorbeeld: "Controleer altijd of je elk onderdeel van de totale kosten hebt opgenomen").

Stap 2: De "Bibliotheek met Lessen" (Principevorming)

Hier gebeurt de magie. De Leraar organiseert deze fouten in twee soorten advies:

  1. De "Algemene Regels" (Opdrachtniveau Principes):

    • Analogie: Stel je een hoofdstuk in een leerboek voor.
    • De Leraar groepeert vergelijkbare fouten samen (bijvoorbeeld: alle rekenfouten over verhoudingen). Vanuit deze groepen schrijft het brede regels die van toepassing zijn op elk wiskundeprobleem.
    • Voorbeeld: "Controleer altijd je rekenkundige bewerkingen dubbel."
  2. De "Persoonlijke Spiekbrief" (Vraagniveau Principes):

    • Analogie: Stel je een post-it voor op het specifieke probleem dat je op dit moment bekijkt.
    • Voor de exacte vraag die de Student gaat beantwoorden, zoekt de Leraar in de bibliotheek naar de meest vergelijkbare eerdere fouten. Het haalt vervolgens het specifieke advies naar boven dat alleen van toepassing is op deze situatie.
    • Voorbeeld: "Voor dit specifieke pizzaprobleem: vergeet niet de fooi aan de basisprijs toe te voegen, niet alleen de fooi te berekenen."

Stap 3: De "Examen Dag" (Principegebruik)

Wanneer de Student een nieuwe vraag krijgt:

  1. Krijgt het de Algemene Regels (het hoofdstuk uit het leerboek) om op het juiste spoor te blijven.
  2. Krijgt het de Persoonlijke Spiekbrief (de post-it) die is toegespitst op die specifieke vraag.
  3. Combineert het deze met zijn normale instructies om het probleem op te lossen.

Cruciaal: De Leraar hoeft niet aanwezig te zijn tijdens het examen. De Student gebruikt gewoon de notities die de Leraar eerder heeft voorbereid. Dit maakt het snel en goedkoop om uit te voeren.

Waarom is dit beter?

Het artikel testte dit op zeven verschillende "examencommissies" (datasets) met wiskunde, gezond verstand en logica.

  • Aanpassing: In tegenstelling tot oude methoden die iedereen hetzelfde advies gaven, geeft RICP het juiste advies voor de specifieke vraag.
  • Dekking: Door fouten te groeperen, zorgt het ervoor dat de Student leert van een breed scala aan fouten, niet alleen van de meest voorkomende.
  • Resultaten: Toen ze deze "Foutennotities" toevoegden aan standaard AI-prompting-methoden, werden de Student Modellen aanzienlijk slimmer en accurater, vooral bij moeilijke logische en wiskundeproblemen.

In het Kort

In plaats van alleen een AI te laten zien hoe je dingen goed doet, leert deze methode haar hoe je fouten voorkomt door haar eerdere mislukkingen te analyseren. Het creëert een hybride gids die zowel brede wijsheid biedt (voor algemene veiligheid) als specifieke tips (voor het directe probleem), waardoor de AI veel meer redeneert als een mens die leert van zijn eigen fouten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →