← Nieuwste papers
💬 NLP

RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation

Het artikel introduceert RubricRAG, een methode die domeinkennis ophaalt om automatisch gegenereerde evaluatiecriteria (rubrics) voor grote taalmodellen interpreteerbaarder en effectiever te maken dan menselijke criteria.

Oorspronkelijke auteurs: Kaustubh D. Dhole, Eugene Agichtein

Gepubliceerd 2026-03-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kaustubh D. Dhole, Eugene Agichtein

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een grote, slimme robot (een "Large Language Model" of LLM) hebt die antwoorden geeft op vragen, bijvoorbeeld over gezondheid. Nu wil je weten: is dit antwoord goed of slecht?

Vroeger keek je alleen naar een cijfer, zoals een "8" of een "4". Maar dat zegt je niet waarom het een 8 is. Was het goed omdat het veilig was? Omdat het vriendelijk was? Of omdat het precies de juiste feiten had? Een cijfer alleen is als een schoolcijfer zonder commentaar: je weet dat je geslaagd bent, maar niet wat je moet verbeteren.

De auteurs van dit paper, RubricRAG, willen dit oplossen. Ze willen dat de robot niet alleen een cijfer geeft, maar een lijstje met regels (een "rubric") maakt om te zien of een antwoord goed is.

Hier is hoe het werkt, vertaald in alledaagse taal:

1. Het Probleem: De "Blinde" Robot

Stel je voor dat je een nieuwe chef-kok hebt. Je vraagt hem om een lasagne te maken.

  • De oude manier: Je proeft het en zegt: "Niet slecht, 7/10." De kok weet niet of hij meer kaas moet doen, of dat de saus te zout was.
  • De nieuwe manier (Rubrics): Je geeft de kok een keuringstabel.
    • Regel 1: De saus mag niet te zout zijn (+2 punten).
    • Regel 2: Er moet genoeg kaas op (+1 punt).
    • Regel 3: Geen rauw vlees (-5 punten!).

Dit is een rubric. Het maakt de beoordeling transparant. Maar hier zit de klem: wie schrijft die lijstjes? Mensen moeten dat doen, en dat kost enorm veel tijd en moeite. Voor elke vraag over gezondheid moet een arts een nieuw lijstje schrijven. Dat is onmogelijk om in grote schaal te doen.

2. De Idee: Laat de Robot het Lijstje Schrijven

De onderzoekers dachten: "Kunnen we de slimme robot zelf een lijstje laten maken?"
Ze vroegen de robot: "Maak een lijstje met regels om te beoordelen of dit antwoord over zwangerschapscomplicaties goed is."

Het resultaat was teleurstellend.
De robot maakte lijstjes die te vaag waren. In plaats van "Bel de ambulance als de bloeding meer dan 500ml is", schreef de robot: "Wees voorzichtig en zorg voor veiligheid."
Dat is als een keuringstabel die zegt: "Zorg dat het eten lekker is." Dat helpt de kok niet echt. De robot miste de specifieke details die een mens (zoals een arts) zou hebben.

3. De Oplossing: RubricRAG (De "Slimme Bibliotheek")

De onderzoekers bedachten een slimme truc: RubricRAG.

Stel je voor dat de robot niet alleen op zijn eigen geheugen vertrouwt, maar dat hij naar een bibliotheek gaat voordat hij een lijstje schrijft.

  • Als de robot een vraag krijgt over "zwangerschap op een afgelegen dorp", kijkt hij eerst in zijn bibliotheek.
  • Hij zoekt daar naar andere vragen die daarop lijken (bijvoorbeeld: "Wat te doen bij een bevalling zonder ziekenhuis?").
  • Hij pakt de goede lijstjes die bij die andere vragen hoorden en gebruikt die als voorbeeld.

Dit noemen ze RAG (Retrieval-Augmented Generation). Het is alsof je een student niet alleen laat toetsen, maar hem eerst laat kijken naar de antwoorden van een slimme klasgenoot die een soortgelijke toets heeft gemaakt.

4. Wat Vonden Ze?

Met deze methode (RubricRAG) gebeurde er magie:

  • Beter dan alleen maar vragen: De lijstjes die de robot maakte, leken veel meer op die van echte artsen. Ze waren specifieker en praktischer.
  • Betere beoordeling: Als je de robot deze lijstjes gaf om antwoorden te beoordelen, was hij veel beter in het onderscheid maken tussen een goed en een slecht antwoord.
  • Minder "hallucinaties": De robot bedacht minder onzinregels die niet bestonden.

Een klein nadeel:
Soms maakte de robot te veel lijstjes die op elkaar leken (redundantie). Alsof hij twee keer schrijft: "Zorg dat het eten niet te zout is" en "Pas op met te veel zout". Dat is niet dodelijk, maar wel een beetje overbodig.

De Grootste Les (De Metafoor)

De belangrijkste ontdekking van dit paper is dit:
Het is niet genoeg om de robot gewoon te laten "nadenken" (zelf leren).
Als je de robot alleen maar vraagt om een lijstje te maken, maakt hij generieke, saaie regels.
Maar als je de robot context geeft (door te kijken naar wat anderen eerder hebben gedaan bij vergelijkbare situaties), wordt hij veel beter.

Het is als het verschil tussen:

  1. Iemand vragen: "Schrijf een recept voor een taart." (Het resultaat is vaak saai en generiek).
  2. Iemand vragen: "Schrijf een recept voor een taart, maar kijk eerst naar de recepten van de beste bakkers die een taart voor een bruiloft hebben gemaakt." (Het resultaat is veel specifieker en beter).

Conclusie

RubricRAG laat zien dat we AI-systemen betrouwbaarder en begrijpelijker kunnen maken door ze niet alleen te laten "gissen", maar door ze te laten leren van vergelijkbare voorbeelden. Dit maakt het mogelijk om in de toekomst AI-antwoorden (bijvoorbeeld in de zorg) op een eerlijke, transparante en menselijke manier te beoordelen, zonder dat we duizenden mensen nodig hebben om elke keer een nieuw lijstje te schrijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →