← Nieuwste papers
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

Het artikel introduceert Prosa, de eerste benchmark voor multi-turn chats in het Braziliaans-Portugees met echte gebruikers, en toont aan dat het gebruik van binaire rubriekscores met filtering door meerdere beoordelaars de evaluatiestabiliteit en het discriminerend vermogen aanzienlijk verbetert ten opzichte van traditionele holistische LLM-as-a-judge-methoden.

Oorspronkelijke auteurs: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

Gepubliceerd 2026-05-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert de beste koks in een stad te rangschikken. In het verleden zou je misschien een foodcriticus hebben gevraagd om een gerecht te proeven en er één enkele score van 1 tot 10 aan te geven. Dit is vergelijkbaar met hoe de meeste AI-modellen momenteel worden geëvalueerd: een "rechter"-AI leest een antwoord en geeft er één holistische score aan.

Het probleem, zoals dit paper uitlegt, is dat verschillende critici verschillende smaken hebben. De ene houdt misschien van pittig eten, terwijl de andere het haat. Als je drie verschillende critici vraagt om dezelfde 16 koks te rangschikken, kunnen ze het misschien eens zijn over wie de slechtste is, maar volledig van mening verschillen over wie de beste is. Dit maakt de rangschikking onbetrouwbaar.

De Oplossing van het Paper: De "Checklist"-methode

De onderzoekers achter Prosa (een nieuwe benchmark voor Braziliaans-Portugese AI-chatgesprekken) besloten het spel te veranderen. In plaats van de rechter te vragen: "Hoe goed is dit gerecht in het algemeen?", gaven ze de rechters een specifieke checklist met binaire (Ja/Nee-)vragen.

  • Oude manier (Holistisch): "Beoordeel dit gesprek van 1 tot 10." (Subjectief, vatbaar voor bias).
  • Nieuwe manier (Gebaseerd op een rubric): "Heeft de AI de vraag beantwoord? Ja/Nee. Is het beleefd gebleven? Ja/Nee. Heeft het vermeden dingen te verzinnen? Ja/Nee."

Denk hierbij aan een rijexamen. In plaats dat een instructeur zegt: "Je hebt vrij goed gereden, ik geef je een 8", vult hij specifieke vakjes in: "Heb je je richtingaanduiding gebruikt? Ja/Nee. Heb je bij het rode licht gestopt? Ja/Nee."

De "Filter"-magie

De onderzoekers realiseerden zich dat soms de checklist-items zelf gebroken zijn. Misschien is één vraag zo makkelijk dat elke kok hem haalt, of zo moeilijk dat iedereen hem faalt. Deze "gebroken vragen" verstoren de rangschikking.

Dus voegden ze een filterstap toe. Voordat ze de scores definitief maakten, lieten ze de checklist door een "kwaliteitscontrole"-team lopen. Ze gooiden de vragen weg die te makkelijk, te moeilijk of verwarrend waren. Dit liet hen een scherpe, hoogwaardige set vragen over, die daadwerkelijk het verschil kon aangeven tussen een goede kok en een geweldige kok.

De Grote Ontdekking

Hier is het meest verrassende deel van hun bevindingen:

  1. De Rechter Minder Belangrijk dan de Methode: Toen ze de oude "1-tot-10"-methode gebruikten, gaven drie verschillende AI-rechters (van verschillende bedrijven) volledig verschillende rangschikkingen voor de topkoks. Maar toen ze overschakelden naar de "Checklist + Filter"-methode, waren alle drie de rechters het volledig eens over exact dezelfde rangschikking voor alle 16 koks.
  2. Het Is Goedkoper: Omdat de checklist de taak opsplitst in simpele Ja/Nee-vragen, heb je geen superduurzame, "super-slimme" AI nodig om het oordeel te vellen. Je kunt een goedkopere, snellere AI gebruiken (zoals Gemini 3 Flash) en toch dezelfde perfecte rangschikking krijgen. Het kost ongeveer $2,10 om een nieuw model met deze methode te evalueren, vergeleken met veel hogere kosten voor andere methoden.

Wat is Prosa?

Prosa is de eerste benchmark van dit type voor Braziliaans-Portugees.

  • Reëel Leven: In plaats van verzonnen testvragen te gebruiken (zoals op een schoolexamen), gebruikten ze 1.000 echte gesprekken die echte mensen in Brazilië met AI hadden. Dit vangt hoe mensen echt praten, de straattaal die ze gebruiken, en de echte problemen die ze proberen op te lossen.
  • Het Resultaat: Ze rangschikten 16 verschillende AI-modellen. De eerste plaats ging naar OpenAI's GPT-5.2, gevolgd op korte afstand door Google- en Alibaba-modellen. Interessant genoeg presteerde een open-source model (Qwen3-235B) zo goed dat het meerdere dure, propriëtaire modellen versloeg.

Samenvattend

Het paper betoogt dat we, om AI-modellen eerlijk te rangschikken, moeten stoppen met rechters te vragen om een vaag "gevoel" van kwaliteit, en moeten beginnen met het gebruik van een strenge, gefilterde checklist van simpele feiten. Deze methode verwijdert de bias van de specifieke rechter, maakt de rangschikking veel stabieler en bespaart geld, allemaal terwijl er gebruik wordt gemaakt van echte gesprekken uit Brazilië als testterrein.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →