← Nieuwste papers
💬 NLP

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

Dit artikel introduceert BLUEX v2, een nieuwe benchmark bestaande uit 395 open vragen uit de belangrijkste Braziliaanse toelatingsexamens voor universiteiten (2022–2025) om 21 state-of-the-art LLM's te evalueren op Portugese discretionaire taken, wat significante prestatiekloven onthult en uitdagingen in wiskundig redeneren en beeldbegrip benadrukt.

Oorspronkelijke auteurs: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je hebt getest hoe slim een groep robots is door ze eenvoudige meerkeuzevragen te stellen, zoals "Welke kleur heeft de lucht? A) Blauw, B) Rood." Ze hebben het goed gedaan door het juiste lettertype te kiezen. Maar de onderzoekers achter dit paper, BLUEX v2, realiseerden zich dat het kiezen van een letter makkelijk is. De echte test van intelligentie is het schrijven van een volledige essay, het uitleggen waarom de lucht blauw is, en het tekenen van een diagram om dat te bewijzen.

Dit paper introduceert een nieuwe, veel moeilijkere "eindtoets" voor AI-modellen, specifiek ontworpen om hun vermogen te testen om in het Portugees te spreken en te schrijven.

Hier is de uitsplitsing van hun werk met eenvoudige analogieën:

1. Het Probleem: De "Meerkeuze"-valstrik

Voorheen testten onderzoekers AI op Braziliaanse toelatingsexamens voor universiteiten, maar dan alleen de eerste ronde. Denk aan de eerste ronde als een trivia-spelletje waarbij je alleen het juiste antwoord omcirkelt. Het is voor AI makkelijk om te gokken of patronen te herkennen.

De tweede ronde van deze examens (de ronde waar BLUEX v2 zich op richt) is als een verdediging van een scriptie. Studenten moeten lange, gedetailleerde antwoorden schrijven, complexe wiskundige problemen stap voor stap oplossen en kaarten of grafieken interpreteren. De oude tests konden niet meten of een AI daadwerkelijk kon denken en schrijven zoals een mens; ze maten alleen of de AI het juiste antwoord kon herkennen.

2. De Oplossing: Een Nieuwe "Eindtoets" voor AI

Het team creëerde BLUEX v2, een enorme dataset van 395 echte vragen van de beste Braziliaanse universiteiten (UNICAMP en USP) tussen 2022 en 2025.

  • De Vragen: Dit zijn niet alleen teksten. Ongeveer 56% van de vragen bevat afbeeldingen, grafieken of kaarten die je moet begrijpen om het antwoord correct te geven.
  • Het Formaat: De AI moet vrije tekstuele antwoorden schrijven, niet A, B, C of D kiezen.
  • De Onderwerpen: Het beslaat 9 verschillende onderwerpen, van Geschiedenis en Sociologie tot Natuurkunde en Wiskunde.

3. Hoe Ze de Robots Gradeerden: De "AI-Docent"

Het nakijken van een essay van 5 pagina's is voor mensen moeilijk snel te doen voor duizenden tests. Daarom bouwde het team een systeem waarbij een AI optreedt als de docent.

  • Het Rubriek: Eerst gebruikten ze een AI om het "officiële juiste antwoord" te lezen en dit te ontleden in een checklist (een rubriek). Als het antwoord bijvoorbeeld "ATP" en "spiercontractie" moet vermelden, bevat de checklist deze twee items.
  • De Beoordelaar: Een andere AI (de "Judge") leest het antwoord van de student-robot en vinkt de items op de lijst af. Heeft het ATP vermeld? Ja. Heeft het spiercontractie vermeld? Nee.
  • Het Cijfer: De robot krijgt een score van 0 tot 10 op basis van hoeveel checklist-items het heeft geraakt.
  • Het Bewijs: Om er zeker van te zijn dat de "AI-Docent" niet aan het hallucineren was, vergeleken ze de beoordeling van de AI met die van echte menselijke docenten. De AI stemde 89,5% van de tijd overeen met de mensen. Dat is een zeer hoge score, wat bewijst dat de geautomatiseerde beoordeling betrouwbaar is.

4. De Resultaten: Wie Geslaagd is en Wie Gezakte is?

Ze testten 21 verschillende AI-modellen (de "robots") op dit examen.

  • De Spreiding: De scores varieerden van een laag van 4,18 tot een hoog van 9,10. Dit laat zien dat de test goed is in het onderscheid maken tussen een slimme robot en een minder slimme robot.
  • De Winnaars: De beste presteerders waren gigantische, dure modellen zoals Gemini 3.1 Pro en GPT-5.
  • De Verliezers: Kleinere, open-source modellen hadden moeite, met de laagste scores rond de 4,18.
  • De Braziliaanse Sterren: Opvallend genoeg presteerden Braziliaanse modellen (Sabiá-4) erg goed, bijna net zo goed als de wereldwijde reuzen, wat aantoont dat lokale training helpt.

5. De "Moeilijke Delen": Waar Robots Struikelen

Zelfs de beste robots hadden moeite met twee specifieke zaken:

  1. Wiskundig Redeneren: Dit was het moeilijkste onderwerp. Net zoals een mens die een geweldig verhaal kan schrijven maar geen lange delingen kan maken, konden de AI's prachtige Portugese essays schrijven, maar maakten ze vaak fouten in de wiskundige stappen.
  2. Beeldbegrip: Wanneer een vraag een grafiek of een kaart bevatte, daalden de scores van de robots met ongeveer 0,5 punt gemiddeld. Het is alsoal een student een wiskundeprobleem te geven, maar de cijfers op een verkreukeld papiertje getekend; de AI had moeite om de details duidelijk genoeg te "zien" om het probleem op te lossen.

6. De Kosten van de Test

De onderzoekers waren transparant over de prijs. Het uitvoeren van dit hele experiment — het stellen van de vragen, het genereren van de beeldbeschrijvingen en het nakijken van de antwoorden — kostte ongeveer $127. Dit is verrassend goedkoop voor een studie van deze omvang, wat aantoont dat we AI rigoureus kunnen testen zonder miljoenen uit te geven.

De Kernboodschap

BLUEX v2 is een nieuwe, strengere standaard voor het testen van AI in het Portugees. Het gaat verder dan eenvoudige trivia en dwingt de AI om te schrijven, te redeneren en naar plaatjes te kijken. De resultaten laten zien dat hoewel AI erg goed wordt in het schrijven en argumenteren in het Portugees, het nog steeds moeite heeft met complexe wiskunde en het interpreteren van visuele gegevens. Deze benchmark geeft onderzoekers een duidelijke kaart van waar ze hun volgende verbeteringen op moeten richten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →