← Nieuwste papers
💬 NLP

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

Deze paper introduceert CAPITU, een nieuw benchmark voor het evalueren van instructievolgende vaardigheden van grote taalmodellen in het Braziliaans-Portugees, waarbij taken zijn verankerd in acht canonieke literaire werken en volledig automatisch verifieerbaar zijn.

Oorspronkelijke auteurs: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

Gepubliceerd 2026-03-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat verwaande kok hebt: een kunstmatige intelligentie (AI). Deze kok kan prachtige maaltijden koken (teksten schrijven) in het Engels, maar als je hem vraagt om een recept in het Portugees te maken met heel specifieke regels – bijvoorbeeld "gebruik precies 100 woorden" of "elke zin moet eindigen met een woordje dat op -inho eindigt" – dan loopt het vaak mis. De kok vergeet de regels, gebruikt de verkeerde ingrediënten of kookt gewoon een gerecht dat niet op het recept lijkt.

Deze paper introduceert CAPITU, een nieuwe "keuring" om te testen hoe goed deze koks (AI-modellen) kunnen luisteren naar specifieke instructies in het Braziliaans Portugees.

Hier is de uitleg, vertaald naar alledaagse taal met een paar creatieve vergelijkingen:

1. Het Probleem: De "Vertaal-Kookboek"

Tot nu toe werden AI's getest met instructies die eerst in het Engels waren bedacht en toen letterlijk vertaald.

  • De analogie: Stel je voor dat je een Italiaans recept hebt (Engels) en je vertaalt het woord voor woord naar het Nederlands. Je vraagt de kok: "Voeg een beetje 'olio' toe." De kok denkt: "Ah, dat is olie!" en doet er olie bij. Maar in het echte Italiaans was het misschien een specifiek soort kruid dat niet direct te vertalen is.
  • Het probleem: Portugees heeft unieke eigenschappen (zoals kleine woordjes als -inho of -zinho voor "kleintje", of woorden die eindigen op -ando). Vertaalde tests missen deze nuances. Ze testen of de AI Engels kan vertalen, niet of ze écht Portugees begrijpt.

2. De Oplossing: CAPITU (De Literaire Keuken)

CAPITU is een nieuwe test die niet vertaald is, maar van meet af aan in het Portugees is bedacht.

  • De setting: In plaats van saaie vragen als "Schrijf een e-mail", gebruiken ze de 8 beroemde Braziliaanse boeken (zoals Dom Casmurro of Macunaíma) als decor.
  • De vergelijking: Het is alsof je de AI niet vraagt om een willekeurige tekst te schrijven, maar om een recensie te schrijven over een klassiek boek, terwijl je tegelijkertijd zegt: "Gebruik precies 3 zinnen, begin elke zin met een hoofdletter, en gebruik minstens één woord dat eindigt op -mente (zoals 'snel' in het Portugees)."
  • Het doel: Kijken of de AI deze complexe, culturele regels kan volgen zonder de inhoud van het verhaal te vergeten.

3. Hoe werkt de test? (De Strikte Keurmeester)

Bij deze test is er geen menselijke keurmeester die zegt: "Nou, dit klinkt wel aardig." Nee, de test is als een robot-keurmeester die alleen kijkt naar cijfers en patronen.

  • Automatische check: De robot telt precies hoeveel woorden er zijn. Hij zoekt met een vergrootglas naar woorden die eindigen op -zinho. Als de AI één regel breekt, is het punt weg.
  • De regels: Er zijn 59 soorten regels. Sommige zijn makkelijk (gebruik geen vraagtekens), andere zijn heel lastig (maak een acrostichon, waarbij de eerste letters van elke zin samen een woord vormen, of tel exact 150 woorden).

4. Wat hebben ze ontdekt? (De Uitslagen)

Ze hebben 18 verschillende AI-koks getest. Hier zijn de belangrijkste bevindingen:

  • De "Denkende" Koks zijn het beste: De modellen die eerst even "nadenken" voordat ze antwoorden (zoals de nieuwste GPT-5 met 'reasoning'), doen het fantastisch. Ze halen bijna 100% van de regels goed. Het is alsof ze eerst het recept lezen, de ingrediënten checken en dan pas beginnen met koken.
  • De "Portugees-specialisten" zijn slim en goedkoop: Er zijn modellen die speciaal voor het Portugees zijn getraind (zoals Sabiazinho). Ze doen het bijna net zo goed als de dure, grote modellen, maar kosten een fractie van het geld.
    • Vergelijking: Het is alsof je een dure, beroemde chef-kok (Claude of GPT) hebt, maar een lokale, slimme kok uit de buurt (Sabiazinho) doet het werk voor een tiende van de prijs en levert net zo goed af.
  • Meer regels = Meer chaos: Als je de AI maar één regel geeft, lukt het vaak wel. Maar als je in één gesprek drie keer achter elkaar nieuwe regels toevoegt (bijv. "schrijf een verhaal", "nu een korter verhaal", "nu een verhaal met alleen woorden die op -o eindigen"), dan raken de meeste AI's in de war. Ze vergeten de eerste regel.
  • De lastigste regels: Het tellen van exact het aantal woorden is een nachtmerrie voor AI's (ze tellen vaak verkeerd). Ook het gebruik van die specifieke Portugese woordjes (zoals -inho) is lastig; ze vergeten ze vaak of gebruiken ze op de verkeerde plek.

5. Waarom is dit belangrijk?

Voorheen dachten we dat AI's gewoon "een taal" spreken. Deze paper laat zien dat cultuur en grammatica belangrijk zijn. Als je een AI wilt gebruiken in Brazilië of Portugal, moet je testen met regels die echt bij die taal horen, niet met vertaalde Engelse regels.

Kort samengevat:
CAPITU is een strenge, automatische test in een Braziliaanse bibliotheek. Het laat zien dat de slimste AI's (die eerst nadenken) de regels goed kunnen volgen, maar dat er nog veel werk te doen is om AI's te leren hoe ze complexe, culturele regels in het Portugees moeten combineren zonder de draad kwijt te raken. En het goede nieuws? Er zijn al slimme, goedkope modellen die dit bijna net zo goed doen als de duurste modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →