← Nieuwste papers
💬 NLP

MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese

Dit artikel introduceert MTEB-BR, de eerste specifieke benchmark bestaande uit 22 inheemse Braziliaans-Portugese taken om tekst-embeddingmodellen te evalueren zonder afhankelijk te zijn van vertalingen, wat onthult dat topprestaties haalbaar zijn met open-source modellen en aantoont dat wereldwijde meertalige ranglijsten slechts matig de Portugees-specifieke effectiviteit voorspellen.

Oorspronkelijke auteurs: Tardelli Ronan Coelho Stekel

Gepubliceerd 2026-07-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tardelli Ronan Coelho Stekel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Lost in Translation"-valstrik

Stel je voor dat je een hoogwaardige auto probeert te kopen die specifiek bedoeld is voor het rijden op Braziliaanse wegen. Je gaat naar een wereldwijde autowebsite voor reviews, maar zij hebben alleen reviews van auto's die getest zijn op Amerikaanse of Europese snelwegen. Ze vertellen je: "Deze auto is geweldig!" omdat hij goed presteerde op die buitenlandse circuits.

Maar hier komt de crux: Braziliaanse wegen hebben andere kuilen, ander verkeerspatroon en ander weer. Een auto die wint op een Europees circuit, kan moeite hebben op een Braziliaans circuit.

Lamaag was dit de situatie voor het Braziliaans-Portugees in de wereld van AI. Als je wilde testen hoe goed een AI Portugese zinnen begrijpt, moest je gebruikmaken van:

  1. Vertaalde tests: Engelse tests nemen en deze naar het Portugees vertalen (wat vaak de "smaak" en nuance van de taal doet verdwijnen).
  2. Beperkte dekking: Zeer weinig tests die niet het volledige spectrum van hoe mensen daadwerkelijk in Brazilië spreken en schrijven, dekten.

De Oplossing: MTEB-BR (De "Braziliaanse Rijexamen-test")

De auteurs creëerden MTEB-BR, een gloednieuwe, native benchmark. Zie dit als het bouwen van een speciaal rijexamen-circuit midden in São Paulo, waarbij uitsluitend Braziliaanse verkeersregels en wegomstandigheden worden gebruikt.

  • Geen vertalingen toegestaan: Ze verboden strikt alle testgegevens die vertaald waren uit het Engels. Elke vraag, elk juridisch document, elke medische notitie of social media-bericht die in de test werd gebruikt, is oorspronkelijk in het Braziliaans-Portugees gemaakt.
  • Het Parcours: Ze bouwden een hindernisbaan met 22 stops die zeven verschillende soorten rijvaardigheden dekken:
    • Classificatie: Post sorteren in de juiste bakken (bijv. is deze tweet haatdragend?).
    • Retrieval (Informatie ophalen): De juiste naald in een hooiberg vinden (bijv. een specifieke wet vinden in een enorme database).
    • Clustering (Groeperen): Vergelijkbare items bij elkaar groeperen (bijv. medische dossiers ordenen op onderwerp).
    • En meer, inclus[ief] juridische, medische en fiscale domeinen.

De Race: Wie won er?

Ze lieten 93 verschillende AI-modellen dit parcours afleggen. Sommige waren gratis, open-source modellen (zoals een DIY-auto die je zelf kunt bouwen), en sommige waren dure, gesloten commerciële API's (zoals een luxe auto die je per minuut moet huren).

De Resultaten:

  1. De "Frontier" Gelijkspel: De top 6 modellen lagen qua prestaties zo dicht bij elkaar dat de test statistisch gezien niet kon bepalen wie er echt de "beste" was. Ze behoren allemaal tot dezelfde elitegroep. Het is als een race waarbij de top zes auto's de finishlijn binnen een millimeter van elkaar passeerden.
  2. De Verrassende Winnaar: Een van de best presterende modellen was een open-source model (Qwen3-Embedding-8B). Dit is enorm, want het betekent dat je niet aan een commercieel bedrijf hoeft te betalen voor topniveau prestaties; je kunt dit model zelf gratis draaien.
  3. De "Globale" Valstrik: De paper controleerde of de wereldwijde "Wereldkampioen" AI (degene die wint op Engelse en meertalige tests) ook hier zou winnen. Het antwoord was nee.
    • Analogie: Stel je een Formule 1-kampioenchauffeur voor. Als je hem in een rallyauto op een modderig Braziliaans onverhard pad zet, wint hij misschien niet.
    • Eén model stond wereldwijd op de 3e plaats, maar zakte naar de 49e plaats in Brazilië. Dit bewijst dat goed zijn in het Engels niet automatisch betekent dat je goed bent in het Portugees.

De "Statistische Laag" (Het Notitieblok van de Scheidsrechter)

De meeste benchmarks geven je gewoon één score en een rangorde (1e, 2e, 3e). De auteurs vonden dit te simpel, alsof je zegt "Auto A is sneller dan Auto B" zonder de marge te vermelden.

Ze voegden een statistische laag toe om te fungeren als een zorgvuldige scheidsrechter:

  • Betrouwbaarheidsintervallen: In plaats van alleen te zeggen "Model A scoorde 0,68", zeggen ze: "Model A scoorde 0,68, plus of min 0,05." Dit vertelt je of het verschil tussen twee modellen echt is of slechts een toevalstreffer.
  • Item Response Theory (IRT): Dit is een chique manier om te vragen: "Welke onderdelen van de test scheiden de goede chauffeurs echt van de slechte?"
    • Ze ontdekten dat Retrieval-taken (informatie zoeken) het beste waren in het onderscheiden van de modellen.
    • Clustering-taken (dingen groeperen) het slechtst waren in het van elkaar onderscheiden van de modellen.
    • Analogie: Het is also dat je beseft dat een wiskundetoets heel goed is in het herkennen van genieën, maar een spellingwedstrijd niet erg goed is in het onderscheid te maken tussen een middelbare scholier en een student.

De Kernboodschap voor Gebruikers

Als je een ontwikkelaar of ondernemer in Brazilië bent:

  • Vertrouw de wereldwijde ranglijsten niet blindelings. Een model dat #1 in de wereld is, kan middelmatig zijn in Brazilië.
  • Je hoeft niet te betalen. Je kunt topniveau prestaties krijgen met gratis, zelf gehoste modellen.
  • Kijk naar de "Frontier". Omdat de top 6 modellen statistisch gezien gelijkwaardig zijn, moet je keuze niet gebaseerd zijn op een minuscuul verschil in score. Kies in plaats daarvan op basis van kosten (gratis versus betaald), snelheid en licentie (kun je het commercieel gebruiken?).

Kortom, MTEB-BR is de eerste keer dat Braziliaans-Portugese sprekers een eerlijke, native en statistisch rigoureuze manier hebben om AI-modellen te beoordelen, wat bewijst dat lokale nuance ertoe doet en dat je geen commerciële API nodig hebt om de beste resultaten te behalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →