Language Models for Portuguese: A Systematic Mapping Study
Dit artikel presenteert een systematische mappingstudie van 46 taalmodellen ontwikkeld voor het Portugees, die een uitgebreid overzicht biedt van hun technische kenmerken, evolutionaire relaties en huidige onderzoeksgebieden om toekomstige ontwikkelingen in het vakgebied te begeleiden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, bruisende bibliotheek waar elk boek in een andere taal is geschreven. Lange tijd waren de slimste computers in deze bibliotheek — de computers die kunnen lezen, schrijven en chatten zoals mensen dat doen — vooral getraind op Engelse boeken. Ze werden ongelooflijk vloeiend in het Engels, maar wanneer je hen iets vroeg over verhalen uit andere landen, struikelden ze vaak, raakten ze in de war of bedachten ze gewoon dingen. Dit komt omdat de "hersenen" van deze computers zijn gebouwd uit de woorden die ze hebben gelezen; als ze niet genoeg boeken in een specifieke taal hebben gelezen, kunnen ze de cultuur, grappen of geschiedenis achter die woorden niet echt begrijpen. Onlangs zijn wetenschappers begonnen met het bouwen van speciale computers voor het Portugees, de taal die gesproken wordt door honderden miljoenen mensen in Brazilië, Portugal en delen van Afrika en Azië. Maar net als een bibliotheek met verspreide boeken, is de informatie over deze nieuwe Portugese computers rommelig, verborgen op verschillende plaatsen en moeilijk in één keer te vinden.
Dit artikel is als een supergeorganiseerde bibliothecaris die besluit de hele Portugese sectie op te ruimen. De auteurs, een team van een universiteit in Brazilië, gingen op een enorme jacht om elke computer die ontworpen is om Portugees te spreken en die tussen 2020 en 2025 is gepubliceerd, te vinden. Ze hebben ze niet alleen geteld; ze hebben de dozen geopend, de handleidingen gecontroleerd en geprobeerd uit te zoeken hoe ze zijn gebouwd, waarmee ze zijn onderwezen en of iemand ze daadwerkelijk kan gebruiken. Ze vonden 46 verschillende modellen, variërend van algemene chatbots tot specialisten die alleen praten over recht, geneeskunde of olie en gas. Hun grote ontdekking? Hoewel er veel opwindende vooruitgang is, is de "bibliotheek" nog steeds een beetje chaotisch. Veel van deze modellen zijn als geheime recepten die alleen de chef kent (de code wordt niet gedeeld), sommige werden onderwezen met vertaalde boeken die de lokale smaak niet helemaal vatten, en zeer weinig van hen zijn gecontroleerd om te zien of ze eerlijk of veilig in gebruik zijn. De auteurs suggereren dat om deze computers echt nuttig te maken voor iedereen die Portugees spreekt, we moeten stoppen met het vertrouwen op vertalingen, onze blauwdrukken opener moeten delen en ervoor moeten zorgen dat de computers de rijke diversiteit van de taal begrijpen, en niet alleen de meest populaire versie ervan.
De Grote Portugese Modeljacht
Denk aan de wereld van Kunstmatige Intelligentie (AI) als een enorme bouwplaats. Jarenlang werden de grootste, meest indrukwekkende wolkenkrabbers gebouwd met Engelse stenen. Dit zijn de "Large Language Models" (LLM's), de slimme computers die essays kunnen schrijven, vragen kunnen beantwoorden en zelfs code kunnen schrijven. Maar de arbeiders op deze bouwplaats realiseerden zich dat als je alleen met Engelse stenen bouwt, je geen huis kunt bouwen dat voor iemand die Portugees spreekt aanvoelt als een thuis. Dus begon tussen 2020 en 2025 een nieuwe golf van bouwers huizen te construeren die specifiek voor Portugees sprekenden zijn.
Het probleem was dat deze nieuwe huizen over de hele kaart verspreid waren. Sommigen werden beschreven in chique wetenschappelijke tijdschriften, anderen waren slechts aantekeningen op een website, en sommige waren verborgen in technische rapporten die niemand las. Het was alsof je probeerde een specifiek speeltje te vinden in een kamer waar de speeltjes in verschillende stapels waren gegooid, waarvan sommige gelabeld waren en andere niet. De auteurs van dit artikel besloten de kamer op te ruimen. Ze voerden een "systematic mapping study" uit, wat een chique manier is om te zeggen dat ze een meesterlijst hebben gemaakt van elk Portugees taalmodel dat ze konden vinden.
Ze vonden in totaal 46 modellen. Dat zijn veel verschillende computers! Ze hebben ze gesorteerd zoals een verzamelaar postzegels sorteert. Ze keken naar welk "base model" elk exemplaar als startpunt had (of het nu gebouwd was op een fundament van BERT, Llama of T5), waar het voor ontworpen was (algemeen chatten, juridisch advies, medische diagnose of het analyseren van tweets) en hoe groot het was (variërend van piepkleine modellen met 12 miljoen parameters tot enorme modellen met 72 miljard).
De "Stamboom" van de Portugese AI
Een van de coolste dingen die de auteurs deden, was het tekenen van een "fylogenetische boom". Stel je een stamboom voor voor deze computers voor. In plaats van te laten zien hoe mensen aan hun grootouders verwant zijn, laat deze boom zien hoe deze AI-modellen verwant zijn aan hun "ouders".
Ze ontdekten dat de meeste Portugese modellen afstammelingen zijn van een paar beroemde "voorouder"-modellen. De grootste familie tak komt van BERT, wat als de overgrootvader van veel van deze modellen fungeert; 20 van de 46 gevonden modellen zijn direct gebouwd bovenop BERT of zijn neven. De tweede grootste familie komt van de Llama-familie, de nieuwe, hippe voorouder waar 10 modellen op gebaseerd zijn.
De boom laat ook zien hoe deze modellen evolueerden. Sommigen begonnen als algemene computers (goed in alles) en kregen toen gespecialiseerde training om experts te worden in specifieke velden. Er is bijvoorbeeld een tak waar een model begon als een algemene lezer, toen medische tekstboeken bestudeerde om een "CardioBERTpt" (een hartarts-AI) te worden, en daarna een andere versie medische documenten bestudeerde om een "JurisBERT" (een advocaat-AI) te worden. Het is als een student die eerst naar een algemene school gaat en dan naar gespecialiseerde hogescholen gaat om arts of advocaat te worden.
Het "Open Deur" Probleem
De auteurs controleerden ook de deuren van deze 46 huizen om te zien of er iemand naar binnen kon lopen. Ze zochten naar drie dingen:
- De Code: Kun je de blauwdrukken zien?
- Het Model: Kun je de voltooide computerhersenen downloaden?
- De Data: Kun je de boeken zien waarop de computer is getraind?
Het nieuws hierover is een beetje gemengd. Van de 46 modellen hadden er slechts 11 hun broncode (de blauwdrukken) beschikbaar voor iedereen om te zien. Ongeveer 5 modellen waren volledig op slot — je kon ze helemaal niet gebruiken. En voor de trainingsdata (de boeken), slechts 17 modellen gebruikten data die vrij beschikbaar was om te downloaden. De rest gebruikte data die ofwel achter een betaalmuur zat, of waarvoor speciale toestemming nodig was om erom te vragen, of die geheim werd gehouden door het bedrijf dat het gebouwd had.
De auteurs controleerden ook of deze modellen een "Model Card" hadden, wat een soort voedingsetiket voor AI is. Het vertelt je waar het model goed in is, waar het slecht in is en of het vooroordelen heeft. Schokkend genoeg hadden slechts 3 van de 46 modellen een volledig, perfect voedingsetiket. De meeste hadden half afgewerkte labels, en 10 hadden helemaal geen label. Dit betekent dat als je deze modellen gebruikt, je misschien niet precies weet waar je aan begint.
De "Vertaalval" en Ontbrekende Stemmen
Een van de belangrijkste bevindingen gaat over hoe deze modellen leerden spreken. De auteurs merkten op dat veel modellen werden onderwezen met boeken die vertaald waren van het Engels naar het Portugees. Stel je voor dat je probeert te leren over de Braziliaanse cultuur door een boek te lezen dat oorspronkelijk in New York is geschreven en vervolgens woord voor woord is vertaald. Je krijgt de grammatica misschien wel goed, maar je mist de slang, de grappen en de lokale gevoelens.
Het artikel suggereert dat het vertrouwen op vertaalde data een probleem is. Het betekent dat deze modellen de unieke culturele nuances van Portugeessprekende mensen in Brazilië, Portugal of Afrika mogelijk niet begrijpen. Bovendien wijzen de auteurs erop dat bijna alle modellen die ze vonden zich alleen richten op twee versies van het Portugees: Braziliaans-Portugees en Europees-Portugees. Ze negeren de andere zeven landen waar Portugees een officiële taal is, zoals Angola, Mozambique en Kaapverdië, volledig. De auteurs betogen dat dit een vorm van "linguïstische vooroordelen" is — de aanname dat omdat een model Braziliaans en Europees Portugees spreekt, het ook voor iedereen die de taal spreekt kan spreken. Ze stellen voor dat toekomstige modellen getraind moeten worden op data die de diversiteit van alle Portugeessprekende naties werkelijk vertegenwoordigt.
Wat Nu?
De auteurs concluderen dat we weliswaar veel vooruitgang hebben geboekt, maar dat we nog een lange weg te gaan hebben. Ze stellen voor dat de volgende generatie Portugese AI moet:
- Stoppen met het gebruik van vertaalde data en beginnen met het gebruik van echte, originele Portugese boeken en gesprekken van over de hele wereld.
- Hun blauwdrukken (code) delen zodat andere wetenschappers hun werk kunnen controleren en verbeteren.
- Meer stemmen op te nemen van Afrikaanse en Aziatische Portugeessprekers, en niet alleen die van Brazilië en Portugal.
- Meer zintuigen toe te voegen. Op dit moment begrijpen de meeste van deze modellen alleen tekst. De auteurs zien een grote kans om modellen te bouwen die ook afbeeldingen en geluiden kunnen begrijpen (multimodale modellen) specifiek voor het Portugees, zoals een computer die naar een foto van een Braziliaanse straat kan kijken en deze in lokale slang kan beschrijven.
Kortom, de bibliotheek van de Portugese AI groeit snel, maar het heeft een betere organisatie, meer open deuren en een grotere variëteit aan stemmen nodig om de miljoenen mensen die de taal spreken werkelijk te kunnen dienen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.