← Nieuwste papers
💬 NLP

Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs

Dit artikel toont aan dat meertalige supervisie, in het bijzonder wanneer diverse figuurlijke vormen zoals cultuurspecifieke en morele/adviserende spreekwoorden worden geïntegreerd, de prestaties van de identificatie van figuurlijk taalgebruik aanzienlijk verbetert en suggereert een verschuiving naar multidimensionale, conceptuele kaders die verder gaan dan metafoor-gecentreerde benaderingen.

Oorspronkelijke auteurs: Rama Alomair, Remas Alsubaie, Walaa Saifalislam, Rima Alsonbul, Mona Alnajjar, Razan Aldossari, Haya Alibrahim, Abeer Aldayel

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rama Alomair, Remas Alsubaie, Walaa Saifalislam, Rima Alsonbul, Mona Alnajjar, Razan Aldossari, Haya Alibrahim, Abeer Aldayel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om menselijke grappen, raadsels en oude spreekwoorden te begrijpen. Dit gaat niet alleen over het vertalen van woorden van de ene taal naar de andere; het gaat over het begrijpen van de verborgen betekenis erachter. In de wereld van de informatica wordt dit "figuurlijk taalgebruik" genoemd. Denk aan een geheime code waarbij "het regent katten en honden" niet betekent dat er dieren uit de hemel vallen, maar dat het hard regent. Spreekwoorden zijn de ultieme test voor deze robots omdat ze kort zijn, vol zitten met culturele wijsheid en vaak nergens op slaan als je ze letterlijk neemt. Lange tijd probeerden wetenschappers computers te leren deze uitspraken te herkennen door slechts één taal tegelijk te gebruiken, zoals het bestuderen van Engelse grappen in een klas waar alleen Engels wordt gesproken. Maar de echte wereld is rommelig en meertalig, dus wilden onderzoekers weten: als we een robot spreekwoorden in veel verschillende talen tegelijk laten zien, wordt hij dan slimmer? Helpt het de robot om een Engels spreekwoord beter te begrijpen als hij hetzelfde spreekwoord in het Frans, Japans en Arabisch ziet?

Dit artikel, getiteld "Wisdom in Unity", duikt in die exacte vraag met behulp van een enorme collectie van 742 concepten van spreekwoorden, vertaald in zeven verschillende talen (Arabisch, Engels, Frans, Duits, Russisch, Japans en Spaans), wat neerkomt op meer dan 6.700 voorbeelden. De onderzoekers vroegen niet alleen of een spreekwoord "figuurlijk" of "letterlijk" is; ze deelden het op in vier specifieke smaken van betekenis: Metaforisch (het gebruik van beelden of symbolen), Moreel/Adviserend (een les of waarschuwing geven), Oorzaak-Gevolg (een actie koppelen aan een resultaat) en Cultuurspecifiek (lokale kennis nodig hebben om de grap te begrijpen). Ze testten vijf verschillende computermodellen, variërend van standaard encoders tot geavanceerde "instruction-tuned" grote taalmodellen (LLM's), om te zien hoe goed ze presteerden wanneer ze werden getraind met verschillende hoeveelheden van deze vertaalde voorbeelden.

Dit is wat zij ontdekten, en het is een beetje alsof je het perfecte recept vindt voor een meertalige smoothie. Ten eerste ontdekten ze dat je de robot niet elk enkel vertaald spreekwoord hoeft te voeren om geweldige resultaten te krijgen. Sterker nog, het voeren van ongeveer 50% van de vertaalde trainingsdata was genoeg om bijna perfecte prestaties te bereiken. Het toevoegen van meer data voorbij dat punt (van 50% naar 100%) hielp niet veel, wat suggereert dat de modellen een "sweet spot" bereikten waar ze genoeg hadden geleerd om te generaliseren.

Ten tweede, en misschien wel het meest verrassend, doet het type spreekwoord er veel toe. De onderzoekers ontdekten dat de "Cultuurspecifieke" spreekwoorden — de spreekwoorden die het moeilijkst te begrijpen zijn omdat ze leunen op lokale geschiedenis of religie — juist de grootste verbetering lieten zien wanneer de modellen met meertalige data werden getraind. Het is alsof het zien van het spreekwoord in verschillende culturele contexten de robot hielp om eindelijk de code te kraken die het unieke ervan bepaalt. Ondertussen kregen de meer voorkomende typen, zoals metaforen, niet zo'n grote boost van de extra talen.

Ten slotte toonde de studie aan dat geen enkele "smaak" van een spreekwoord op zichzelf voldoende is. De modellen presteerden het best wanneer ze werden getraind op een mix van alle vier de typen. Het blijkt dat terwijl sommige modellen misschien goed zijn in het herkennen van morele lessen en andere in het herkennen van oorzaak-gevolg, het combineren van al deze verschillende perspectieven het sterkste algemene begrip creëert. De auteurs suggereren dat AI in plaats van alleen maar te zoeken naar metaforen, getraind moet worden om deze verschillende, complementaire lagen van betekenis te herkennen om werkelijk de wijsheid te begrijpen die verborgen ligt in onze wereldwijde collectie van spreekwoorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →