PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing
Dit artikel introduceert PERCEPT, de eerste grootschalige Perzisch-Engelse gecodeerde corpus geannoteerd met Universal Dependencies POS-tags, samen met een door een LLM ondersteund annotatiekader en een uitgebreide linguïstische analyse die platformspecifieke patronen in code-mixing op sociale media onthult.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een gigantische, chaotische speeltuin waar mensen van over de hele wereld tegelijkertijd schreeuwen, fluisteren en chatten. In deze speeltuin spreken veel mensen niet slechts één taal; ze mengen ze samen als ingrediënten in een smoothie. Dit wordt "code-mixing" genoemd. Dit is wanneer iemand een zin begint in zijn moedertaal en plotseling een Engels woord erdoorheen gooit omdat het precies goed voelt, of omdat het de enige term is die hij kent voor een nieuw apparaatje. Voor computers is dit een nachtmerrie. Als een computer een zin probeert te begrijpen, verwacht deze dat woorden strikte regels volgen. Maar wanneer talen door elkaar worden gehusseld, raakt de computer in de war, zoals een chef die een recept probeert te volgen dat halverwege het bakken van een cake plotseling overschakelt van metrische bekers naar imperiale ounces. Om computers te leren hoe ze met deze rommelige, leuke realiteit om moeten gaan, hebben wetenschappers een speciale woordenlijst en een set regels nodig—een "corpus"—die hen precies laat zien hoe deze gemengde woorden werken.
Maak kennis met PERCEPT, een nieuw project dat fungeert als een gigantische, georganiseerde bibliotheek voor Perzisch sprekende mensen die ervan houden om Engels in hun berichten te verwerken. De onderzoekers, een team van taalkundigen en computerwetenschappers uit Iran, merkten op dat hoewel we wel kaarten hebben voor andere gemengde taalparen, de Perzisch-Engelse mix een donker, onverkend bos was. Ze wilden een zaklamp bouwen om te zien wat daar aan de hand was. Dus verzamelden ze 6.800 berichten van drie populaire digitale ontmoetingsplaatsen: X (voorheen Twitter), Instagram en Digikala (een enorme online winkelwebsite). Ze verzamelden niet alleen de woorden; ze gebruikten een super slimme AI-assistent genaamd Gemini om als een detective elk enkel Engels woord (of Engels woord geschreven in Perzische letters) te labelen met zijn "functie" in de zin. In de grammatica wordt deze functie een "woordsoort" (Part-of-Speech of POS) genoemd. Is het woord een zelfstandig naamwoord (een ding)? Een werkwoord (een actie)? Een bijvoeglijk naamwoord (een beschrijving)? Het team vroeg de AI ook om te raden waar de post over ging, zoals "winkelen", "politiek" of "grappige memes".
Hier komt het spannende deel: het team heeft niet alleen de bibliotheek gebouwd; ze zijn naar binnen gegaan en begonnen de boeken te lezen om te zien welke patronen ze konden vinden. Ze ontdekten dat wanneer Perzisch sprekenden Engels erbij mengen, ze dat vooral doen voor zelfstandige naamwoorden (dingen). Het is alsof ze de "objecten" uit het Engels lenen, maar de "acties" en "beschrijvingen" in het Perzisch houden. Bijvoorbeeld, ze kunnen zeggen: "Ik kocht een nieuwe laptop", waarbij "laptop" het geleende zelfstandig naamwoord is, maar de rest van de zin in het Perzisch blijft. Echter, de "smaak" van de mix verandelt afhankelijk van waar je bent. Op de winkelwebsite, Digikala, mengden mensen veel merknamen en productmodellen (wat speciale namen zijn, of "eigen namen"). Op X mengden ze meer werkwoorden (acties), en op Instagram leunden ze meer naar bijvoeglijke naamwoorden (beschrijvingen).
De onderzoekers keken ook naar waar deze gemengde woorden zich in een zin verstoppen. Ze ontdekten een verrassende consistentie: ongeacht welk platform je gebruikt, gemengde woorden verschijnen meestal aan het begin of in het midden van een zin, en zelden aan het einde van de zin. Het is alsof de sprekers het Engelse woord vroeg in de zin laten vallen om de scène te schetsen, om vervolgens de gedachte in het Perzisch af te maken. Maar de meest interessante ontdekking ging over "triggeren". Op Digikala, als iemand één Engels woord gebruikte, was de kans heel groot dat ze er direct daarna nog een zouden gebruiken. Het is alsof, zodra je begint te praten over een specifiek merk of product, de Engelse woorden gewoon blijven stromen. Dit gebeurde minder vaak op Instagram of X.
Ten slotte controleerden ze welke onderwerpen de meeste mixing veroorzaakten. Onverwachts hadden de onderwerpen "Industrie & Handel" en "Merk & Bedrijf" de hoogste mate van code-mixing. Wanneer mensen praten over winkelen, technologie of zaken doen, kunnen ze simpelweg niet anders dan Engelse termen erdoorheen strooien. Het team bevestigde het werk van hun AI door menselijke experts een steekproef te laten dubbelchecken, en de mensen waren het bijna altijd eens met de AI, wat bewees dat hun nieuwe bibliotheek betrouwbaar is.
Kortom, dit artikel geeft ons niet alleen een nieuwe dataset; het geeft ons een helder beeld van hoe Perzisch sprekenden van nature talen mengen. Het suggereert dat hoewel de soorten woorden die ze lenen veranderen op basis van het platform, de manier waarop ze mengen een constante ritme volgt. Deze kaart staat nu open voor iedereen om te gebruiken, wat helpt bij het bouwen van betere vertaaltools, slimmere chatbots en een dieper begrip van hoe we communiceren in een wereld waarin talen constant samen dansen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.