Wiktionary as a Crowdsourced Lexicon for English Dialects
Dit artikel evalueert Wiktionary als een ethisch gecrowdsourced lexicon voor Engelse dialecten, waarbij door middel van descriptieve analyse en sociale media-data wordt aangetoond dat het de dekking van traditionele woordenboeken zoals de OED voor regionale variëteiten evenaart of overtreft, terwijl tegelijkertijd macro-uitdagingen in dialect-responsieve taalbronnen worden belicht.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Taal is geen enkele, solide blok; het is een levend landschap dat verschuift en verandert afhankelijk van waar je staat. Een woord dat één ding betekent in Londen, kan iets volkomen anders betekenen in Auckland, of kan helemaal niet bestaan in Mumbai. Decennialang hebben de mensen die deze taalkundige territoria in kaart brengen vertrouwd op traditionele woordenboeken, boeken samengesteld door teams van experts die jarenlang beslissen welke woorden belangrijk genoeg zijn om op te nemen. Maar de wereld van taal beweegt sneller dan welk team van redacteuren dan ook kan bijhouden, vooral voor de vele variëteiten van het Engels die wereldwijd worden gesproken. Naarmate computers en kunstmatige intelligentie gebruikelijker worden, is er een groeiende behoefte om hen te leren hoe ze deze lokale verschillen kunnen begrijpen. Als een computer het verschil niet kan zien tussen een Nieuw-Zeelandse frase en een Amerikaanse, zal het de mensen die het gebruiken niet begrijpen. Dit creëert een probleem voor de eerlijkheid in technologie, aangezien systemen die alleen gebouwd zijn op standaard Engels vaak moeite hebben met de rijke, diverse manieren waarop mensen daadwerkelijk spreken.
Om dit op te lossen, zoeken onderzoekers naar nieuwe manieren om taaldata te verzamelen die zowel omvangrijk als actueel is. Eén veelbelovende bron is Wiktionary, een gratis, online woordenboek dat door iedereen bewerkt kan worden. In tegen tegenstelling tot traditionele boeken, die geschreven zijn door een kleine groep betaalde experts, is Wiktionary een crowdsourced project waarbij vrijwilligers uit de hele wereld inzendingen, definities en voorbeelden toevoegen. De vraag die onderzoekers stelden was simpel maar moeilijk: Kan dit open, door de gemeenschap gebouwde woordenboek dienen als een betrouwbare kaart voor de vele dialecten van het Engels? Specifiek wilden ze weten of Wiktionary regionale woorden even goed dekt als het beroemde Oxford English Dictionary, en of de woorden die daar gevonden worden ook daadwerkelijk voorkomen in de echte gesprekken die mensen op sociale media voeren.
De onderzoekers begonnen door de inhoud van Wiktionary te vergelijken met het Oxford English Dictionary voor twaalf verschillende nationale variëteiten van het Engels, variërend van het bekende Brits en Amerikaans Engels tot variëteiten uit India, Kenia en de Filipijnen. Ze ontdekten dat hoewel het traditionele woordenboek nog steeds een lichte voorsprong heeft in omvang voor standaard Amerikaans en Brits Engels, Wiktionary voor veel andere regio's juist meer terrein beslaat. Voor variëteiten zoals Canadees en Iers en Australisch Engels bevatte Wiktionary aanzienlijk meer inzendingen dan het traditionele woordenboek. Het verschil was nog opvallender voor Engels dat gesproken wordt in landen buiten de traditionele "inner circle" van Engelstalige naties. Terwijl het traditionele woordenboek helemaal geen inzendingen had voor Keniaans of Pakistaans Engels, had Wiktionary honderden inzendingen voor deze variëteiten. Dit suggereert dat het door de gemeenschap gedreven model bijzonder goed is in het vastleggen van woorden die professionele redacteuren misschien over het hoofd zien of nog geen tijd hebben om op te nemen.
Om te testen of deze woorden ook daadwerkelijk in de echte wereld werden gebruikt, wendde het team zich tot sociale media. Ze bekeken miljoenen berichten en reacties van landspecifieke gemeenschappen op Reddit, een populair online forum. Ze beschouwden deze digitale gemeenschappen als een surrogaat voor geografische locatie, uitgaande van het feit dat mensen die in een Nieuw-Zeelandse gemeenschap posten, waarschijnlijk Nieuw-Zeelands Engels gebruiken. Ze controleerden vervolgens of de woorden die in Wiktionary voor elk land werden vermeld, frequent voorkwamen in de overeenkomstige online gemeenschap. De resultaten toonden een sterke verbinding aan. Wanneer ze naar de hoofdberichten keken die mensen schreven, verschenen de woorden die in Wiktionary werden gevonden precies waar men ze verwachtte. Zo vertoonden woorden die specifiek zijn voor Nieuw-Zeeland bijvoorbeeld het vaakst op in de Nieuw-Zeelandse gemeenschap, en woorden voor India verschenen het vaakst in de Indiase gemeenschap. Deze afstemming suggereert dat Wiktionary niet alleen een lijst met woorden is, maar een reflectie van hoe mensen daadwerkelijk spreken in hun dagelijkse digitale leven.
Echter, de studie onthulde ook dat het type tekst er groot toe doet. De verbinding tussen het woordenboek en de sociale media-data was zeer sterk wanneer er gekeken werd naar de hoofdberichten die mensen schreven, maar het werd veel zwakker wanneer er gekeken werd naar de reacties die mensen achterlieten. In de reactiesessies was de taal meer conversationeel en vaak vermengd met woorden uit andere talen. In de Nieuw-Zeelandse gemeenschap bijvoorbeeld bleken sommige woorden die op Nieuw-Zeels Engels leken, eigenlijk veelvoorkomende woorden in het Tagalog te zijn, de taal van de Filipijnen, omdat de twee talen enkele gelijkaardige spellingen delen. Dit benadrukte een uitdaging: hoewel het woordenboek nuttig is, kan de manier waarop mensen taal gebruiken in snelle, interactieve gesprekken rommelig en beïnvloed zijn door veel verschillende factoren. De onderzoekers vonden dat het woordenboek het beste werkte wanneer de tekst formeler of gestructureerder was, zoals een hoofdbericht, in plaats van in de snelle heen-en-weer interactie van een reactiedraad.
De studie keek ook nauwgezet naar hoe woorden worden gevormd. Ze vergeleken de typen nieuwe woorden die in Wiktionary voor Nieuw-Zeels Engels werden gevonden met het traditionele woordenboek. Ze vonden een zeer hoog niveau van overeenstemming in de patronen die werden gebruikt om deze woorden te creëren, zoals het combineren van twee woorden of het licht veranderen van de betekenis van een woord. Dit suggereert dat zelfs al wordt Wiktionary door vrijwilligers geschreven, de manier waarop zij inzendingen opbouwen dezelfde logische regels volgt als professionele taalkundigen. De onderzoekers merkten op dat Wiktionary bijzonder goed was in het opnemen van frasen en idiomen — groepen woorden die samen een specifieke betekenis hebben — die vaak ontbreken in traditionele woordenboeken. Dit maakt de crowdsourced bron bijzonder waardevol voor het begrijpen van de kleurrijke, expressieve kant van taal die formele boeken soms buiten laten.
Uiteindelijk concludeert het artikel dat Wiktionary een krachtig en levensvatbaar instrument is voor het begrijpen van Engelse dialecten, vooral voor regio's die historisch ondervertegenwoordigd zijn in taaltechnologie. Het vervangt de behoefte aan professionele woordenboeken niet, maar vult ze aan door een snellere, inclusievere en actuelere kijk te bieden op hoe taal evolueert. De onderzoekers waarschuwen dat het gebruik van deze data zorgvuldigheid vereist, met name bij het omgaan met online gesprekken waar verschillende talen kunnen mengen of waar de context van het gesprek de betekenis van een woord verandert. Maar voor het doel van het bouwen van eerlijke en nauwkeurige taaltools die werken voor iedereen, en niet alleen voor de meerderheid, biedt dit open, door de gemeenschap gebouwde woordenboek een cruciaal onderdeel van de puzzel. Het laat zien dat wanneer mensen samenkomen om hun eigen taal te documenteren, ze een bron creëren die zowel diep accuraat als opmerkelijk breed is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.