The invisible majority: linking a national researcher registry to OpenAlex reveals Peru's uncertified artificial intelligence workforce
Door het koppelen van het nationale register voor onderzoekers van Peru (RENACYT) aan OpenAlex, onthult deze studie dat het gecertificeerde kunstmatige intelligentie-werkforce van het land slechts een kwart van zijn werkelijke AI-auteurs omvat, wat een aanzienlijk grotere ongecertificeerde meerderheid blootlegt en regionale en gendergerelateerde ongelijkheden in certificering benadrukt, ondanks de hoge productiviteit buiten de hoofdstad.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Overheden moeten weten wie het wetenschappelijke werk verricht om de toekomst te kunnen plannen. In veel Latijns-Amerikaanse landen vertrouwen zij op officiële lijsten, of registers, die onderzoekers certificeren. Deze lijsten fungeren als een formeel verslag van wie als wetenschapper telt, wat vaak bepaalt wie financiering of professionele erkenning krijgt. De aanname achter deze lijsten is dat ze de mensen vastleggen die daadwerkelijk het onderzoek uitvoeren. De wetenschap beweegt echter snel, vooral in velden zoals kunstmatige intelligentie, waar voortdurend nieuwe experts opkomen vanuit universiteiten en industrieën. Als de officiële lijsten de nieuwste en meest actieve werkers missen, wordt het beeld van de overheid over de eigen wetenschappelijke kracht incompleet, wat potentieel kan leiden tot slechte beslissingen over waar geïnvesteerd moet worden in opleiding en middelen.
Een team van onderzoekers van de Universidad Nacional del Altiplano in Peru besloot deze aanname te testen. Ze wilden zien of het nationale register van wetenschappers in Peru, bekend als RENACYT, de wetenschappelijke beroepsbevolking in kunstmatige intelligentie werkelijk weerspiegelt. Hiervoor vertrouwden ze niet op enquêtes of schattingen. In plaats daarvan bouwden ze een brug tussen twee enorme, open databases. Aan de ene kant stond de officiële overheidslijst van gecertificeerde onderzoekers. Aan de andere kant stond OpenAlex, een wereldwijde, gratis te gebruiken catalogus van wetenschappelijke artikelen en de mensen die ze hebben geschreven. Door deze twee bronnen met elkaar te verbinden, kon het team de officiële lijst vergelijken met de werkelijke output van onderzoekers die publicaties produceren op het gebied van kunstmatige intelligentie en computer vision.
De resultaten onthulden een aanzienlijke kloof tussen het officiële verslag en de realiteit. De onderzoekers ontdekten dat het overheidsregister slechts een fractie van de mensen vastlegt die werk verrichten op het gebied van kunstmatige intelligentie in Peru. Terwijl het register meer dan 11.000 gecertificeerde onderzoekers vermeldt, werkt slechts ongeveer 856 van hen primair in de kunstmatige intelligentie. Toen het team keek naar de bredere groep mensen die artikelen publiceren met een Peruaanse connectie in dit veld, vonden zij bijna 3.500 verschillende auteurs. Van hen hield slechts ongeveer één op vier een officiële certificering in bezit. Dit betekent dat de overgrote meerderheid van de mensen die het werk doen, onzichtbaar is voor de officiële statistieken. De gecertificeerde groep vertegenwoordigt een kleine kern, terwijl de ongecertificeerde meerderheid, die studenten, pas afgestudeerden en professionals uit de industrie omvat, de bulk van de beroepsbevolking vormt.
Deze onzichtbaarheid verandert hoe we de groei van het vakgebied begrijpen. Het aantal artikelen dat uit Peru komt op het gebied van kunstmatige intelligentie is in het afgelopen decennium vijfmaal gegroeid, maar het officiële register is niet meegegroeid met deze opmars. De nieuwe auteurs die elk jaar het veld betreden, zijn zelden degenen die onmiddellijk gecertificeerd raken. Bijgevolg zou elk overheidsplan dat uitsluitend op het register is gebaseerd, slechts een kwart van de werkelijke talentenpool in beeld hebben. De studie suggereert dat voor opkomende velden deze officiële lijsten moeten worden beschouwd als een momentopname van een stabiele kern, in plaats van een volledige volkstelling van iedereen die bijdraagt aan de wetenschap.
De studie bracht ook een verrassend verhaal aan het licht over waar deze onderzoekers wonen. Decennialang was het wetenschappelijk werk in Peru sterk geconcentreerd in de hoofdstad, Lima. Het officiële register bevestigt dit, waarbij blijkt dat meer dan de helft van alle gecertificeerde onderzoekers in de hoofdstad woont. Echter, toen de onderzoekers specifiek naar kunstmatige intelligentie keken, verschoof de kaart. Hoewel Lima nog steeds het grootste totale aantal gecertificeerde AI-experts heeft, zijn andere regio's in feite dichter bevolkt met talent. Wanneer gemeten wordt naar het aantal onderzoekers per inwoner in een gebied, hebben steden in het zuiden zoals Arequipa, Tacna en Puno meer gecertificeerde AI-experts per capita dan Lima doet. Sterker nog, de Universidad Nacional del Altiplano, gelegen in de hooggelegen regio Puno, staat op de derde plaats van de meest productieve instellingen in het land voor gecertificeerde AI-onderzoekers, vooruitlopend op enkele van de bekendste universiteiten van het land.
Deze bevinding daagt het idee uit dat de provincies achterblijven qua prestaties. De gegevens tonen aan dat onderzoekers buiten de hoofdstad net zoveel artikelen per persoon produceren als die in Lima. Het verschil is simpelweg de totale omvang van de mensen. De provincies presteren niet ondermaats; ze zijn alleen kleiner van schaal. Dit sugggeert dat de wetenschappelijke kracht van het land meer verspreid is dan de officiële cijfers doen vermoeden, met sterke concentraties van expertise in het zuiden die klaar zijn om ondersteund te worden.
De onderzoekers onderzochten ook hoe de officiële certificeringsniveaus zich verhouden tot de werkelijke productiviteit. Het register wijst onderzoekers toe aan verschillende niveaus op basis van hun carrièreprestaties, waarbij hogere niveaus wijzen op meer senioriteit en prestige. Men zou verwachten dat zij met de hoogste certificeringen het meest productief zouden zijn in de kunstmatige intelligentie. De gegevens laten echter een zeer zwakke correlatie zien. Het officiële rangniveau van een onderzoeker is geen sterke voorspeller voor hoeveel artikelen zij schrijven in dit specifieke veld. Veel van de meest actieve schrijvers in de kunstmatige intelligentie bevinden zich in de lagere niveaus van het register, vaak omdat zij aan het begin van hun carrière staan. Dit geeft aan dat het algemene certificeringssysteem, dat kijkt naar de gehele carrière van een wetenschapper over alle onderwerpen heen, geen nauwkeurig instrument is om expertise in een snel bewegend, gespecialiseerd gebied zoals kunstmatige intelligentie te meten.
Ten slotte belichtte de studie een genderkloof die binnen het vakgebied breder wordt. Vrouwen maken ongeveer een derde uit van het totaal aantal gecertificeerde onderzoekers in het Peruaanse register. Echter, in de subgroep van onderzoekers in de kunstmatige intelligentie daalt dat aantal aanzienlijk. Het aandeel vrouwen valt naar minder dan een vijfde in de AI-groep, en daalt nog verder onder de hoogst gecertificeerde experts in dit veld. Dit patroon suggereert dat de barrières voor vrouwen in de kunstmatige intelligentie niet alleen gaan over het toetreden tot het veld, maar ook over het doormaken naar de hoogste niveaus van erkenning binnen het vakgebied.
Door het officiële overheidsregister te koppelen aan het wereldwijde verslag van gepubliceerde artikelen, biedt deze studie een duidelijker, eerlijker beeld van de Peruaanse wetenschappelijke beroepsbevolking. Het laat zien dat het land een veel grotere en geografisch diversere gemeenschap van kunstmatige intelligentie heeft dan de officiële lijsten toegeven. De bevindingen bekritiseren het register zelf niet, dat een essentieel instrument blijft voor beleid, maar ze suggereren wel dat voor snelgroeiende velden deze lijsten gecontroleerd moeten worden tegen open data om ervoor te zorgen dat de "onzichtbare meerderheid" niet over het hoofd wordt gezien. Het werk demonstreert dat met open data en zorgvuldige matching mogelijk is om deze systemen te auditeren en de ware vorm van een natie's wetenschappelijke potentieel te onthullen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.