← Nieuwste papers
🤖 AI

COCI: Conference Organisers and Content Identifier

Dit artikel introduceert COCI, een op AI gebaseerd framework dat Large Language Models en semantische mapping gebruikt om gestructureerde metadata te extraheren uit ongestructureerde Calls for Papers, waardoor grijze literatuur kan worden geïntegreerd in gevestigde wetenschappelijke kennisgrafen voor systematische analyse.

Oorspronkelijke auteurs: Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

Gepubliceerd 2026-08-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Wetenschap wordt vaak voorgesteld als een collectie voltooide boeken en gepolijste tijdschriftartikelen, de definitieve rapporten van onderzoek die door strikte redactionele poorten zijn gegaan. Toch vindt een groot deel van het wetenschappelijke gesprek plaats lang voordat die laatste pagina's worden gedrukt. Dit is de wereld van de "grijze literatuur", een term voor documenten die buiten de traditionele publicatiekanalen bestaan. Tot deze behoren ook "calls for papers", wat in essentie uitnodigingen zijn die door conferentieorganisatoren worden verzonden om nieuw onderzoek te verzamelen. Deze documenten zijn essentieel omdat ze de vroegste vonken van nieuwe ideeën onthullen, waarbij ze laten zien over welke onderwerpen onderzoekers enthousiast zijn en wie de leiding neemt. Omdat deze uitnodigingen echter vaak verspreid zijn over e-maillijsten en eenvoudige webpagina's, missen ze de nette, gestandaardiseerde labels die bibliotheken en databases gebruiken om informatie te organiseren. Dit maakt het bijna onmogelijk om ze op grote schaal te bestuderen, wat een aanzienlijk blinde vlek achterlaat in ons begrip van hoe wetenschap evolueert en wie deze vormgeeft.

Om dit probleem op te lossen, heeft een team van onderzoekers een nieuwe digitale tool gebouwd genaamd COCI, wat staat voor Conference Organisers and Content Identifier. Zie dit systeem als een zeer bekwame vertaler die rommelige, ongestructureerde tekst kan lezen en dit kan omzetten in een nette, georganiseerde lijst met feiten. De onderzoekers voerden ruwe tekst van veertig verschillende conferentie-uitnodigingen in hun systeem in, variërend van de vakgebieden informatica tot materiaalkunde. De tool gebruikt geavanceerde kunstmatige intelligentie om de tekst te scannen en specifieke details eruit te halen: de naam van de conferentie, waar en wanneer deze zal plaatsvinden, de brede onderwerpen die worden besproken, en, het belangrijkste, de namen en rollen van elke persoon die het evenement organiseert.

Wat deze tool bijzonder krachtig maakt, is wat hij doet nadat hij die namen heeft geëxtraheerd. In plaats van een persoon alleen als "John Smith" te vermelden, werkt het systeem eraan om die naam te koppelen aan een permanente, unieke digitale ID die wordt gebruikt door de wereldwijde onderzoekscommunity. Het controleert de bevindingen tegen verschillende massieve, gevestigde databases om te verzekeren dat het de juiste persoon en de juiste organisatie heeft gevonden. Als het systeem een match vindt, koppelt het een unieke identificator aan het profiel van die persoon, waardoor deze verbonden wordt met het eigenlijke werk uit het verleden en de instelling. Het doet hetzelfde voor de conferentie zelf, door het evenement te verbinden met bekende records van soortgelijke bijeenkomsten. Dit proces transformeert een eenvoudige, informele uitnodiging in een gestructureerd stuk data dat kan worden gekoppeld aan andere wetenschappelijke records, waardoor de kloof tussen informele aankondigingen en de formele kaarten van wetenschappelijke kennis effectief wordt overbrugd.

De onderzoekers testten hun systeem door veertig real-world voorbeelden te verwerken en vervolgens de resultaten handmatig te controleren om te zien hoe goed het presteerde. De tool slaagde erin de metadata uit elk geanalyseerd document te extraheren. In één specifief geval onthulde de output van het systeem een mismatch in een externe database; onderzoek wees uit dat dit geen fout was van het uitlijningsalgoritme van COCI, maar een bestaande fout binnen de OpenAlex-database zelf, die de naam van de organisator als een alternatieve alias voor een andere onderzoeker had vermeld. Dit voorbeeld benadrukt dat de betrouwbaarheid van semantische extractie soms afhankelijk is van de kwaliteit van de externe Linked Data. Het team heeft ook een visuele interface gebouwd die deze informatie duidelijk weergeeft, waarbij de conferentiedetails, de lijst met organisatoren met hun geverifieerde identiteiten en de onderwerpen gemapt naar standaard wetenschappelijke categorieën worden getoond. Deze gestructureerde representatie opent paden om verbinding te maken met externe databases, wat de toekomstige mogelijkheid biedt om te onderzoeken of organisatoren eerder betrokken zijn geweest bij academisch wangedrag.

Het uiteindelijke doel van dit werk is om de vaak onzichtbare arbeid van het organiseren van de wetenschappelijke gemeenschap formele erkenning te geven. Door deze verspreide, informele documenten om te zetten in gestructureerde data, hebben de onderzoekers een fundament gelegd voor een nieuwe manier om de gezondheid en kwaliteit van academische conferenties te volgen. In de toekomst willen ze een systeem bouwen dat automatisch nieuwe uitnodigingen opspoort zodra ze verschijnen, waardoor een levend verslag ontstaat van hoe wetenschappelijke gemeenschappen ontstaan en veranderen. Dit zou de bredere gemeenschap in staat stellen om de vroege stadia van onderzoekstrends te begrijpen en om de mensen te erkennen die de platforms voor ontdekking bouwen, zodat het werk van het organiseren van wetenschap net zo gezien en gewaardeerd wordt als het onderzoek zelf.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →