← Derniers articles
🤖 AI

COCI: Conference Organisers and Content Identifier

Cet article présente COCI, un cadre basé sur l'IA qui utilise des modèles de langage de grande taille et une cartographie sémantique pour extraire des métadonnées structurées à partir d'appels à communications non structurés, intégrant ainsi la littérature grise dans les graphes de connaissances académiques établis pour une analyse systématique.

Auteurs originaux : Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

Publié 2026-08-26
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La science est souvent imaginée comme une collection de livres achevés et d'articles de revues polis, les rapports finaux de la recherche ayant passé des portes éditoriales strictes. Pourtant, une immense partie de la conversation scientifique se déroule bien avant que ces pages finales ne soient imprimées. C'est le monde de la « littérature grise », un terme désignant les documents qui existent en dehors des canaux de publication traditionnels. Parmi ceux-ci figurent les « appels à communications », qui sont essentiellement des invitations envoyées par des organisateurs de conférences pour rassembler de nouvelles recherches. Ces documents sont vitaux car ils révèlent les premières étincelles de nouvelles idées, montissant quels sujets passionnent les chercheurs et qui mène la charge. Cependant, comme ces invitations sont souvent dispersées sur des listes de diffusion et de simples pages web, elles manquent des étiquettes nettes et normalisées que les bibliothèques et les bases de données utilisent pour organiser l'information. Cela rend presque impossible l'étude de ces documents à grande échelle, laissant un angle mort important dans notre compréhension de l'évolution de la science et de ceux qui la façonnent.

Pour résoudre ce problème, une équipe de chercheurs a construit un nouvel outil numérique appelé COCI, qui signifie Conference Organisers and Content Identifier. Voyez ce système comme un traducteur hautement qualifié capable de lire du texte désordonné et non structuré pour le transformer en une liste de faits propre et organisée. Les chercheurs ont injecté dans leur système du texte brut provenant de quarante invitations de conférences différentes, couvrant des domaines allant de l'informatique à la science des matériaux. L'outil utilise l'intelligence artificielle avancée pour scanner le texte et en extraire des détails spécifiques : le nom de la conférence, le lieu et la date où elle aura lieu, les grands thèmes abordés et, plus important encore, les noms et les rôles de chaque personne organisant l'événement.

Ce qui rend cet outil particulièrement puissant, c'est ce qu'il fait après avoir extrait ces noms. Au lieu de simplement lister une personne sous le nom de « John Smith », le système s'efforce de relier ce nom à un identifiant numérique permanent et unique utilisé par la communauté de recherche mondiale. Il vérifie ses découvertes auprès de plusieurs bases de données massives et établies pour s'assurer qu'il a trouvé la bonne personne et la bonne organisation. Si le système trouve une correspondance, il attache un identifiant unique au profil de cette personne, la liant à ses travaux passés et à son institution. Il fait la même chose pour la conférence elle-même, connectant l'événement à des registres connus de rassemblements similaires. Ce processus transforme une simple invitation informelle en une pièce de donnée structurée qui peut être liée à d'autres enregistrements scientifiques, comblant ainsi efficacement le fossé entre les annonces informelles et les cartes formelles du savoir scientifique.

Les chercheurs ont testé leur système en traitant quarante exemples réels, puis en vérifiant manuellement les résultats pour voir comment il performait. L'outil a extrait avec succès les métadonnées de chaque document analysé. Dans un cas spécifique, la production du système a révélé une discordance dans une base de données externe ; l'enquête a montré qu'il ne s'agissait pas d'un échec de l'algorithme d'alignement de COCI, mais plutôt d'une erreur existante au sein de la base de données OpenAlex elle-même, qui avait répertorié le nom de l'organisateur comme un alias alternatif pour un autre chercheur. Cet exemple souligne que la fiabilité de l'extraction sémantique est parfois tributaire de la qualité des données liées (Linked Data) externes. L'équipe a également construit une interface visuelle qui affiche clairement ces informations, montrant les détails de la conférence, la liste des organisateurs avec leurs identités vérifiées, et les sujets cartographiés selon des catégories scientifiques standards. Cette représentation structurée ouvre des voies pour se connecter à des bases de données externes, permettant la possibilité future d'étudier si des organisateurs ont déjà été impliqués dans des cas de faute professionnelle académique.

Le but ultime de ce travail est de donner une reconnaissance formelle au travail souvent invisible d'organisation de la communauté scientifique. En transformant ces documents épars et informels en données structurées, les chercheurs ont créé une fondation pour une nouvelle façon de suivre la santé et la qualité des conférences académiques. À l'avenir, ils prévoient de construire un système qui traquera automatiquement les nouvelles invitations à mesure qu'elles apparaissent, créant un registre vivant de la formation et de l'évolution des communautés scientifiques. Cela permettrait à la communauté élargie de comprendre les premières étapes des tendances de recherche et de créditer les personnes qui construisent les plateformes de découverte, garantissant que le travail d'organisation de la science soit vu et valorisé autant que la recherche elle-même.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →