← Derniers articles
💻 computer science

Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset

Cet article présente SBC-AND, un ensemble de données organisé de 442 enregistrements de publications scientifiques en portugais conçu pour remédier à la sous-représentation des langues autres que l'anglais dans la recherche sur la désambiguïsation de noms d'auteurs et servir de référence exigeante pour évaluer les modèles de désambiguïsation multilingues.

Auteurs originaux : Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Publié 2026-07-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le gros problème : La confusion des « étiquettes de nom »

Imaginez que vous entriez dans une immense bibliothèque où des millions de personnes ont écrit des livres. Le problème est que beaucoup de gens portent le même nom, comme « John Smith » ou « Maria Silva ».

Dans le monde de la science, c'est un énorme casse-tête. Si une chercheuse nommée « Maria Silva » écrit un article sur l'informatique, et qu'une autre « Maria Silva » écrit un article sur l'histoire, la bibliothèque pourrait accidentellement penser qu'il s'agit de la même personne. Cela fausse sa réputation, ses comptes de citations et la façon dont nous comprenons qui collabore avec qui. Cette tâche consistant à déterminer quelle « Maria Silva » a écrit quel article est appelée Désambiguïsation du Nom d'Auteur (AND - Author Name Disambiguation).

La lacune : La fête « réservée à l'anglais »

Pendant longtemps, les scientifiques ont construit des outils pour résoudre cette confusion, mais ils se sont principalement exercés sur des noms anglais. C'est comme avoir un organisateur de fêtes qui est excellent pour organiser des invités anglophones, mais qui n'a jamais rencontré personne avec un nom portugais.

Les noms portugais sont complexes. Ils comportent souvent plusieurs noms de famille (comme « Silva » ou « Santos ») et de petits mots de liaison comme « de », « da » ou « dos ». De plus, dans les archives scientifiques, ces noms sont souvent abrégés ou écrits de manière incohérente (par exemple, « A. Silva » contre « Ana Silva »). Pour cette raison, les outils existants ont du mal face aux publications portugaises.

La solution : La « salle de sport d'entraînement » SBC-AND

Les auteurs de cet article ont créé un nouvel outil appelé SBC-AND. Considérez cela comme une salle de sport spécialisée pour les programmes informatiques.

  • Qu'est-ce qu'il y a dedans ? C'est une collection de 442 articles scientifiques réels provenant de revues de l'informatique brésilienne.
  • Comment est-il organisé ? Les auteurs ont pris ces articles et les ont triés en « blocs ambigus ». Imaginez une boîte étiquetée « Silva ». À l'intérieur, il y a des articles de 232 différentes personnes réelles qui partagent toutes ce nom de famille.
  • Le but : Le jeu de données est « curaté », ce qui signifie qu'un humain a déjà vérifié et étiqueté exactement quels articles appartiennent à quelle personne réelle. Cela donne à l'ordinateur une « clé de correction » pour s'auto-évaluer.

L'expérience : Tester le cerveau de l'ordinateur

Les chercheurs n'ont pas seulement créé ce jeu de données ; ils l'ont mis à l'épreuve. Ils ont utilisé un système informatique flexible (appelé ADAN) qui tente de trier les articles pour les remettre dans les bons groupes.

Ils ont testé le système en utilisant deux modèles de « cerveau » différents (des modèles d'IA qui comprennent le langage) :

  1. BAAI/bge-m3 : Un modèle multilingue.
  2. IBM Granite : Un autre modèle multilingue.

Ils ont également modifié la « profondeur » du système (le nombre de couches de réflexion qu'il effectue) et la durée de son entraînement (époques d'entraînement).

Les résultats : Un défi de taille

Voici ce qui s'est passé lorsque l'ordinateur a tenté de trier les articles :

  • La « vue d'ensemble » vs les « détails » : L'ordinateur était en fait assez doué pour maintenir les groupes séparés les uns des autres (comme garder la boîte « Silva » loin de la boîte « Oliveira »). Cependant, il a eu du mal à trier correctement les articles à l'intérieur de la boîte « Silva ».
  • Le score : L'ordinateur a obtenu un score décent sur la structure globale (environ 90 % de précision), mais lorsqu'il s'agissait d'associer des paires spécifiques d'articles au bon auteur, le score a chuté considérablement (environ 45 %).
  • Pourquoi ? L'article explique que c'est parce que de nombreux auteurs réels dans le jeu de données n'ont qu'un ou deux articles listés. C'est comme essayer d'identifier une personne à une fête quand on ne la voit qu'une seule fois ; il est très difficile de la distinguer de quelqu'un d'autre qui lui ressemble.
  • Le vainqueur : Le modèle IBM Granite a légèrement mieux performé que l'autre, surtout lorsqu'il utilisait une certaine « profondeur de réflexion » (deux couches). Rendre le système plus « profond » (trois couches) n'a pas aidé ; cela a même rendu les choses plus confuses.

Ce qu'il faut retenir

L'article conclut que SBC-AND est un test très difficile pour la technologie actuelle. Il souligne que, bien que les ordinateurs deviennent meilleurs pour organiser les données scientifiques, ils ont encore du mal avec les langues comme le portugais, où les noms sont complexes et où les auteurs ont souvent peu de publications pour aider à l'identification.

Les auteurs ont mis ce jeu de données en ligne afin que d'autres chercheurs puissent l'utiliser pour construire de meilleurs outils, garantissant ainsi qu'à l'avenir, chaque « Maria Silva » reçoive le crédit dû pour son propre travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →