← Últimos artigos
💻 computer science

Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset

Este artigo apresenta o SBC-AND, um conjunto de dados curado de 442 registros de publicações científicas em português, projetado para enfrentar a sub-representação de línguas não inglesas na pesquisa de Desambiguação de Nomes de Autores e servir como um benchmark desafiador para avaliar modelos de desambiguação multilíngues.

Autores originais: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Publicado 2026-07-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Confusão das "Etiquetas de Nome"

Imagine que você entra em uma biblioteca gigantesca onde milhões de pessoas escreveram livros. O problema é que muitas pessoas têm o mesmo nome, como "João Silva" ou "Maria Santos".

No mundo da ciência, isso é uma dor de cabeça enorme. Se uma pesquisadora chamada "Maria Silva" escreve um artigo sobre computação, e outra "Maria Silva" escreve um artigo sobre história, a biblioteca pode achar erroneamente que elas são a mesma pessoa. Isso prejudica a reputação delas, suas contagens de citações e a forma como entendemos quem está colaborando com quem. Essa tarefa de descobrir qual "Maria Silva" escreveu qual artigo é chamada de Desambiguação de Nome de Autor (AND - Author Name Disambiguation).

A Lacuna: A "Festa Só para Ingleses"

Por muito tempo, cientistas construíram ferramentas para resolver essa confusão, mas elas praticaram majoritariamente com nomes em inglês. É como ter um organizador de festas que é ótimo em organizar convidados que falam inglês, mas que nunca conheceu ninguém com um nome português.

Nomes portugueses são complicados. Eles frequentemente possuem múltiplos sobrenomes (como "Silva" ou "Santos") e pequenas palavras de ligação como "de", "da" ou "dos". Além disso, nos registros científicos, esses nomes são frequentemente abreviados ou escritos de forma inconsistente (ex: "A. Silva" vs. "Ana Silva"). Por causa disso, as ferramentas existentes têm dificuldade quando encontram publicações em português.

A Solução: O "Ginásio de Treinamento" SBC-AND

Os autores deste artigo criaram uma nova ferramenta chamada SBC-AND. Pense nisso como um ginásio de treinamento especializado para programas de computador.

  • O que tem dentro? É uma coleção de 442 artigos científicos reais de periódicos brasileiros de computação.
  • Como é organizado? Os autores pegaram esses artigos e os separaram em "blocos ambíguos". Imagine uma caixa rotulada como "Silva". Dentro dela, há artigos de 232 pessoas reais diferentes que compartilham esse sobrenome.
  • O Objetivo: O conjunto de dados é "curado", o que significa que um humano já verificou e rotulou exatamente quais artigos pertencem a qual pessoa real. Isso fornece ao computador uma "chave de respostas correta" para testar a si mesmo.

O Experimento: Testando o Cérebro do Computador

Os pesquisadores não apenas criaram o conjunto de dados; eles o colocaram à prova. Eles usaram um sistema de computador flexível (chamado ADAN) que tenta separar os artigos de volta nos grupos corretos.

Eles testaram o sistema usando dois modelos diferentes de "cérebro" (modelos de IA que entendem linguagem):

  1. BAAI/bge-m3: Um modelo multilíngue.
  2. IBM Granite: Outro modelo multilíngue.

Eles também ajustaram a "profundidade" do sistema (quantas camadas de pensamento ele realiza) e quanto tempo ele praticou (épocas de treinamento).

Os Resultados: Um Desafio Difícil

Aqui está o que aconteceu quando o computador tentou organizar os artigos:

  • O "Panorama Geral" vs. Os "Detalhes": O computador foi muito bom em manter os grupos separados uns dos outros (como manter a caixa "Silva" longe da caixa "Oliveira"). No entanto, ele teve dificuldade em organizar os artigos dentro da caixa "Silva" corretamente.
  • A Pontuação: O computador obteve uma pontuação decente na estrutura geral (cerca de 90% de precisão), mas quando se tratava de combinar pares específicos de artigos com o autor correto, a pontuação caiu significativamente (cerca de 45%).
  • Por quê? O artigo explica que isso ocorre porque muitos dos autores reais no conjunto de dados possuem apenas um ou dois artigos listados. É como tentar identificar uma pessoa em uma festa quando você a vê apenas uma vez; é muito difícil diferenciá-la de outra pessoa que se pareça com ela.
  • O Vencedor: O modelo IBM Granite teve um desempenho ligeiramente melhor que o outro, especialmente quando utilizou uma quantidade específica de "profundidade de pensamento" (duas camadas). Tornar o sistema "mais profundo" (três camadas) não ajudou; na verdade, tornou as coisas mais ruidosas.

A Conclusão

O artigo conclui que o SBC-AND é um teste muito difícil para a tecnologia atual. Ele destaca que, embora os computadores estejam ficando melhores em organizar dados científicos, eles ainda têm dificuldades com idiomas como o português, onde os nomes são complexos e os autores muitas vezes não possuem muitas publicações para ajudar na identificação.

Os autores disponibilizaram este conjunto de dados online para que outros pesquisadores possam usá-lo para construir ferramentas melhores, garantindo que, no futuro, cada "Maria Silva" receba o crédito pelo seu próprio trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →