← Últimos artículos
💻 computer science

Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset

Este artículo presenta SBC-AND, un conjunto de datos curado de 442 registros de publicaciones científicas en portugués diseñado para abordar la subrepresentación de lenguas no inglesas en la investigación de la Desambiguación de Nombres de Autor y servir como un referente desafiante para evaluar modelos de desambiguación multilingües.

Autores originales: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Publicado 2026-07-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: La confusión de las "etiquetas de nombre"

Imagina que entras en una biblioteca enorme donde millones de personas han escrito libros. El problema es que muchas personas tienen el mismo nombre, como "John Smith" o "Maria Silva".

En el mundo de la ciencia, esto es un gran dolor de cabeza. Si una investigadora llamada "Maria Silva" escribe un artículo sobre computación, y otra "Maria Silva" escribe un artículo sobre historia, la biblioteca podría pensar erróneamente que son la misma persona. Esto arruina su reputación, sus recuentos de citas y la forma en que entendemos quién colabora con quién. Esta tarea de averiguar qué "Maria Silva" escribió qué artículo se llama Desambiguación de Nombre de Autor (AND, por sus siglas en inglés).

La brecha: La fiesta "solo para angloparlantes"

Durante mucho tiempo, los científicos han construido herramientas para resolver esta confusión, pero la mayoría ha practicado con nombres en inglés. Es como tener un organizador de fiestas que es excelente organizando invitados que hablan inglés, pero que nunca ha conocido a nadie con un nombre portugués.

Los nombres portugueses son complicados. A menudo tienen múltiples apellidos (como "Silva" o "Santos") y pequeñas palabras de conexión como "de", "da" o "dos". Además, en los registros científicos, estos nombres suelen escribirse de forma abreviada o inconsistente (por ejemplo, "A. Silva" frente a "Ana Silva"). Debido a esto, las herramientas existentes tienen dificultades cuando se encuentran con publicaciones en portugués.

La solución: El "gimnasio de entrenamiento" SBC-AND

Los autores de este artículo crearon una nueva herramienta llamada SBC-AND. Piensa en esto como un gimnasio de entrenamiento especializado para programas informáticos.

  • ¿Qué hay dentro? Es una colección de 442 artículos científicos reales de revistas de ciencias de la computación brasileñas.
  • ¿Cómo está organizado? Los autores tomaron estos artículos y los clasificaron en "bloques ambiguos". Imagina una caja etiquetada como "Silva". Dentro, hay artículos de 232 personas reales diferentes que comparten ese mismo apellido.
  • El objetivo: El conjunto de datos es "curado", lo que significa que un humano ya ha comprobado y etiquetado exactamente qué artículos pertenecen a qué persona real. Esto le da a la computadora una "clave de respuestas correctas" para ponerse a prueba.

El experimento: Probando el cerebro de la computadora

Los investigadores no solo crearon el conjunto de datos; también lo pusieron a prueba. Utilizaron un sistema informático flexible (llamado ADAN) que intenta clasificar los artículos nuevamente en los grupos correctos.

Probaron el sistema utilizando dos modelos de "cerebro" diferentes (modelos de IA que entienden el lenguaje):

  1. BAAI/bge-m3: Un modelo multilingüe.
  2. IBM Granite: Otro modelo multilingüe.

También ajustaron la "profundidad" del sistema (cuántas capas de pensamiento realiza) y cuánto tiempo practicó (épocas de entrenamiento).

Los resultados: Un desafío difícil

Esto es lo que sucedió cuando la computadora intentó clasificar los artículos:

  • "El panorama general" vs. "Los detalles": La computadora fue bastante buena manteniendo los grupos separados entre sí (como mantener la caja de "Silva" lejos de la caja de "Oliveira"). Sin embargo, tuvo dificultades para clasificar correctamente los artículos dentro de la caja de "Silva".
  • La puntuación: La computadora obtuvo una puntuación decente en la estructura general (alrededor del 90% de precisión), pero cuando se trató de emparejar artículos específicos con el autor correcto, la puntuación bajó significamente (alrededor del 45%).
  • ¿Por qué? El artículo explica que esto se debe a que muchos de los autores reales en el conjunto de datos solo tienen uno o dos artículos listados. Es como intentar identificar a una persona en una fiesta cuando solo la ves una vez; es muy difícil distinguirla de alguien más que se ve similar.
  • El ganador: El modelo IBM Granite funcionó ligeramente mejor que el otro, especialmente cuando utilizó una cantidad específica de "profundidad de pensamiento" (dos capas). Hacer el sistema más "profundo" (tres capas) no ayudó; de hecho, hizo que todo fuera más ruidoso.

La conclusión

El artículo concluye que SBC-AND es una prueba muy dura para la tecnología actual. Destaca que, si bien las computadoras están mejorando en la organización de datos científicos, todavía luchan con idiomas como el portugués, donde los nombres son complejos y los autores a menudo no tienen muchas publicaciones que ayuden a identificarlos.

Los autores han puesto este conjunto de datos a disposición en línea para que otros investigadores puedan usarlo para construir mejores herramientas, asegurando que, en el futuro, cada "Maria Silva" reciba el crédito por su propio trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →