← 최신 논문
💻 computer science

Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset

이 논문은 저자명 모호성 해소(Author Name Disambiguation) 연구에서 비영어권 언어의 과소대표성 문제를 해결하고 다국어 모호성 해소 모델을 평가하기 위한 도전적인 벤치마크 역할을 수행하도록 설계된 442개의 포르투갈어 과학 출판 기록으로 구성된 정제된 데이터셋인 SBC-AND를 소개한다.

원저자: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

게시일 2026-07-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Natan de S. Rodrigues, Samuel Gomes dos Santos, Vitória Maria Diniz, Sirlene A. Rodrigues Costa

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: "이름표" 혼동

수백만 명의 사람들이 책을 쓴 거대한 도서관에 들어갔다고 상상해 보세요. 문제는 "존 스미스(John Smith)"나 "마리아 실바(Maria Silva)"처럼 이름이 같은 사람이 아주 많다는 점입니다.

과학계에서 이것은 매우 골치 아픈 문제입니다. 만약 "마리아 실바"라는 연구자가 컴퓨터에 관한 논문을 썼는데, 또 다른 "마리아 실바"가 역사에 관한 논문을 썼다면, 도서관은 실수로 두 사람이 동일 인물이라고 생각할 수 있습니다. 이는 그들의 명성, 인용 횟수, 그리고 누가 누구와 협력하고 있는지에 대한 이해를 망가뜨립니다. 어떤 "마리아 실바"가 어떤 논문을 썼는지 구별해내는 이 작업이 바로 **저자 이름 모호성 해소(Author Name Disambiguation, AND)**입니다.

격차: "영어 전용" 파티

오랫동안 과학자들은 이 혼동을 해결하기 위한 도구들을 만들어 왔지만, 주로 영어 이름을 대상으로 연습해 왔습니다. 이는 마치 영어로 이름을 말하는 손님들을 정리하는 데는 뛰어나지만, 포르투갈어 이름을 가진 사람을 한 번도 만나본 적 없는 파티 플래너와 같습니다.

포르투갈어 이름은 까다롭습니다. 종종 여러 개의 성(예: "Silva" 또는 "Santos")을 가지며, "de", "da", "dos"와 같은 작은 연결 단어들이 붙습니다. 게다가 과학 기록에서 이러한 이름들은 종로되거나 일관되지 않게 표기되기도 합니다 (예: "A. Silva" vs "Ana Silva"). 이 때문에 기존의 도구들은 포르투갈어 출판물을 접할 때 어려움을 겪습니다.

해결책: SBC-AND "훈련 체육관"

이 논문의 저자들은 SBC-AND라고 불리는 새로운 도구를 만들었습니다. 이것을 컴퓨터 프로그램을 위한 특화된 **훈련 체육관(training gym)**이라고 생각하면 됩니다.

  • 내부에는 무엇이 있나요? 브라질 컴퓨터 과학 학술지에서 가져온 442개의 실제 과학 논문 모음입니다.
  • 어떻게 구성되어 있나요? 저자들은 이 논문들을 "모호한 블록(ambiguous blocks)"으로 분류했습니다. "Silva"라고 적힌 상자를 상상해 보세요. 그 안에는 모두 성이 "Silva"인 232명의 서로 다른 실제 인물이 쓴 논문들이 들어 있습니다.
  • 목표: 이 데이터셋은 "큐레이션(curated)"되었습니다. 즉, 사람이 이미 어떤 논문이 어떤 실제 인물에게 속하는지 정확하게 확인하고 라벨을 붙였다는 뜻입니다. 이는 컴퓨터가 스스로를 테스트할 수 있는 "정답지" 역할을 합니다.

실험: 컴퓨터의 두뇌 테스트

연구진은 단순히 데이터셋을 만든 것에 그치지 않고, 이를 테스트에 활용했습니다. 그들은 논문을 올바른 그룹으로 다시 분류하려고 시도하는 유연한 컴퓨터 시스템(ADAN)을 사용했습니다.

그들은 두 가지 서로 다른 "두뇌" 모델(언어를 이해하는 AI 모델)을 사용하여 시스템을 테스트했습니다:

  1. BAAI/bge-m3: 다국어 모델.
  2. IBM Granite: 또 다른 다국어 모델.

또한 그들은 시스템의 "깊이"(생각하는 층수)와 얼마나 오랫동안 연습했는지(학습 에포크)를 조절하며 테스트했습니다.

결과: 힘겨운 도전

컴퓨터가 논문을 분류하려고 시도했을 때 다음과 같은 일이 일었습니다:

  • "전체적인 그림" vs "세부 사항": 컴퓨터는 그룹 간을 분리하는 것(예를 들어 "Silva" 상자와 "Oliveira" 상자를 서로 멀리 떨어뜨려 놓는 것)에는 꽤 능숙했습니다. 하지만 "Silva" 상자 내부의 논문들을 올바르게 분류하는 데는 어려움을 겪었습니다.
  • 점수: 컴퓨터는 전체적인 구조에 대해서는 괜찮은 점수(정확도 약 90%)를 받았지만, 특정 논문 쌍을 올바른 저자와 매칭하는 문제에 있어서는 점수가 크게 떨어졌습니다(약 45%).
  • 이유는 무엇인가요? 논문에 따르면, 이는 데이터셋에 포함된 많은 실제 저자들이 목록에 단 한두 개의 논문만 가지고 있기 때문입니다. 이는 파티에서 누군가를 딱 한 번만 보고 그 사람을 식별해야 하는 것과 같습니다. 비슷해 보이는 다른 사람과 구별하기가 매우 어렵습니다.
  • 승자: IBM Granite 모델이 다른 모델보다 약간 더 나은 성능을 보였으며, 특히 특정 "생각의 깊이"(2개 층)를 사용할 때 그러했습니다. 시스템을 더 "깊게"(3개 층) 만드는 것은 도움이 되지 않았으며, 오히려 노이즈를 발생시켰습니다.

핵심 요약

이 논문은 SBC-AND가 현재 기술에 매우 혹독한 시험대라는 결론을 내립니다. 이는 컴퓨터가 과학적 데이터를 정리하는 데 점점 더 능숙해지고 있음에도 불구하고, 이름이 복잡하거나 저자가 자신을 식별할 수 있는 출판물을 많이 보유하지 못한 포르투갈어와 같은 언어에서는 여전히 어려움을 겪고 있다는 점을 강조합니다.

저자들은 다른 연구자들이 더 나은 도구를 구축할 수 있도록 이 데이터셋을 온라인에 공개했습니다. 이를 통해 미래에는 모든 "마리아 실바"가 자신의 업적에 대해 정당한 인정을 받을 수 있도록 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →