← 최신 논문
💻 computer science

A Pathway for Assessing Grey Literature: Leveraging AI to Extract Conference Metadata and Organiser Information from Calls for Papers

본 논문은 거대언어모델을 활용하여 비정형적인 논문 모집 공고(Calls for Papers)로부터 세밀한 메타데이터를 자동 추출 및 구조화함으로써, 이전에 간과되었던 회색 문헌에 대한 체계적인 메타과학적 분석을 가능하게 하는 AI 기반 프레임워크인 COCI를 소개한다.

원저자: Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Angelo Salatino, Francesco Osborne, Alexis Vizcaino, Aliaksandr Birukou, Enrico Motta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학은 흔히 도서관 선반 위에 깔끔하게 쌓인 완결된 책들의 집합체로 상상되곤 하며, 연구자들은 이미 출판된 내용을 읽음으로써 과거를 연구합니다. 하지만 중요한 지식의 상당 부분은 이러한 공식적인 경로 외부에 존재합니다. 이를 '회색 문헌(grey literature)'이라고 부르는데, 이는 표준 학술지에 실리지 못한 보고서, 워킹 페이퍼, 문서 등을 일컫는 용어입니다. 이 중 가장 중요한 것 중 하나는 연구자들에게 다가올 컨퍼런스에 자신의 작업물을 제출하도록 권유하는 공고인 '논문 모집 공고(calls for papers)'입니다. 이 문서들은 과학의 조기 경보 시스템으로서, 새로운 트렌드와 신흥 분야가 최종 논문으로 작성되기 전부터 이를 드러내 보여줍니다. 그러나 이러한 공고들은 웹상에 무질서하고 비표준화된 형식으로 흩어져 있기 때문에 대규모로 연구하기가 거의 불가능했습니다. 전통적인 컴퓨터 도구들은 이를 읽는 데 어려움을 겪으며, 이로 인해 과학 공동체가 실제로 어떻게 형성되고 진화하는지에 대한 이해에 큰 공백을 남겼습니다.

이 간극을 메우기 위해 연구진은 고급 인공지능을 사용하여 이 혼란스러운 공고들을 읽고 정리하는 COCI라는 새로운 시스템을 개발했습니다. 이 시스템은 디지털 기록 보관소 역할을 하며, 컨퍼런스 초대장의 가공되지 않은 비구조적 텍스트를 깔끔하고 체계적인 사실 목록으로 변환합니다. 이 시스템은 행사의 명칭, 연도 및 장소를 식별할 뿐만 아니라, 가장 중요하게는 그 행사를 운영하는 사람들을 찾아냅니다. 단순히 이름만을 나열하는 것이 아니라, 이들이 누구인지, 어떤 기관에 속해 있는지, 그리고 워크숍을 조직하거나 홍보를 관리하는 것과 같은 구체적인 역할은 무엇인지 파악합니다. 이를 통해 시스템은 엉클어진 텍스트 뭉치를 과학자들이 연구 지형을 분석하는 데 실제로 사용할 수 있는 구조화된 데이터베이스로 변환합니다.

연구진은 컴퓨터 과학과 공학부터 치의학 및 고고학에 이르기까지 다양한 분야의 40개 서로 다른 컨퍼런스 공고를 시스템에 입력하여 성능을 테스트했습니다. 목표는 한 컨퍼런스는 조직 위원들을 단순한 단락에 나열하고, 다른 컨퍼런스는 복잡한 표 속에 정보를 숨겨두는 인터넷의 무질서한 현실을 시스템이 처리할 수 있는지 확인하는 것이었습니다. 시스템은 이 40개의 문서 모두에서 핵심 세부 정보를 성공적으로 추출했습니다. 컨퍼런스 시리즈, 특정 회차, 그리고 지리적 위치를 식별했습니다. 또한 조직 위원회의 모든 인물의 이름을 추출하고, 이들의 신원을 확인하기 위해 공개된 과학 기록과 연결했습니다. 이 과정은 시스템이 동명이인을 구분하고, 해당 인물이 현재 어느 대학이나 기관을 대표하는지 확인할 수 있게 해줍니다.

이 시스템의 가장 중요한 성과 중 하나는 컨퍼런스가 다루는 주제를 파악하는 능력입니다. 컨퍼런스 공고가 관심 분야를 나열할 때, 종종 비격식적인 언어나 독특한 구절을 사용하곤 합니다. 시스템은 이를 표준 과학 개념으로 번속하여, 공고의 일상적인 언어와 전 세계 연구자들이 사용하는 공식적인 어휘 사이의 가교를 만듭니다. 또한 컨퍼런스 명칭을 기존의 글로벌 데이터베이스와 매칭하여, 이름이 약간 다르거나 수년에 걸쳐 다양한 명칭으로 개최되었더라도 해당 행사가 정확하게 식별되도록 합니다. 이는 행사의 흐름을 광범ly한 과학계의 맥락 속에 신뢰할 수 있는 지도로 만들어 줍니다.

하지만 연구진은 시스템이 완벽하지 않으며 실수를 바로잡기 위해 인간의 감독이 필요하다는 점을 주의 깊게 언급했습니다. 한 테스트 사례에서, 시스템은 원문 텍난에 개별 소속이 명시되지 않았다는 이유로 조직 위원회 구성원 모두가 동일한 대학 소속이라고 잘못 가정했습니다. 연구진은 전체 위원회가 단 하나의 기관에서 나올 가능성이 매우 낮다는 점을 인식하고, 이러한 오류를 잡아내기 위한 안전 장치를 시스템에 구축했습니다. 또 다른 사례에서는 데이터베이스 자체에 상충하는 정보가 포함되어 있어, 시스템이 연구자를 엉뚱한 인물과 매칭하기도 했습니다. 이러한 사례들은 이 도구가 강력하긴 하지만, 여전히 접근하는 데이터의 품질과 따르는 규칙의 논리에 의존하고 있음을 보여줍니다.

이 연구의 궁극적인 목표는 과학적 분석의 초점을 이러한 비전통적인 이벤트로 전환하는 것입니다. 논문 모집 공고를 체계적으로 연구할 수 있게 함으로써, 이 시스템은 연구 공동체가 밑바닥에서부터 어떻게 구축되는지 이해하는 문을 열어줍니다. 이는 공식 학술지에 등장하기 전의 신흥 트렌드를 추적할 수 있게 하며, 전통적인 지표에서는 종종 주목받지 못하는 많은 조직가와 기여자들의 공헌을 인정할 수 있는 방법을 제공합니다. 연구진은 이 도구를 오픈 소스 프로젝트로 공개하여 다른 사람들이 이를 사용하고 개선할 수 있도록 했습니다. 이러한 접근 방식은 과학적 활동의 전체적이고 다양한 모습, 즉 다듬어진 최종 결과물뿐만 아니라 발견의 역동적이고 진화하는 과정 자체를 볼 수 있는 미래를 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →