← 최신 논문
💬 NLP

Measuring research data reuse in scholarly publications using generative artificial intelligence: Open Science Indicator development and preliminary results

PLOS 와 DataSeer 는 학술 출판물에서 연구 데이터 재사용률이 43% 임을 밝혀내는 새로운 LLM 기반 지표를 개발하여 생성형 AI 가 대규모로 오픈 과학의 영향을 측정할 수 있음을 입증하고 데이터 공유의 긍정적 효과가 현재 과소평가되고 있음을 시사했습니다.

원저자: Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학 연구의 세계를 거대하고 분주한 주방으로 상상해 보십시오. 수년 동안 우리는 다른 주방장 (과학자) 들이 조리대 위에 남겨 둔 재료 (데이터) 를 얼마나 자주 실제로 사용하는지, 아니면 자신들의 정원에서 완전히 새로운 야채를 다듬는지에 대해 파악하려 노력해 왔습니다.

이 논문은 PLOS(과학 출판사) 와 DataSeer(기술 회사) 가 이 주방의 한 장면을 포착하고 얼마나 많은 재료 공유가 일어나는지 정확히 세어 보기 위해 구축한 새로운 첨단 '스마트 카메라'에 관한 것입니다.

간단한 용어로 이 프로젝트의 개요를 살펴보면 다음과 같습니다:

문제: '침묵하는' 재사용

과거에는 과학자들이 데이터를 재사용하는 빈도를 두 가지 주요 방법으로 측정하려 했습니다:

  1. 직접 질문하기: 설문조사 결과, 과학자들의 약 50% 가 "네, 저는 다른 사람의 데이터를 사용합니다"라고 답했습니다.
  2. 공식 인용 찾기: 논문 내에서 공식적인 '감사' 메모 (인용) 를 찾았습니다. 하지만 이 방법은 이름표를 쓴 사람들만 보고 파티에 참석한 손님을 세어 보려는 것과 같았습니다. 이는 구석에서 그냥 대화만 하던 사람들을 모두 놓쳤습니다. 이 방법은 재사용이 매우 낮다고 (약 9~16%) 제시했습니다.

과학자들이 자신이 무엇을 했다고 말한 것과 '이름표' 방식이 보인 것 사이에는 큰 간극이 있었습니다.

해결책: AI '슈퍼 독자'

이를 해결하기 위해 팀은 초집중 독서 능력을 갖춘 슈퍼 독서가 역할을 하는 생성형 AI(스마트 컴퓨터 두뇌의 한 유형) 를 구축했습니다. 이 AI 는 공식 인용만 찾는 대신 과학 논문의 전체 텍스트를 읽어 이야기를 이해합니다.

이는 특정 지문만 찾는 것이 아니라, 도서관에서 책을 빌렸는지 아니면 새 책을 샀는지 파악하기 위해 일기 전체를 읽는 탐정처럼 생각하시면 됩니다.

AI 를 훈련시킨 방법:

  • 그들은 AI 에게 수천 편의 과학 논문을 보여주고 세 가지를 식별하도록 가르쳤습니다:
    1. 저자가 새로운 데이터를 만들었는가 (새로운 야채를 기르는 것처럼)?
    2. 저자가 기존 데이터를 재사용했는가 (다른 사람의 남은 재료를 사용하는 것처럼)?
    3. 그랬는가? (그 '이유').
  • 그들은 정확성을 보장하기 위해 AI 를 인간 전문가와 비교 테스트했습니다. AI 는 이 작업에 매우 능숙해져 약 85% 의 빈도로 재사용을 정확하게 식별했습니다.

발견: 주방은 우리가 생각했던 것보다 더 바쁘다

AI 는 2024 년 첫 3 개월 동안 출판된 4,475 편의 과학 논문을 분석했습니다. 그 결과는 다음과 같습니다:

  • 큰 숫자: 논문의 43% 가 데이터를 재사용했습니다.
  • 비교: 이는 기존 '공식 인용' 방법 (약 10% 만 감지) 보다 훨씬 높지만, 과학자들이 설문조사에서 말한 것 (약 50%) 과는 훨씬 더 잘 일치합니다.
  • 교훈: 기존 방법들은 과학자들이 실제로 얼마나 도움이 되고 협력적인지 과소평가했을 가능성이 높습니다. '재사용'은 일어나고 있지만, 종종 공식적인 '감사' 메모가 붙지 않은 채 논문 본문 내에서 일어나고 있습니다.

흥미로운 패턴

AI 는 지역과 주제에 따라 몇 가지 차이점도 발견했습니다:

  • 지역별: 아시아 - 태평양 지역의 과학자들이 데이터를 재사용할 가능성이 가장 높았으며 (46%), 아프리카 지역 과학자들이 가장 낮았습니다 (31%). 저자들은 이것이 전 세계적 데이터 공유 방식과 데이터 소유권에 대한 우려와 관련이 있을 수 있다고 제안합니다.
  • 주제별:
    • 이공계사회과학은 가장 균형 잡혀 있어, 새로운 데이터를 생성하는 것과 거의 동일한 빈도로 데이터를 재사용했습니다.
    • 생명과학(생물학 등) 은 완전히 새로운 데이터를 생성할 가능성이 가장 높았으며 (76%), 기존 데이터를 재사용할 가능성은 가장 낮았습니다 (37%).

왜 이것이 중요한가

저자들은 공식 인용만 본다면 개방형 과학이 어떻게 작동하는지에 대한 전체 그림을 놓치게 된다고 주장합니다. 이 AI '스마트 카메라'를 사용하면 데이터 공유가 우리가 생각했던 것보다 더 큰 영향을 미치고 있음을 알 수 있습니다.

한계에 대한 중요 참고사항:
저자들은 이것이 '진행 중인 작업'이라고 조심스럽게 밝힙니다. 그들은 다음과 같이 인정합니다:

  • 자신의 과거 데이터를 사용하는 것과 다른 사람의 데이터를 사용하는 것 사이의 차이를 구분하는 것은 까다로울 수 있습니다.
  • 그들은 한 출판사 (PLOS) 의 논문만 살펴보았으므로, 다른 저널에서는 결과가 다르게 보일 수 있습니다.
  • AI 는 아직 완벽하지는 않지만, 기존 계산 방식에 비해 큰 진전을 이룬 것입니다.

요약하자면, 이 논문은 과학자들이 우리가 깨닫지 못했던 것보다 훨씬 더 자주 서로의 작업을 공유하고 재사용하고 있음을 보여 주는 새로운 도구를 소개하며, 이는 '개방형 과학' 운동이 우리의 기존 측정 도구들이 보여 줄 수 있었던 것보다 더 잘 작동하고 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →