← 최신 논문
📄 scientific communication and education

Who Funds Open Data Sharing? Analysis of data availability statements in biomedical publications

이 연구는 78만 편 이상의 생물 의학 논문을 분석하여 연구 지원 기관과 학술지 간의 오픈 데이터 공유 준수율에서 나타나는 상당한 격차를 밝혀냈으며, 전체 준수율은 8.7%이나 주요 지원 기관의 경우 24%, 상위 학술지의 경우 최대 92.9%까지 상승하는 것으로 나타났고, 동시에 PDF 기반 탐지 방식이 XML 전용 방식보다 공유 성명서를 52% 더 많이 식별한다는 점을 강조했다.

원저자: Lawrimore, J., Li, C., Moraczewski, D., Poline, J.-B., Thomas, A.

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lawrimore, J., Li, C., Moraczewski, D., Poline, J.-B., Thomas, A.

원본 논문은 CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

과학의 세계를 우리 몸이 어떻게 작동하는지, 질병이 어떻게 퍼지는지, 그리고 그것들을 어떻게 치료할 수 있는지에 대해 끊임없이 새로운 책을 써 내려가는 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 이 책들은 "비밀 재료"를 숨기는 방식으로 작성되었습니다. 만약 어떤 과학자가 "우리는 특별한 혼합물을 사용하여 치료법을 발견했습니다"라고 썼다면, 그들은 종종 그 혼합물이 무엇인지, 어떻게 만드는지에 대해 말해주지 않았습니다. 이는 다른 과학자들이 그들의 연구를 검증하거나 이를 바탕으로 새로운 것을 만들어가는 것을 어렵게 만들었습니다. 이를 해결하기 위해 "오픈 사이언스(Open Science)"라고 불리는 운동이 시작되었으며, FAIR 원칙이라는 일련의 규칙을 옹호하기 시작했습니다. FAIR를 모든 데이터가 찾을 수 있고(Findable), 접근 가능하며(Accessible), 상호 운용 가능하고(Interoperable, 다른 데이터와 섞기 쉬운), 재사용 가능해야(Reusable) 한다는 약속이라고 생각하면 됩니다. 아이디어는 간단합니다. 만약 당신이 당신의 생재료를 공유한다면, 모두가 그 요리를 맛보고, 레시피를 확인하고, 어쩌면 더 나은 것을 발명할 수도 있다는 것입니다. 하지만 여기서 중요한 질문이 생깁니다. 과학자들은 실제로 그 약속을 지키고 있을까요? 그들은 정말로 데이터를 공유하고 있을까요, 아니면 단지 공유하겠다고 말만 하고 있는 것일까요?

이 논문은 정확히 얼마나 많은 과학자가 실제로 데이터를 공유하고 있는지 알아내기 위해 파견된 거대하고 첨단 기술을 갖춘 탐정 사무소와 같습니다. 저자들인 데이터 탐정 팀은 단순히 연구자들에게 손을 들어보라고 요청하는 데 그치지 않고, 2024년 1월부터 2025년 6월 사이에 발표된 거의 100만 편의 과학 논문을 스캔했습니다. 그들은 진실을 잡기 위해 영리한 2단계 전략을 사용했습니다. 첫째, 그들은 서가에 놓인 최종적으로 다듬어진 완성본 책과 같은 디지털 "PDF" 버전을 살펴보았습니다. 둘째, 그들은 컴퓨터가 사용하는 가공되지 않은 초안 형태인 "XML" 버전을 살펴보았습니다. 그들은 raw한 초안들이 최종 완성본에 담긴 중요한 데이터 공유 관련 메모들을 놓치는 경우가 많다는 것을 발견했습니다. 스마트한 컴퓨터 프로그램을 사용하여 PDF를 읽음으로써, 그들은 다른 방식이 놓쳤던 데이터 공유 약속들을 찾아낼 수 있었습니다.

그래서 그들은 무엇을 발견했을까요? 소식은 다소 복합적입니다. 전반적으로, 그들이 살펴본 논문 중 "네, 우리의 데이터는 공개되어 있으며 여러분이 사용할 준비가 되어 있습니다"라는 명확한 문구를 포함하고 있는 논문은 약 8.7%에 불과했습니다. 이는 꽤 낮은 수치로, 대부분의 과학자에게 데이터 공개 약속은 여전히 단지 약속에 불과하다는 것을 시사합니다. 하지만 연구 자금을 대는 곳이 어디인지, 그리고 어디에 발표되는지에 따라 이야기는 훨씬 더 흥미로워집니다. 저자들은 프로젝트 뒤에 있는 "보스"가 누구냐에 따라 공유율이 크게 변한다는 것을 발견했습니다.

프랑스 연구 기관이나 스위스 국립 과학 재단과 같은 거액의 자금을 지원하는 후원자들의 경우, 공유율이 약 22~24%까지 치솟았습니다. 훨씬 더 나은 사례는 특정 학술지(논문이 발표되는 곳)들입니다. 유전학 및 뇌 과학에 집중하는 학술지인 Nature Genetics 같은 곳은 논문의 최대 92.9%가 데이터를 공유하고 있음을 보여주었습니다. 이는 어떤 선생님은 숙제에 엄격하여 반 전체가 A를 받는 반면, 다른 선생님은 좀 더 느슨하여 반 평균이 훨씬 낮은 학교와 같습니다. 이 논문은 규칙이 명확하고 강제될 때 과학자들이 데이터를 공유한다는 점을 시사합니다. 하지만 또한 우리는 규칙이 공유를 '유발했다'고 확신할 수는 없다는 점도 지적합니다. 아마도 공유를 좋아하는 과학자들이 애초에 그 특정 후원자나 학술지를 선택해서 작업했을 수도 있기 때문입니다.

연구자들은 논문의 "초안(XML)" 버전을 보는 것이 마치 페이지가 절반쯤 빠진 책을 읽는 것과 같다는 사실도 발견했습니다. 그들의 PDF 기반 방식은 XML 방식 단독 사용 시보다 약 52% 더 많은 데이터 공유 성명을 찾아냈습니다. 이는 오랫동안 우리가 텍스트의 잘못된 버전을 보고 있었기 때문에, 실제로 공유되고 있는 데이터의 양을 과소평가해 왔을 수도 있음을 의미합니다.

결론적으로, 이 논문은 오픈 사이언스의 완전한 승리를 선언하지도, 그렇다고 우리가 완전히 실패했다고 말하지도 않습니다. 대신, 이 논문은 명확하고 정직한 지형도를 제공합니다. 전반적인 공유율은 여전히 완벽과는 거리가 멀지만, 놀라울 정도로 잘 작동하는 밝은 지점들이 있다는 것을 보여줍니다. 저자들은 어떤 후원자와 학술지가 가장 잘하고 있는지 누구나 확인할 수 있는 라이브 스코어보드와 같은 공개 대시보드를 구축했습니다. 그들의 연구는 만약 우리가 더 많은 공유를 보고 싶다면, 성과가 높은 그룹들이 무엇을 제대로 하고 있는지 살펴보고 그들의 플레이북을 따라 해 볼 필요가 있다는 점을 시사합니다. 완전히 열린 과학 도서관을 향한 여정은 여전히 진행 중이지만, 이제 우리는 어디의 문이 열려 있고 어디의 문이 여전히 잠겨 있는지 훨씬 더 잘 알게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →