What does Retraction Watch's "computer-generated content" reason capture? A metadata analysis of 9,161 retractions
9,161건의 철회 논문에 대한 이 메타데이터 분석은 리트랙션 워치(Retraction Watch)의 "컴퓨터 생성 콘텐츠" 사유가 특정 출판사 한 곳에 과도하게 집중되어 있으며 논문 공장(paper mills)과 강력하게 연관되어 있음을 밝혀내고 있으나, 이러한 패턴은 실제 철회된 논문들에 생성형 AI가 존재했다는 결정적인 증거를 제공하기보다는 공동 코딩(co-coding) 관행을 반영하는 것이다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인류 지식의 방대한 도서관에서, 모든 출판된 연구는 진리의 구성 요소가 되어야 합니다. 하지만 때때로 그 블록들이 뽑혀 나가기도 합니다. 학술지가 특정 논문이 결함이 있거나, 부정직하거나, 혹은 단순히 틀렸다고 판단할 때, 그들은 철회(retraction)를 공표하며 사실상 그 논문을 과학의 선반에서 끌어내립니다. 수십 년 동안 연구자들은 시스템이 어떻게 실패하는지 이해하기 위해 이러한 철회 사례들을 추적해 왔습니다. 최근, 철회 통지문에 새로운 이유가 등장했습니다: 바로 "컴퓨터 생성 콘텐츠(computer-generated content)"입니다. 이 라벨은 조사를 통해 논문의 전체 또는 일부가 인간이 아닌 기계에 의해 작성되었다는 사실이 밝혀졌을 때 적용됩니다. 인공지능 도구들이 더욱 강력해지고 접근하기 쉬워짐에 따라, 이 이유는 급격히 증가했으며, 이는 많은 이들로 하여금 이것이 생성형 AI에 의한 새로운 형태의 부정행위 물결을 알리는 신호라고 믿게 만들었습니다. 문제는 이 라벨이 정말로 AI로 작성된 논문의 급증을 가리키고 있는지, 아니면 완전히 다른 무언가를 포착하고 있는 것인지 하는 점입니다.
요나스 만달룬스(Jonas Mandalunes)라는 연구자는 이 라벨이 정확히 무엇을 포착하는지 조사하기 위해 나섰습니다. 66,000개 이상의 철회 기록이 담긴 방대한 데이터베이스를 활용한 이 연구는 "컴퓨터 보조 또는 컴퓨터 생성 콘텐츠"라는 이유가 붙은 9,161개의 논문에 집중했습니다. 목표는 이 논문들이 철회되기 전까지 출판 상태로 유지된 기간, 보유했던 다른 문제점들, 그리고 철회 후 얼마나 자주 인용되었는지의 측면에서 다른 철회 논문들과 다르게 행동하는지 확인하는 것이었습니다. 연구 결과는 이 라벨 뒤에 숨겨진 이야기가 단순한 AI 오용의 급증보다 훨씬 더 복렴하고 구체적이라는 사실을 보여줍니다.
데이터가 보여준 첫 번째 사실은 엄청난 수치의 급증이었으나, 이것이 전 세계 과학계 전체에 걸쳐 꾸준히 상승한 것은 아니었다는 점입니다. 2020년 이전에는 이 사유가 거의 존재하지 않았으며, 단 28개의 논문에만 나타났습니다. 그러나 2023년에는 기록된 모든 철회 중 거의 42%를 차지했습니다. 이 갑작스러운 폭발은 마치 AI가 생성한 부정행위의 해일처럼 보였습니다. 하지만 연구자가 자세히 들여다보았을 때, 그 파도는 모든 곳에서 오는 것이 아니었습니다. 그것은 거의 전적으로 '힌다위(Hindawi)'라는 특정 출판사에 집중되어 있었습니다. 실제로 이 라벨이 붙은 모든 논문의 70%가 이 한 곳의 출간물에서 나왔습니다. 이 출판사는 최근 자사의 특집호(special-issue) 프로그램에 대한 대대적인 내부 조사를 진행했으며, 그 과정에서 피어 리뷰(동료 검토) 프로세스의 광범위한 조작을 발견했습니다. 이 연구는 이 라벨이 일반적인 과학 분야 전반의 AI 글쓰기 유행이라기보다는, 이 특정하고 대규모적인 정리 작업의 여파를 주로 포착하고 있음을 시사합니다.
또 다른 흔한 가정은 이러한 컴퓨터 생성 논문들이 다른 부정직한 작업들보다 훨씬 빠르게 적발되고 있다는 것이었습니다. 기계는 텍스트를 빠르게 생성할 수 있으므로, 그 실수 또한 빠르게 발견될 것이라고 생각하는 것이 논리적이었습니다. 가공되지 않은 수치들은 이를 뒷받uyên 듯 보였으며, "컴퓨터 생성" 논문들이 다른 철회 논문들의 불규칙하고 다양한 타임라인에 비해 철회 전까지의 기간이 훨씬 짧은 범위를 보였다는 점을 보여주었습니다. 그러나 이 긴밀한 타이밍은 데이터의 집중도가 만들어낸 환상이었습니다. 연구자가 이 논문들을 동일한 출판사의 동일한 연도에 나온 다른 논문들과 비교했을 때, 그 차이는 사라졌습니다. "컴퓨터 생성" 논문들이 더 빨리 적발된 것이 아니라, 특정 출판사의 조사 과정에서 한꺼번에 검토되고 철회된 논문 묶음의 일부였을 뿐이었습니다. 지배적인 출판사를 비교 대상에서 제거하자, 이 논문들이 독특하게 빠른 타임라인을 가진다는 생각은 완전히 사라졌습니다.
연구는 또한 이 라벨과 "페이퍼 밀(paper mills, 가짜 저자성과 조작된 원고를 판매하는 조직)" 사이의 연관성을 조사했습니다. 처음에 데이터는 강한 연결 고리를 보여주었습니다. "컴퓨터 생성" 논문의 71%가 페이퍼 밀 플래그도 함께 달고 있었는데, 이는 다른 철회 논문의 9%와 대조적입니다. 이는 이 라벨이 이러한 범죄 운영을 나타내는 신뢰할 만한 표식임을 시사했습니다. 하지만 다시 한번, 데이터를 출판사와 연도별로 분류하자 그림이 바뀌었습니다. 2023년 이전에는 이 연결 고리가 존재하지 않았습니다. 2023년과 2024년에는 특정 출판사 내에서 관계가 매우 강력해졌습니다. 그러나 다른 대형 출판사들에서는 관계가 역전되어, "컴퓨터 생성" 논문들이 다른 철회 논문들보다 오히려 페이퍼 밀과 연결될 가능성이 더 낮았습니다. 이러한 극단적인 변동성은 이 라벨과 페이퍼 밀을 연결하는 단 하나의 보편적인 규칙은 존재하지 않으며, 그 연관성은 전적으로 누가 언제 조사하느냐에 달려 있다는 것을 의미합니다.
마지막으로, 연구자는 이 논문들이 철회된 후 인용이 적게 되는지, 즉 과학계가 경고에 주의를 기울이고 있는지를 살펴보았습니다. 언뜻 보기에 "컴퓨터 생성" 논문들은 유사한 철회 논문들보다 현저히 적게 인용되는 것처럼 보였습니다. 그러나 이 차이는 대조군에 속한 논문들이 철회되기 전부터 이미 더 많이 인용되었기 때문에 발생한 것이었습니다. 연구자가 기존에 받은 인용 횟수를 기준으로 논문들을 완벽하게 매칭했을 때, 철회 후 인용 횟수의 차이는 거의 사라졌습니다. 남은 미세한 격차는 통계적으로 유의미하지 않았으며, 이는 과학계가 기존의 명성을 고려했을 때 이 논문들을 다른 철회된 작업들과 다르게 취급하지 않는다는 것을 시사합니다.
아마도 가장 결정적인 발견은 철회 노트에서 특정 단어를 검색한 결과에서 나왔습니다. 연구자는 논문의 메타데이터에서 "ChatGPT"나 "거대 언어 모델(LLM)"과 같은 특정 AI 도구에 대한 언급이 있는지 찾아보았습니다. 수천 개의 기록 중에서 그러한 구체적인 용어를 포함한 것은 단 21개뿐이었습니다. 더욱 놀라운 점은, "컴퓨터 생성 콘텐츠" 라벨이 붙어 있으면서 특정 AI 도구를 언급한 논문들이 실제로는 그 도구 자체에 관한 연구가 아니라, AI에 대한 연구였다는 것입니다. AI 생성 이미지를 언급한 단 하나의 논문조차도 "컴퓨터 생성 콘텐츠" 라벨을 달고 있지 않았습니다. 이는 이 라벨이 "이것은 기계에 의해 작성되었습니다"라고 명시적으로 말하기 때문에 적용되는 것이 아님을 나타냅니다. 대신, 이 라벨은 종종 피어 리뷰의 결함 발견과 함께, 논문의 무결성에 대한 더 넓은 조사에 근거하여 적용되고 있습니다.
연구는 결론적으로, 철회 데이터베이스의 "컴퓨터 생성 콘텐츠" 라벨이 생성형 AI 오용을 나타내는 신뢰할 만한 대리 지표가 아니라고 밝힙니다. 그것은 특정 출판사의 특집호 프로그램을 대상으로 한 대규모 조사 기록이며, 이 과정에서 해당 라벨은 페이퍼 밀과 피어 리뷰 실패를 포함한 광범위한 문제들에 적용되었습니다. 데이터는 이 라벨이 독특한 유형의 논문을 가리키거나, 더 빨리 적발되거나, 과학계에서 다르게 취급된다는 것을 보여주지 않습니다. 연구자들이 실제 철회 통지문을 읽고 논문의 내용을 검증할 수 있기 전까지는, 이 라벨을 AI 생성 부정행위의 척도로 사용하는 것은 왜곡된 시각을 낳을 것입니다. 진짜 이야기는 AI가 작성한 과학의 갑작스러운 침공이 아니라, 광범위한 라벨을 사용하여 자신의 조사 결과를 설명했던 특정 출판 워크플로우에 대한 집중적인 정리 작업입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.