Computer-generated content and the AI/ML retraction record, 2018– 2026: a characterization study
2018년부터 2026년까지의 13,502건의 AI/ML 관련 철회 기록에 대한 이 특성 연구는 컴퓨터 생성 콘텐츠가 철회의 가장 큰 단일 추정 원인임을 밝히고 있으며, 이는 사례의 34.8%를 차지하고 주로 2021년에서 2023년 사이에 발표된 논문들에 영향을 미쳤다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
과학 출판의 세계를 거대하고 북적이는 도서관이라고 상상해 보세요. 수년 동안 사서들(편집자와 동료 검토자들)은 책이 서가에 올라가기 전에 그 이야기가 사실인지, 그리고 저자가 직접 작업한 것인지 확인하기 위해 책들을 점검해 왔습니다.
이 논문은 2018년부터 2026년 사이의 그 도서관에 있는 '반송된 물품(Return to Sender)' 더미에 대한 성적표와 같습니다. 구체적으로, 이 논문은 인공지능(AI) 및 머신러닝 전용 구역을 살펴봅니다.
저자 안톤 소콜로프(Anton Sokolov)가 발견한 내용을 알기 쉽게 설명하면 다음과 같습니다.
1. 새로운 문제: "유령 작가"
2022년 이전에는 이 구역의 책이 반송된다면, 대개 저자가 다른 사람의 이야기를 베꼈거나(표절), 데이터를 조작했거나, 혹은 '페이퍼 밀(가짜 논문을 써내는 공장)'에 돈을 주고 작업을 맡겼기 때문이었습니다.
하지만 2022년부터 새로운 일이 벌어졌습니다. 거대 언어 모델(우리가 대화할 수 있는 AI 같은 것들)이 유창하고 과학적인 문체를 쓰는 데 매우 능숙해졌습니다. 갑자기 도서관에는 이러한 "유령 작가"들이 쓴 책들이 쏟아져 들어오기 시작했습니다.
이 연구는 AI 섹션에서 회수(철회)된 13,502건의 논문을 조사했습니다. 그들은 물었습니다: 왜 이 책들이 반송되었는가?
2. 주요 발견
가장 놀라운 발견은 이 AI 논문들을 철회한 1위 이유가 바로 **컴퓨터 생성 콘텐츠(Computer-Generated Content)**였다는 점입니다.
- 수치: 철회된 AI 논문 100건 중 약 35건이 구체적으로 AI(챗봇 등)에 의해 생성된 텍스트라는 이유로 철회되었습니다.
- 비교: 이는 "동료 검토 과정의 훼손(Compromised Peer Review)" (22%), "표절" (18%), 또는 "편집상의 실수" (13%)보다 높은 수치입니다.
이것을 빵집에 비유해 보겠습니다. 오랫동안 빵이 폐기되는 주요 원인은 빵이 타거나 딱딱해졌기 때문이었습니다. 하지만 갑자기 빵집에서는 반죽 자체가 굽는 법을 모르는 로봇이 만든 것이라는 사실이 발견되기 시작했습니다. 이것이 빵을 버리게 되는 가장 흔한 이유가 되었습니다.
3. "정밀도" 필터 (안전망)
저자는 단순히 대략적으로 계산하지 않기 위해 정밀도를 구분하는 "안전망"을 만들었습니다.
- 높은 정밀도: 제목에 명확하게 "AI" 또는 "머신러닝"이 포함된 논문 (3,243건).
- 넓은 그물: 일반적인 "컴퓨터 과학"에 관한 논문 (13,502건).
확실히 AI에 관한 것들인 "높은 정밀도" 그룹만 보더라도, **41.8%**가 AI 생성 텍스트 때문에 철회되었습니다. 따라서 이 문제는 단순히 라벨링이 느슨해서 생긴 일시적인 현상이 아니라, 이 특정 분야에서 나타나는 실제적이고 지배적인 문제입니다.
4. 타임라인: 갑작스러운 파도
이 논문은 기상 보고서처럼 연도별 추이를 추적합니다.
- 2018–2021년: AI 생성 논문이 적발된 경우가 매우 적었습니다.
- 2022년: 파도가 시작되었습니다.
- 2023년: 파도가 정점에 달했습니다. 이는 한 주요 출판사(Hindawi/Wiley)가 수천 편의 논문을 한꺼번에 철회하며 대대적인 정리를 진행했기 때문에 발생한 "쓰나미"의 해였습니다.
- 2024–2025년: 수치는 정점에서는 내려왔지만, 2022년 이전보다 10배나 높은 수준을 유지하고 있습니다.
이러한 부적절한 논문 대부분은 2021년과 2023년 사이에 작성되어 발표되었습니다. 이들은 보통 출판된 지 1년 이내에 빠르게 적발되었습니다.
5. 누가 관련되었는가?
연구는 가장 많은 철회 논문을 보유한 출판사와 저널을 나열합니다.
- Hindawi(출판사)가 가장 많았으며, 이 목록에 있는 모든 철회 논문의 3분의 1 이상을 차지했습니다.
- 그러나 저자는 이것이 반드시 "수치스러운 명단"은 아니라고 경고합니다. 때때로 어떤 출판사가 철회 건수가 많은 이유는, 그들이 나쁜 논문을 많이 팔아서가 아니라 오히려 서가를 적극적으로 청소하고 잘못된 논문을 잡아내고 있기 때문일 수도 있습니다. 이는 마치 "반품" 창구가 많은 가게와 같습니다. 반품이 많다는 것은 그 가게가 나쁜 제품을 팔아서가 아니라, 품질 관리에 매우 엄격하다는 것을 의미할 수도 있습니다 있습니다.
6. 이 연구가 말해주지 않는 것
저자는 이 보고서가 무엇을 말하지 않는지에 대해서도 매우 명확히 밝히고 있습니다.
- 이 연구는 아직 서가에 남아 있지만 아직 적발되지 않은 AI 작성 논문이 얼마나 되는지는 알려주지 않습니다.
- AI 연구자들이 "나쁜" 사람들임을 증명하는 것도 아닙니다.
- AI 연구가 다른 분야(생물학이나 물리학 등)보다 더 자주 실패한다고 말하는 것도 아닙니다. 우리는 아직 이를 비교할 데이터가 없습니다.
결론
이 논문은 "특성 연구(characterization study)"입니다. AI 논문에 대한 "반송된 물품" 함을 스냅샷으로 찍은 것과 같습니다.
핵심 요점은 간단합니다: AI 생성 텍스트의 시대가 과학계에 도래했으며, 그 첫 번째 주요 징후는 텍스트 자체가 기계에 의해 작성되었다는 이유로 발생하는 대규모 철회 급증입니다.
연구는 과학계가 이 문제를 해결하기 위해서는 "이것은 AI에 의해 작성됨"이라고 명시하는, 기계가 읽을 수 있는 명확한 라벨이 철회 기록에 필요하다고 결론짓습니다. 이러한 명확한 라벨 없이는 문제를 측정하거나 제대로 해결할 수 없습니다. 미래의 해결책을 위한 "기질(substrate, 토대)"은 단순히 무엇이 잘못되었는지에 대한 정직하고 명확한 기록을 갖는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.