What Citations Get Wrong: A Full-Corpus Audit of Reference Existence and Claim Support in a Major NLP Conference
이 논문은 ACL 2026 프로시딩을 감사하여 거의 모든 인용 문헌이 존재함을 확인했으나, 단일 실행 자동화된 주장 지원 검증이 기록되지 않은 모델 설정으로 인해 재현에 실패했음을 밝힘으로써, 엄격한 인용 검증을 위해서는 재현성을 보장하기 위한 철저한 운영 로깅이 필요함을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 과학이라는 거대한 도서관에서 인용은 단순히 목록에 있는 이름 그 이상이며, 하나의 약속이다. 저자가 문장을 쓰고 다른 논문을 가리킬 때, 그들은 두 가지 뚜렷한 약속을 하는 것이다. 첫째, 그들이 가리키는 논문이 실제로 존재하며 찾아볼 수 있다는 약속이다. 둘째, 훨씬 더 검증하기 어려운 것으로, 그들이 가리키는 논문이 실제로 저자가 주장하는 바를 말하고 있다는 약속이다. 수십 년 동안 과학계는 특히 인공지능의 부상과 함께 첫 번째 약속에 대해 주로 우려해 왔다. 컴퓨터 프로그램이 존재하지 않는 가짜 논문을 만들어내고, 존재하지도 않는 제목과 저자로 참고 문헌 목록을 채워 학술 기록을 허구로 오염시키고 있다는 공포가 커지고 있다. 이러한 불안은 요란했지만, 이를 뒷받침할 증거는 빈약했다. 반면, 두 번째 약속인 주장 자체의 정확성은, 저자가 자신의 출처에 대해 진실을 말하고 있는지 판단하는 더 오래되고 근본적인 시험임에도 불구하고 훨씬 적은 관심을 받아왔다.
타오 안(Tao An)이라는 연구자는 이 두 가지 약속을 동시에 테스트하기로 결정했다. 소규모 샘플이 아니라, 주요 컴퓨터 과학 컨퍼런스의 1년 치 논문 전체를 대상으로 했다. 연구팀은 약 4,500편의 논지와 20만 개 이상의 참고 문헌을 포함하고 있는 2026년 계산 언어학 협회(ACL) 프로시딩의 모든 참고 문헌을 전수 조사하여, 이들이 실제 문서를 가리키는지 확인했다. 또한 이 중 일부 표본 추출된 부분에 대해서는, 해당 문서가 인용한 문장을 실제로 뒷받받하는지도 확인했다. 목표는 AI가 생성한 가짜 참고 문헌에 대한 공포가 현실에 근거한 것인지 확인하고, 저자가 자신의 출처를 얼마나 자주 왜곡하는지 측정하는 것이었다.
조사는 첫 번째 약속인 '존재'로부터 시작되었다. 연구진은 모든 참고 문헌이 실제 검색 가능한 저작물을 가리키는지 확인하는 시스템을 구축했다. 그 결과, 대다수인 약 91%의 참고 문헌이 실제 문헌으로 연결됨을 확인했다. 일치하지 않는 소수의 문헌은 가짜 논문이 아니라, 블로그 포스트, 소프트웨어 문서, 또는 컴퓨터가 텍스트를 잘못 읽은 파싱 오류 등이었다. 연구팀이 의심스러운 아주 적은 비율의 참고 문헌을 수동으로 검토했을 때, 논문이 완전히 존재하지 않는다고 확인된 사례는 약 21만 건 중 단 두 건뿐이었다. 이 결과는 이 주요 플랫폼에서 AI가 가짜 논문으로 문헌을 채우고 있다는 공포가 대체로 근거 없음을 시사한다. 참고 문헌은 거의 항상 실재한다.
하지만 연구진이 두 번째 약의 약속, 즉 인용된 논문이 실제로 주장을 뒷받침하는지를 확인하기 위해 넘어갔을 때 이야기는 완전히 달라졌다. 이는 인용된 논문을 읽고 그것을 인용한 문장과 비교해야 하는 훨씬 더 어려운 작업이다. 연구팀은 인용이 출처를 왜곡하는 것처럼 보이는 경우를 찾아내기 위해 컴퓨터 모델을 활용한 2단계 프로세스를 사용했다. 첫 번째 시도에서 시스템은 매우 적은 수의 오류를 찾아냈고, 이는 저자들이 대체로 정확하다는 것을 시사했다. 그러나 연구진이 동일한 코드와 동일한 논문을 사용하여 정확히 같은 과정을 다시 실행했을 때, 결과는 판이하게 달랐다. 두 번째와 세 번째 실행에서는 첫 번째 실행보다 약 6배나 더 많은 오류가 발견되었다.
이 불일치는 연구의 가장 중요한 발견이 되었다. 연구진은 그 원인을 숨겨진 변수에서 찾아냈다. 초기 판단을 내리는 데 사용된 특정 컴퓨터 모델이 기록되지 않았던 것이다. 첫 번째 실행에서 시스템은 기록되지 않은 채 더 약한 모델을 기본값으로 사용하여 많은 오류를 놓쳤다. 이후의 실행에서는 다른 더 강력한 모델이 사용되었고, 이 모델은 훨씬 더 많은 문제를 잡아냈다. 첫 번째 실행이 기록되지 않은 모델을 사용했기 때문에, 연구진은 그 첫 번째 결과가 실제로 무엇을 측정했는지 확신할 수 없었다. 교훈은 명확했다. 아무리 수동으로 꼼꼼히 확인하더라도, 과정을 동일한 도구로 반복할 수 없다면 단 한 번의 자동화된 감사는 신뢰할 수 없다는 것이다. 측정 자체가 불안정했던 것이다.
연구진이 재현 가능한 데이터를 살펴보았을 때, 오류는 실재했지만 사람들이 두려워했던 종류의 기계적 헛소리는 아니었다. 확인된 실수들은 미묘한 인간의 오류였다. 저자가 실제 논문을 가져와서 그 논문이 주장하는 바와 정반대의 내용을 말한다고 주장하거나, 논문은 좁은 범위의 결과만을 지지함에도 광범orphic한 결론을 인용하는 식이었다. 이것들은 인공지능이 만들어낸 환각이 아니라, 원고를 마무리하기 위해 서두르는 과정에서 지친 연구자가 저지를 수 있는 종류의 실수였다. 이러한 오류들은 논문의 존재 여부만을 확인하는 도구에는 보이지 않았다. 논문은 실재했지만, 주장과 출처 사이의 연결 고리가 끊어져 있었기 때문이다.
또한 이 연구는 동료 검토(peer review) 과정이 이러한 지원 오류를 잡아내지 못한다는 점을 밝혀냈다. 연구팀이 출판된 컨퍼런스 논문과 검토되지 않은 초안 세트를 비교했을 때, 인용 오류율은 통계적으로 동일했다. 이는 현재의 동료 검토 시스템이 모든 인용을 출처와 대조하도록 설계되어 있지 않음을 시사하며, 이는 자원봉사 검토자들에게 너무 많은 시간을 요구하는 작업이다. 따라서 인용이 실제로 주장을 뒷받침하는지를 보장하는 책임은 아마도 논문을 제출하기 전 저자 자신에게 있을 것이다.
궁극적으로, 이 감사는 어디에 문제가 있는지에 대한 명확한 그림을 제공했다. 과학적 기록이 가짜의 존재하지 않는 논문들로 넘쳐나고 있다는 공포는 데이터에 의해 뒷받침되지 않는다; 참고 문헌은 거의 항상 실제하다. 진짜 문제는 해당 참고 문헌에 붙은 주장의 정확성이다. 이러한 오류들은 미묘하고 인간적이며, 이를 찾아내는 도구가 아직 단일하고 신뢰할 수 있는 수치를 줄 만큼 안정적이지 않기 때문에 자동화하여 탐지하기 어렵다. 연구는 우리가 과학의 무결성을 감시하기 위해 기계에 의존하기 전에, 먼저 기계 자체가 일관성을 갖추고 기계 자체의 오류가 충분히 이해되어야 한다고 결론짓는다. 남아 있는 결함들은 인공지능의 무게 아래 시스템이 붕괴하고 있다는 징후가 아니라, 인간 학문의 지속적인 복잡성을 상기시키는 증거이다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.