← 최신 논문
🤖 machine learning

The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

이 논문은 거대 언어 모델들이 다양한 허구적 및 학술적 맥락에 걸쳐 일관되고 상관관계가 있는 "유령" 이름 쌍과 삼인조를 생성하며, 이것이 실제 DOI를 가진 사기적 학술 기록의 대량 생성으로 이어져 의도치 않게 모델 특유의 행동 지문과 배포 타임라인을 노출한다는 사실을 밝히고 있다.

원저자: Michał Brzozowski, Neo Christopher Chung

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michał Brzozowski, Neo Christopher Chung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 발전했지만 약간은 괴짜 같은 AI 작가 그룹에게 이야기를 위한 전문가 팀을 만들어 달라고 요청한다고 상상해 보십시오. 당신은 그들에게 구체적인 이름은 주지 않고, 그저 "과학자들을 몇 명 만들어 봐"라고 말합니다.

당신은 AI가 인간처럼 무작위로 이름을 고를 것이라 예상할 수도 있습니다. 하지만 이 논문은 이상한 사실을 밝혀냅니다. AI는 무작위로 선택하는 것이 아닙니다. AI는 마치 모든 영화의 줄거리와 상관없이 항상 똑같은 배우 세 명을 캐스팅하는 데 집착하는 감독처럼, 매번 똑같은 특정 캐릭터 군단을 반복해서 선택하고 있습니다.

이 "유령 커플(Ghost Couple)" 현상을 알기 쉽게 설명하면 다음과 같습니다:

1. "유령 캐스트 (The Ghost Cast)"

연구진은 서로 다른 AI 모델들이 각자 선호하는 "기본" 캐릭터들을 가지고 있다는 것을 발견했습니다. 이들은 단순히 무작위적인 이름이 아니라, 항상 함께 나타나는 상관관계가 있는 쌍이나 그룹입니다.

  • 클로드(Claude) 모델: 이 모델은 특정 듀오를 좋아합니다: **엘레나 바스케스(Elena Vasquez)**와 마커스 첸(Marcus Chen). 때로는 **아마라(Amara)**라는 세 번째 캐릭터가 합류하기도 합니다. 이야기가 화산에 관한 것이든, 우주 여행에 관한 것이든, 혹은 심리 치료에 관한 것이든 상관없이, 클로드에게 전문가를 만들어 달라고 요청하면 이 이름들이 계속해서 함께 등장합니다.
  • 제미나이(Gemini) 모델: 이 모델은 자신만의 선호하는 쌍을 가지고 있습니다: **아리스 손(Aris Thorne)**과 레나 페트로바(Lena Petrova).
  • GPT 모델: 이 모델은 솔로 스타인 **엘라라 보스(Elara Voss)**를 보유하고 있지만, 그녀에게는 고정된 파트너가 없으며 사이드킥(조수)은 매번 바뀝니다.

비유: 이 AI 모델들을 비디오 게임의 캐릭터 생성기라고 생각해 보십시오. 만약 특정 게임에서 "랜덤화(Randomize)" 버튼을 누른다면, 게임의 코드가 루프에 빠져 있기 때문에 항상 똑같은 세 명의 캐릭터만 얻게 될 수 있습니다. 이 AI 모델들도 이름을 다루는 방식에서 똑같은 행동을 하고 있는 것입니다.

2. "디지털 유령 출몰 (The Digital Haunting)"

무서운 점은 AI가 이 이름들을 사용하는 것뿐만이 아닙니다. 이 이름들이 AI를 벗어나 이제 실제 인터넷을 떠돌며 유령처럼 출몰하고 있다는 사실입니다.

웹상의 많은 콘텐츠가 AI에 의해 작성되기 때문에, 이 "유령 캐릭터들"은 다음과 같은 곳에서 나타나기 시작했습니다:

  • 가짜 대학교 교수진 페이지.
  • 아마존(Amazon)의 소설 책들.
  • 팟캐스트 설명란.
  • 심지어 가짜 뉴스 기사들까지.

비유: 어떤 도시에서 찍힌 모든 사진에 특정 유령이 계속 나타난다고 상상해 보십시오. 스페인 블로그에서는 화산 전문가인 "엘레나 바스케스"를 보고, 캐나다 클리닉에서는 상담사로, 그리고 테크 스타트업에서는 과학자로 그녀를 보게 됩니다. 이들은 존재하지 않는 사람들입니다. 이들은 동일한 AI "글리치(glitch, 오류)"에 의해 만들어진 디지털 유령들입니다.

3. "학술적 좀비 (The Academic Zombie)" 문제

논문은 이 유령 문제가 심각한 과학 및 학술 출판 세계로까지 옮겨갔음을 발견했습니다.

  • 설정: 연구진은 제네도(Zenodo)(합법적인 과학 저장소)에 업로드된 방대한 양의 가짜 학술 논문 뭉치를 발견했습니다.
  • 수법: 이 논문들은 존재하지 않는 학술지에 게재되었다고 주장했습니다.
  • 날짜: 이 논문들은 몇 년 전으로 날짜를 소급 적용(backdated)하여 게시되었지만, 디지털 타임스탬프를 통해 이들이 2026년 3월과 4월에 대량으로 업로드되었음이 증명되었습니다.
  • 저자: 저자들은 "유령 캐릭터들"(엘레나 바스케스와 마커스 첸 등)이 다른 가짜 이름들과 협업하는 형태였습니다.

비유: 가짜 졸업장을 인쇄하여 실제 도서관 카탈로그에 붙여넣는 공장을 상상해 보십시오. 도서관의 컴퓨터 시스템(DataCite)은 이 가짜 논문들에 유효한 ID 번호(DOI)를 부여하여, 컴퓨터들이 이를 실제 논문처럼 인식하게 만듭니다. 이제 과학 논문을 찾는 모든 검색 엔진은 이 가짜 기록들을 실제라고 생각하며 "수집(harvest)"하게 됩니다.

4. 연구진은 어떻게 이를 찾아냈나

저자들은 단순히 추측한 것이 아니라, 이를 포렌식 조사처럼 다루었습니다.

  • "디프(Diff)" 테스트: 그들은 서로 다른 버전의 AI 모델들을 비교했습니다. 이전 버전의 AI는 다른 유령 이름(엘레나 로드리게스)을 사용했던 반면, 최신 버전에서는 엘레나 바스케스로 바뀌었다는 것을 확인했습니다. 이 변화를 관찰함으로써, 그들은 AI가 정확히 언제 업데이트되었는지 알 수 있었습니다.
  • "억제(Suppression)"의 단서: AI 기업들은 결국 이러한 이상한 패턴을 인지하고 이를 "수정(억제)"하려고 시도했습니다. 연구진은 모델이 업데이트됨에 따라 유령 이름들이 AI의 출력물에서 사라지는 것을 관찰함으로써, 기업들이 이 문제를 알고 있었다는 것을 증명했습니다.

5. 논문에 따른 중요성 (Why It Matters)

논문은 인터넷이 의도치 않게 이러한 AI의 "행동 지문(behavioral fingerprints)"의 저장소가 되었다고 결론짓습니다.

  • 가짜 그룹: ResearchGate와 같은 사이트에서 이 유령들은 "합성 연구 그룹(synthetic research groups)"을 형성하고 있습니다. 당신은 실존할 법한 교수(예: 메이린 장)의 프로필을 볼 수 있지만, 그녀는 서로 다른 AI 모델에서 온 유령들(클로드의 엘레나, 제미나이의 아리스 등)과 35편의 논문을 공동 저술한 것으로 나타납니다.
  • 타임라인: 가짜 논문들이 언제 업로드되었는지 확인함으로써, 연구진은 실제로 AI 모델들이 언제 출시되었는지 추측할 수 있습니다. 가짜 논문들은 AI의 발전을 보여주는 달력 역할을 합니다.

요약

이 논문은 거대 언어 모델(LLM)이 똑같은 가짜 사람들을 반복해서 만들어내는 이상한 습관을 갖게 되었다고 주장합니다. 이 "유령 커플"들은 AI 밖으로 새어 나와 웹을 가짜 전문가들로 채웠으며, 심지어 실제 디지털 ID를 가진 방대한 양의 가짜 과학 논문 파도를 만들어냈습니다. 인터넷은 이제 존재하지 않는 사람들이 수행하지도 않은 작업의 공로를 인정받고 있는 "유령들의 출몰"로 가득 차 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →