← 최신 논문
💬 NLP

Beyond speculation: Measuring the growing presence of LLM-generated texts in multilingual disinformation

이 연구는 ChatGPT 출시 이후 실제 다국어 허위 정보 데이터셋에서 LLM 생성 콘텐츠의 존재감이 커지고 있다는 첫 번째 실증적 증거를 제공하며, 이 위협의 실제 규모에 관한 학술적 논쟁을 메우기 위해 언어, 플랫폼 및 시기에 걸친 구체적인 패턴을 기록한다.

원저자: Dominik Macko, Aashish Anantha Ramakrishnan, Jason Samuel Lucas, Robert Moro, Ivan Srba, Adaku Uchendu, Dongwon Lee

게시일 2026-02-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dominik Macko, Aashish Anantha Ramakrishnan, Jason Samuel Lucas, Robert Moro, Ivan Srba, Adaku Uchendu, Dongwon Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "로봇 펜"이 거짓말을 쓰고 있는가?

누구나 거의 모든 언어로 이야기, 뉴스, 게시물을 쓸 수 있는 초지능적이고 즉각적인 '글쓰기 펜'(거대언어모델, 즉 LLM)을 집어 들 수 있는 세상을 상상해 보세요. ChatGPT와 같은 도구들이 출시된 이후, 사람들은 걱정하기 시작했습니다. 이 펜이 가짜 뉴스와 거짓 정보(디스정보)를 쓰는 데 사용되고 있는 것은 아닐까?

오랫동안 전문가들은 겉돌며 논쟁해 왔습니다. 어떤 이들은 "걱정 마라, 인터넷은 너무 무질서해서 로봇이 장악하기에는 너무 복잡하다"라고 말했습니다. 다른 이들은 "조심하라, 로봇이 이미 문제를 일으키고 있는 숨겨진 구석들이 있다"라고 말했습니다.

이 논문은 실제로 현실 세계에 이러한 "로봇이 작성한" 거짓말이 얼마나 존재하는지 측정한 첫 번째 연구입니다. 그들은 단순히 추측한 것이 아니라, 증거를 찾기 위해 팩트 체크된 뉴스 및 소셜 미디어의 디지털 기록 속으로 직접 들어갔습니다.

탐정 도구: 그들은 어떻게 로봇을 찾아냈는가?

연구진은 두 개의 "디지털 거짓말 탐지기"를 만들었습니다. 이것을 클럽의 서로 다른 두 보안 요원이라고 생각하면 됩니다:

  1. 경비원 A (Gemma_GenAI): 일반적인 패턴을 바탕으로 로봇의 글쓰기를 식별하도록 훈련되었습니다.
  2. 경비원 B (Gemma_MultiDomain): 로봇의 글쓰기를 식별하기 위해 소셜 미디어와 뉴스에 특화되어 훈련되었습니다.

그들은 이 경비원들이 제 역할을 잘 수행하는지 확인하기 위해 알려진 "인간 vs 로봇" 글쓰기 목록으로 테스트했습니다. 그 결과, 두 경비원이 모두 특정 텍스트가 로봇에 의해 작성되었다고 동의했을 때, 그들의 정확도는 **93%에서 99%**에 달했습니다.

이 경비원들을 신뢰할 수 있게 되자, 그들은 팩트 체크된 주장, 선거 관련 트윗, 전쟁 관련 뉴스를 포함한 네 가지 서로 다른 "동네"(데이터셋)를 순찰하도록 보냈습니다.

발견한 내용: 로봇의 침공은 실재한다 (하지만 불균등하다)

연구 결과, 로봇이 작성한 디스정보는 분명히 존재하지만, 이는 홍수라기보다는 점점 커지고 있는 '미세한 누수'에 가깝습니다.

1. "ChatGPT 전후" 효과
타임라인을 상상해 보세요. (ChatGPT가 대중화되기 전인) 2022년 말 이전에는 로봇이 작성한 거짓말의 양이 매우 적었습니다.

  • 비유: 이것은 조용한 연못과 같습니다. 2021년에는 로봇에 의해 만들어진 파동(물결)이 약 1% 정도로 아주 적었습니다.
  • 변화: 2023년, ChatGPT가 등장한 이후 물결은 커졌습니다. 연구에 따르면, 2023년 데이터셋 내 팩트 체크된 거짓말 중 **1.5%에서 15%**가 로봇에 의해 작성되었거나 편집되었을 가능성이 높았습니다. 가장 확신할 수 있는 추정치는 약 **1.85%**입니다.
  • 추세: 로봇이 작성한 거짓말의 수는 매년 증가하고 있습니다.

2. "표적" 공격
로봇은 모든 언어나 모든 플랫폼에서 똑같이 거짓말을 쓰는 것이 아닙니다. 이것은 특정 집만 골라서 터는 도둑과 같습니다.

  • 언어: 영어와 스페인어는 단순히 사용하는 사람이 많기 때문에 로봇 거짓말이 가장 많지만, 거짓말의 비율은 **폴란드어(4.7%)**와 **프랑스어(4.2%)**에서 가장 높았습니다.
  • 플랫폼: 로봇은 **인스타그램(1.5%)**과 **페이스북(1.3%)**에서 가장 활발하며, 트위터/X(0.64%)에서는 덜 활발합니다.
  • 특정 사건: 2024년 미국 대선 기간 동안, 트윗 내 로봇 작성 콘텐츠의 양은 1월부터 11월까지 두 배로 증가했으며, 선거 직전에 정점에 달했습니다.

3. "가짜 뉴스" 데이터셋
연구진은 "가짜 뉴스"로 분류된 특정 데이터셋도 살펴보았습니다.

  • 그들은 "가짜"로 라벨링된 기사 중 **2.6%에서 3.3%**가 실제로 로봇에 의해 작성되었다는 것을 발견했습니다.
  • 가자 지구 전쟁에 관한 데이터셋에서는 다른 언어에 비해 훨씬 낮은 수치를 보였음에도 불구하고, 프랑스어 게시물의 10% 이상이 로봇 생성물임을 발견했습니다.

이것이 왜 중요한가

이 논문은 로봇이 거짓말을 쓰고 있다는 공포는 단순한 추측이 아니라, 지금 실제로 일어나고 있는 일이라고 결론짓습니다.

  • "나쁜" 소식: 로봇은 디스정보를 만드는 데 사용되고 있으며, 점점 더 정교해지고 있습니다. 이는 특정 언어와 특정 시기(예: 선거철)에 발생하고 있는데, 이는 누군가가 전략적으로 로봇을 사용하고 있음을 시사합니다.
  • "좋은" 소식: 로봇의 거짓말은 여전히 전체 인터넷의 아주 작은 부분(2024년 기준 약 2%)을 차지합니다. 하지만 인터넷이 워낙 방대하기 때문에, 2%라는 수치조차도 엄청난 양의 가짜 콘텐츠를 의미합니다.
  • 경고: 로봇이 더 똑똑해짐에 따라, 그들은 물을 "오염"시키기 시작할 수 있습니다. 만약 미래의 AI 모델이 이미 로봇이 쓴 거짓말로 가득 찬 데이터를 학습하게 된다면, 그 새로운 모델들은 거짓말을 사실이라고 믿고 더 빠르게 퍼뜨릴 수 있습니다.

결론

저자들은 이렇게 말합니다: "추측을 멈추고 측정을 시작하라." 우리는 이제 로봇이 현실 세계에서 거짓말을 쓰고 있다는 증거를 가지고 있으며, 특히 폴란드어, 프랑스어, 그리고 선거 시즌에 그러합니다. 우리는 그들을 잡아낼 더 나은 도구와, 우리가 읽고 있는 이야기가 로봇의 것인지 알려주는 더 나은 시스템이 필요합니다. 그래야 속지 않을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →