← 최신 논문
💬 NLP

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

이 논문은 중국어 시나리오에서 LLM 생성, 인간 작성 및 LLM 수정 텍스트를 효과적으로 탐지하여 NLPCC 2026 Shared Task 6에서 1위를 차지한 충돌 인지 융합 기반의 다중 신호 앙상블 프레임워크인 EVIL-Detect를 제시한다.

원저자: Hongrui Bao, Hangyu Rong, Zhuoshang Wang, Yubing Ren, Yanan Cao

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Hongrui Bao, Hangyu Rong, Zhuoshang Wang, Yubing Ren, Yanan Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 인간과 새로운 종류의 매우 빠른 사서인 인공지능(AI)이 함께 책을 쓰는 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 이 AI 사서들(대규모 언어 모델이라 불리는)은 단순한 메모만을 작성할 수 있었지만, 이제는 인간이 쓴 것처럼 거의 똑같이 들리는 전체 이야기, 에세이, 기사를 쓸 수 있게 되었습니다. 이것은 양날의 검입니다. 한편으로는 창의성을 위한 초능력이 되지만, 다른 한편으로는 누가 실제로 글을 썼는지 구별하기 어렵게 만듭니다. 만약 학생이 에세이를 제출했다면, 그것을 학생이 썼는지, AI가 썼는지, 아니면 학생이 초안을 다듬기 위해 AI의 도움을 받았는지 어떻게 알 수 있을까요? 이것이 바로 과학자들이 해결하려고 노력 중인 큰 퍼즐입니다. 즉, 인간, 로봇, 그리고 인간과 로봇의 협업 사이의 차이를 포착할 수 있는 텍스트용 "거짓말 탐지기"를 구축하는 것입니다.

이 이야기에서, 중국의 연구진은 이 퍼즐을 해결하기 위해 EVIL-Detect라고 불리는 새로운 도구를 만들었습니다. 그들은 단순히 단일 탐지기를 만든 것이 아니라, 진실을 잡기 위해 함께 작동하는 "탐정단"을 구축했습니다. 그들의 시스템은 NLPCC 2026이라는 주요 대회에서 테스트되었으며, 그곳에서 세 가지 유형의 텍스트—순수하게 인간이 쓴 글, 순수하게 AI가 쓴 글, 그리고 인간이 썼지만 AI에 의해 편집되거나 다듬어진 글—를 구별해야 하는 까다로운 과제에 직면했습니다. 다른 방법들이 단일한 뇌로 정답을 추측하려고 노력할 때, EVIL-Detect는 다양한 단서들을 결합하여 정답을 찾아내는 팀 접근 방식을 사용했습니다. 최종 점수에서 그들의 시스템은 0.8888의 macro-F1 점수를 기록하며 공식 평가에서 1위를 차지했습니다.

문제점: "세 갈래"의 미스터리

기존의 탐지기들은 대부분 이진 스위치와 같았습니다. 즉, "인간" 또는 "AI"라고만 말할 수 있었습니다. 하지만 현실 세계는 더 복잡합니다. 사람들은 종종 문법을 고치거나 글을 더 좋게 만들기 위해 AI를 사용합니다. 이는 세 번째 카테고리를 만들어냅니다: LLM으로 다듬어진 텍스트(LLM-refined text). 학생이 초안을 쓰고(인간), 그 후 AI에게 "이것을 더 전문적으로 보이게 해줘"라고 요청하거나(다듬어짐), 혹은 AI가 처음부터 전체 이야기를 쓰는 것(AI)을 상상해 보세요. 문제는 "다듬어진" 텍스트가 두 가지 성격이 섞여 있어 포착하기 매우 어렵다는 점입니다.

연구진은 만약 컴퓨터에게 세 가지를 한꺼번에 맞히도록 가르치려고 하면 혼란에 빠진다는 것을 발견했습니다. 그들의 테스트에서, 세 카테고리를 직접 학습하려고 시도한 표준적인 방법은 테스트에서 단 0.1690점을 기록하며 형편없는 성적을 냈습니다. 그것은 마치 개에게 세 가지 언어를 동시에 말하도록 가르치는 것과 같았고, 결국 개는 포기해 버린 셈이었습니다.

해결책: 탐정단 (EVIL-Detect)

하나의 거대한 뇌 대신, 연구진은 EVIL-Detect(탐지용 편집 인식 뷰 통합 학습, Edit-aware View-Integrated Learning for Detection의 약자)를 구축했습니다. 이 시스템을 네 명의 서로 다른 탐정이 각기 다른 안경을 쓰고 텍스트를 바라보는 팀이라고 생각하면 됩니다. 그들은 단순히 투표하는 것이 아니라, 서로 대화하고 의견 차이를 해결하여 최종 판결에 도달합니다.

다음은 네 명의 탐정과 그들이 찾아내는 요소들입니다:

  1. "편집 탐정" (지도 학습): 이 탐정은 텍스트가 얼마나 많이 변경되었는지를 측정하도록 훈련되었습니다. 이 탐정은 인간의 원래 스타일과 최종 버전 사이의 차이를 살펴봅니다. 텍스트가 순수한 인간의 글이라면 변화는 0입니다. 순수한 AI라면 변화는 매우 큽니다. 만약 "다듬어진" 글이라면 변화는 그 중간 어디쯤에 위치합니다. 이 탐정은 0에서 1 사이의 슬라이딩 척도로 점수를 부여하여 팀에 텍스트가 얼마나 "편집"된 느낌인지를 알려줍니다.
  2. "제로샷 탐정" (EchoPrompt): 이 탐정은 특정 데이터에 대해 훈련될 필요가 없습니다. 이 탐정은 영리한 트릭을 사용합니다: 다양한 AI 모델이 해당 텍스트를 생성할 가능성을 비교함으로써 텍스트에게 "이것이 로봇이 할 법한 말인가?"라고 묻습니다. 만약 텍스트가 로봇의 자연스러운 출력물과 매우 흡사하다면, 이 탐정은 "AI 생성"에 대한 경고 신호를 보냅니다.
  3. "단어 수 탐정" (어휘 통계): 이 탐정은 작고 지루한 세부 사항들을 살펴봅니다: 특정 단어나 글자 조합이 얼마나 자주 나타나는지 말입니다. 인간과 로봇은 서로 다른 단어 "지문"을 사용하는 경향이 있습니다. 이 탐정은 이러한 패턴을 계산하여 텍스트가 인간의 습관에 가까운지 혹은 기계의 습관에 가까운지를 확인합니다.
  4. "규칙 책 탐정" (텍xt 규칙): 이것은 안전망입니다. 이 탐정은 인간이라면 저지르지 않을 명백한 실수들, 예를 들어 남겨진 컴퓨터 코드(HTML 태그인 <div 또는 <html>)나 로봇이 문장 중간에 끊긴 듯한 미완성 문장 등을 찾아냅니다. 만약 이런 것들이 발견되면, 즉시 텍스트를 AI로 분류합니다.

그들은 어떻게 협력하는가: "갈등 인식" 회의

EVIL-Detect의 마법은 단순히 네 명의 탐정을 보유한 것이 아니라, 그들이 의견이 일치하지 않을 때 어떻게 처리하느냐에 있습니다. 때때로 "편집 탐정"은 텍스트가 "다듬어진" 것이라고 생각하지만, "단어 수 탐정"은 "AI"라고 생각할 수 있습니다.

단순히 투표를 평균 내는 대신(이는 소수의 의견이 무시되는 민주주의와 같습니다), 팀은 갈등 인식 융합(Conflict-Aware Fusion) 전략을 사용합니다. 그들은 논쟁을 해결하기 위한 일련의 규칙을 가지고 있습니다:

  • 두 탐정이 동의하면, 그 답을 따릅니다.
  • 만약 의견이 갈리면, 구체적인 단서를 확인합니다. 예를 들어, "편집 탐정"이 "인간"과 "다듬어진 글" 사이에서 확신하지 못한다면, 팀은 "제로샷 탐정"을 통해 AI의 징후가 강하게 나타나는지 확인합니다.
  • 마지막으로, "규칙 책 탐정"이 최종 결정권을 갖습니다. 만약 텍스트에 명백한 컴퓨터 코드가 포함되어 있다면, 시스템은 다른 모든 것을 무시하고 이를 AI로 판정합니다.

결과: 대회 우승

연구진이 까다롭고 탐지기를 무너뜨리기 위해 설계된 미지의 사례들이 포함된 공식 대회 데이터로 시스템을 테스트했을 때, EVIL-Detect는 놀라운 성과를 거두었습니다.

  • 첫 번째 테스트 세트(testp1)에서 macro-F1 점수 0.8913을 기록했습니다.
  • 두 번째로 더 어려운 테스트 세트(testp2)에서 0.8888을 기록했습니다.

이 시스템은 특히 순수 AI 텍스트를 포착하는 데 뛰어났으며(해당 카테고리에서 0.9219 득점), 까다로운 "다듬어진" 텍스트에 대해서도 준수한 성적(0.8407)을 냈습니다. 연구진은 "편집 탐정"이 팀 내에서 가장 강력한 단일 구성원임을 발견했지만, 시스템이 정상에 오를 수 있었던 것은 다른 탐정들이 메인 탐정의 실수를 보완해주었기 때문이라고 밝혔습니다.

무엇을 배웠는가 (그리고 무엇을 거부했는가)

논문은 또한 다른 아이디어들이 효과가 있는지 테스트했으며, 일부 인기 있는 방법들이 이 특정한 세 갈래 챌린지에서는 실패했다는 것을 발견했습니다.

  • 직접 학습의 실패: 연구진은 단일 AI 모델이 세 카테고리를 직접 "추측"하도록 훈련시켜 보았습니다. 결과는 처참했습니다. 단 0.1690점을 기록했습니다. 이는 도움 없이 단순히 데이터를 모델에 던져준다고 해서 모델이 "인간", "AI", "다듬어진 글" 사이의 미묘한 차이를 이해할 수 없다는 것을 증명했습니다.
  • 기존 탐지기의 한계: 그들은 이진 탐지에는 유용하지만 여기서는 0.3928점에 그친 "Binoculars"라는 방법도 테스트했습니다. 이 방법은 세 가지 클래스의 복잡성을 감당할 수 없었습니다.

연구진은 성공의 비결이 단일한 "슈퍼 모델"이 아니라, **다중 신호 앙상블(multi-signal ensemble)**에 있다고 제안합니다. "편집 강도"(얼마나 변경되었는지), "가능성"(로봇처럼 들리는지), 그리고 "단어 패턴"을 결 조합함으로써, 그들은 오늘날 사람들이 실제로 AI를 사용하는 복잡한 현실을 다룰 수 있을 만큼 견고한 시스템을 만들어냈습니다.

요컨대, EVIL-Detect는 AI와 인간이 공존하는 세상에서 진실을 잡기 위해서는 단 하나의 추측에 의존하기보다, 서로 논쟁하고 타협하며 재확인할 수 있는 전문가 팀이 필요하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →