← 최신 논문
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

본 논문은 5 억 2,700 만 개의 레딧 게시물을 처리하기 위해 규칙 기반 필터링과 LLM 분류를 결합한 확장 가능하고 모듈화된 파이프라인을 제시하며, 이를 통해 1 억 2,460 만 개의 고유 토큰을 1,021 개의 신조어 후보로 성공적으로 축소했고, 이 중 58.7% 는 수동 검증을 통해 진정한 어휘적 혁신으로 확인되었습니다.

원저자: Diego Rossini, Lonneke van der Plas

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Diego Rossini, Lonneke van der Plas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

5 억 2 천 7 백만 권의 책 (2005 년부터 2024 년까지의 레딧 게시물) 이 포함된 도서관을 상상해 보세요. 이 거대한 텍스트 산속에는 사람들이 방금 invented 한 몇 천 개의 완전히 새로운 단어들이 숨어 있습니다. 당신의 목표는 그것들을 찾아내는 것입니다.

만약 새로운 단어들을 찾기 위해 그 도서관의 모든 단어를 하나씩 읽으려 한다면, 당신은 평생 내내 바쁘게 지내야 할 것입니다. 당신이 발견하는 대부분의 '이상한' 단어들은 새로운 inventions 이 아닙니다. 그저 오타, 공백 없이 두 단어를 붙여 입력한 경우, 혹은 다른 언어의 단어일 뿐입니다.

이 논문은 그 거대한 텍스트 산을 훑어내어 실제로 새로운 단어인 '용의자'들의 작고 관리 가능한 더미만 당신에게 건네도록 설계된 스마트한 다단계 필터를 설명합니다.

다음은 파이프라인이 단계별로 작동하는 방식입니다:

1. 거대한 체 (규칙 기반 필터링)

첫 번째 단계를 일련의 거대한 체라고 생각하세요. 1 억 2 천 4 백만 개의 고유 단어를 하나씩 그 체에 부어 넣습니다.

  • '오래된 단어' 체: 2015 년 이전에 사전에 등재된 단어라면 버립니다. 우리는 새로운 것들만 관심 있습니다.
  • '말도 안 되는' 체: 키보드 난타 (예: "asdfgh"), 오타, 혹은 반복된 문자열처럼 보이는 단어라면 폐기합니다.
  • '접착' 체: 공백 없이 두 단어가 붙어버린 경우 (예: "datingapp"), 시스템이 이를 분리하려 시도합니다. 만약 단순한 실수였다면 쓰레기통으로 보냅니다.
  • '외국어' 체: 시스템이 단어가 스페인어나 타갈로그어라고 판단하면 따로 보관합니다 (비록 일부 까다로운 혼합 언어 단어는 빠져나오기도 하지만).

결과: 이 단계는 놀라울 정도로 효율적입니다. 단어의 **99.99%**를 폐기합니다. 1 억 2 천 4 백만 개의 후보를 약 17 만 5 천 개의 잠재적 새로운 단어로 줄입니다.

2. 판사 패널 (LLM 분류)

이제 17 만 5 천 명의 용의자가 남았습니다. 아직 모두 수동으로 읽을 수는 없으므로, **네 가지 다른 AI '판사'(대형 언어 모델)**에게 각 단어를 살펴보게 합니다.

  • 판사들은 각 단어를 다음 네 가지 통 중 하나로 분류하도록 요청받습니다:
    1. 신조어: 진정한 새로운 단어 (예: "doomscrolling").
    2. 개체: 사람, 브랜드, 또는 장소의 이름 (예: "Elon").
    3. 외국어: 다른 언어의 단어.
    4. 없음: 단순한 오타, 사용자 이름, 혹은 쓰레기.
  • 투표 시스템: 하나의 AI 가 너무 게으르거나 너무 미친 행동을 하지 않도록 투표합니다. 다수가 '신조어'라고 동의하면 다음 라운드로 넘어갑니다. 의견이 일치하지 않으면 안전을 위해 보통 해당 단어는 폐기됩니다.

3. 최종 검사관 (검증)

AI 패널이 투표를 마친 후에도 여전히 약 1 만 개의 '신조어' 후보가 남아 있습니다. 이는 인간이 빠르게 확인하기에는 여전히 너무 많습니다.
따라서 매우 엄격한 최종 AI 판사 (Claude) 가 목록을 다시 살펴봅니다. 이 판사는 매우 보수적입니다. "이게 새로운 단어라는 게 100% 확실하지 않다면, '없음'으로 간주하겠다"라고 말합니다.

  • 이 단계는 목록을 1 만 개에서 단 1,021 개의 후보로 줄입니다.

최종 공개

연구자들은 이 최종 1,021 개의 단어를 가져와 수동으로 확인했습니다.

  • 좋은 소식: 그중 58.7% (599 개 단어) 가 진정한 새로운 inventions 이었습니다!
  • 나쁜 소식: 나머지는 사물의 이름 (개체), 빠져나온 외국어 단어, 혹은 단순한 실수였습니다.

그들이 발견한 새로운 단어들은 어떤 종류였을까요?

논문에 따르면 새로운 단어는 주로 두 가지 방식으로 만들어집니다:

  1. '규칙 준수자들': 기존 단어에 접두사나 접미사를 추가하는 사람들 (예: "woke"에 "-ism"을 붙여 "wokeism"을 만드는 것).
  2. '규칙 위반자들': 재미로 단어를 부수거나 변형하는 사람들 (예: "Barbie"와 "Oppenheimer"를 섞어 "Barbenheimer"를 만들거나, 강조를 위해 "thick"을 "thiccest"로 바꾸는 것).

이것이 중요한 이유

이 논문의 주요 성과는 단순히 단어를 찾는 것이 아니라 압축에 있습니다. 인간에게는 불가능한 작업 (1 억 2 천 4 백만 단어를 읽는 것) 을 인간이 하루 만에 완료할 수 있는 작업 (1,021 개 단어를 확인하는 것) 으로 압축한 것입니다.

이 논문이 하지 않는 일:

  • 언어의 미래를 예측하지 않습니다.
  • 사용자의 오타를 수정하지 않습니다.
  • "touch grass"와 같은 구절에는 작동하지 않습니다 (단어 하나만 찾습니다).
  • 철자는 그대로 유지되면서 의미가 바뀐 단어 (예: "Karen"이 속어적 모욕어로 변한 경우) 는 포착하지 못합니다. 시스템은 "Karen"을 단순히 오래된 이름으로 생각하기 때문입니다.

요약하자면, 이는 매우 효율적인 금 채굴 기계입니다. 거대한 디지털 흙더미를 파헤쳐 돌과 흙을 걸러내고, 인간 전문가가 다듬을 준비가 된 작은 금괴 (새로운 단어) 통을 당신에게 건네줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →