← 最新の論文
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

本論文は、5 億 2700 万件の Reddit 投稿を処理するために、ルールベースのフィルタリングと LLM 分類を組み合わせたスケーラブルでモジュール化されたパイプラインを提示し、1 億 2460 万個の一意のトークンを 1021 個の新語候補に絞り込み、そのうち 58.7% が手動検証を通じて真の語彙的革新として確認されたことを示す。

原著者: Diego Rossini, Lonneke van der Plas

公開日 2026-05-08
📖 1 分で読めます☕ さくっと読める

原著者: Diego Rossini, Lonneke van der Plas

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

図書館に5 億 2700 万冊(2005 年から 2024 年までの Reddit の投稿)の本が入っていると想像してください。この膨大なテキストの山の中に、人々が新たに生み出したばかりの数千語の新しい言葉がいくつか潜んでいます。あなたの目標は、それらを見つけることです。

もし、新しい言葉を見つけるためにその図書館のすべての単語を一つずつ読み通そうとしたら、残りの人生を費やすことになってしまいます。あなたが発見する「奇妙な」言葉のほとんどは、新しい発明ではなく、単なるタイプミス、スペースなしで二つの単語を続けて入力したもの、あるいは他の言語の単語に過ぎません。

この論文は、そのテキストの山をふるい分け、実際に新しい言葉である「容疑者」の小さな管理可能な山をあなたに手渡すために設計された賢明な多段階フィルターについて説明しています。

以下が、パイプラインが段階ごとにどのように機能するかです。

1. 巨大なふるい(ルールベースのフィルタリング)

第一段階を、一連の巨大なふるいと想像してください。1 億 2400 万の一意の単語を、それらに一つずつ注ぎます。

  • 「古い単語」ふるい: 2015 年以前に辞書にあった単語は捨てられます。私たちは新しいものだけを気にします。
  • 「無意味」ふるい: キーボードを乱打したようなもの(例:「asdfgh」)、タイプミス、または繰り返された文字の列に見える単語は廃棄されます。
  • 「接着」ふるい: スペースなしで二つの単語がくっついてしまった場合(例:「datingapp」)、システムはそれらを分離しようとします。単なる間違いだった場合は、それらはゴミ箱へ捨てられます。
  • 「外国語」ふるい: システムが単語がスペイン語やタガログ語であると判断した場合、それを脇に置きます(ただし、いくつかの厄介な混合言語の単語はすり抜けてしまいます)。

結果: この段階は非常に効率的です。単語の99.99%を捨て去ります。1 億 2400 万の候補を約17 万 5000の潜在的な新しい言葉にまで減らします。

2. 審査員パネル(LLM 分類)

これで 17 万 5000 人の容疑者が揃いました。まだすべてを手動で読むことはできないので、4 人の異なる AI「審査員」(大規模言語モデル)に、それぞれを見てもらうように頼みます。

  • 審査員は、各単語を以下の 4 つのバケットのいずれかに分類するように指示されます。
    1. 新語: 真の新しい言葉(例:「doomscrolling」)。
    2. 固有名詞: 人、ブランド、または場所の名前(例:「Elon」)。
    3. 外国語: 他の言語からの単語。
    4. なし: 単なるタイプミス、ユーザー名、またはゴミ。
  • 投票システム: 一人の AI が怠慢すぎたり、狂気じみたりすることを避けるため、彼らは投票します。過半数が「新語」に同意した場合、その単語は次のラウンドに進みます。意見が割れた場合、安全のためにその単語は通常廃棄されます。

3. 最終検査官(検証)

AI パネルが投票した後でも、まだ約 1 万の「新語」候補が残っています。それでも人間が素早く確認するには多すぎます。
そこで、非常に厳格な最終 AI 審査員(Claude)がリストを再度確認します。この審査員は極めて慎重です。「これが新しい言葉だと 100% 確信できないなら、それを『なし』と呼ぶ」と言います。

  • このステップにより、リストは 1 万からわずか1,021の候補に削減されます。

最終的な発表

その後、研究者たちはこの最終的な1,021の単語を手に取り、手動で確認しました。

  • 良い知らせ: そのうちの58.7%(599 語)が真の新しい発明でした!
  • 悪い知らせ: 残りは、固有名詞、すり抜けた外国語、または単なる間違いでした。

彼らが見つけた新しい言葉の種類は?

この論文は、新しい言葉が主に 2 つの方法で生み出されていることを発見しました。

  1. 「規則遵守者」: 既存の単語に接頭辞や接尾辞を追加する人々(例:「woke」に「-ism」を追加して「wokeism」を作る)。
  2. 「規則違反者」: 楽しみのために単語をくっつけたり、変えたりする人々(例:「Barbie」と「Oppenheimer」を混ぜて「Barbenheimer」を作る、または強調のために「thick」を「thiccest」に変える)。

なぜこれが重要なのか

この論文の主な達成は、単に言葉を見つけることではなく、圧縮にあります。彼らは、人間には不可能なタスク(1 億 2400 万語を読むこと)を、人間が 1 日で完了できるタスク(1,021 語を確認すること)に圧縮しました。

この論文が「行わない」こと:

  • 言語の未来を予測することはありません。
  • ユーザーのタイプミスを修正することはありません。
  • 「touch grass」のようなフレーズには機能しません(単一の単語のみを検出します)。
  • 意味は変化したものの綴りは同じままの言葉(例:スラングの侮辱語となった「Karen」)を検出することはありません。なぜなら、システムは「Karen」を単なる古い名前だと考えているからです。

要するに、これは非常に効率的な金鉱掘り機械です。膨大なデジタルの土の山を掘り下げ、岩や土を濾過し、人間専門家が磨く準備が整った小さな金鉱石(新しい言葉)のバケツをあなたに手渡します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →