← नवीनतम पेपर
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

यह शोध पत्र एक स्केलेबल, मॉड्यूलर पाइपलाइन प्रस्तुत करता है जो 527 मिलियन रेडिट पोस्ट को प्रोसेस करने के लिए नियम-आधारित फ़िल्टरिंग और LLM वर्गीकरण को जोड़ता है, जो सफलतापूर्वक 124.6 मिलियन अद्वितीय टोकन को 1,021 नवोन्मेषी शब्द (neologism) उम्मीदवारों तक सीमित करता है, जिनमें से 58.7% को मैन्युअल सत्यापन के माध्यम से वास्तविक शाब्दिक नवाचारों के रूप में पुष्टि की गई है।

मूल लेखक: Diego Rossini, Lonneke van der Plas

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Diego Rossini, Lonneke van der Plas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक पुस्तकालय है जिसमें 527 मिलियन पुस्तकें हैं (2005 से 2024 तक की रेडिट पोस्ट)। उस टेक्स्ट के पहाड़ के भीतर कहीं, कुछ हज़ार बिल्कुल नए शब्द हैं जो लोगों ने अभी-अभी ईजाद किए हैं। आपका लक्ष्य उन्हें खोजना है।

यदि आप उन नए शब्दों को खोजने के लिए उस पुस्तकालय के हर एक शब्द को पढ़ने की कोशिश करेंगे, तो आप अपना पूरा जीवन इसमें बिता देंगे। अधिकांश "अजीब" शब्द जो आप पाएंगे, वे नए आविष्कार नहीं हैं; वे केवल टाइपिंग की गलतियाँ (typos) हैं, या लोग दो शब्दों को बिना स्पेस के एक साथ लिख रहे हैं, या अन्य भाषाओं के शब्द हैं।

यह शोध पत्र एक स्मार्ट, मल्टी-स्टेज फ़िल्टर का वर्णन करता है जिसे उस टेक्स्ट के पहाड़ में से छानने और आपको "संदिग्धों" का एक छोटा, प्रबंधनीय ढेर थमाने के लिए डिज़ाइन किया गया है जो वास्तव में नए शब्द हैं।

यह पाइपलाइन कैसे काम करती है, चरण-दर-चरण यहाँ दिया गया है:

1. विशाल छननी (नियम-आधारित फ़िल्टरिंग)

पहले चरण को कई विशाल छलनी के रूप में सोचें। आप 124 मिलियन अद्वितीय शब्दों को एक-एक करके इनके माध्यम से गुजारते हैं।

  • "पुराना शब्द" की छलनी: यदि कोई शब्द 2015 से पहले डिक्शनरी में था, तो उसे बाहर निकाल दिया जाता है। हमें केवल नई चीज़ों की परवाह है।
  • "बेमतलब" की छलनी: यदि कोई शब्द कीबोर्ड पर बेतरतीब उंगलियां चलाने जैसा दिखता है (जैसे, "asdfgh"), एक टाइपो है, या दोहराए गए अक्षरों की एक श्रृंखला है, तो उसे फेंक दिया जाता है।
  • "गोंद" की छलनी: यदि दो शब्द बिना स्पेस के आपस में चिपक गए हैं (जैसे, "datingapp"), तो सिस्टम उन्हें अलग करने की कोशिश करता है। यदि वे केवल एक गलती थे, तो वे कचरे में चले जाते हैं।
  • "विदेशी" की छलनी: यदि सिस्टम को लगता है कि कोई शब्द स्पेनिश या टैगालोग (Tagalog) में है, तो वह उसे अलग रख देता है (हालांकि कुछ पेचीदा मिश्रित-भाषा वाले शब्द इसमें से निकल जाते हैं)।

परिणाम: यह चरण अविश्वसनीय रूप से कुशल है। यह 99.99% शब्दों को बाहर फेंक देता है। यह 124 मिलियन उम्मीदवारों को लगभग 175,000 संभावित नए शब्दों तक कम कर देता है।

2. न्यायाधीशों का पैनल (LLM वर्गीकरण)

अब हमारे पास 175,000 संदिग्ध हैं। हम अभी भी उन सभी को मैन्युअल रूप से नहीं पढ़ सकते, इसलिए हम चार अलग-अलग AI "न्यायाधीशों" (लार्ज लैंग्वेज मॉडल्स) से प्रत्येक को देखने के लिए कहते हैं।

  • न्यायाधीशों को प्रत्येक शब्द को चार बकेटों (buckets) में वर्गीकृत करने के लिए कहा जाता है:
    1. नियोलोजिज्म (Neologism): एक वास्तविक नया शब्द (जैसे, "doomscrolling")।
    2. एंटिटी (Entity): किसी व्यक्ति, ब्रांड या स्थान का नाम (जैसे, "Elon")।
    3. विदेशी (Foreign): दूसरी भाषा का एक शब्द।
    4. कोई नहीं (None): केवल एक टाइपो, यूजरनेम, या कचरा।
  • मतदान प्रणाली: एक AI को बहुत आलसी या बहुत अजीब होने से बचाने के लिए, वे वोट देते हैं। यदि बहुमत सहमत है कि एक शब्द "नियोलोजिज्म" है, तो वह अगले दौर में जाता है। यदि वे असहमत हैं, तो सुरक्षा के लिए शब्द को आमतौर पर हटा दिया जाता है।

3. अंतिम निरीक्षक (सत्यापन)

AI पैनल के वोट देने के बाद भी, अभी भी लगभग 10,000 "नियोलोजिज्म" उम्मीदवार बचे होते हैं। यह अभी भी बहुत अधिक है जिसे एक इंसान जल्दी से चेक न कर सके।
इसलिए, एक अंतिम, बहुत सख्त AI न्यायाधीश (Claude) सूची को फिर से देखता है। यह न्यायाधीश अत्यंत रूढ़िवादी है। वह कहता है, "यदि मैं 100% सुनिश्चित नहीं हूँ कि यह एक नया शब्द है, तो मैं इसे 'None' कहूँगा।"

  • यह चरण सूची को 10,000 से घटाकर केवल 1,021 उम्मीदवार कर देता है।

अंतिम खुलासा

फिर शोधकर्ताओं ने इन अंतिम 1,021 शब्दों को हाथ से (manually) चेक किया।

  • अच्छी खबर: उनमें से 58.7% (599 शब्द) वास्तविक नए आविष्कार थे!
  • बुरी खबर: बाकी या तो चीजों के नाम (entities) थे, विदेशी शब्द थे जो छिपकर निकल आए थे, या बस गलतियाँ थीं।

उन्होंने किस तरह के नए शब्द खोजे?

शोध पत्र ने पाया कि नए शब्द मुख्य रूप से दो तरीकों से बनाए जाते हैं:

  1. "नियमों का पालन करने वाले": मौजूदा शब्दों में प्रीफिक्स या सफिक्स जोड़ना (जैसे, "woke" में "-ism" जोड़कर "wokeism" बनाना)।
  2. "नियम तोड़ने वाले": शब्दों को आपस में मिलाना या मज़े के लिए उन्हें बदलना (जैसे, "Barbie" और "Oppenheimer" को मिलाकर "Barbenheimer" बनाना, या ज़ोर देने के लिए "thick" को "thiccest" में बदलना)।

यह क्यों महत्वपूर्ण है

शोध पत्र की मुख्य उपलब्धि केवल शब्द खोजना नहीं है; यह संपीड़न (compression) है। उन्होंने एक ऐसे कार्य को लिया जो एक इंसान के लिए असंभव था (124 मिलियन शब्द पढ़ना) और उसे एक ऐसे कार्य में संपीड़ित कर दिया जिसे एक इंसान एक दिन में पूरा कर सकता है (1,021 शब्द चेक करना)।

शोध पत्र क्या नहीं करता है:

  • यह भाषा के भविष्य की भविष्यवाणी नहीं करता है।
  • यह उपयोगकर्ताओं के लिए टाइपो को ठीक नहीं करता है।
  • यह "touch grass" जैसे वाक्यांशों पर काम नहीं करता है (यह केवल एकल शब्दों को खोजता है)।
  • यह उन शब्दों को नहीं पकड़ता जिनका अर्थ बदल गया लेकिन स्पेलिंग वही रही (जैसे, "Karen" का एक अपशब्द बनना), क्योंकि सिस्टम मानता है कि "Karen" केवल एक पुराना नाम है।

संक्षेप में, यह एक अत्यधिक कुशल स्वर्ण-खनन मशीन (gold-mining machine) है। यह डिजिटल मिट्टी के एक विशाल पहाड़ को खोदता है, पत्थर और मिट्टी को छानता है, और आपको सोने के दानों की एक छोटी बाल्टी थमाता है जो एक मानव विशेषज्ञ द्वारा पॉलिश किए जाने के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →