← नवीनतम पेपर
💬 NLP

Operationalizing Linguistic Methods through Prompt-Engineering Skills: An Automatic Chinese Web Neologism Detection Pipeline

यह शोध पत्र चीनी वेब नवोन्मेषों (neologisms) का पता लगाने के लिए एक स्वचालित पाइपलाइन प्रस्तुत करता है जो पारंपरिक भाषाई सिद्धांतों को प्रॉम्प्ट-इंजीनियरिंग कौशल में अनुवादित करता है, जिससे एक विशाल कॉर्पस पर उच्च कवरेज प्राप्त होता है और एक नवीन कंडीशनल रिकॉल डिकंपोजिशन विश्लेषण के माध्यम से उम्मीदवार पीढ़ी (candidate generation) और अर्थ संबंधी वर्गीकरण (semantic classification) को प्रमुख बाधाओं के रूप में पहचानता है।

मूल लेखक: Yufeng Wu, Meichun Liu

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufeng Wu, Meichun Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप चीनी इंटरनेट पर लोगों द्वारा बनाए जा रहे नए, ट्रेंडी स्लैंग शब्दों को खोजने की कोशिश कर रहे हैं। यह एक विशाल, धुंधले महासागर में मछली पकड़ने जैसा है जहाँ पानी पुराने, ज्ञात मछलियों, बिखरे हुए मलबे और कुछ बिल्कुल नई, चमकदार रचनाओं से भरा हुआ है जिन्हें आपने पहले कभी नहीं देखा है।

यह शोध पत्र विशेष रूप से इन नई "इंटरनेट मछलियों" (नवागंतुक शब्दों/neologisms) को स्वचालित रूप से पकड़ने के लिए डिज़ाइन किए गए एक चार-चरणीय फिशिंग नेट (मछली पकड़ने का जाल) का वर्णन करता है, ताकि हर मलबे के टुकड़े को देखने के लिए किसी इंसान की आवश्यकता न पड़े।

यह प्रक्रिया कैसे काम करती है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

बड़ी तस्वीर: नियमों को "कौशल" (Skills) में बदलना

पारंपरिक रूप से, भाषाविदों ने किताबें लिखी हैं जो इस बात का वर्णन करती हैं कि नए शब्द कैसे बनाए जाते हैं (जैसे कि कैसे आप एक नया शब्द बनाने के लिए दो शब्दों को मिला सकते हैं)। लेकिन वे किताबें केवल विवरण हैं; वे कंप्यूटर को यह नहीं बतातीं कि इसे कैसे करना है।

लेखकों ने उन भाषाई नियमों को एक AI (लार्ज लैंग्वेज मॉडल) के लिए "कौशल" में बदल दिया। इसे एक बहुत ही बुद्धिमान लेकिन शाब्दिक अर्थ समझने वाले इंटर्न को एक विशिष्ट चेकलिस्ट और उदाहरणों का सेट देने जैसा समझें, बजाय इसके कि केवल यह कहा जाए, "मेरे लिए नए शब्द ढूँढो।"

चार-चरणीय पाइपलाइन

चरण 1: बड़ा जाल (उम्मीदवार पीढ़ी - Candidate Generation)
टीम ने 267 मिलियन चीनी वेब दस्तावेजों के एक विशाल पुस्तकालय से शुरुआत की। टेक्स्ट को काटने के लिए मानक शब्दकोश का उपयोग करने के बजाय, उन्होंने हर उस संभावित संयोजन को लिया जो 2, 3, या 4 वर्णों (characters) के रूप में बार-बार दिखाई दे रहा था।

  • परिणाम: वे 1.2 मिलियन संभावित शब्द उम्मीदवारों की एक बाल्टी निकाल कर लाए। यह "कच्चा शिकार" है।

चरण 2: डिक्शनरी चेक और ग्लू टेस्ट (पूर्व-फ़िल्टरिंग - Pre-filtering)

  • डिक्शनरी चेक: उन्होंने जांचा कि क्या ये शब्द मानक 2005 के चीनी शब्दकोश में मौजूद हैं। यदि वे मौजूद थे, तो उन्हें बाहर कर दिया गया (क्योंकि वे नए नहीं हैं)।
  • ग्लू टेस्ट (PMI): उन्होंने एक गणितीय परीक्षण का उपयोग किया यह देखने के लिए कि क्या उम्मीदवार के वर्ण आपस में मजबूती से "चिपकते" हैं। उदाहरण के लिए, "सोशल" और "डेथ" मिलकर "सोशल डेथ" (एक नई अवधारणा) के रूप में अच्छी तरह से चिपक जाते हैं, लेकिन "एप्पल" और "क्लाउड" जैसे यादृच्छिक वर्ण शायद आपस में नहीं जुड़ते। यदि गोंद (glue) कमजोर है, तो उम्मीदवार को हटा दिया जाता है।
  • परिणाम: बाल्टी सिकुड़कर 783,000 उम्मीदवार रह गई।

चरण 3: ग्रामर आर्किटेक्ट (सुव्यवस्थितता कौशल - Well-formedness Skill)
यहीं पर AI को अपना पहला "कौशल" मिलता है। AI शेष बचे हुए उम्मीदवारों को देखता है और पूछता है: "क्या यह एक वास्तविक चीनी शब्द की संरचना जैसा दिखता है?"

  • यह जाँचता है कि क्या शब्द "विशेषण + संज्ञा" या "क्रिया + कर्म" जैसे नियमों का पालन करता है।
  • यह इस बात की परवाह नहीं करता कि AI ने वह शब्द पहले सुना है या नहीं; इसे केवल यह परवाह है कि क्या संरचना तर्कसंगत है।
  • परिणाम: बाल्टी सिकुड़कर 226,000 उम्मीदवार रह गई जो संरचनात्मक रूप से सुदृढ़ दिखते हैं।

चरण 4: अंतिम निर्णायक (तीन-तरफा वर्गीकरण - Three-Way Classification)
यह चरण यह तय करने के लिए दो चरणों में विभाजित होता है कि वह शब्द वास्तव में क्या है:

  • 4A (नियम फ़िल्टर): एक सरल नियम-आधारित फ़िल्टर तेजी से स्पष्ट कचरे (जैसे कि वे शब्द जो "the" से शुरू होते हैं या प्रीपोज़िशन पर समाप्त होते हैं जो वाक्य के अंशों की तरह लगते हैं) को हटा देता है।
  • 4B (AI जज): AI अंतिम निर्णय लेने के लिए दूसरे "कौशल" का उपयोग करता है। इसे तीन विकल्पों में से चुनना होता है:
    1. नवागंतुक (Neologism): एक बिल्कुल नया, वैध स्लैंग शब्द।
    2. एंटिटी (Entity): किसी व्यक्ति, स्थान या वस्तु का नाम (जो नया शब्द नहीं है)।
    3. कोई नहीं (None): केवल यादृच्छिक शोर या मौजूदा वाक्यांश।
  • परिणाम: अंतिम बाल्टी में 226,959 वर्गीकृत आइटम हैं, जिनमें 4,853 पुष्ट नए शब्द शामिल हैं।

"एक्स-रे" मूल्यांकन: रिसाव का पता लगाना

लेखकों ने केवल यह नहीं कहा, "हमें 4,853 शब्द मिले!" वे यह भी जानना चाहते थे कि वे उन शब्दों को कहाँ खो बैठे जो उन्हें मिलने चाहिए थे। उन्होंने कंडीशनल रिकॉल डिकंपोजिशन (conditional recall decomposition) नामक एक विशेष "एक्स-रे" पद्धति का उपयोग किया।

कल्पना कीजिए कि आपके पास पाँच छेदों वाली एक लीक होती बाल्टी है। केवल यह मापने के बजाय कि अंत में कितना पानी बचा है, उन्होंने यह भी मापा कि प्रत्येक विशिष्ट छेद से कितना पानी बाहर निकला।

निष्कर्ष:

  1. दो बड़े रिसाव: उन्होंने पाया कि अधिकांश "नए शब्द" बिल्कुल शुरुआत में (चरण 1, क्योंकि प्रारंभिक जाल पर्याप्त चौड़ा नहीं था) और बिल्कुल अंत में (चरण 4B, क्योंकि AI यह तय करने में संघर्ष कर रहा था कि कोई शब्द वास्तव में "नया" है या केवल एक ज्ञात एंटिटी) खो गए थे।
  2. लंबाई की समस्या: उन्होंने शब्द की लंबाई के आधार पर एक दिलचस्प पैटर्न का पता लगाया:
    • AI यह जाँचने में बहुत अच्छा था कि 2, 3, या 4-वर्णों वाले शब्द संरचनात्मक रूप से सही हैं (यह लगभग सभी में सफल रहा)।
    • हालाँकि, जैसे-जैसे शब्द लंबे होते गए, AI यह तय करने में कमजोर होता गया कि वे नए हैं या नहीं। वह नए 2-वर्णों वाले शब्दों को पहचानने में अच्छा था, लेकिन 4-वर्णों वाले शब्दों के लिए उसकी सटीकता काफी कम हो गई।

मुख्य निष्कर्ष

यह शोध पत्र सिद्ध करता है कि आप आधुनिक AI "कौशल" के रूप में पुराने भाषाई नियमों को बदलकर स्वचालित रूप से नए शब्द खोज सकते हैं। उन्होंने अपनी 4,853 नए शब्दों की सूची और अपनी "एक्स-रे" परीक्षण पद्धति को एक सार्वजनिक संसाधन के रूप में जारी किया है।

हालाँकि, उन्होंने एक सीमा भी पाई: जबकि AI यह जाँचने में उत्कृष्ट है कि कोई शब्द शब्द जैसा दिखता है, उसे इस कठिन कार्य में अभी भी थोड़ा संघर्ष करना पड़ता है कि क्या वह शब्द वास्तव में नया है, खासकर जब शब्द लंबा और जटिल हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →