← नवीनतम पेपर
💬 NLP

Large language models can disambiguate opioid slang on social media

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स), लेक्सिकॉन-आधारित, लेक्सिकॉन-मुक्त और उभरते हुए स्लैंग परिदृश्यों में, अस्पष्ट ओपिओइड स्लैंग को सटीक रूप से स्पष्ट करने और प्रासंगिक सोशल मीडिया पोस्टों की पहचान करने में पारंपरिक लेक्सिकॉन-आधारित रणनीतियों से काफी बेहतर प्रदर्शन करते हैं, जिससे ओपिओइड ओवरडोज़ संकट की निगरानी में वृद्धि होती है।

मूल लेखक: Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Altman

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Altman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शहर के आकार के विशाल, अराजक घास के ढेर (haystack) के भीतर छिपी कुछ विशिष्ट, दुर्लभ सुइयों को खोजने की कोशिश कर रहे हैं। यह वही चुनौती है जिसका सामना शोधकर्ता सोशल मीडिया पर ओपिओइड संकट (opioid crisis) की निगरानी करने के लिए करते हैं।

हर दिन, लाखों लोग ट्विटर, रेडिट और अन्य प्लेटफार्मों पर पोस्ट करते हैं। अधिकांश पोस्ट बिल्लियों, मौसम या भोजन के बारे में होते हैं। बहुत कम हिस्सा नशीली दवाओं का उल्लेख करता है। इन "सुइयों" (ओपिओइड के बारे में पोस्ट) को खोजने के लिए, शोधकर्ता पहले एक कीवर्ड सूची (एक लेक्सिकॉन) का उपयोग करते थे। वे कहते थे, "यदि किसी पोस्ट में 'heroin' या 'fentanyl' शब्द है, तो उसे रखें।"

लेकिन यहाँ समस्या यह है: ड्रग उपयोगकर्ता पुलिस और एल्गोरिदम से बचने के लिए स्लैंग (बोलचाल की भाषा) का उपयोग करते हैं। वे हेरोइन को "smack" या फेंटानिल को "fenty" कह सकते हैं। परेशानी यह है कि इन शब्दों के निर्दोष अर्थ भी होते हैं। "Smack" का अर्थ ड्रम बजाना हो सकता है; "fenty" किसी मेकअप ब्रांड का नाम हो सकता है; "lean" का अर्थ दुबला होना हो सकता है।

यदि आप केवल उन शब्दों की खोज करते हैं, तो आपको हजारों गलत अलार्म (घास के ढेर का शोर) मिलते हैं और आप वास्तविक सुइयों को खो देते हैं क्योंकि आपकी सूची अपडेट होने की गति से स्लैंग बदल जाता है।

नया समाधान: "सुपर-रीडर" AI

यह पेपर एक नए टूल को पेश करता है: लार्ज लैंग्वेज मॉडल्स (LLMs)। इन AI मॉडल्स को केवल साधारण सर्च इंजन के रूप में नहीं, बल्कि सुपर-रीडर्स के रूप में सोचें जिन्होंने लगभग इंटरनेट पर मौजूद सब कुछ पढ़ा है। वे केवल एक विशिष्ट शब्द को नहीं देखते; वे वाक्य के संदर्भ (context) और भाव (vibe) को समझते हैं।

शोधकर्ताओं ने चार सबसे स्मार्ट उपलब्ध AI मॉडल्स (GPT-4, GPT-5, Gemini, और Claude) का परीक्षण किया यह देखने के लिए कि क्या वे इन सुपर-रीडर्स के रूप में कार्य कर सकते हैं। उन्होंने परीक्षण करने के लिए तीन अलग-अलग "गेम्स" सेट किए:

गेम 1: "अस्पष्ट शब्द" की चुनौती

सेटअप: AI को "fenty" या "smack" जैसे ट्रिकी शब्दों वाले पोस्ट की एक सूची दी गई।
कार्य: निर्णय लें: क्या यह व्यक्ति नशीली दवाओं के बारे में बात कर रहा है, या वे केवल मेकअप या ड्रम बजाने के बारे में बात कर रहे हैं?
परिणाम: पुराने कीवर्ड लिस्ट इस काम में बहुत खराब थे। वे या तो लगभग सब कुछ मिस कर देते थे या हजारों निर्दोष पोस्ट को फ्लैग कर देते थे। हालाँकि, AI ने एक जासूस की तरह काम किया। इसने पूरे वाक्य को देखा और कहा, "आह, यह 'smack' ड्रम बजाने के बारे में है, लेकिन यह दूसरा 'smack' निश्चित रूप से हेरोइन के बारे में है।" AI पुराने कीवर्ड्स की तुलना में बहुत अधिक सटीक था।

गेम 2: "बिना सुराग" की चुनौती

सेटअप: AI को न्यूयॉर्क और कैलिफोर्निया के यादृच्छिक (random) पोस्ट का एक बड़ा ढेर दिया गया। इसे किसी विशिष्ट शब्द को खोजने के लिए नहीं बताया गया था।
कार्य: शुरुआत से ही ओपिओइड पोस्ट को खोजें।
परिणाम: यहीं पर AI वास्तव में चमका। पुराने कीवर्ड लिस्ट ने लगभग 60-90% ड्रग पोस्ट को मिस कर दिया क्योंकि उनके पास सही स्लैंग शब्द नहीं थे। AI ने, अपनी "कॉमन सेंस" और लोगों के बात करने के तरीके की समझ का उपयोग करते हुए, लगभग सभी को ढूंढ लिया। इसने बिना भ्रमित हुए एक बड़ा जाल बुना।

गेम 3: "नकली स्लैंग" की चुनौती

सेटअप: शोधकर्ताओं ने वास्तविक ड्रग पोस्ट लिए और उनमें स्लैंग शब्दों को पोकेमोन के नामों (जैसे "Charizard" या "Pikachu") से बदल दिया।
कार्य: क्या AI यह पता लगा सकता है कि भले ही शब्द नकली था, लेकिन संदर्भ अभी भी यह संकेत दे रहा था कि यह ड्रग्स के बारे में है?
परिणाम: हाँ! AI ने महसूस किया कि भले ही किसी ने कहा, "I'm feeling the Charizard," एक ऐसे संदर्भ में जो आमतौर पर नशे में होने का वर्णन करता है, यह संभवतः ड्रग्स के बारे में था। यह साबित करता है कि AI केवल एक डिक्शनरी को रट नहीं रहा है; यह स्थिति को समझता है।

यह क्यों महत्वपूर्ण है

पुराने तरीके (कीवर्ड लिस्ट) को एक सख्त गेस्ट लिस्ट वाले बाउंसर के रूप में सोचें। यदि आपका नाम लिस्ट में नहीं है, तो आपको प्रवेश नहीं मिलता। लेकिन ड्रग उपयोगकर्ता घुसपैठ करने के लिए अपने नाम (स्लैंग) बदल देते हैं, या बाउंसर गलती से हजारों ऐसे लोगों को अंदर जाने देता है जो लिस्ट में दिखते तो हैं लेकिन वास्तव में नहीं हैं।

नया तरीका (AI) एक बहुत ही चौकस सुरक्षा गार्ड की तरह है। उन्हें लिस्ट की जरूरत नहीं है। वे लोगों के व्यवहार, उनकी बातों और उनके साथ कौन है, इस पर नज़र रखते हैं। वे संदिग्ध व्यवहार को पहचान सकते हैं भले ही व्यक्ति ने कोई वेशभूषा पहनी हो।

मुख्य निष्कर्ष (The Bottom Line)

यह अध्ययन दिखाता है कि ये AI मॉडल्स घास के ढेर में "सुइयों" को खोजने में अविश्वसनीय रूप से अच्छे हैं। वे पुराने कीवर्ड लिस्ट की तुलना में कम गलतियाँ करते हैं और कई अधिक ड्रग-संबंधित पोस्ट पकड़ लेते हैं जो पहले अदृश्य थे।

महत्वपूर्ण नोट: लेखक बहुत सावधानी से कहते हैं कि यह टूल सार्वजनिक स्वास्थ्य निगरानी (जैसे तूफान के लिए वेदर रडार) के लिए है, न कि व्यक्तियों की जासूसी करने के लिए। वे इस डेटा का उपयोग समुदायों को ओवरडोज रोकने और उपचार प्रदान करने में मदद करने के लिए करना चाहते हैं, न कि लोगों को गिरफ्तार करने या उनके पोस्ट को सेंसर करने के लिए।

संक्षेप में: AI ओपिओइड संकट को समझने के लिए एक शक्तिशाली नए माइक्रोस्कोप के रूप में उभर रहा है, जो हमें समस्या को स्पष्ट रूप से देखने में मदद कर रहा है ताकि हम उसे ठीक कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →