Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest
यह शोध पत्र डेटा पूर्वाग्रह को कम करने और पुनरुत्पादनीय बेंचमार्क स्थापित करने के लिए एक नए एकत्रित ट्विटर डेटासेट का उपयोग करते हुए, तीन मुख्य सोशल मीडिया एनालिटिक्स कार्यों—लेखक सत्यापन (authorship verification), पोस्ट जनरेशन, और उपयोगकर्ता विशेषता अनुमान (user attribute inference)—में आधुनिक लार्ज लैंग्वेज मॉडल्स का पहला व्यापक मूल्यांकन प्रस्तुत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अराजक डिजिटल शहर के चौक (जैसे Twitter/X) में कदम रखते हैं जहाँ लाखों लोग चिल्ला रहे हैं, फुसफुसा रहे हैं, मीम्स साझा कर रहे हैं और बहस कर रहे हैं। वर्षों से, कंप्यूटर इस शोर को समझने की कोशिश कर रहे हैं, लेकिन वे अक्सर स्लैंग (slang), छोटे वाक्यों और इस तथ्य से भ्रमित हो जाते थे कि लोग कितनी जल्दी अपने विचार और लिखने की शैलियाँ बदल लेते हैं।
हाल ही में, लार्ज लैंग्वेज मॉडल्स (LLMs)—जिन्हें आप "डिजिटल जीनियस" मान सकते हैं जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ा है—आ गए हैं। बड़ा सवाल यह है: क्या ये डिजिटल जीनियस वास्तव में सोशल मीडिया की अव्यवस्थपूर्ण, वास्तविक दुनिया को समझ और उसकी नकल कर सकते हैं, या वे केवल दिखावटी तोते मात्र हैं?
यह शोध पत्र एक विशाल "रिपोर्ट कार्ड" है जहाँ लेखकों ने सात सबसे स्मार्ट AI मॉडल्स (GPT-4, Gemini और Llama सहित) को सोशल मीडिया को संभालने के लिए एक तीन-चरणीय चुनौती के माध्यम से परखा है।
यहाँ उनके तीन चुनौतियों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) के साथ समझाया गया है:
चुनौती 1: "हैंडराइटिंग टेस्ट" (लेखक सत्यापन - Authorship Verification)
लक्ष्य: क्या AI एक ट्वीट को देखकर कह सकता है, "हाँ, यह निश्चित रूप से यूजर A द्वारा लिखा गया था," या "नहीं, यह नकली है"?
- उपमा: कल्पना कीजिए कि आप एक जासूस हैं जो किसी संदिग्ध की पहचान करने की कोशिश कर रहे हैं। आपके पास उनकी पुरानी लिखावटों की एक नोटबुक (प्रशिक्षण डेटा) है। फिर, कोई आपको एक नया नोट थमाता है। क्या आप बता सकते हैं कि यह उनकी लिखावट है या कोई जालसाजी?
- ट्विस्ट: लेखकों ने AI को केवल पुराने नोट्स पर नहीं परखा। उन्होंने इसे बिल्कुल नए नोट्स दिए जो AI के सीखने बंद करने के बाद लिखे गए थे (जैसे किसी छात्र को उस पाठ्यपुस्तक के अध्याय पर टेस्ट देना जिसे उसने अभी तक नहीं पढ़ा है)। यह जाँचता है कि क्या AI वास्तव में स्मार्ट है या केवल उत्तर रट रहा है।
- परिणाम: GPT-4 सबसे शानदार जासूस निकला। यह नए नोट्स पर भी "लिखावट" को पहचानने में अविश्वसनीय रूप से कुशल था। अन्य मॉडल ठीक-ठाक थे, लेकिन कुछ (जैसे पुराना BERT) आसानी से धोखा खा गए।
चुनौती 2: "इम्पर्सनेटर कॉन्टेस्ट" (पोस्ट जनरेशन - Post Generation)
लक्ष्य: क्या AI एक ऐसा ट्वीट लिख सकता है जो किसी विशिष्ट वास्तविक व्यक्ति जैसा बिल्कुल सुनाई दे?
- उपमा: कल्पना कीजिए कि आप अपने लिए एक ट्वीट लिखने के लिए एक घोस्टराइटर (ghostwriter) को काम पर रखते हैं। आप उन्हें आपकी डायरी, आपका बायो और आपके दोस्तों की एक सूची देते हैं। वे एक नया ट्वीट लिखते हैं। फिर, आप अपने दोस्तों से पूछते हैं: "क्या यह मैंने लिखा है?"
- परीक्षण: शोधकर्ताओं ने वास्तविक लोगों से AI-जनरेटेड ट्वीट्स को देखा और अनुमान लगाया कि क्या वे स्वयं द्वारा लिखे गए थे या किसी रोबोट द्वारा। उन्होंने शब्दों की समानता को मापने के लिए गणित का भी उपयोग किया।
- परिणाम: यह मिला-जुला रहा।
- Gemini और Llama इंसानों को भ्रमित करने में सबसे अच्छे थे। लोगों ने अक्सर सोचा, "वाह, यह बिल्कुल मेरी तरह लग रहा है!"
- DeepSeek ने ऐसे ट्वीट्स लिखे जो विषय में बहुत समान थे लेकिन कभी-कभी थोड़े रोबोटिक या कम "मानवीय" महसूस होते थे।
- GPT-4o एक ठोस ऑल-राउंडर था लेकिन उसे "सबसे अधिक मानवीय" होने का पुरस्कार नहीं मिला।
- मुख्य निष्कर्ष: सिर्फ इसलिए कि एक AI सही शब्दों का उपयोग करता है, इसका मतलब यह नहीं है कि वह उपयोगकर्ता की "आत्मा" को पकड़ लेता है।
चुनौती 3: "साइकिक प्रोफाइल" (यूजर एट्रिब्यूट इन्फरेंस - User Attribute Inference)
लक्ष्य: क्या AI किसी उपयोगकर्ता के ट्वीट्स को देखकर बिना कभी उनका प्रोफाइल देखे, उनकी नौकरी और शौक का अनुमान लगा सकता है?
- उपमा: कल्पना कीजिए कि आप एक भविष्यवक्ता (psychic) हैं। आपको एक अजनबी के 50 रैंडम पोस्टकार्ड दिए जाते हैं। केवल यह देखकर कि उन्होंने क्या लिखा है, क्या आप अनुमान लगा सकते हैं: "यह व्यक्ति एक डेंटिस्ट है जिसे साइंस-फिक्शन फिल्में पसंद हैं"?
- परीक्षण: AI को उपयोगकर्ता की नौकरी (सरकारी नौकरी की श्रेणियों का उपयोग करके) और उनकी रुचियों (शौक की एक मानक सूची का उपयोग करके) का अनुमान लगाना था।
- परिणाम: Gemini सबसे अच्छा भविष्यवक्ता था। इसने उच्च सटीकता के साथ नौकरियों और शौक का अनुमान लगाया। हालाँकि, Llama को काफी संघर्ष करना पड़ा, और अक्सर गलत नौकरियां अनुमानित कीं। यह दर्शाता है कि स्मार्ट AI भी भ्रमित हो सकते हैं यदि संकेत सूक्ष्म हों।
बड़ी तस्वीर: हमने क्या सीखा?
- कोई एकल विजेता नहीं: हर काम के लिए एक ही "सर्वश्रेष्ठ" AI नहीं है। GPT-4 सबसे अच्छा जासूस है, Gemini सबसे अच्छा भविष्यवक्ता है, और Llama सबसे अच्छा अभिनेता (इम्पर्सनेटर) है।
- "नया डेटा" की समस्या: कई AI उन चीजों को दोहराने में माहिर हैं जो वे पहले से जानते हैं, लेकिन वे नई प्रवृत्तियों या उनके "लर्निंग कटऑफ" के बाद लिखे गए पोस्ट के सामने संघर्ष करते हैं।
- मानव बनाम मशीन: कभी-खरों, जो AI गणितीय रूप से सबसे "परफेक्ट" दिखता है, वह वह नहीं होता जो सबसे अधिक मानवीय महसूस होता है। सोशल मीडिया के लिए सबसे अच्छे AI को स्मार्ट होने के साथ-साथ स्वाभाविक सुनाई देने के बीच संतुलन बनाना आवश्यक है।
संक्षेप में: ये AI मॉडल शक्तिशाली उपकरण हैं जो हमें सोशल मीडिया को बेहतर ढंग से समझने में मदद कर सकते हैं, लेकिन वे अभी तक मानवीय अंतर्ज्ञान के पूर्ण विकल्प नहीं हैं। वे बहुत प्रतिभाशाली इंटर्न की तरह हैं जिन्हें अपने काम की दोबारा जाँच करने के लिए एक मानव बॉस की आवश्यकता होती है, विशेष रूप से ऑनलाइन बातचीत की अव्यवस्थपूर्ण और निरंतर बदलती दुनिया में।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।