Expectation, Backlash, Recovery, and Excitement: How Model Releases Shape Reddit Perceptions of Conversational AI Systems
यह शोध पत्र दीर्घकालिक रेडिट (Reddit) चर्चाओं का विश्लेषण करके यह प्रदर्शित करता है कि संवादात्मक एआई (AI) मॉडल रिलीज़ गतिशील, उपयोगकर्ता-केंद्रित हस्तक्षेप हैं जो सार्वजनिक भावना और विमर्श को महत्वपूर्ण रूप से नया आकार देते हैं, जिसमें एंथ्रोपिक (Anthropic), ओपनएआई (OpenAI), ग्रोक (Grok) और डीपसीक (DeepSeek) जैसे प्रदाताओं के बीच अपेक्षा, आक्रोश और सुधार के विशिष्ट पैटर्न देखे गए हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: अपेक्षा, प्रतिक्रिया (Backlash), रिकवरी और उत्साह
समस्या विवरण
संवादात्मक AI सिस्टम (CAISes) स्थिर उत्पाद नहीं हैं; वे मॉडल रिलीज़, फीचर अपडेट, सुरक्षा हस्तक्षेप और एक्सेस-पॉलिसी बदलावों के माध्यम से निरंतर विकसित होते रहते हैं। जबकि पूर्व शोध ने स्थिर स्नैपशॉट्स (सर्वेक्षण, क्रॉस-सेक्शनल सोशल मीडिया विश्लेषण) के माध्यम से AI के प्रति उपयोगकर्ता धारणाओं का व्यापक रूप से मानचित्रण किया है, ये दृष्टिकोण विशिष्ट सिस्टम हस्तक्षेपों के जवाब में उपयोगकर्ता की भावना की गतिशील प्रकृति को पकड़ने में विफल रहते हैं। मौजूदा साहित्य अक्सर मॉडल परिवर्तनों को विशुद्ध रूप से तकनीकी अपडेट के रूप में देखता है, जिससे उपयोगकर्ताओं पर उनके सामाजिक और संबंधपरक प्रभाव की अनदेखी होती है। यह अध्ययन कई प्रदाताओं के माध्यम से विशिष्ट मॉडल रिलीज़ घटनाओं के पहले और बाद में उपयोगकर्ता की धारणाएं कैसे गतिशील रूप से बदलती हैं, इस अंतराल को संबोधित करता है।
कार्यप्रणाली
लेखकों ने अक्टूबर 2022 से दिसंबर 2025 तक रेडिट (Reddit) चर्चाओं का एक दीर्घकालिक, बड़े पैमाने पर विश्लेषण किया, जिसमें 20 सबरेडिट्स और 668,063 पोस्ट शामिल थे। कार्यप्रणाली को एक "रिलीज़-केंद्रित डिज़ाइन" के इर्द-गिर्द संरचित किया गया है जो मॉडल रिलीज़ को हस्तक्षेप बिंदुओं (intervention points) के रूप में मानता है।
1. डेटा निर्माण और सामान्यीकरण:
- कॉर्पस (Corpus): छह प्रमुख प्रदाताओं (OpenAI, Anthropic, Google, xAI, Meta, और DeepSeek) पर ध्यान केंद्रित करते हुए 20 प्रासंगिक सबरेडिट्स (जैसे, r/ChatGPT, r/ClaudeAI, r/grok) से सबमिशन को फ़िल्टर किया गया।
- मेंशन एक्सट्रैक्शन (Mention Extraction): मॉडल उल्लेखों को चार-स्तरीय पदानुक्रम
<प्रदाता, परिवार, पीढ़ी, टियर>में पहचानने और सामान्य करने के लिए एक टैक्सोनॉमी-निर्देशित LLM पाइपलाइन विकसित की गई। इस टैक्सोनॉमी ने 9 प्रदाताओं के 189 प्रविष्टियों को मैप किया। एक्सट्रैक्टर ने कच्चे टेक्स्ट को इस स्कीमा में मैप करने में उच्च सटीकता (F1 > 0.95) प्राप्त की। - फ़िल्टरिंग: विश्लेषण ने स्पष्ट एट्रिब्यूशन सुनिश्चित करने के लिए "सिंगल-मेंशन" पोस्ट पर ध्यान केंद्रित किया, जिसके परिणामस्वरूप 363,546 पोस्ट का एक डेटासेट प्राप्त हुआ जिसमें 505,250 मॉडल उल्लेख थे।
2. धारणा मापन:
- सेंटिमेंट क्लासिफिकेशन (Sentiment Classification): एक मानव-सत्यापित LLM क्लासिफायर ने स्पष्ट टेक्स्ट साक्ष्य के आधार पर पोस्ट को सकारात्मक, तटस्थ या नकारात्मक श्रेणियों में वर्गीकृत किया। क्लासिफायर ने मानव बहुमत लेबल के विरुद्ध 0.82 का वेटेड F1 प्राप्त किया।
- थीमैटिक कॉन्सेप्ट इंडक्शन (Thematic Concept Induction): LLooM फ्रेमवर्क को अपनाते हुए, लेखकों ने कॉर्पस से 236 व्याख्या योग्य "कैनोनिकल कॉन्सेप्ट्स" (जैसे, "कोडिंग उत्पादकता," "अपेक्षा अंतराल," "जबरदस्ती अपग्रेड का हताशा") को प्रेरित किया। इन अवधारणाओं को समावेश मानदंडों के आधार पर पोस्ट के विरुद्ध स्कोर किया गया, जिससे पूर्व-निर्धारित टैक्सोनॉमी पर निर्भर रहे बिना विषयगत व्यापकता को ट्रैक करना संभव हुआ।
3. हस्तक्षेप विश्लेषण (Intervention Analysis):
- विंडो डिज़ाइन: प्रत्येक मॉडल रिलीज़ के लिए, प्रदाता-विशिष्ट रिलीज़ गैप सांख्यिकी (DeepSeek के लिए 25 दिनों से लेकर Google के लिए 104 दिनों तक) के आधार पर सममित प्री- और पोस्ट-रिलीज़ विंडो को परिभाषित किया गया।
- डेल्टा गणना: अध्ययन ने प्री- और पोस्ट-रिलीज़ विंडो के बीच सेंटिमेंट डेल्टा (सकारात्मक/नकारात्मक पोस्ट के हिस्से में परिवर्तन) और कॉन्सेप्ट डेल्टा (अवधारणा व्यापकता में परिवर्तन) की गणना की। सांख्यिकीय महत्व का आकलन बेन्जामिन-होचबर्ग FDR सुधार के साथ ची-स्क्वायर टेस्ट और टू-प्रपोर्शन ज़-टेस्ट का उपयोग करके किया गया।
मुख्य परिणाम
1. दीर्घकालिक सेंटिमेंट रुझान:
- OpenAI और Google: दोनों ने तटस्थ से नकारात्मक भावना की ओर एक दीर्घकालिक बदलाव प्रदर्शित किया। OpenAI के लिए, तटस्थ भावना में ~19 प्रतिशत अंक (pp) की गिरावट आई जबकि नकारात्मक भावना में अवलोकन अवधि के दौरान ~19 pp की वृद्धि हुई।
- Anthropic: एकमात्र ऐसा प्रदाता रहा जिसने सकारात्मक रुझान दिखाया, जहाँ सकारात्मक भावना ~20% से बढ़कर ~35% हो गई और नकारात्मक भावना में महत्वपूर्ण गिरावट आई।
- Meta: इसने तटस्थ-से-सकारात्मक बदलाव दिखाया, जबकि xAI और DeepSeek ने छोटे अवलोकन विंडो या उच्च अस्थिरता के कारण कोई स्पष्ट दीर्घकालिक दिशात्मक रुझान नहीं दिखाया।
2. रिलीज़-विशिष्ट गतिशीलता:
- Anthropic (Claude 4): सबसे स्पष्ट सकारात्मक हस्तक्षेप प्रोफाइल (+5.3 pp सकारात्मक, -10.5 pp नकारात्मक) प्रदर्शित किया। यह "Claude Code" की सार्वजनिक रिलीज़ द्वारा संचालित था, जिसने मॉडल क्षमता को उपयोगकर्ता वर्कफ़्लो (कोडिंग/स्वचालन) के साथ संरेखित किया, जिससे विमर्श सामान्य उत्पादकता से हटकर विशिष्ट कोडिंग उत्पादकता की ओर स्थानांतरित हो गया।
- OpenAI (GPT-5): सबसे मजबूत प्रतिकूल बदलाव (-3.5 pp सकारात्मक, +10.3 pp नकारात्मक) को ट्रिगर किया। इस बैकलाश की विशेषता "जबरदस्ती अपग्रेड का हताशा" (Forced Upgrade Frustration) और "फीचर रिमूवल का हताशा" (Feature Removal Frustration) थी, जहाँ उपयोगकर्ताओं ने एक "व्यक्तिगत साथी" के खोने का अनुभव किया और बाधित वर्कफ़्लो का सामना किया।
- OpenAI (GPT-5.1): इसने आंशिक रिकवरी दिखाई, जिससे बैकलाश कॉन्सेप्ट्स का वॉल्यूम कम हुआ लेकिन उत्साह पूरी तरह से बहाल नहीं हुआ, जो प्लेटफॉर्म-स्तरीय विद्रोह से संकीर्ण उत्पाद शिकायतों की ओर बदलाव का संकेत देता है।
- DeepSeek R1: इसने एक "डिमांड शॉक" पैदा किया जिससे पोस्ट वॉल्यूम में 19 गुना वृद्धि हुई। सेंटिमेंट मिश्रित था: इंजीनियरिंग क्षमता ("मॉडल तुलना और मूल्यांकन") के लिए उच्च प्रशंसा के साथ-साथ एक्सेस, विश्वसनीयता और सेंसरशिप ("विश्वसनीयता उपलब्धता हताशा") के संबंध में गंभीर निराशा भी देखी गई।
- xAI (Grok 3): इसने सकारात्मक और नकारात्मक दोनों श्रेणियों में एक साथ वृद्धि के साथ एक विभाजित स्वागत उत्पन्न किया। विमर्श अत्यधिक राजनीतिक था, जिसने मॉडल के प्रदर्शन को प्रदाता की पहचान (Elon Musk) और राजनीतिक एजेंडे से जोड़ा, साथ ही मानक विश्वसनीयता संबंधी चिंताएँ भी बनी रहीं।
- OpenAI (GPT-4o): एक विशाल "अपेक्षा अंतराल" (+19.4 pp) द्वारा चिह्नित था। उपयोगकर्ता "ओम्नी" डेमो क्षमताओं (रियल-टाइम वॉयस, वीडियो) और लॉन्च के समय उपलब्ध सीमित फीचर्स के बीच के अंतर पर प्रतिक्रिया कर रहे थे, जिससे एक्सेस बाधाओं के कारण मिश्रित सेंटिमेंट उत्पन्न हुआ।
महत्व और दावे
यह पेपर दावा करता है कि मॉडल रिलीज़ केवल तकनीकी अपडेट नहीं हैं बल्कि "उपयोगकर्ता-सामना करने वाले हस्तक्षेप" हैं जो सार्वजनिक चर्चा, भावना और अपेक्षाओं को नया आकार देते हैं। अध्ययन दर्शाता है कि:
- धारणाएँ गतिशील हैं: स्थिर स्नैपशॉट्स अपर्याप्त हैं; उपयोगकर्ता का विश्वास और भावना विशिष्ट हस्तक्षेप प्रकारों (जैसे, जबरदस्ती अपग्रेड बनाम नई फीचर उपलब्धता) के प्रति अत्यधिक संवेदनशील होते हैं।
- प्रदाता की पहचान मायने रखती है: रिलीज़ का स्वागत प्रदाता के ब्रांड, राजनीतिक रुख और उपयोगकर्ता के साथ उनके संबंध (जैसे, GPT-4o के प्रति "संबंधपरक जुड़ाव" बनाम DeepSeek के प्रति "इंजीनियरिंग प्रशंसा") से गहराई से प्रभावित होता है।
- प्रोडक्ट-मॉडल फिट महत्वपूर्ण है: सफल रिलीज़ (जैसे, Claude 4) तकनीकी क्षमताओं को स्पष्ट उपयोगकर्ता वर्कफ़्लो के साथ संरेखित करती है, जबकि विफलताओं का कारण अक्सर गलत संरेखित अपेक्षाएं (GPT-4o) या स्थापित उपयोगकर्ता आदतों को बाधित करने वाले जबरदस्ती के बदलाव (GPT-5) होते हैं।
लेखक निष्कर्ष निकालते हैं कि प्रदाताओं को रिलीज़ को परिणामी सामाजिक-तकनीकी घटनाओं के रूप में मानना चाहिए, क्षमता घोषणाओं को वास्तविक एक्सेस के साथ संरेखित करना चाहिए, संक्रमण के दौरान मॉडल निरंतरता बनाए रखनी चाहिए, और स्वागत को एक बार की घटना मानने के बजाय समय के साथ उपयोगकर्ता की प्रतिक्रियाओं की निगरानी करनी चाहिए।
सीमाएँ
अध्ययन कई सीमाओं को स्वीकार करता है:
- डेटा स्रोत: विश्लेषण टेक्स्ट-आधारित रेडिट पोस्ट तक सीमित है, जिसमें मल्टीमीडिया सामग्री को छोड़ दिया गया है और संभावित रूप से तकनीकी रूप से संलग्न शुरुआती अपनाने वालों (early adopters) का अधिक प्रतिनिधित्व हो सकता है।
- AI-जनित सामग्री: डेटासेट में AI-जनित या AI-सहायता प्राप्त पोस्ट हो सकते हैं, जिन्हें फ़िल्टर करना कठिन है।
- कार्यप्रणाली संबंधी बाधाएं: निष्कर्षण और वर्गीकरण के लिए LLM का उपयोग संभावित त्रुटियों को पेश करता है, और बैच-आधारित कॉन्सेप्ट इंडक्शन अतिरेक (redundancy) पैदा कर सकता है।
- विंडो संवेदनशीलता: हालांकि मजबूती की जाँच स्थिरता दिखाती है, लेकिन सममित विंडो का चयन तत्काल, अल्पकालिक प्रतिक्रियाओं को सुचारू (smooth out) कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।