← नवीनतम पेपर
💬 NLP

Dimensionality in Satisfaction Ratings

यह शोध पत्र यह प्रदर्शित करता है कि ग्राहक संतुष्टि को विशिष्ट अक्षों (जैसे एजेंट का प्रदर्शन और परिणाम) में विभाजित करने के लिए एक लार्ज लैंग्वेज मॉडल का उपयोग करना, पारंपरिक सर्वेक्षण-आधारित मेट्रिक्स की तुलना में ग्राहक अनुभव की अधिक सूक्ष्म और व्यापक समझ प्रदान करता है, जो केवल स्व-चयनित सर्वेक्षण उत्तरदाताओं के बजाय सभी सहायता वार्तालापों का विश्लेषण करने पर काफी कम संतुष्टि स्तरों को प्रकट करता है।

मूल लेखक: Andrew Hong, Jason Potteiger

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Hong, Jason Potteiger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़ा नींबू पानी का स्टॉल चलाते हैं। हर बार जब कोई एक कप खरीदता है, तो आप उनसे पूछते हैं, "कैसा था?" अधिकांश लोग बस चलते जाते हैं, लेकिन कुछ लोग रुककर आपको एक स्टार रेटिंग देते हैं। आप अपना पूरा बिजनेस स्ट्रैटेजी उन कुछ रुकने वाले लोगों की राय पर बना रहे हैं, यह मानकर कि वे सभी का प्रतिनिधित्व करते हैं।

यह पेपर एक जासूसी कहानी की तरह है जहाँ शोधकर्ता एक सुपर-स्मार्ट रोबोट (एक AI जिसे GPT-4.1 कहा जाता है) को ग्राहकों और नींबू पानी के स्टॉल के कर्मचारियों के बीच की वास्तविक बातचीत पढ़ने के लिए लाते हैं। रोबोट केवल एक स्टार रेटिंग का अनुमान नहीं लगाता; वह अनुभव को पाँच विशिष्ट सामग्रियों में तोड़ देता है: कुल (Overall) खुशी, एजेंट (Agent) की दयालुता, परिणाम (Outcome) (क्या उन्हें अपना नींबू पानी मिला?), उत्पाद (Product) की गुणवत्ता (क्या नींबू ताज़ा था?), और प्रयास (Effort) (ग्राहक को कितनी मेहनत करनी पड़ी?)।

यहाँ रोबोट ने क्या पाया, और क्यों यह बदल देता है जो हम ग्राहक की खुशी के बारे में जानते थे।

बड़ी सच्चाई: "मौन बहुमत" (Silent Majority) नाखुश है

सबसे चौंकाने वाली खोज यह है कि जो लोग रेटिंग देने के लिए रुकते हैं, वे सभी का निष्पक्ष नमूना (fair sample) नहीं हैं।

  • रेटिंग करने वाली भीड़: वे कुछ लोग जिन्होंने वास्तव में स्टॉल को रेटिंग देने के लिए रोका, उन्होंने 5 में से औसत 3.62 का स्कोर दिया।
  • मौन भीड़: जब रोबोट ने सभी लोगों (उन 8,343 लोगों सहित जो बिना रेटिंग दिए चले गए) के ट्रांसक्रिप्ट पढ़े, तो औसत स्कोर केवल 2.91 था।

पेपर का तर्क है कि केवल उन लोगों पर निर्भर रहना जो सर्वे भरते हैं, एक पूरी फिल्म की समीक्षा केवल उन लोगों के रिव्यु से करने जैसा है जिन्होंने उसे पसंद किया है। "मौन बहुमत" वास्तव में सर्वेक्षणों की तुलना में बहुत बुरा समय बिता रहा है। हर बातचीत को पढ़ने की रोबोट की क्षमता, यहाँ तक कि उन बातचीत को भी जिनमें कोई रेटिंग नहीं दी गई, एक छिपा हुआ अंतर 0.71 अंक का प्रकट करती है जिसे सर्वे पूरी तरह से मिस कर देते हैं।

रोबोट का स्कोरकार्ड: कुछ चीजों में अच्छा, कुछ में कमजोर

शोधकर्ताओं ने परीक्षण किया कि क्या रोबोट द्वारा अनुभव का विवरण ग्राहकों द्वारा अपने बारे में कही गई बातों से मेल खाता है।

  • विजेता: रोबोट कुल (Overall) भावना, एजेंट के प्रदर्शन, और परिणाम (Outcome) (क्या समस्या हल हो गई?) का अनुमान लगाने में काफी अच्छा था। ये ग्राहकों की अपनी रेटिंग के साथ लगभग 0.65 का सहसंबंध (correlation) रखते हैं। यदि आप केवल उन मामलों को देखते हैं जहाँ रोबलेट और ग्राहक करीब से सहमत थे, तो यह संख्या बढ़कर 0.811 हो जाती है, और यदि आप कुछ अजीब आउटलेर्स को छोड़ देते हैं, तो यह 0.914 तक पहुँच जाती है।
  • हारने वाला: रोबोट उत्पाद (Product) की संतुष्टि का अनुमान लगाने में संघर्ष करता है। वह चैट पढ़कर यह नहीं बता सका कि ग्राहक को नींबू पानी पसंद आया या नहीं। पेपर का सुझाव है कि यह जरूरी नहीं कि रोबोट बुरा है, बल्कि इसलिए है क्योंकि चेक करने के लिए उपयोग किए गए सर्वे प्रश्न बहुत "शोरभरे" (noisy) थे (जैसे यह पूछना कि क्या वे इसे फिर से खरीदेंगे, जो कीमत और आदत पर निर्भर करता है, न कि केवल चैट पर)। इसलिए, उत्पाद का स्कोर अभी भी एक "शायद" है और इसके और परीक्षण की आवश्यकता है।
  • प्रयास का मोड़: रोबोट ने मापा कि ग्राहक को कितना "प्रयास" करना पड़ा। यह स्कोर तब कम हो गया जब संतुष्टि बढ़ी (एक सहसंबंध -0.54), जो समझ में आता है: आप जितनी अधिक मेहनत करेंगे, आप उतने ही कम खुश होंगे।

"जादुई ट्रिक" जो काम नहीं आई (लेकिन वह ठीक है)

शोधकर्ताओं ने एक पेचीदा सवाल पूछा: "यदि हम सभी पाँच सामग्रियों (एजेंट + परिणाम + उत्पाद + प्रयास) को जोड़ दें, तो क्या हम केवल रोबोट से 'कुल' स्कोर मांगकर बेहतर तरीके से ग्राहक की अंतिम स्टार रेटिंग का अनुमान लगा सकते हैं?"

जवाब है नहीं।
पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि चीजों को तोड़ने से आप अंतिम स्कोर का बेहतर अनुमान लगा सकते हैं। पाँचों सामग्रियाँ एक-दूसरे के बहुत समान हैं (वे एक साथ चलती हैं), इसलिए उन्हें जोड़ने से आपको कोई नई जानकारी नहीं मिलती है। यह मौसम का अनुमान लगाने के लिए तापमान, आर्द्रता और हवा की गति को अलग-अलग मापने और फिर उन्हें जोड़ने जैसा है—इससे आपको आसमान को देखने से अधिक जानकारी नहीं मिलती।

तो, ब्रेकडाउन का क्या मतलब है?
मूल्य संख्या का अनुमान लगाने में नहीं है; बल्कि कहानी को समझने में है।

  • "मिश्रित" (Blended) जाल: एक एकल स्टार रेटिंग सच्चाई को छुपा देती है। आपको 4-स्टार रेटिंग मिल सकती है क्योंकि एजेंट अद्भुत था (5 स्टार), भले ही उत्पाद् बहुत खराब (1 स्टार) रहा हो।
  • "जनगणना" (Census) की शक्ति: क्योंकि रोबोट हर बातचीत को पढ़ता है, वह इन छिपे हुए पैटर्न को पकड़ सकता है। उसने पाया कि लगभग 4.8% मामलों में, एजेंट शानदार था लेकिन उत्पाद खराब था। एक एकल सर्वे रेटिंग केवल "4 स्टार" कहती, यह तथ्य छुपा लेती कि असली समस्या उत्पाद है। ब्रेकडाउन एक एक्स-रे की तरह काम करता है, जो दिखाता है कि अनुभव कहाँ टूटा है, न कि केवल यह कि वह टूटा हुआ है।

रोबोट और ग्राहक कभी-कभी असहमत क्यों होते हैं

रोबोट और ग्राहकों के बीच असहमति थी। लगभग 83 विशिष्ट मामलों में, उनके स्कोर दो या अधिक अंकों से अलग थे। पेपर ने केवल इसे खारिज नहीं किया; इसने कारण जानने के लिए हर एक ट्रांसक्रिप्ट को पढ़ा।

  • "विनम्र लेकिन खाली" (Polite but Empty) जाल (ओवरप्रेडिक्शन): कभी-कभी रोबोट ने उच्च स्कोर दिया क्योंकि बातचीत विनम्र और सुचारू रूप से चली, भले ही ग्राहक की वास्तविक समस्या हल नहीं हुई थी। रोबोट ने "तरीका" देखा लेकिन "मिशन" को मिस कर गया।
  • "सहायक हैंडऑफ" (Helpful Handoff) जाल (अंडरप्रेडिक्शन): कभी-कभी रोबोट ने कम स्कोर दिया क्योंकि समस्या चैट में हल नहीं हुई थी। लेकिन ग्राहक ने उच्च रेटिंग दी क्योंकि एजेंट इतना मददगार था कि उसने उन्हें किसी इंसान या केस नंबर पर भेज दिया। ग्राहक प्रक्रिया से खुश था, लेकिन रोबलेट अनसुलझे परिणाम को स्कोर कर रहा था।

पेपर का सुझाव है कि यदि रोबोट को "कार्य पूर्णता" (task completion - क्या विशिष्ट काम पूरा हुआ?) को देखने के लिए सिखाया जाए, तो वह अधिकांश त्रुटियों को ठीक कर सकता है। असहमति यादृच्छिक शोर (random noise) नहीं है; यह एक मानचित्र है कि रोबोट को आगे क्या सीखने की आवश्यकता है।

निचोड़ (Bottom Line)

यह पेपर यह दावा नहीं करता कि इसने सब कुछ हल कर लिया है। यह स्वीकार करता है कि रोबोट का परीक्षण केवल "खुश" ग्राहकों पर किया गया था जिन्होंने रेटिंग छोड़ी थी, इसलिए हम 100% निश्चित नहीं हैं कि यह बहुत नाखुश ग्राहकों पर कैसा प्रदर्शन करता है। यह यह भी स्वीकार करता है कि "उत्पाद" स्कोर अस्थिर है।

हालाँकि, मुख्य निष्कर्ष ठोस है: सर्वेक्षण चूक (omission) के माध्यम से झूठ बोलते हैं। वे केवल संतुष्ट कुछ लोगों को सुनते हैं। हर एक बातचीत को पढ़ने के लिए AI का उपयोग करके, हम अंततः पूरी तस्वीर देख सकते हैं, जो हमारी सोच से कहीं अधिक कम सुखद है। असली शक्ति स्टार रेटिंग का सटीक अनुमान लगाने में नहीं है; बल्कि यह समझने में है कि लोग क्यों नाखुश हैं, जिससे कंपनियों को केवल अपने सेवा के अनुमान लगाने के बजाय विशिष्ट टूटे हुए हिस्सों को ठीक करने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →