Dimensionality in Satisfaction Ratings
यह शोध पत्र यह प्रदर्शित करता है कि ग्राहक संतुष्टि को विशिष्ट अक्षों (जैसे एजेंट का प्रदर्शन और परिणाम) में विभाजित करने के लिए एक लार्ज लैंग्वेज मॉडल का उपयोग करना, पारंपरिक सर्वेक्षण-आधारित मेट्रिक्स की तुलना में ग्राहक अनुभव की अधिक सूक्ष्म और व्यापक समझ प्रदान करता है, जो केवल स्व-चयनित सर्वेक्षण उत्तरदाताओं के बजाय सभी सहायता वार्तालापों का विश्लेषण करने पर काफी कम संतुष्टि स्तरों को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़ा नींबू पानी का स्टॉल चलाते हैं। हर बार जब कोई एक कप खरीदता है, तो आप उनसे पूछते हैं, "कैसा था?" अधिकांश लोग बस चलते जाते हैं, लेकिन कुछ लोग रुककर आपको एक स्टार रेटिंग देते हैं। आप अपना पूरा बिजनेस स्ट्रैटेजी उन कुछ रुकने वाले लोगों की राय पर बना रहे हैं, यह मानकर कि वे सभी का प्रतिनिधित्व करते हैं।
यह पेपर एक जासूसी कहानी की तरह है जहाँ शोधकर्ता एक सुपर-स्मार्ट रोबोट (एक AI जिसे GPT-4.1 कहा जाता है) को ग्राहकों और नींबू पानी के स्टॉल के कर्मचारियों के बीच की वास्तविक बातचीत पढ़ने के लिए लाते हैं। रोबोट केवल एक स्टार रेटिंग का अनुमान नहीं लगाता; वह अनुभव को पाँच विशिष्ट सामग्रियों में तोड़ देता है: कुल (Overall) खुशी, एजेंट (Agent) की दयालुता, परिणाम (Outcome) (क्या उन्हें अपना नींबू पानी मिला?), उत्पाद (Product) की गुणवत्ता (क्या नींबू ताज़ा था?), और प्रयास (Effort) (ग्राहक को कितनी मेहनत करनी पड़ी?)।
यहाँ रोबोट ने क्या पाया, और क्यों यह बदल देता है जो हम ग्राहक की खुशी के बारे में जानते थे।
बड़ी सच्चाई: "मौन बहुमत" (Silent Majority) नाखुश है
सबसे चौंकाने वाली खोज यह है कि जो लोग रेटिंग देने के लिए रुकते हैं, वे सभी का निष्पक्ष नमूना (fair sample) नहीं हैं।
- रेटिंग करने वाली भीड़: वे कुछ लोग जिन्होंने वास्तव में स्टॉल को रेटिंग देने के लिए रोका, उन्होंने 5 में से औसत 3.62 का स्कोर दिया।
- मौन भीड़: जब रोबोट ने सभी लोगों (उन 8,343 लोगों सहित जो बिना रेटिंग दिए चले गए) के ट्रांसक्रिप्ट पढ़े, तो औसत स्कोर केवल 2.91 था।
पेपर का तर्क है कि केवल उन लोगों पर निर्भर रहना जो सर्वे भरते हैं, एक पूरी फिल्म की समीक्षा केवल उन लोगों के रिव्यु से करने जैसा है जिन्होंने उसे पसंद किया है। "मौन बहुमत" वास्तव में सर्वेक्षणों की तुलना में बहुत बुरा समय बिता रहा है। हर बातचीत को पढ़ने की रोबोट की क्षमता, यहाँ तक कि उन बातचीत को भी जिनमें कोई रेटिंग नहीं दी गई, एक छिपा हुआ अंतर 0.71 अंक का प्रकट करती है जिसे सर्वे पूरी तरह से मिस कर देते हैं।
रोबोट का स्कोरकार्ड: कुछ चीजों में अच्छा, कुछ में कमजोर
शोधकर्ताओं ने परीक्षण किया कि क्या रोबोट द्वारा अनुभव का विवरण ग्राहकों द्वारा अपने बारे में कही गई बातों से मेल खाता है।
- विजेता: रोबोट कुल (Overall) भावना, एजेंट के प्रदर्शन, और परिणाम (Outcome) (क्या समस्या हल हो गई?) का अनुमान लगाने में काफी अच्छा था। ये ग्राहकों की अपनी रेटिंग के साथ लगभग 0.65 का सहसंबंध (correlation) रखते हैं। यदि आप केवल उन मामलों को देखते हैं जहाँ रोबलेट और ग्राहक करीब से सहमत थे, तो यह संख्या बढ़कर 0.811 हो जाती है, और यदि आप कुछ अजीब आउटलेर्स को छोड़ देते हैं, तो यह 0.914 तक पहुँच जाती है।
- हारने वाला: रोबोट उत्पाद (Product) की संतुष्टि का अनुमान लगाने में संघर्ष करता है। वह चैट पढ़कर यह नहीं बता सका कि ग्राहक को नींबू पानी पसंद आया या नहीं। पेपर का सुझाव है कि यह जरूरी नहीं कि रोबोट बुरा है, बल्कि इसलिए है क्योंकि चेक करने के लिए उपयोग किए गए सर्वे प्रश्न बहुत "शोरभरे" (noisy) थे (जैसे यह पूछना कि क्या वे इसे फिर से खरीदेंगे, जो कीमत और आदत पर निर्भर करता है, न कि केवल चैट पर)। इसलिए, उत्पाद का स्कोर अभी भी एक "शायद" है और इसके और परीक्षण की आवश्यकता है।
- प्रयास का मोड़: रोबोट ने मापा कि ग्राहक को कितना "प्रयास" करना पड़ा। यह स्कोर तब कम हो गया जब संतुष्टि बढ़ी (एक सहसंबंध -0.54), जो समझ में आता है: आप जितनी अधिक मेहनत करेंगे, आप उतने ही कम खुश होंगे।
"जादुई ट्रिक" जो काम नहीं आई (लेकिन वह ठीक है)
शोधकर्ताओं ने एक पेचीदा सवाल पूछा: "यदि हम सभी पाँच सामग्रियों (एजेंट + परिणाम + उत्पाद + प्रयास) को जोड़ दें, तो क्या हम केवल रोबोट से 'कुल' स्कोर मांगकर बेहतर तरीके से ग्राहक की अंतिम स्टार रेटिंग का अनुमान लगा सकते हैं?"
जवाब है नहीं।
पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि चीजों को तोड़ने से आप अंतिम स्कोर का बेहतर अनुमान लगा सकते हैं। पाँचों सामग्रियाँ एक-दूसरे के बहुत समान हैं (वे एक साथ चलती हैं), इसलिए उन्हें जोड़ने से आपको कोई नई जानकारी नहीं मिलती है। यह मौसम का अनुमान लगाने के लिए तापमान, आर्द्रता और हवा की गति को अलग-अलग मापने और फिर उन्हें जोड़ने जैसा है—इससे आपको आसमान को देखने से अधिक जानकारी नहीं मिलती।
तो, ब्रेकडाउन का क्या मतलब है?
मूल्य संख्या का अनुमान लगाने में नहीं है; बल्कि कहानी को समझने में है।
- "मिश्रित" (Blended) जाल: एक एकल स्टार रेटिंग सच्चाई को छुपा देती है। आपको 4-स्टार रेटिंग मिल सकती है क्योंकि एजेंट अद्भुत था (5 स्टार), भले ही उत्पाद् बहुत खराब (1 स्टार) रहा हो।
- "जनगणना" (Census) की शक्ति: क्योंकि रोबोट हर बातचीत को पढ़ता है, वह इन छिपे हुए पैटर्न को पकड़ सकता है। उसने पाया कि लगभग 4.8% मामलों में, एजेंट शानदार था लेकिन उत्पाद खराब था। एक एकल सर्वे रेटिंग केवल "4 स्टार" कहती, यह तथ्य छुपा लेती कि असली समस्या उत्पाद है। ब्रेकडाउन एक एक्स-रे की तरह काम करता है, जो दिखाता है कि अनुभव कहाँ टूटा है, न कि केवल यह कि वह टूटा हुआ है।
रोबोट और ग्राहक कभी-कभी असहमत क्यों होते हैं
रोबोट और ग्राहकों के बीच असहमति थी। लगभग 83 विशिष्ट मामलों में, उनके स्कोर दो या अधिक अंकों से अलग थे। पेपर ने केवल इसे खारिज नहीं किया; इसने कारण जानने के लिए हर एक ट्रांसक्रिप्ट को पढ़ा।
- "विनम्र लेकिन खाली" (Polite but Empty) जाल (ओवरप्रेडिक्शन): कभी-कभी रोबोट ने उच्च स्कोर दिया क्योंकि बातचीत विनम्र और सुचारू रूप से चली, भले ही ग्राहक की वास्तविक समस्या हल नहीं हुई थी। रोबोट ने "तरीका" देखा लेकिन "मिशन" को मिस कर गया।
- "सहायक हैंडऑफ" (Helpful Handoff) जाल (अंडरप्रेडिक्शन): कभी-कभी रोबोट ने कम स्कोर दिया क्योंकि समस्या चैट में हल नहीं हुई थी। लेकिन ग्राहक ने उच्च रेटिंग दी क्योंकि एजेंट इतना मददगार था कि उसने उन्हें किसी इंसान या केस नंबर पर भेज दिया। ग्राहक प्रक्रिया से खुश था, लेकिन रोबलेट अनसुलझे परिणाम को स्कोर कर रहा था।
पेपर का सुझाव है कि यदि रोबोट को "कार्य पूर्णता" (task completion - क्या विशिष्ट काम पूरा हुआ?) को देखने के लिए सिखाया जाए, तो वह अधिकांश त्रुटियों को ठीक कर सकता है। असहमति यादृच्छिक शोर (random noise) नहीं है; यह एक मानचित्र है कि रोबोट को आगे क्या सीखने की आवश्यकता है।
निचोड़ (Bottom Line)
यह पेपर यह दावा नहीं करता कि इसने सब कुछ हल कर लिया है। यह स्वीकार करता है कि रोबोट का परीक्षण केवल "खुश" ग्राहकों पर किया गया था जिन्होंने रेटिंग छोड़ी थी, इसलिए हम 100% निश्चित नहीं हैं कि यह बहुत नाखुश ग्राहकों पर कैसा प्रदर्शन करता है। यह यह भी स्वीकार करता है कि "उत्पाद" स्कोर अस्थिर है।
हालाँकि, मुख्य निष्कर्ष ठोस है: सर्वेक्षण चूक (omission) के माध्यम से झूठ बोलते हैं। वे केवल संतुष्ट कुछ लोगों को सुनते हैं। हर एक बातचीत को पढ़ने के लिए AI का उपयोग करके, हम अंततः पूरी तस्वीर देख सकते हैं, जो हमारी सोच से कहीं अधिक कम सुखद है। असली शक्ति स्टार रेटिंग का सटीक अनुमान लगाने में नहीं है; बल्कि यह समझने में है कि लोग क्यों नाखुश हैं, जिससे कंपनियों को केवल अपने सेवा के अनुमान लगाने के बजाय विशिष्ट टूटे हुए हिस्सों को ठीक करने की अनुमति मिलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।