← नवीनतम पेपर
💬 NLP

The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text

यह शोध पत्र यह प्रदर्शित करता है कि जबकि प्रॉम्प्ट अनुकूलन (prompt customization) सर्वेक्षण पाठ से प्रशंसक अनुभव रेटिंग की भविष्यवाणी करने में एलएलएम (LLM) की सटीकता में मामूली सुधार कर सकता है, लेकिन प्रदर्शन की मौलिक सीमा मॉडल चयन या व्यापक इंजीनियरिंग के बजाय इनपुट की अंतर्निहित भाषाई सामग्री और लिखित फीडबैक एवं वास्तविक निर्णयों के बीच के अंतर द्वारा निर्धारित होती है।

मूल लेखक: Andrew Hong, Jason Potteiger, Luis E. Zapata

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Hong, Jason Potteiger, Luis E. Zapata

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेसबॉल टीम हैं जो यह समझने की कोशिश कर रही हैं कि आपके प्रशंसकों ने खेल को कितना पसंद किया। आप उनसे दो सवाल पूछते हैं:

  1. संख्या: "0 से 10 के पैमाने पर, खेल कैसा था?" (यह निर्णय है)।
  2. कहानी: "क्या हुआ, हमें बताएं।" (यह प्रमाण है)।

आमतौर पर, ये दोनों आपस में मेल खाते हैं। यदि कोई कहता है "यह अद्भुत था!" और 10 अंक देता है, तो यह आसान है। लेकिन कभी-कभी, एक प्रशंसक लंबी लाइनों और खराब पार्किंग की शिकायतों से भरी कहानी लिखता है, फिर भी 9 या 10 अंक देता है। क्यों? क्योंकि उन्होंने जीत की भावना को पसंद किया, भले ही लॉजिस्टिक्स कष्टप्रद रहे हों।

यह शोध पत्र एक AI (एक लार्ज लैंग्वेज मॉडल, या LLM) को उन कहानियों को पढ़ने और यह अनुमान लगाने के लिए सिखाने के बारे में है कि प्रशंसक ने कौन सी संख्या दी होगी। शोधकर्ता जानना चाहते थे: AI कितना अच्छा हो सकता है, और इसे पूर्ण होने से क्या रोकता है?

यहाँ उनके निष्कर्षों का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए।

1. "सीलिंग" (छत) की उपमा

मुख्य विचार यह है कि AI की सटीकता पर एक सीलिंग (छत) होती है। आप एक ऐसे कैनवास से बेहतर चित्र नहीं बना सकते जिसकी सीमा ही वह हो।

  • कैनवास (टेक्स्ट): प्रशंसक की कहानी।
  • पेंटर (AI): कंप्यूटर मॉडल।
  • सीलिंग (छत): सटीकता की सीमा।

शोधकर्ताओं ने पाया कि टेक्स्ट (पाठ) स्वयं सबसे बड़ा कारक है। यदि प्रशंसक एक स्पष्ट, सुखद कहानी लिखता है, तो AI बहुत अच्छा काम करता है (90%+ सटीक)। यदि प्रशंसक एक उलझी हुई कहानी लिखता है जिसमें मिली-जुली भावनाएं हैं (जीत से खुश, लेकिन हॉट डॉग से नाराज), तो AI संघर्ष करता है। AI को कितना भी "ट्वीक" (सुधारने) करने से यह ठीक नहीं होगा क्योंकि गायब जानकारी (कि प्रशंसक वास्तव में जीत के लिए कितना आभारी था बनाम हॉट डॉग के लिए) टेक्स्ट में नहीं है। यह प्रशंसक के दिमाग में है।

2. सीलिंग के दो भाग

शोध पत्र इस सीलिंग को दो अलग-अलग प्रकार की ईंटों वाली दीवार की तरह दो भागों में विभाजित करता है:

ईंट A: "गायब जानकारी" की दीवार (संज्ञानात्मक अंतर/Cognitive Gap)

  • यह क्या है: इंसान अजीब होते हैं। हम उबाऊ चीजों (लाइन में इंतजार करना) की तुलना में चरम क्षणों (होम रन) और अंत (अंतिम जयकार) को अधिक याद रखते हैं। हम उबाऊ चीजों को इसलिए लिखते हैं क्योंकि उन्हें वर्णित करना आसान है, लेकिन हम उच्च स्कोर इसलिए देते हैं क्योंकि हमें वह 'महसूस' होता है।
  • क्या AI इसे ठीक कर सकता है? नहीं। AI केवल टेक्स्ट देखता है। उसके पास प्रशंसक की भावनाएं नहीं हैं। वह "लंबी लाइनें" देखता है और सोचता है "खराब अनुभव।" वह यह नहीं जान सकता कि प्रशंसक ने सोचा होगा, "लाइनें लंबी थीं, लेकिन खेल इसके लायक था।"
  • उपमा: यह किसी व्यक्ति की किराने की सूची पढ़कर उसके मूड का अनुमान लगाने जैसा है। यदि उन्होंने आइसक्रीम और मूवी टिकट खरीदा है, तो आप अनुमान लगा सकते हैं कि वे खुश हैं। लेकिन यदि उन्होंने भारी कोट और थर्मामीटर भी खरीदा है, तो आप अनुमान लगा सकते हैं कि वे बीमार हैं। आपको यह नहीं पता कि वे "घर पर एक बीमार दिन" बिता रहे हैं या "एक आरामदायक मूवी नाइट"। सूची (टेक्स्ट) आपको पूरी कहानी नहीं बताती।

ईंट B: "बुरी आदत" की दीवार (मापन पूर्वाग्रह/Measurement Bias)

  • यह क्या है: AI मॉडल इंटरनेट से लाखों समीक्षाओं पर प्रशिक्षित होते हैं। वे एक बुरी आदत सीख लेते हैं: "नकारात्मक शब्द = कम स्कोर।" यदि कोई प्रशंसक कहता है "पार्किंग भयानक थी," तो AI स्वचालित रूप से सोचता है, "ओह, उन्हें पूरे खेल से नफरत होगी," और कम स्कोर दे देता है।
  • क्या AI इसे ठीक कर सकता है? हाँ। यह एक बुरी आदत है जिसे AI थोड़ी कोचिंग के साथ अनलर्न (unlearn) कर सकता है।
  • समाधान: शोधकर्ताओं ने एक विशेष "प्रॉम्प्ट" (निर्देशों का एक सेट) लिखा जिसने AI को निर्देश दिया: "हे, बस नकारात्मक शब्दों को गिनना बंद करो। बड़ी तस्वीर देखो। यदि वे 'शानदार खेल' कहते हैं लेकिन 'लंबी लाइनों' का उल्लेख करते हैं, तो उन्हें बहुत अधिक दंड न दें।"
  • परिणाम: इस "कोचिंग" ने AI की सटीकता में लगभग 2% का सुधार किया। इसने सीलिंग को नहीं तोड़ा, लेकिन इसने AI को उस दीवार पर थोड़ा ऊपर चढ़ने में मदद की जिसे वह छू सकता था।

3. "मॉडल स्वैप" प्रयोग

शोधकर्ताओं ने AI के दिमाग को बदलने की कोशिश की। उन्होंने एक सुपर-स्मार्ट AI, एक छोटा AI और एक नया AI इस्तेमाल किया।

  • परिणाम: इससे ज्यादा फर्क नहीं पड़ा। सुपर-स्मार्ट AI बहुत बेहतर नहीं हुआ, और छोटा AI बहुत खराब हो गया।
  • सबक: आप खराब सड़क को ठीक करने के लिए केवल अधिक महंगी कार नहीं खरीद सकते। यदि "सड़क" (प्रशंसक का टेक्स्ट) भ्रमित करने वाली है, तो स्मार्ट से स्मार्ट AI भी रास्ता भटक जाएगा। इंजन (मॉडल) से ज्यादा निर्देश (प्रॉम्प्ट) मायने रखते हैं।

4. टीमों को वास्तव में क्या करना चाहिए?

चूंकि AI पूर्ण नहीं हो सकता, इसलिए टीमें इसका उपयोग कैसे करें?

  • इसे प्रतिस्थापन के रूप में न देखें: अपने सर्वेक्षण नंबरों को फेंककर केवल AI के अनुमान पर भरोसा न करें। वे अलग-अलग चीजें मापते हैं।
  • इसे "रेड फ्लैग" डिटेक्टर के रूप में उपयोग करें: AI वास्तव में दो विशिष्ट समूहों के प्रशंसकों को पहचानने में बहुत अच्छा है:
    1. "नाजुक प्रशंसक" (Fragile Fans): वे लोग जिन्होंने उच्च स्कोर (9 या 10) दिया लेकिन एक ऐसी कहानी लिखी जो शिकायतों से भरी है। AI उन्हें कम स्कोर दे सकता है, जो एक संकेत है: "हे, यह प्रशंसक खुश है, लेकिन वह परेशान है। इससे पहले कि वे चले जाएं, लाइनों को ठीक करें!"
    2. "मौन आलोचक" (Silent Critics): वे लोग जिन्होंने कम स्कोर दिया लेकिन एक अच्छी कहानी लिखी।
  • "कॉन्फिडेंस" मीटर पर भरोसा करें: AI आपको बता सकता है कि वह कितना आश्वस्त है। यदि AI कहता है, "मुझे 90% यकीन है कि यह 9 है," तो उस पर भरोसा करें। यदि वह कहता है, "मुझे केवल 50% यकीन है," तो उसे इंसानों द्वारा पढ़े जाने वाले ढेर में डाल दें।

सारांश

शोध पत्र निष्कर्ष निकालता है कि आप मानव मनोविज्ञान के माध्यम से इंजीनियरिंग करके बाहर नहीं निकल सकते।

  • टेक्स्ट (पाठ) ही सीमा है। यदि कहानी भ्रमित करने वाली है, तो अनुमान गलत होगा।
  • प्रॉम्प्ट एक उपकरण है। यह AI को मूर्खतापूर्ण गलतियाँ करने (जैसे नकारात्मक शब्दों के लिए अत्यधिक दंड देना) से बचने में मदद करता है, लेकिन यह मन नहीं पढ़ सकता।
  • मूल्य (Value) सटीक संख्या प्राप्त करने में नहीं है; बल्कि उन प्रशंसकों को पहचानने में है जिनके शब्द और संख्या मेल नहीं खाते। वे ही प्रशंसक हैं जिन्हें आपके ध्यान की सबसे अधिक आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →