← नवीनतम पेपर
💬 NLP

Prompt Stability Scoring for Text Annotation with Large Language Models

यह शोध पत्र प्रॉम्प्ट विविधताओं के कारण लार्ज लैंग्वेज मॉडल टेक्स्ट एनोटेशन की संवेदनशीलता को संबोधित करने के लिए 'प्रॉम्प्ट स्टेबिलिटी स्कोर' (PSS) नामक एक सामान्य ढांचे का प्रस्ताव करता है, जो स्थिरता संबंधी समस्याओं का निदान करने के लिए पारंपरिक विश्वसनीयता मेट्रिक्स को अनुकूलित करता है और व्यावहारिक कार्यान्वयन के लिए एक पायथन पैकेज को शामिल करता है।

मूल लेखक: Christopher Barrie, Elli Palaiologou, Petter Törnberg

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christopher Barrie, Elli Palaiologou, Petter Törnberg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके इस शोध पत्र (paper) की व्याख्या दी गई है।

मुख्य विचार: क्या आपका AI "चंचल" (Fickle) है?

कल्पना कीजिए कि आपने पत्रों के ढेर को "हाँ" और "नहीं" लिफाफों में छाँटने के लिए एक बहुत ही बुद्धिमान, लेकिन थोड़े घबराए हुए सहायक को काम पर रखा है। आप उसे एक विशिष्ट निर्देश देते हैं: "यदि पत्र में पैसे का उल्लेख है, तो उसे 'हाँ' वाले ढेर में रखें।"

आप उनसे यह काम 30 बार करने को कहते हैं।

  • परिदृश्य A: वे हर बार एक ही तरह के पत्रों को एक ही ढेर में रखते हैं।
  • परिदृश्य B: पहली कोशिश में, वे "बचत" (savings) के बारे में एक पत्र को "हाँ" वाले ढेर में रखते हैं। दूसरी कोशिश में, वे उसी पत्र को "नहीं" वाले ढेर में रखते हैं। तीसरी कोशिश में, वे उसे फिर से "हाँ" में रखते हैं।

भले ही वह सहायक आमतौर पर सही हो, लेकिन परिदृश्य B एक समस्या है। इसका मतलब है कि उनके निर्णय लेने की प्रक्रिया अस्थिर है। यदि आप उन्हें बिल्कुल समान निर्देशों के साथ सुसंगत (consistent) रहने के लिए भरोसा नहीं कर सकते, तो आप उन पर तब भी भरोसा नहीं कर सकते जब आप शब्दों को थोड़ा बदल देते हैं (जैसे, "यदि पत्र में नकदी (cash) की बात है...")।

यह शोध पत्र यह देखने के लिए एक परीक्षण (test) बनाने के बारे में है कि आपका AI सहायक काम शुरू करने से पहले स्थिर (Scenario A) है या चंचल (Scenario B)।


समस्या: AI "शब्दों के सलाद" (Word Salad) के प्रति संवेदनशील है

लेखक बताते हैं कि लार्ज लैंग्वेज मॉडल्स (AI) कैलकुलेटर की तरह काम नहीं करते हैं। वे किसी किताब में से एक निश्चित उत्तर नहीं ढूँढते। इसके बजाय, वे एक-एक करके अगले शब्द का अनुमान लगाते हैं, जैसे कोई व्यक्ति वाक्य में अगले शब्द का अनुमान लगा रहा हो।

इस कारण, दो चीजें उनकी निरंतरता (consistency) को बिगाड़ सकती हैं:

  1. "समान प्रॉम्प्ट" की समस्या: भले ही आप दो बार बिल्कुल एक ही निर्देश टाइप करें, AI थोड़ा अलग उत्तर दे सकता है क्योंकि उसके कंप्यूटर मस्तिष्क में कुछ अदृश्य यादृच्छिक कारक (जैसे बैकग्राउंड में सिक्का उछालना) काम कर रहे होते हैं।
  2. "पुनः वाक्यांश (Rephrasing)" की समस्या: यदि आप अपने निर्देशों को थोड़ा सा भी बदल देते हैं—जैसे "इसे छाँटें" (Sort this) के बजाय "इसका वर्गीकरण करें" (Classify this) कहना—तो AI भ्रमित हो सकता है और बिल्कुल अलग उत्तर दे सकता है।

पेपर का तर्क है कि केवल सटीकता (accuracy) पर्याप्त नहीं है। एक AI 90% बार सही उत्तर दे सकता है, लेकिन यदि आपके प्रॉम्प्ट में थोड़ा सा बदलाव करने पर वह हर बार अपना उत्तर बदल देता है, तो आपके शोध के परिणाम अविश्वसनीय हैं।

समाधान: "प्रॉम्प्ट स्टेबिलिटी स्कोर" (PSS)

लेखकों ने एक टूल बनाया है (एक पायथन पैकेज जिसे promptstability कहा जाता है) जो आपके AI निर्देशों के लिए एक स्ट्रेस टेस्ट की तरह काम करता है।

इसे एक पुल (bridge) के परीक्षण जैसा समझें:

  • इंट्रा-प्रॉम्ट स्थिरता (पुनरावृत्ति परीक्षण): आप उसी डेटा पर एक ही निर्देश को 30 बार चलाते हैं। टूल यह जाँचता है: क्या AI ने हर बार एक ही उत्तर दिया? यदि उत्तर ऊपर-नीचे हो रहे हैं, तो पुल कमजोर है।
  • इंटर-प्रॉम्ट स्थिरता (पुनः वाक्यांश परीक्षण): आप अपने निर्देश को लेते हैं और एक अलग AI से इसे 10 अलग-अलग तरीकों से फिर से लिखने को कहते हैं (जैसे, "इनको छाँटें," "इनका वर्गीकरण करें," "इन्हें लेबल करें")। फिर आप उन्हीं 10 संस्करणों को एक ही डेटा पर चलाते हैं। टूल यह जाँचता है: क्या AI अभी भी खुद से सहमत था, भले ही शब्द बदल गए हों?

यह टूल आपको एक स्कोर देता है (जिसे क्रिपेंडोर्फ का अल्फा (Krippendorff's alpha) कहा जाता है, जो केवल "सहमति स्कोर" कहने का एक तकनीकी तरीका है)।

  • उच्च स्कोर (1.0 के करीब): बहुत बढ़िया! आपके निर्देश मजबूत हैं। AI सुसंगत है।
  • कम स्कोर (0.8 से नीचे): चेतावनी! आपके निर्देश बहुत नाजुक हैं। शब्दों में मामूली बदलाव भी सिस्टम को तोड़ देता है।

उन्होंने क्या पाया ("स्ट्रेस टेस्ट" के परिणाम)

शोधकर्ताओं ने छह अलग-अलग वास्तविक दुनिया के डेटासेट्स (जैसे अमेरिकी राजनीतिक ट्वीट्स, यूके पार्टी घोषणापत्र और समाचार लेख) पर इसका परीक्षण किया। यहाँ उनकी खोजें हैं:

  1. सरल कार्य स्थिर होते हैं: जब कार्य आसान था और डेटा स्पष्ट था (जैसे यह पहचानना कि ट्वीट रिपब्लिकन या डेमोक्रेट का था), तो AI बहुत स्थिर था। इससे कोई फर्क नहीं पड़ता था कि आपने प्रॉम्प्ट को कैसे बदला; उसने एक ही उत्तर दिया।
  2. जटिल कार्य नाजुक होते हैं: जब कार्य कठिन या डेटा अव्यवस्थित था (जैसे यह तय करना कि क्या कोई ट्वीट "लोकलुभावन" (populist) भाषा का उपयोग करता है, या सर्वेक्षण उत्तरों को 12 बहुत मिलते-जुलते श्रेणियों में छाँटना), तो AI अस्थिर हो गया। प्रॉम्प्ट में छोटे बदलावों के कारण AI अपने निर्णय बदलने लगा।
  3. "फॉर्मेट" का जाल: कभी-कभी AI वास्तव में भ्रमित नहीं था; वह बस फॉर्मेटिंग नियमों का पालन करना भूल गया था (जैसे नंबर के बजाय पैराग्राफ लिखना)। जब शोधकर्ताओं ने इन "लापरवाह" उत्तरों को हटा दिया, तो स्थिरता स्कोर बढ़ गया। इससे उन्हें पता चला कि कभी-कभी समस्या AI के दिमाग में नहीं, बल्कि सख्त फॉर्मेटिंग नियमों का पालन करने की उसकी अक्षमता में होती है।
  4. मॉडल मायने रखता है: उन्होंने एक शक्तिशाली AI (GPT-4) की तुलना एक छोटे, ओपन-सोर्स मॉडल से की। शक्तिशाली मॉडल बहुत अधिक स्थिर था। इसका मतलब है कि "चंचलता" हमेशा आपकी गलती नहीं होती; कभी-कभी आपको बस एक स्मार्ट AI की आवश्यकता होती है।

"प्लेबुक": आपको क्या करना चाहिए?

यह पेपर शोधकर्ताओं के लिए एक सरल मार्गदर्शिका देता है:

  • चरण 1: स्थिरता परीक्षण चलाएं। अपने परिणामों को मान्य करने में पैसा या समय खर्च करने से पहले, promptstability टूल चलाएं।
  • चरण 2: स्कोर की जाँच करें।
    • यदि स्कोर उच्च है: आप तैयार हैं। आपका पाइपलाइन मजबूत है।
    • यदि स्कोर कम है: रुकिए! अभी अपने परिणामों पर भरोसा न करें।
  • चरण 3: समस्या को ठीक करें।
    • क्या AI फॉर्मेटिंग को अनदेखा कर रहा है? प्रॉम्प्ट को अधिक सख्त बनाकर सुधारें।
    • क्या कार्य बहुत अस्पष्ट है? अपने निर्देशों को अधिक स्पष्ट बनाएं।
    • क्या डेटा बहुत अव्यवस्थित है? शायद यह विशिष्ट कार्य AI द्वारा लगातार संभालने के लिए बहुत कठिन है।
    • क्या AI बहुत कमजोर है? अधिक शक्तिशाली मॉडल का उपयोग करने का प्रयास करें।

निष्कर्ष

आप यह मानकर नहीं चल सकते कि सिर्फ इसलिए कि एक AI ने आपको उत्तर दिया है, वह उत्तर विश्वसनीय है। यह शोध पत्र यह सुनिश्चित करने के लिए एक चेकलिस्ट प्रदान करता है कि आपका AI केवल रैंडम अंदाज़े लगा रहा है या आपके प्रश्न पूछने के तरीके के प्रति बहुत संवेदनशील प्रतिक्रिया दे रहा है।

स्थिरता ही भरोसे की नींव है। यदि आपका AI एक ही सवाल को थोड़े अलग तरीके से पूछने पर खुद से सहमत नहीं हो सकता, तो आप अपने शोध के लिए उसके द्वारा दिए गए परिणामों पर भरोसा नहीं कर सकते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →