← नवीनतम पेपर
💬 NLP

Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domains

यह शोध पत्र बाइनरी व्याकरणिक निर्णय के स्थान पर ऑर्डिनल-स्केल्ड वर्गीकरण कार्यों का उपयोग करते हुए, सूचना-सैद्धांतिक सरप्राइज़ल वक्रों (surprisal curves) और एंट्रॉपी के माध्यम से विविध डोमेन में मॉडल की प्राथमिकताओं और अनिश्चितता का आकलन करने के लिए, महंगे टेक्स्ट जनरेशन पर निर्भर रहे बिना, भाषा मॉडलों के मूल्यांकन हेतु मिनिमल पेयर्स प्रतिमान (minimal pairs paradigm) का विस्तार करता है।

मूल लेखक: Andrew Katz

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Katz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक बहुत बुद्धिमान, लेकिन थोड़ी रहस्यमयी, रोबोट क्या सोच रही है। आपके पास इसे करने के दो तरीके हैं:

  1. "पूछो और प्रतीक्षा करो" विधि (The "Ask and Wait" Method): आप रोबोट से एक सवाल पूछते हैं, और वह एक लंबा, विस्तृत उत्तर लिख देती है। फिर आप उत्तर को पढ़ते हैं कि क्या वह सही है।
  2. "आश्चर्य मीटर" विधि (The "Surprise Meter" Method): आप रोबोट को बोलने के लिए नहीं कहते। इसके बजाय, आप उसे एक ऐसा वाक्य दिखाते हैं जो अंत से ठीक पहले रुक जाता है, और आप चुपचाप यह देखते हैं कि अगर आप खाली स्थान को अलग-अलग शब्दों से भर देते, तो रोबोट कितना "आश्चर्यचकित" होता।

यह पेपर इस दूसरी विधि (सरप्राइज मीटर) को अपग्रेड करने के बारे में है ताकि इसे AI के परीक्षण के लिए एक बहुत अधिक शक्तिशाली उपकरण बनाया जा सके।

पुराना तरीका: बाइनरी स्विच (The Old Way: The Binary Switch)

पहले, शोधकर्ता एक "मिनिमल पेयर्स" (Minimal Pairs) टेस्ट का उपयोग करते थे। यह एक साधारण ऑन/ऑफ स्विच की तरह था।

  • परिदृश्य: आप AI को दिखाते हैं: "The cat sat on the ___."
  • विकल्प A: "mat" (व्याकरणिक रूप से सही)
  • विकल्प B: "matte" (व्याकरणिक रूप से अजीब)
  • परीक्षण: AI "mat" के लिए कम आश्चर्यचकित होता है और "matte" के लिए अधिक आश्चर्यचकित होता है। यदि "mat" के लिए आश्चर्य का स्तर कम है, तो AI पास हो जाता है।

समस्या: यह केवल सरल "हाँ/नहीं" या "सही/गलत" वाले सवालों के लिए काम करता है। यह एक कमरे के तापमान को उस स्विच से मापने की कोशिश करने जैसा है जो केवल "गर्म" या "ठंडा" बताता है। यह बीच के सभी सूक्ष्म अंतरों को छोड़ देता है। इसके अलावा, AI को उत्तर लिखने के लिए कहना धीमा, महंगा है, और AI केवल अच्छा दिखने के लिए एक फैंसी-सा दिखने वाला कारण बना सकता है (जिसे "पोस्ट-हॉक रेशनलाइजेशन" कहा जाता है)।

नया तरीका: ऑर्डिनल सरप्राइज़ल कर्व (The New Way: The Ordinal Surprisal Curve)

लेखक, एंड्रयू काट्ज़ (Andrew Katz), सुझाव देते हैं कि हमें एक साधारण स्विच के बजाय एक स्लाइडर या डायल का उपयोग करना चाहिए।

यह पूछने के बजाय कि "क्या यह वाक्य सत्य है या असत्य?", हम AI से इसे 1 से 5 (या 1 से 9) के पैमाने पर रेट करने के लिए कहते हैं।

  • सेटअप: हम AI को उत्तर लिखने नहीं देते। हम बस इसे प्रश्न देते हैं और पैमाने के हर संभावित नंबर (1, 2, 3, 4, और 5) के लिए इसके "आश्चर्य के स्तर" की जांच करते हैं।
  • परिणाम: हमें एक सरप्राइज़ल कर्व (Surprisal Curve) प्राप्त होता है।
    • यदि AI आत्मविश्वासी है, तो कर्व एक तीखे स्पाइक (नुकीले शिखर) जैसा दिखता है। यह 1, 2, 4, और 5 के लिए बहुत आश्चर्यचकित है, लेकिन 3 के लिए बिल्कुल भी आश्चर्यचकित नहीं है। वह जानता है कि उत्तर 3 है।
    • यदि AI भ्रमित है, तो कर्व एक सपाट पहाड़ी जैसा दिखता है। वह सभी नंबरों के लिए समान रूप से आश्चर्यचकित है। उसे नहीं पता कि क्या सोचना है।

जादुई तत्व: एंट्रॉपी (The "Magic Ingredient: Entropy" - भ्रम का मीटर)
पेपर में एक अवधारणा पेश की गई है जिसे एंट्रॉपी (Entropy) कहते हैं। इसे एक "कन्फ्यूजन मीटर" (भ्रम का मीटर) के रूप में सोचें।

  • कम एंट्रॉपी (तीखा स्पाइक): AI अपने निर्णय को लेकर आश्वस्त है। यह एक ऐसे जासूस की तरह है जो 100% निश्चित है कि बटलर ने ही हत्या की है।
  • उच्च एंट्रॉपी (सपाट पहाड़ी): AI वास्तव में अनिश्चित है। यह एक ऐसे जासूस की तरह है जो बिना किसी सुराग के अपराध स्थल को देख रहा है।

यह बहुत बड़ी बात है क्योंकि यह हमें यह बताने में सक्षम बनाता है कि क्या AI गलत लेकिन आत्मविश्वासी है (गलत उत्तर पर एक तीखा स्पाइक) या AI उचित रूप से भ्रमित है (एक सपाट पहाड़ी)।

हमने इसका परीक्षण कहाँ किया?

लेखक ने इस "सरप्राइज मीटर" का चार बहुत अलग प्रकार के कार्यों पर परीक्षण किया, जिससे यह सिद्ध हुआ कि यह केवल व्याकरण तक सीमित नहीं है:

  1. "यह क्या है?" खेल (The "What is this?" Game - SETS):

    • कार्य: क्या "spring" एक प्राकृतिक चीज़ (पारिस्थितिक) है या मशीन का हिस्सा (तकनीकी)?
    • परिणाम: AI अंतर बता सका। यदि आपने कहा "The spring in the pen," तो AI "प्राकृतिक" के लिए बहुत आश्चर्यचकित था और "मशीन" के लिए बिल्कुल नहीं। यदि आपने कहा "The spring in the garden," तो यह बदल गया। AI मॉडल जितना बड़ा था, वह उतना ही बेहतर था।
  2. "कारण और प्रभाव" का जासूस (The "Cause and Effect" Detective):

    • कार्य: क्या "Smoking causes cancer" एक वास्तविक कारण व्यक्त करता है? क्या "Ice cream sales go up when it's hot" के साथ ऐसा है? (यह केवल एक सहसंबंध है, कारण नहीं)।
    • परिणाम: AI ने स्मोकिंग के लिए एक स्पष्ट "हाँ" दिया और आइसक्रीम के लिए एक सपाट, भ्रमित "शायद" दिया। यह दिखाता है कि AI समझता है कि किसी चीज़ का कारण होना और केवल साथ में होना क्या होता है।
  3. "रूपक" (Metaphor) पहचानने वाला:

    • कार्य: क्या "The words hung in the air" शाब्दिक (literal) है या लाक्षणिक (figurative)?
    • परिणाम: AI जानता था कि शाब्दिक संस्करण (लटकते हुए बैनर) के लिए, उत्तर "गैर-लाक्षणिक" था। लाक्षणिक संस्करण (वस्तु के रूप में शब्द) के लिए, यह "बहुत लाक्षणिक" था। वह अंतर समझ सका भले ही शब्द लगभग एक जैसे थे।
  4. "सर्वे कोडर" (The "Survey Coder"):

    • कार्य: महामारी के बारे में लोगों के खुले-अंत वाले सर्वे उत्तरों को पढ़ना और उन्हें विषयों (जैसे, "काम/जीवन का संतुलन") के साथ टैग करना।
    • परिणाम: AI एक विशिष्ट उत्तर के साथ एक विषय कितनी अच्छी तरह फिट बैठता है, इसका स्कोर दे सकता था। यदि फिट स्पष्ट था, तो कर्व स्पाइक हुआ। यदि उत्तर अस्पष्ट था, तो कर्व सपाट हो गया, जो मानव शोधकर्ता को बताता था, "हे, मैं इस बारे में अनिश्चित हूँ, आपको इसकी दोबारा जांच करनी चाहिए।"

आपको इससे क्यों फर्क पड़ना चाहिए?

यह पेपर AI का परीक्षण करने का एक तेज़, सस्ता और अधिक ईमानदार तरीका प्रदान करता है।

  • बात करने की आवश्यकता नहीं: AI को एक पैराग्राफ लिखने में समय बर्बाद करने की आवश्यकता नहीं है। हम बस उसकी आंतरिक "अंतरात्मा की आवाज़" (संभावना/probability) की जांच करते हैं।
  • ईमानदारी की जाँच: यह AI को झूठ बोलने (bluffing) से रोकता है। यदि AI भ्रमित है, तो "कन्फ्यूजन मीटर" (एंट्रॉपी) बढ़ जाएगा, जो हमें चेतावनी देगा कि उत्तर संदिग्ध हो सकता है।
  • सूक्ष्मता (Nuance): यह हमें सरल "सही/गलत" सोच से आगे बढ़कर यह समझने की ओर ले जाता है कि AI कितना आश्वस्त है।

संक्षेप में: AI से भाषण देने के लिए कहने और यह उम्मीद करने के बजाय कि वह सच बोलेगा, यह विधि AI की विभिन्न उत्तरों के प्रति "आंतरिक सहज प्रतिक्रिया" (gut reaction) को सुनती है। यह न केवल यह बताता है कि AI क्या सोचता है, बल्कि यह भी बताता है कि वह उस विचार के बारे में कितना आश्वस्त है। यह मौसम के पूर्वानुमान को केवल "धूप" या "बारिश" के आइकन को देखने के बजाय, मौसम विज्ञानी की संभावनाओं के प्रतिशत को देखने जैसा है ताकि यह देखा जा सके कि क्या वह वास्तव में आत्मविश्वास से भरा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →