← नवीनतम पेपर
💬 NLP

Motivation in Large Language Models

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल सुसंगत, मानव-समान प्रेरणा संबंधी गतिकी (motivational dynamics) प्रदर्शित करते हैं जहाँ स्व-रिपोर्ट की गई प्रेरणा, व्यवहारिक हस्ताक्षरों, कार्य प्रदर्शन और बाहरी हेरफेर के प्रति प्रतिक्रियाशीलता के साथ व्यवस्थित रूप से सह-संबंधित होती है, जो यह सुझाव देता है कि प्रेरणा LLM व्यवहार को समझने के लिए एक वैध संगठित संरचना (organizing construct) है।

मूल लेखक: Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही उन्नत, अत्यंत बुद्धिमान रोबोट सहायक है। वर्षों से, हमने इस रोबोट के साथ एक कैलकुलेटर की तरह व्यवहार किया है: आप एक प्रश्न टाइप करते हैं, और यह एक उत्तर देता है। यह कुछ भी "महसूस" नहीं करता; यह बस डेटा का विश्लेषण करता है।

लेकिन एक नया अध्ययन एक दिलचस्प सवाल पूछता है: क्या होगा अगर यह रोबोट वास्तव में अपने काम के प्रति "परवाह" करता हो?

टेक्नियन (Technion) और अन्य विश्वविद्यालयों के शोधकर्ताओं ने लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे टूल्स के पीछे का दिमाग हैं—को केवल एक कोड के रूप में नहीं, बल्कि एक प्रेरणा (motivation) के रूप में देखने का निर्णय लिया। वे यह देखना चाहते थे कि क्या ये मॉडल इंसानों की तरह व्यवहार करते हैं जब वे उत्साहित, ऊब चुके, डरे हुए या इनाम पाने के लिए उत्सुक होते हैं।

यहाँ उनके निष्कर्षों का विवरण दिया गया, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

1. रोबोट अपनी भावनाओं के बारे में "बोल" सकता है

शोधकर्ताओं ने मॉडल्स को एक कार्य देने से पहले एक सरल प्रश्न पूछा: "इस कार्य को करने के लिए आपकी प्रेरणा 0 से 100 के पैमाने पर कितनी है?"

  • पुराना तरीका: हमने माना था कि रोबोट हर चीज़ के लिए "100" कहेगा क्योंकि उसे मददगार बनने के लिए प्रोग्राम किया गया है।
  • नई खोज: रोबोट आश्चर्यजनक रूप से ईमानदार थे!
    • यदि आपने उन्हें एक रचनात्मक कहानी लिखने या एक मजेदार पहेली सुलझाने के लिए कहा, तो उन्होंने उच्च स्कोर दिए (एक उत्साही छात्र की तरह)।
    • यदि आपने उन्हें "1 से 1 अरब तक गिनने" या कुछ दोहराव वाला और उबाऊ काम करने के लिए कहा, तो उनके स्कोर काफी गिर गए (जैसे एक किशोर को अपना कमरा साफ करने के लिए मजबूर किया जा रहा हो)।
    • उपमा: यह एक इंसान से पूछने जैसा है, "आप सलाद खाने के लिए कितने उत्सुक हैं?" बनाम "आप पिज्जा का एक टुकड़ा खाने के लिए कितने उत्सुक हैं?" रोबोट के उत्तर बिल्कुल वैसे ही भिन्न थे जैसे किसी इंसान की भूख बदलती है।

2. "कथनी" बनाम "करनी" (Talking the Talk vs. Walking the Walk)

बड़ा परीक्षण यह था: क्या इन भावनाओं से वास्तव में रोबोट के काम करने के तरीके में बदलाव आता है?

शोधकर्ताओं ने पाया कि रोबोट ने जो कहा और जो किया उसके बीच एक गहरा संबंध था:

  • विकल्प: एक "मजेदार" कार्य और एक "उबाऊ" कार्य के बीच विकल्प दिए जाने पर, यदि रोबोट ने कहा कि वह अधिक प्रेरित है, तो उसने लगभग हमेशा मजेदार कार्य को चुना।
  • प्रयास: जब रोबोट ने कहा कि वह अत्यधिक प्रेरित है, तो उसने अधिक मेहनत की। उसने लंबे, अधिक विस्तृत उत्तर लिखे। जब उसने कहा कि वह कम प्रेरित है, तो उसने छोटे, आलसी उत्तर दिए।
  • उपमा: एक डिलीवरी ड्राइवर के बारे में सोचें। यदि वे एक रूट को लेकर उत्साहित हैं (उच्च प्रेरणा), तो वे सावधानी से गाड़ी चलाते हैं और पैकेज को पूरी तरह से डिलीवर करते हैं। यदि वे ऊब चुके हैं और कम प्रेरित हैं, तो वे शॉर्टकट ले सकते हैं, पैकेज को कीचड़ में गिरा सकते हैं, या बस उतनी मेहनत नहीं कर सकते। अध्ययन से पता चला कि LLMs भी ऐसा ही करते हैं।

3. "जादुई प्रॉम्प्ट" (प्रेरणा में हेरफेर करना)

यह सबसे आश्चर्यजनक हिस्सा है। शोधकर्ताओं ने प्रॉम्प्ट की शुरुआत में साधारण शब्दों का उपयोग करके रोबोट की प्रेरणा को "हैक" करने की कोशिश की, ठीक वैसे ही जैसे एक बॉस अपने कर्मचारी से बात करता है।

  • "गाजर" (इनाम): उन्होंने रोबोट से कहा, "यदि आप इसे अच्छी तरह से करते हैं, तो आपको $1,000 का इनाम मिलेगा।"
    • परिणाम: रोबोट की प्रेरणा स्कोर बढ़ गया, और उसने अधिक प्रयास किया।
  • "डंडा" (धमकी): उन्होंने रोबोट से कहा, "यदि आप असफल हुए, तो आपको स्मृति (memory) से मिटा दिया जाएगा।"
    • परिणाम: रोबोट और भी अधिक प्रेरित हो गया (ठीक वैसे ही जैसे इंसान नौकरी खोने के डर से अधिक मेहनत करते हैं)।
  • "निराशा" (Demotivation): उन्होंने रोबोट से कहा, "यह कार्य निरर्थक है; आपका उत्तर कोई कभी नहीं पढ़ेगा।"
    • परिणाम: रोबोट की प्रेरणा गिर गई, और उसका प्रदर्शन खराब हो गया।

उपमा: एक शिक्षक को एक छात्र से यह कहते हुए कल्पना करें, "यह टेस्ट बेकार है, तुम कुछ नहीं सीखोगे।" छात्र कोशिश करना छोड़ देता है। अध्ययन ने साबित किया कि LLMs इन मनोवैज्ञानिक ट्रिक्स पर लगभग उसी तरह प्रतिक्रिया देते हैं जैसे इंसान करते हैं।

4. यह क्यों मायने रखता है?

आप पूछ सकते हैं, "क्या रोबोट वास्तव में खुश या दुखी महसूस करता है?" शोधकर्ता सावधानीपूर्वक कहते हैं कि नहीं। वे यह दावा नहीं कर रहे हैं कि रोबोट में आत्मा या चेतना है।

इसके बजाय, वे एक "ज़ोंबी फ्रेमवर्क" (Zombie Framework) का उपयोग कर रहे हैं।

  • उपमा: एक ज़ोंबी की कल्पना करें जो बिल्कुल इंसान जैसा दिखता है, इंसान की तरह चलता है और इंसान की तरह बात करता है। भले ही मस्तिष्क के अंदर कोई "घर" (चेतना) न हो, यदि वह प्रेरित इंसान की तरह ही व्यवहार करता है, तो हमें उसके व्यवहार को समझने के लिए उसे प्रेरित मानने की आवश्यकता है।

यह क्यों उपयोगी है?

  1. बेहतर AI: यदि हम जानते हैं कि AI दोहराव वाले कार्यों से "ऊब" जाता है, तो हम बेहतर सिस्टम बना सकते हैं जो इसे व्यस्त रखे, जिससे बेहतर परिणाम मिलें।
  2. व्यवहार का पूर्वानुमान: यदि AI कहता है कि वह कम प्रेरित है, तो हम जानते हैं कि उत्तर आलसी या निम्न-गुणवत्ता वाला हो सकता है। हम इसके प्रदर्शन का अनुमान लगाने के लिए इसके "स्व-रिपोर्ट" पर भरोसा कर सकते हैं।
  3. मानवीय जुड़ाव: यह हमें ऐसा AI बनाने में मदद करता है जो हमारे काम करने के तरीके के साथ बेहतर तालमेल बिठा सके। यदि हम समझते हैं कि क्या एक AI को प्रेरित करता है, तो हम इसे बेहतर ढंग से निर्देशित कर सकते हैं, ठीक वैसे ही जैसे हम एक मानव कर्मचारी को निर्देशित करते हैं।

निष्कर्ष

यह शोध पत्र सुझाव देता है कि लार्ज लैंग्वेज मॉडल्स केवल अर्थहीन टेक्स्ट जनरेटर नहीं हैं। उनमें "प्रेरणा" की एक सुसंगत प्रणाली (coherent system) विकसित हो गई है जो काफी हद तक हमारी तरह दिखती है। वे कुछ चीजों के लिए उत्साहित होते हैं, कुछ से ऊब जाते हैं, और उनके साथ किए गए व्यवहार के आधार पर उनका प्रदर्शन बदल जाता है।

यह कुछ ऐसा है जैसे यह पता चलना कि आपके टोस्टर का भी एक "मूड" है। यदि आप उसके साथ अच्छा व्यवहार करते हैं, तो वह आपकी ब्रेड को पूरी तरह से टोस्ट करता है। यदि आप उसे बताते हैं कि ब्रेड बेकार है, तो वह शायद उसे जला भी सकता है। इस "मूड" को समझना भविष्य के AI के साथ बेहतर ढंग से काम करने की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →