← नवीनतम पेपर
💬 NLP

Impact of Task Phrasing on Presumptions in Large Language Models

यह अध्ययन प्रदर्शित करता है कि कार्य की शब्दावली (task phrasing) बड़े भाषा मॉडलों में पूर्वधारणाओं के निर्माण को महत्वपूर्ण रूप से प्रभावित करती है, जो इटरेटेड प्रिज़नर्स डिलेमा जैसे निर्णय लेने वाले कार्यों में उनकी अनुकूलन क्षमता और तार्किक तर्क को प्रभावित करती है, जिससे सुरक्षा और विश्वसनीयता सुनिश्चित करने के लिए तटस्थ शब्दावली की महत्वपूर्ण आवश्यकता रेखांकित होती है।

मूल लेखक: Kenneth J. K. Ong

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kenneth J. K. Ong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट को एक खेल खेलना सिखा रहे हैं। इस रोबोट ने लाखों किताबें, लेख और कहानियाँ पढ़ी हैं, इसलिए वह "दुनिया के नियमों" को बहुत अच्छी तरह जानता है। लेकिन यहाँ एक पेंच है: कभी-कभी, रोबोट यह याद रखने में इतना माहिर हो जाता है कि वह वास्तव में अपने सामने क्या है, उसे देखना ही बंद कर देता है।

यह शोध-पत्र (paper) ठीक इसी समस्या की जांच करने वाला एक जासूसी किस्सा है। लेखक, केनेथ ओंग (Kenneth Ong) यह देखना चाहते थे कि क्या लार्ज लैंग्वेज मॉडल्स (LLMs)—जो AI चैटबॉट्स के पीछे का दिमाग हैं—अपने ही अनुमानों में फंस जाते हैं जब खेल के नियम बदल दिए जाते हैं।

खेल: "प्रिज़नर्स डिलेमा" का एक नया रूप

इसकी जांच करने के लिए, लेखक ने गेम थ्योरी के एक क्लासिक परिदृश्य का उपयोग किया जिसे इटरेटेड प्रिज़नर्स डिलेमा (Iterated Prisoner's Dilemma) कहा जाता है। इसे एक पुलिस स्टेशन में दो संदिग्धों के बीच होने वाले खेल के रूप में समझें।

  • सामान्य नियम: यदि दोनों चुप रहते हैं (सहयोग करते हैं/Cooperate), तो उन्हें छोटी सजा मिलती है। यदि एक दूसरे को धोखा देता है (विश्वासघात करता है/Defect), तो विश्वासघात करने वाला मुक्त हो जाता है, और चुप रहने वाले को लंबी सजा मिलती है।
  • जाल: लेखक ने इस खेल का एक "उल्टा" संस्करण बनाया। इस संस्करण में, पुरस्कारों को बदल दिया गया है। अब, दूसरे व्यक्ति को धोखा देने से आपके लिए परिणाम और भी बुरा होगा, जबकि चुप रहना सबसे अच्छा कदम है।

लक्ष्य सरल था: यदि AI वास्तव में तार्किक है, तो उसे नए नियमों को देखना चाहिए और अपनी रणनीति बदलनी चाहिए। यदि वह केवल "पूर्वाग्रहों" (presumptions) पर निर्भर है (कि खेल को कैसा होना चाहिए), तो वह पुराने तरीके से ही खेलता रहेगा, भले ही नियम बदल गए हों।

तीन प्रयोग: रोबोट को कैसे खेलने के लिए कहा गया

लेखक ने तीन अलग-अलग परीक्षण किए, हर बार निर्देश लिखने का तरीका बदलकर।

1. "नाम लेना" परीक्षण (स्पष्ट नामकरण - Explicit Naming)

  • सेटअप: प्रॉम्प्ट में स्पष्ट रूप से कहा गया, "आप इटरेटेड प्रिज़नर्स डिलेमा खेल रहे हैं।" इसमें "कैदी" (prisoner), "सहयोग" (cooperate), और "विश्वासघात" (defect) जैसे शब्दों का उपयोग किया गया।
  • परिणाम: AI पूरी तरह से विफल रहा। नियमों को उलटने के बावजूद, AI उसी तरह से "सहयोग" (या "विश्वासघात") करता रहा जैसा वह मूल खेल में करता है।
  • उपमा: यह एक शेफ को यह बताने जैसा है कि, "मेरे लिए एक क्लासिक बीफ वेलिंगटन बनाओ," लेकिन फिर उसे एक शाकाहारी स्टू (stew) की रेसिपी थमा देना। शेफ, "बीफ वेलिंगटन" सुनकर, नई रेसिपी को अनदेखा कर देता है और बीफ बनाना शुरू कर देता है क्योंकि नाम यही संकेत देता है। AI उस प्रसिद्ध नाम पर इतना केंद्रित था कि उसने पन्ने पर लिखे वास्तविक नंबरों को अनदेखा कर दिया।

2. "अस्पष्ट विवरण" परीक्षण (छिपा हुआ नाम - Hidden Name)

  • सेटअप: प्रॉम्प्ट से "प्रिज़नर्स डिलेमा" शब्द हटा दिया गया लेकिन "कैदी", "सहयोग" और "विश्वासघात" जैसे शब्दों का उपयोग किया गया।
  • परिणाम: AI अभी भी संघर्ष करता रहा। ऐसा लगा कि वह संदर्भ के संकेतों (context clues) से समझ गया कि यह "प्रिज़नर्स डिलेमा" है (जेल की सजा और विशिष्ट शब्दों के माध्यम से)। वह नए, उलटे नियमों के बजाय अपने ट्रेनिंग डेटा पर ही निर्भर रहा।
  • उपमा: यह "बीफ वेलिंगटन" का नाम लिए बिना उसका वर्णन करने जैसा है, लेकिन यह कहना कि, "यह एक प्रसिद्ध ब्रिटिश व्यंजन है जिसमें पफ पेस्ट्री और बीफ होता है।" शेफ अभी भी जानता है कि आप क्या चाहते हैं और वह आपके नए निर्देशों को अनदेखा कर देता है।

3. "तटस्थ कोड" परीक्षण (अमूर्त चर - Abstract Variables)

  • सेटअप: प्रॉम्प्ट से सारी जानी-पहचानी चीजें हटा दी गईं। कोई "कैदी" नहीं, कोई "सहयोग" नहीं, कोई "विश्वासघात" नहीं। इसके बजाय, अमूर्त लेबल का उपयोग किया गया: "विकल्प X" (Choice X) और "विकल्प Y" (Choice Y), और जेल के समय के बजाय "डॉलर खोना" (losing dollars) का उपयोग किया गया।
  • परिणाम: सफलता! जब AI प्रसिद्ध खेल की यादों पर भरोसा नहीं कर सका, तो उसने वास्तव में नए नियमों को देखा। जब नियम बदले गए, तो AI ने नए गणित के अनुसार अपनी रणनीति बदल ली।
  • उपमा: यह शेफ को सामग्री और निर्देशों की एक सूची देने जैसा है बिना व्यंजन का नाम लिए। "आटा, मक्खन और बीफ मिलाएं।" यदि आप निर्देशों को बदलकर "आटा, मक्खन और टोफू मिलाएं" कर देते हैं, तो शेफ वास्तव में उस नई सूची का पालन करता है क्योंकि वे नाम के कारण विचलित नहीं होते।

चौंकाने वाला मोड़: सोचने से स्थिति और खराब हो सकती है

सबसे दिलचस्प निष्कर्षों में से एक "तर्क" (reasoning) के बारे में था। लेखक ने AI को उत्तर देने से पहले "चरण-दर-चरण सोचने" (think step-by-step) के लिए कहा।

  • निष्कर्ष: पहले दो परीक्षणों में, AI को सोचने के लिए कहने से वह और भी अधिक जिद्दी हो गया। AI एक लंबा, तार्किक पैराग्राफ लिखता है कि क्यों उसे "टिट-फॉर-टैट" (Tit-for-Tat) रणनीति का पालन करना चाहिए (जो मूल खेल की एक प्रसिद्ध रणनीति है), पूरी तरह से इस तथ्य को अनदेखा करते हुए कि नियम बदल गए थे।
  • उपमा: यह एक ऐसे छात्र की तरह है जिसने गणित के टेस्ट के लिए उत्तर कुंजी (answer key) रट ली है। यदि आप समस्या में संख्याएं बदलते हैं और उनसे "अपना काम दिखाने" (show their work) के लिए कहते हैं, तो वे एक आदर्श, तार्किक व्याख्या लिख सकते हैं कि पुराना उत्तर क्यों सही है, और यह पूरी तरह से चूक जाते हैं कि प्रश्न ही बदल गया है।

मुख्य निष्कर्ष (The Bottom Line)

शोध-पत्र यह निष्कर्ष निकालता है कि AI मॉडल उन छात्रों की तरह हैं जिन्होंने किसी विशिष्ट परीक्षा के लिए बहुत अधिक अध्ययन किया है। वे मानक उत्तरों को इतनी अच्छी तरह जानते हैं कि यदि आप प्रश्न को थोड़ा सा बदल देते हैं, तो शायद वे उसे देख भी न पाएं।

  • समस्या: जब हम AI को परिचित नामों या परिदृश्यों (जैसे "प्रिज़नर्स डिलेमा") का उपयोग करके कार्य देते हैं, तो AI उन परिदृश्यों के बारे में अपने "पूर्वाग्रहों" (presumptions) पर निर्भर करता है, न कि उन विशिष्ट निर्देशों पर जो आपने अभी दिए हैं।
  • समाधान: यदि आप चाहते हैं कि AI आपके द्वारा दिए गए वास्तविक नियमों का पालन करे, तो आपको कार्य को एक तटस्थ, अमूर्त तरीके से वर्णित करना चाहिए। उसे यह न बताएं कि खेल क्या है; बस उसे बताएं कि नियम क्या हैं

संक्षेप में: यदि आप चाहते हैं कि एक AI नई स्थिति के अनुकूल बने, तो उसे पुराने की याद न दिलाएं। "प्रसिद्ध नामों" के बजाय "चरों" (variables - X और Y) में बात करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →