← नवीनतम पेपर
🤖 AI

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

यह शोध पत्र GENSTRAT प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) की रणनीतिक तर्क क्षमता का मूल्यांकन करने के लिए प्रक्रियात्मक रूप से उत्पन्न रणनीतिक वातावरण और एक बहु-अक्षीय क्षमता प्रोफ़ाइल का उपयोग करने वाला एक ढांचा है, जो यह प्रकट करता है कि समान समग्र प्रदर्शन वाले मॉडल विशिष्ट तैनाती-प्रासंगिक परिदृश्यों में विशिष्ट शक्तियों और अप्रत्याशित व्यवहारिक अस्थिरता को प्रदर्शित कर सकते हैं।

मूल लेखक: Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-दांव वाले कैसीनो को चलाने के लिए विशेषज्ञ पोकर खिलाड़ियों की एक टीम को काम पर रख रहे हैं। आप जानना चाहते हैं कि सबसे अच्छा कौन है।

पुराना तरीका: "फिक्स्ड मेनू" की समस्या
पारंपरिक रूप से, इन खिलाड़ियों का परीक्षण करने के लिए, आप उन्हें पांच प्रसिद्ध पोकर खेलों (जैसे "टेक्सस होल्डम" या "कुह्न पोकर") का एक निश्चित मेनू देंगे। आप उन्हें खेलते हुए देखेंगे, जीत का हिसाब लगाएंगे और उन्हें रैंक करेंगे।

समस्या क्या है?

  1. उन्होंने मेनू रट लिया था: यदि खिलाड़ियों ने परीक्षण से पहले उन सटीक पांच खेलों का अध्ययन किया था, तो वे वास्तविक कौशल नहीं दिखा रहे हैं; वे केवल उन उत्तरों को दोहरा रहे हैं जिन्हें वे पहले से जानते हैं।
  2. मेनू बहुत छोटा है: सिर्फ इसलिए कि कोई व्यक्ति उन पांच विशिष्ट खेलों में बहुत अच्छा है, इसका मतलब यह नहीं है कि वह उन जटिल, अजीब और अप्रत्याशित खेलों को संभाल सकता है जो वास्तव में एक वास्तविक कैसीनो में सामने आ सकते हैं।

नया तरीका: GENSTRAT (द "इनफिनिट स्लॉट मशीन")
इस शोध पत्र के लेखकों ने एक नया परीक्षण मैदान बनाया जिसे GENSTRAT कहा जाता है। एक निश्चित मेनू के बजाय, उन्होंने एक "गेम जनरेटर" बनाया—एक स्लॉट मशीन की तरह जो कभी भी नए, अद्वितीय पोकर खेल बनाना बंद नहीं करती।

  • मांग पर ताज़ा खेल: जब भी वे किसी मॉडल का परीक्षण करना चाहते हैं, मशीन घूमती है और अलग-अलग नियमों, कार्ड डेक और बेटिंग चरणों के साथ एक बिल्कुल नया खेल बनाती है। कोई भी मॉडल उत्तर याद नहीं कर सकता क्योंकि प्रश्न हमेशा बदलते रहते हैं।
  • "छह-आयामी" रिपोर्ट कार्ड: एक एकल स्कोर (जैसे "90/100") देने के बजाय, GENSTRAT कठिनाई के छह विशिष्ट "अक्षों" (axes) पर एक विस्तृत प्रोफ़ाइल देता है:
    1. स्टेट स्पेस (State Space): कितनी अलग-अलग स्थितियाँ हो सकती हैं? (क्या खेल सरल है या अराजक?)
    2. टेम्पोरल डेप्थ (Temporal Depth): क्या शुरुआती चालों का बाद में महत्व होता है? (क्या आपको 10 कदम आगे की योजना बनाने की आवश्यकता है, या केवल अगले कार्ड पर प्रतिक्रिया देने की?)
    3. इंफॉर्मेशन सेंसिटिविटी (Information Sensitivity): क्या अपने गुप्त हाथ (hand) को जानने से आपकी रणनीति बदल जाती है?
    4. अपोनेंट मॉडलिंग (Opponent Modeling): क्या आपको यह अनुमान लगाने की आवश्यकता है कि दूसरा खिलाड़ी क्या सोच रहा है?
    5. रिस्क (Risk): क्या यह एक सुरक्षित खेल है, या आपको बड़े इनाम के लिए बड़ा जुआ खेलना पड़ता है?
    6. ब्रिटलनेस (Brittleness): क्या खेल "नाजुक" है? यदि आप एक छोटी सी गलती करते हैं, तो क्या आप सब कुछ खो देते हैं?

टूर्नामेंट: 36,000 हाथों का मुकाबला
शोधकर्ताओं ने दुनिया के 9 सबसे स्मार्ट AI मॉडलों को 3 6,000 मैचों में एक-दूसरे के खिलाफ खड़ा किया। यहाँ उन्हें क्या पता चला:

  • "औसत" विजेता: नए, बड़े मॉडल आम तौर पर औसतन अधिक चिप्स जीतते हैं।
  • "स्पेशलिस्ट" बनाम "जनरलिस्ट": दो मॉडलों का कुल स्कोर समान हो सकता है, लेकिन उनकी "प्रोफ़ाइल" पूरी तरह से अलग दिख सकती है।
    • उदाहरण: एक मॉडल (Claude) "ब्रिटल" खेलों (जहाँ सटीकता मायने रखती है) में अद्भुत था लेकिन अन्य क्षेत्रों में औसत था। दूसरा मॉडल (Gemini) लगभग सभी श्रेणियों में मजबूत था।
    • उपमा: यह दो धावकों की तरह है जिनका कुल दौड़ का समय समान है, लेकिन एक स्प्रिंटर है जो सीधे ट्रैक पर उत्कृष्ट है, जबकि दूसरा मैराथन धावक है जो पहाड़ी इलाकों में उत्कृष्ट है। यदि आप केवल कुल समय को देखते हैं, तो आप सूक्ष्मता को मिस कर देते हैं।

"जैग्डनेस" टेस्ट: ऊबड़-खाबड़ सड़क
शोधकर्ताओं ने एक नया विचार पेश किया जिसे जैग्डनेस (Jaggedness) कहा जाता है।

  • कल्पना कीजिए कि आप एक कार चला रहे हैं। एक "स्मूथ" कार सड़क के झटकों को लगातार संभालती है। एक "जैग्ड" कार एक झटके को पूरी तरह से संभालती है, फिर अगले झटके पर बेकाबू हो जाती है, भले ही झटके बिल्कुल एक जैसे हों।
  • शोधकर्ताओं ने पाया कि कुछ शीर्ष-स्तरीय मॉडल "जैग्ड" थे। वे एक विशिष्ट खेल पर अविश्वसनीय रूप से अच्छा प्रदर्शन करते थे, लेकिन फिर ठीक उसके बगल वाले एक बहुत ही समान खेल में आश्चर्यजनक रूप से खराब प्रदर्शन करते थे।
  • यह क्यों मायने रखता है: यदि आप एक "जैग्ड" मॉडल को वास्तविक दुनिया में तैनात करते हैं, तो आप आज शानदार परिणाम प्राप्त कर सकते हैं, लेकिन कल एक थोड़ी अलग स्थिति आपको दुर्घटनाग्रस्त कर सकती है। एक "स्मột" मॉडल अधिक अनुमानित और विश्वसनीय होता है।

"सोचने" का परीक्षण
उन्होंने यह भी जांचा कि AI को "ज़्यादा गहराई से सोचने" (अधिक कंप्यूटिंग पावर का उपयोग करने) के लिए कहने से क्या मदद मिली।

  • अधिकांश मॉडलों के लिए, ज़्यादा सोचने से उन्हें अधिक चिप्स जीतने में मदद मिली।
  • हालाँकि, कुछ मॉडलों के लिए, अतिरिक्त सोचने से सांख्यिकीय रूप से महत्वपूर्ण अंतर नहीं दिखा, जिससे पता चलता है कि या तो वे अपनी सीमा तक पहुँच गए हैं या अतिरिक्त प्रयास का कुशलतापूर्वक उपयोग नहीं किया जा रहा है।

निष्कर्ष
यह शोध पत्र तर्क देता है कि केवल AI मॉडलों को इस आधार पर रैंक करना कि "किसने सबसे अधिक जीता" खतरनाक है। यह समझने के लिए कि एक AI वास्तविक दुनिया में कैसे व्यवहार करेगा, आपको यह जानना आवश्यक है कि:

  1. वह किस प्रकार की समस्याओं में अच्छा है (उसकी क्षमता प्रोफ़ाइल)।
  2. स्थिति थोड़ी बदलने पर वह कितना सुसंगत (consistent) है (उसकी जैग्डनेस)।

GENSTRAT इन विवरणों को देखने का एक तरीका प्रदान करता है, यह सुनिश्चित करता है कि जब हम AI को वास्तविक दुनिया के बाजारों या नीलामियों में डालते हैं, तो हम केवल उस मॉडल को नहीं चुन रहे होते हैं जिसका स्कोर सबसे अधिक है, बल्कि उसे चुन रहे होते हैं जो विशिष्ट कार्य के लिए वास्तव में विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →