Foresight Optimization for Strategic Reasoning in Large Language Models
यह शोध पत्र फॉरसाइट पॉलिसी ऑप्टिमाइज़ेशन (FoPO) को प्रस्तुत करता है, जो मल्टी-एजेंट वातावरण के भीतर लार्ज लैंग्वेज मॉडल्स में रणनीतिक तर्क और निर्णय लेने की क्षमता को बढ़ाने के लिए पॉलिसी ऑप्टिमाइज़ेशन में अपोनेंट मॉडलिंग को एकीकृत करने वाली एक नवीन विधि है, जो विविध मॉडल्स और परिदृश्यों में महत्वपूर्ण प्रदर्शन सुधार और मजबूत सामान्यीकरण प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक दोस्त के साथ शतरंज (Chess) या वेयरवोल्फ (Werewolf) जैसा कोई खेल खेल रहे हैं। जीतने के लिए, आपको केवल अपनी अगली चाल के बारे में ही नहीं सोचना है; आपको यह भी सोचना होगा, "अगर मैं यहाँ अपना नाइट (Knight) चलता हूँ, तो मेरा प्रतिद्वंद्वी इसके जवाब में क्या करेगा? और अगर वे ऐसा करते हैं, तो मुझे आगे क्या करना चाहिए?"
आगे देखने, दूसरों के व्यवहार का अनुमान लगाने और उसके अनुसार अपनी चालें योजनाबद्ध करने की इस क्षमता को रणनीतिक तर्क (Strategic Reasoning) कहा जाता है।
वर्तमान में, लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे टूल्स के पीछे के AI दिमाग हैं—सवाल पूछने और कहानियाँ लिखने में बहुत अच्छे हैं। लेकिन जब बात गेम खेलने या अन्य AI के साथ बातचीत (negotiation) करने की आती है, तो वे अक्सर अल्पदृष्टि वाले खिलाड़ियों (myopic players) की तरह व्यवहार करते हैं: वे केवल अगले तात्कालिक कदम को देखते हैं और यह भूल जाते हैं कि उनके कार्यों से उनके प्रतिद्वंद्वी का व्यवहार कैसे बदल जाएगा। वे "प्रतिक्रियात्मक" (reactive) रूप से खेलते हैं, न कि "रणनीतिक" (strategic) रूप से।
यह शोध पत्र FoPO (Foresight Policy Optimization) नामक एक नई प्रशिक्षण विधि पेश करता है ताकि इसे ठीक किया जा सके। यहाँ इसका विवरण सरल उपमाओं (analogies) के माध्यम से दिया गया है:
1. समस्या: "टनल विजन" वाला खिलाड़ी
एक मानक AI खिलाड़ी को घने कोहरे में चल रहे हाइकर (हाइकर/पैदल यात्री) के रूप में देखें। वे अपने ठीक सामने वाले रास्ते को देख सकते हैं (अपना अगला वाक्य या चाल), लेकिन वे पहाड़ की चोटी या मोड़ पर छिपे जाल को नहीं देख पाते। वे एक कदम उठाते हैं, इनाम पाते हैं, और फिर दूसरा कदम उठाते हैं, बिना यह समझे कि उनका एक कदम दूसरे हाइकर को ऐसी स्थिति में धकेल सकता है जो बाद में उनके लिए हानिकारक हो।
2. समाधान: "चेस ग्रैंडमास्टर" अपग्रेड
शोधकर्ताओं ने FoPO बनाया, जो AI को एक क्रिस्टल बॉल (जादुई दृष्टि) देता है। केवल यह पूछने के बजाय कि, "अभी मेरे लिए सबसे अच्छी चाल क्या है?", FoPO AI को यह पूछने के लिए प्रशिक्षित करता है:
"अगर मैं यह चाल चलता हूँ, तो मेरा प्रतिद्वंद्वी मुझे काउंटर करने के लिए अपनी रणनीति कैसे बदलेगा? और यह जानते हुए कि वे बदलेंगे, बाद में जीतने के लिए मुझे अभी क्या करना चाहिए?"
यह एक शतरंज खिलाड़ी की तरह है जो केवल एक प्यादा काटने के लिए मोहरा नहीं चलता; वह तीन चाल आगे चलकर जाल बिछाने के लिए उसे चलता है, यह जानते हुए कि प्रतिद्वंद्वी की प्रतिक्रिया क्या होगी।
3. उन्होंने इसे कैसे सिखाया: "अभ्यास अरीना" (The Practice Arena)
आप एक ग्रैंडमास्टर को केवल किताब पढ़कर नहीं सिखा सकते; उन्हें हजारों गेम खेलने की आवश्यकता होती है। शोधकर्ताओं ने AI को प्रशिक्षित करने के लिए दो विशिष्ट "अभ्यास अरीना" (डेटासेट्स) बनाए:
सहकारी RSA (Cooperative RSA - "ब्लाइंड डेट" गेम): कल्पना करें कि आप और आपका साथी एक ऐसे कमरे में एक विशिष्ट वस्तु खोजने की कोशिश कर रहे हैं जहाँ बहुत सारी मिलती-जुलती चीजें हैं। आप केवल एक बार में एक विशेषता (feature) के माध्यम से उसका वर्णन कर सकते हैं (जैसे, "यह नीला है")।
- रणनीति: आपको यह अनुमान लगाना होगा कि आपके साथी को सबसे तेज़ी से चीज़ को पहचानने के लिए किस जानकारी की आवश्यकता है। यदि आप कहते हैं "नीला", लेकिन वहाँ 10 नीली चीजें हैं, तो आपने एक टर्न बर्बाद कर दिया। यदि आप कहते हैं "नीला और चिकना", तो आप उन्हें तेज़ी से जीतने में मदद करते हैं।
- सबक: यह AI को यह पूर्वानुमान (anticipate) लगाने में प्रशिक्षित करता है कि दूसरे व्यक्ति को किस जानकारी की आवश्यकता है।
प्रतिस्पर्धी टैबू (Competitive Taboo - "माइंड रीडर" गेम): एक व्यक्ति (Attacker) दूसरे (Defender) को एक गुप्त शब्द (जैसे "Apple") बोले बिना उसे बोलने के लिए trick करने की कोशिश करता है। Defender उस शब्द को बोलने से पहले उसे पहचानने की कोशिश करता है।
- रणनीति: Attacker को सोचना होगा, "अगर मैं फलों के बारे में बात करता हूँ, तो वे 'Apple' समझ सकते हैं। लेकिन अगर मैं लाल चीजों के बारे में बात करता हूँ, तो वे 'Red' समझ सकते हैं। ऐसा क्या है जिससे वे फिसल जाएँ?" Defender को सोचना होगा, "वह फलों के बारे में क्यों बात कर रहा है? क्या वह मुझे बेवकूफ बनाने की कोशिश कर रहा है?"
- सबक: यह AI को हेरफेर (manipulation) का पूर्वानुमान लगाने और उससे बचने में प्रशिक्षित करता है।
4. जादुई सामग्री: "फॉरसाइट करेक्शन" (The Foresight Correction)
मानक AI प्रशिक्षण (जिसे PPO कहा जाता है) में, AI प्रयास और त्रुटि (trial and error) से सीखता है: "मैंने X किया, मुझे इनाम मिला। मैं फिर से X करूँगा।"
FoPO गणित में एक विशेष "करेक्शन टर्म" जोड़ता है। यह एक कोच की तरह है जो प्रशिक्षण के दौरान AI के कान में फुसफुसाता है:
"रुको! अगर तुम X करते हो, तो तुम्हारा प्रतिद्वंद्वी X से नफरत करने लगेगा और Y पर स्विच कर जाएगा। यदि वे Y पर स्विच करते हैं, तो तुम हार जाओगे। इसलिए, केवल X मत करो; इसके बजाय Z करो, जो उन्हें ऐसी स्थिति में रहने के लिए मजबूर करता है जहाँ तुम जीत सको।"
यह AI को यह समझने की अनुमति देता है कि वह किसी स्थिर दीवार के खिलाफ नहीं, बल्कि एक गतिशील प्रतिद्वंद्वी के खिलाफ खेल रहा है जो खुद भी सीख रहा है।
5. परिणाम: नौसिखिए से प्रो तक
शोधकर्ताओं ने परीक्षण के लिए विभिन्न AI मॉडल (जैसे Llama और Qwen) का उपयोग किया।
- FoPO से पहले: AI सरल खेलों में ठीक थे लेकिन जटिल, उतार-चढ़ाव वाली बातचीत में भ्रमित हो जाते थे। वे अक्सर स्पष्ट चालों में फंस जाते थे।
- FoPO के बाद: AI सहयोग (कुशलता से मिलकर काम करना) और प्रतिस्पर्धा (प्रतिद्वंद्वियों को मात देना) दोनों में बहुत बेहतर हो गए।
- सबसे अच्छी बात: यहाँ तक कि जब उन्होंने इन "प्रशिक्षित" AI को नए, अनदेखे खेलों (जैसे किसी अन्य प्रकार की बातचीत) में डाला, तो वे पुराने तरीकों से प्रशिक्षित AI की तुलना में बेहतर प्रदर्शन करते रहे। उन्होंने वास्तव में आगे सोचने का कौशल सीखा था, न कि केवल एक विशिष्ट खेल के नियमों को रटा था।
सारांश
यह शोध पत्र AI को एक प्रतिक्रियाशील रोबोट बनने के बजाय एक रणनीतिक विचारक बनने के लिए सिखाने के बारे में है। उन्हें आगे देखने और यह समझने के लिए प्रशिक्षित करके कि उनके कार्य दूसरों को कैसे प्रभावित करते हैं, शोधकर्ताओं ने ऐसे AI एजेंट बनाए हैं जो अधिक स्मार्ट, अनुकूलन योग्य (adaptable) और भविष्य की जटिल, मल्टी-प्लेयर दुनिया के लिए तैयार हैं।
एक वाक्य में: उन्होंने AI को केवल अगले कदम को देखना बंद करके पूरा खेल खेलना सिखाया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।