← नवीनतम पेपर
💬 NLP

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

यह शोध पत्र CAST का प्रस्ताव करता है, एक ऐसी विधि जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से LLM एजेंटों को प्रशिक्षित करने के लिए गेम सॉल्वर से स्टेट-वैल्यू परिवर्तनों का लाभ उठाकर सघन, टर्न-स्तरीय क्रेडिट सिग्नल उत्पन्न करती है, जो विभिन्न गेम वातावरणों में मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

प्रकाशित 2026-07-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"क्या होगा अगर?" का महान खेल

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत ही उत्साही रोबोट को शतरंज या कोई वीडियो गेम जैसा जटिल बोर्ड गेम खेलना सिखा रहे हैं। उस रोबोट ने पुस्तकालय की हर किताब पढ़ ली है और वह भाषा को लगभग किसी भी अन्य व्यक्ति से बेहतर समझ सकता है, लेकिन उसने वास्तव में कभी वह खेल खेला नहीं है। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है: सुपर-स्मार्ट कंप्यूटर जो चैट कर सकते हैं, लिख सकते हैं और तर्क कर सकते हैं, लेकिन अक्सर उन्हें संघर्ष करना पड़ता है जब उन्हें बदलते परिवेश में एक लक्ष्य तक पहुँचने के लिए निर्णयों की एक श्रृंखला लेनी होती है।

इन रोबोटों को सिखाने के लिए, वैज्ञानिक आमतौर पर रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक विधि का उपयोग करते हैं। इसे एक कुत्ते को प्रशिक्षित करने की तरह समझें। आप कुत्ते को एक आदेश देते हैं, वह कुछ करता है, और यदि वह अंत में सही काम करता है, तो आप उसे एक बड़ा इनाम (ट्रीट) देते हैं। यदि वह विफल रहता है, तो उसे कुछ नहीं मिलता। समस्या यह है कि लंबे, जटिल खेलों में, "इनाम" केवल अंत में मिलता है। यदि रोबोट ने तीन चाल पहले कोई गलती की थी, तो उसे पता नहीं चलता कि कौन सी चाल समस्या थी। वह बस इतना जानता है कि पूरा खेल विफल रहा। इसे "क्रेडिट असाइनमेंट" (credit assignment) समस्या कहा जाता है: यह पता लगाना कि सफलता के लिए किस विशिष्ट कदम को श्रेय दिया जाना चाहिए या विफलता के लिए किसे दोषी ठहराया जाना चाहिए। इसके बिना, रोबोट केवल अनुमान लगाता है, और सीखना अविश्वसनीय रूप से धीमा और निराशाजनक हो जाता है।

"सॉल्वर" शिक्षक: सीखने का एक नया तरीका

यह शोध पत्र CAST (Credit Assignment from Solver Teachers) नामक एक चतुर नई तकनीक पेश करता है ताकि इन AI एजेंटों को तेज़ी से और स्मार्ट तरीके से सीखने में मदद मिल सके। शोधकर्ताओं ने महसूस किया कि जबकि AI खेल को समझने के लिए संघर्ष कर रहा है, वहां पहले से ही एक "परफेक्ट प्लेयर" उपलब्ध है: एक गेम सॉल्वर (game solver)। एक सॉल्वर एक विशेष कंप्यूटर प्रोग्राम है जिसे किसी विशिष्ट खेल को पूरी तरह से हल करने के लिए डिज़ाइन किया गया है, जैसे कि एक गणितीय समीकरण। वह जानता है कि बोर्ड पर किसी भी स्थान से जीतने के लिए कितने कदमों की आवश्यकता है।

लेखकों का बड़ा विचार यह है कि इस परफेक्ट सॉल्वर को एक टर्न-लेवल टीचर (turn-level teacher) के रूप में कार्य करने दें। खेल के खत्म होने तक "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, सॉल्वर AI द्वारा चली गई हर एक चाल के बाद बोर्ड की जांच करता है। वह पूछता है: "क्या इस चाल ने हमें जीतने के करीब पहुँचाया, या हमें जीत से दूर धकेल दिया?"

यहाँ जादू कैसे होता है:

  1. स्कोरकार्ड: सॉल्वर बोर्ड के लिए एक "कॉस्ट-टू-गो" (cost-to-go) नंबर की गणना करता है। यह नंबर जीत तक के शेष चरणों का प्रतिनिधित्व करता है। यदि AI ऐसी चाल चलता है जो इस नंबर को कम करती है (जीत के करीब पहुँचती है), तो सॉल्वर इसे एक सकारात्मक "एडवांटेज" स्कोर देता है। यदि चाल स्थिति को बदतर बनाती है, तो इसे नकारात्मक स्कोर मिलता है।
  2. सिग्नल: शोध पत्र का तर्क है कि यह स्कोर वास्तव में एक गुप्त कोड है। यह पता चलता है कि गणितीय रूप से, AI को इस स्कोर को "अधिकतम (maximize)" करने के लिए कहना, बिल्कुल सॉल्वर के विकल्पों की नकल करने के समान है, लेकिन बिना सॉल्वर को संभावनाओं की एक पूरी सूची लिखने की आवश्यकता के (जो बहुत भारी और धीमा होगा)। यह एक शिक्षक के फुसफुसाने जैसा है, "वह एक अच्छी चाल थी," बजाय इसके कि वह क्यों अच्छी थी, इस पर एक पूरा निबंध लिखे।
  3. फ़िल्टर: कभी-कभी सॉल्वर के स्कोर बहुत अजीब हो सकते हैं—जैसे किसी जाल में फंसने के लिए भारी दंड मिलना। AI को इन चरम संख्याओं से भ्रमित होने से बचाने के लिए, शोधकर्ता एक विशेष गणितीय "कंप्रेसर" (जिसे asinh ट्रांसफॉर्मेशन कहा जाता है) का उपयोग करते हैं जो बड़े उतार-चढ़ाव को सुचारू बनाता है जबकि छोटे, महत्वपूर्ण विवरणों को स्पष्ट रखता है। वे स्कोर को सामान्य (normalize) भी करते हैं ताकि AI संख्याओं के आकार से अभिभूत न हो जाए।

उन्होंने क्या पाया

टीम ने तीन क्लासिक खेलों पर इस नई विधि का परीक्षण किया: सोकोबान (Sokoban) (बक्सों को लक्ष्यों तक धकेलना), माइनस्वीपर (Minesweeper) (बमों से टकराए बिना सुरक्षित वर्ग खोजना), और रश ऑवर (Rush Hour) (रास्ता खाली करने के लिए कारों को खिसकाना)। उन्होंने अपने AI की तुलना अन्य AI मॉडल्स से की जो केवल अंतिम जीत/हार के परिणाम से सीखते हैं।

परिणाम प्रभावशाली थे। "सॉल्वर टीचर" के साथ प्रशिक्षित AI ने काफी तेज़ी से सीखा। कुछ मामलों में, इसने अन्य तरीकों की तुलना में 1.7 से 2.0 गुना कम चरणों में समान स्तर का कौशल प्राप्त कर लिया। अधिक महत्वपूर्ण बात यह है कि यह केवल उन विशिष्ट पहेलियों में बेहतर नहीं हुआ जिनका इसने अभ्यास किया था; यह एक बेहतर सामान्य खिलाड़ी भी बन गया। जब उन्होंने इसे उन खेलों पर परखा जिन्हें इसने पहले कभी नहीं देखा था, या उन्हीं खेलों के बहुत कठिन संस्करणों पर, तो CAST-प्रशिक्षित AI ने लगातार सभी अन्य प्रशिक्षित मॉडलों को पछाड़ दिया और यहाँ तक कि कई शक्तिशाली, पूर्व-निर्मित व्यावसायिक AI मॉडल्स को भी हरा दिया जिन्होंने इन खेलों पर प्रशिक्षण नहीं लिया था।

शोधकर्ताओं ने यह भी जाँच की कि क्या यह "सॉल्वर टीचर" बहुत धीमा या महंगा है। उन्होंने पाया कि बोर्ड की जाँच करने में सॉल्वर द्वारा लिया गया समय बहुत कम था—AI द्वारा खेल में बिताए गए कुल समय का 0.01% से भी कम। यह इतना तेज़ था कि इससे कोई अतिरिक्त काम भी नहीं बढ़ा। यहाँ तक कि जब उन्होंने परफेक्ट सॉल्वर को एक "लर्नड" (learned) AI से बदल दिया जो परफेक्ट नहीं था (लेकिन फिर भी अच्छा था), तब भी यह तरीका अच्छी तरह से काम करता रहा, जिससे पता चलता है कि इस दृष्टिकोण का उपयोग तब भी किया जा सकता है जब एक पूर्ण समाधान मौजूद न हो।

संक्षेप में, यह शोध पत्र सुझाव देता है कि परफेक्ट गेम-सॉल्वर को हर एक कदम के बाद "अच्छी चाल" या "बुरी चाल" फुसफुसाने देने से, हम सामान्य-उद्देश्य वाले AI एजेंटों को बेहतर निर्णय लेने वाला बना सकते हैं, जिससे वे बहुत कम ट्रायल और एरर के साथ जटिल, दीर्घकालिक समस्याओं को हल कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →