Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
यह शोध पत्र OPT* प्रस्तुत करता है, जो अनुकूलन-शैली (optimization-style) के कार्यों का एक स्केलेबल परिवार है जिसमें विस्तृत खोज स्थान (expanding search spaces) शामिल हैं, जो सॉल्वर-निर्देशित ऑनलाइन पॉलिसी ऑप्टिमाइज़ेशन और सर्च-आधारित ऑफलाइन रीइन्फोर्समेंट लर्निंग, दोनों के माध्यम से LLMs को स्टेप-बाय-स्टेप ऑप्टिमाइज़ेशन-जैसे तर्क पर प्रशिक्षित करने और उनका मूल्यांकन करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े नादान रोबोट शेफ को एक जटिल, बहु-कोर्स भोजन बनाना सिखा रहे हैं।
समस्या: "ठीक-ठाक है" का जाल (The "Good Enough" Trap)
अभी, ये AI शेफ (लार्ज लैंग्वेज मॉडल्स) उन रेसिपीज़ को मानने में बहुत अच्छे हैं जहाँ केवल एक ही सही उत्तर होता है, जैसे कि गणित का कोई समीकरण हल करना या कोड का कोई स्निपेट लिखना जो कंपाइल हो जाए। यदि वे अंतिम उत्तर सही पाते हैं, तो उन्हें एक गोल्ड स्टार मिल जाता है।
लेकिन वास्तविक जीवन ऐसा नहीं है। वास्तविक जीवन एक डिलीवरी रूट की योजना बनाने जैसा है जिसमें 50 ट्रकों को रूट देना है, 20 अलग-अलग शिफ्टों के लिए 20 कर्मचारियों को काम पर लगाना है, या एक मूविंग ट्रक को पैक करना है। इन परिदृश्यों में, केवल एक ही सही उत्तर नहीं होता; हजारों तरीके ऐसे होते हैं जो "वैध" (valid) हैं (कुछ टूटता नहीं है, हर किसी को काम मिल जाता है), लेकिन केवल कुछ ही तरीके "शानदार" (great) होते हैं (सबसे छोटा रास्ता, उच्चतम संतुष्टि, सबसे कम खाली जगह)।
यह पेपर तर्क देता है कि वर्तमान AI यहाँ संघर्ष करता है। वह एक वैध योजना तो बना सकता है, लेकिन वह एक "ठीक-ठाक" योजना पर अटक जाता है और एक "परफेक्ट" योजना को मिस कर देता है क्योंकि उसे यह नहीं पता कि आगे कैसे देखना है या बुरे विचारों को जल्दी कैसे हटाना है।
समाधान: OPT⋆ (अनंत खेल का मैदान - The Infinite Playground)
लेखकों ने एक नया प्रशिक्षण मैदान बनाया है जिसे OPT⋆ कहा जाता है। इसे एक वीडियो गेम लेवल जनरेटर के रूप में सोचें जो बिना किसी मानव डिजाइनर के नए लेवल बनाए, गेम को कठिन से कठिन बनाता जा सकता है।
- खेल: वे क्लासिक ऑप्टिमाइज़ेशन पहेलियों का उपयोग करते हैं (जैसे ट्रैवलिंग सेल्समैन प्रॉब्लम, जहाँ आप सबसे छोटे रास्ते में शहरों की यात्रा करते हैं, या बैकपैक में चीजें पैक करना)।
- चीट शीट: इस गेम में दो अंतर्निहित उपकरण हैं:
- नियम जांचकर्ता (The Rule Checker): तुरंत बताता है कि कोई चाल अवैध है (जैसे, "आप उस नाजुक चीज़ के ऊपर वह भारी बॉक्स नहीं रख सकते")।
- स्कोरकीपर (The Scorekeeper): तुरंत बताता है कि अंतिम परिणाम कितना अच्छा है (जैसे, "आपके रूट ने 10 मिनट बचाए")।
- कठिनाई का डायल (The Difficulty Dial): आप एक डायल (जिसे कहा जाता है) को घुमाकर अधिक शहर, अधिक कर्मचारी या अधिक आइटम जोड़ सकते हैं। यह संभावित रास्तों की संख्या को तेजी से (exponentially) बढ़ा देता है, लेकिन नियम और स्कोरिंग सरल और स्वचालित रहते हैं। इसमें होमवर्क चेक करने के लिए किसी इंसान की जरूरत नहीं है।
हमने AI को कैसे सिखाया: दो विधियाँ
पेपर में AI को इन विशाल, फैलते हुए भूलभुलैयाओं में नेविगेट करने के लिए दो तरीकों का परीक्षण किया गया है:
1. "ऑफलाइन" विधि: खजाने की खोज (The Treasure Hunt)
कल्पना कीजिए कि AI को एक अंधेरी गुफा (सर्च स्पेस) में एक टॉर्च के साथ छोड़ दिया गया है। उसके पास कोई नक्शा नहीं है।
- रणनीति: AI इधर-उधर घूमता है, अलग-अलग रास्तों को आजमाता है। जब उसे एक रास्ता मिलता है जो खजाने (एक उच्च स्कोर) की ओर ले जाता है, तो वह उस रास्ते को याद रखता है।
- चाल (The Trick): पेपर में खोज को कुशल बनाने के लिए दो "स्मार्ट फिल्टर" पेश किए गए हैं:
- बाउंसर (Feasibility Check): यदि AI दीवार के माध्यम से चलने की कोशिश करता है (एक अवैध चाल), तो बाउंसर उसे तुरंत रोक देता है। वह उस डेड एंड (dead end) को खोजने में समय बर्बाद नहीं करता।
- जुड़वा डिटेक्टर (Deduction/Deduplication): कभी-कभी AI अंग्रेजी में "Go North" कहता है, फ्रेंच में "Head Up" कहता है, और स्पेनिश में "Move Up" कहता है। ये सभी एक ही चाल हैं। ट्विन डिटेक्टर पहचान लेता है कि ये एक ही एक्शन हैं और केवल एक को रखता है, जिससे AI एक ही विचार पर दोबारा ऊर्जा बर्बाद करने से बच जाता है।
- परिणाम: AI मृत अंतों (dead ends) को अनदेखा करना और डुप्लिकेट विचारों को हटाना सीख जाता है, जिससे वह खजाना बहुत तेजी से ढूंढ पाता है।
2. "ऑनलाइन" विधि: क्रिस्टल बॉल वाला कोच (The Coach with a Crystal Ball)
इस परिदृश्य में, AI के पास एक कोच है जो भविष्य देख सकता है (एक सॉल्वर)।
- रणनीति: AI एक चाल चलता है। कोच उस चाल को देखता है और तुरंत गणना करता है: "यदि आप यह कदम उठाते हैं, तो यहाँ से आप जो सबसे अच्छा कर सकते हैं, वह स्कोर 90 है।"
- इनाम: खेल के अंत तक स्कोर मिलने का इंतजार करने के बजाय, AI को हर एक कदम पर तत्काल फीडबैक मिलता है। यदि कोई कदम कम क्षमता वाले स्कोर की ओर ले जाता है, तो कोच कहता है, "बुरी चाल!" यदि वह उच्च क्षमता की ओर ले जाता है, तो कोच कहता है, "अच्छी चाल!"
- परिणाम: AI हर कदम पर बेहतर निर्णय लेना सीखता है, न कि केवल एक अच्छे अंत की उम्मीद करता है।
उन्होंने क्या पाया
- "ब्रांचिंग" की बाधा (The "Branching" Bottleneck): जैसे-जैसे गेम कठिन होता जाता है (अधिक शहर/आइटम), रास्तों की संख्या इतनी तेजी से बढ़ती है कि सामान्य खोज एक आकाशगंगा के आकार के घास के ढेर में सुई खोजने जैसी हो जाती है। पेपर गणितीय रूप से सिद्ध करता है कि सफल होने के लिए, AI को केवल अधिक प्रयास करने के बजाय बुरे रास्तों को छानने में अधिक स्मार्ट होना चाहिए।
- फिल्टर काम करते हैं: "बाउंसर" और "ट्विन डिटेक्टर" (ऑफलाइन विधियों) ने खोज को काफी कुशल बनाया। AI ने बिना किसी मानव शिक्षक के, सामान्य खोज की तुलना में बहुत तेजी से उच्च-गुणवत्ता वाले समाधान खोजे।
- कोच सबसे अच्छा है (लेकिन महंगा है): कोच (सॉल्वर) के साथ "ऑनलाइन" विधि ने सबसे स्मार्ट AI बनाया, लेकिन इसके लिए एक शक्तिशाली कंप्यूटर की आवश्यकता होती है जो कोच के रूप में कार्य करे। "ऑफलाइन" विधि एक बेहतरीन बैकअप है जब आपके पास हाथ में सुपरकंप्यूटर न हो।
- सामान्यीकरण (Generalization): जब उन्हें इन ऑप्टिमाइज़ेशन पहेलियों पर प्रशिक्षित किया गया, तो वे वास्तव में अन्य स्थानिक कार्यों (जैसे आकृतियों को घुमाना या ग्रिड को कवर करना) में बेहतर हो गए और यहाँ तक कि उनके गणितीय तर्क में भी सुधार हुआ। ऐसा लगता है कि AI ने एक सामान्य "योजना बनाने का कौशल" सीखा है, न कि केवल एक विशिष्ट पहेली को हल करना।
संक्षेप में
यह पेपर AI को जटिल योजना बनाने में बेहतर बनाने के लिए ऐसे खेलों का उपयोग करके प्रशिक्षित करने का एक तरीका पेश करता है जो स्वचालित रूप से अनंत रूप से कठिन हो सकते हैं। AI को अवैध चालों को जल्दी पहचानने और एक ही विचार को दोहराने से बचने के लिए सिखाकर, हम इसे विशाल और जटिल समस्याओं में सर्वोत्तम समाधान खोजने में मदद कर सकते हैं, वह भी बिना किसी मानव शिक्षक की निगरानी के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।