← नवीनतम पेपर
🤖 machine learning

Code World Models for Parameter Control in Evolutionary Algorithms

यह शोध पत्र प्रदर्शित करता है कि कोड वर्ल्ड मॉडल्स (Code World Models), जहाँ लार्ज लैंग्वेज मॉडल्स उप-इष्टतम ऑप्टिमाइज़र ट्रैजेक्टरीज से पायथन सिम्युलेटर्स को संश्लेषित करते हैं, चुनौतीपूर्ण कॉम्बिनेटरियल ऑप्टिमाइज़ेशन समस्याओं पर मौजूदा बेसलाइन्स की तुलना में निकट-इष्टतम या श्रेष्ठ प्रदर्शन प्राप्त करने के लिए इवोल्यूशनरी एल्गोरिदम मापदंडों को प्रभावी ढंग से सीख और नियंत्रित कर सकते हैं।

मूल लेखक: Camilo Chacón Sartori, Guillem Rodríguez Corominas

प्रकाशित 2026-02-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Camilo Chacón Sartori, Guillem Rodríguez Corominas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) सुलझाना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आपके पास दो विकल्प होते हैं:

  1. नियम पुस्तिका (The Rulebook): आप रोबोट को दीवार के रंगों के आधार पर बाएं या दाएं मुड़ने के लिए एक सख्त मैनुअल देते हैं।
  2. प्रयास और त्रुटि (The Trial-and-Error): आप रोबोट को हजारों बार दीवारों से टकराने देते हैं, इस उम्मीद में कि वह गलती से पैटर्न सीख जाएगा।

यह शोध पत्र एक तीसरा, अधिक स्मार्ट विकल्प पेश करता है: "ड्रीम सिम्युलेटर" (The "Dream Simulator")।

शोधकर्ताओं ने एक सवाल पूछा: क्या हम एक AI (विशेष रूप से एक लार्ज लैंग्वेज मॉडल, या LLM) को किसी समस्या को हल करने में रोबोट की विफलता को देखने, यह समझने के लिए कि वह क्यों विफल हुआ, और फिर अपनी खुद की "ड्रीम सिम्युलेटर" लिखने के लिए सिखा सकते हैं ताकि वह एक आदर्श रणनीति बना सके?

यहाँ उनके तरीके, "कोड वर्ल्ड मॉडल्स" (CWM) का सरल उपमाओं के साथ विवरण दिया गया है।

1. सेटअप: रोबोट और भूलभुलैया

"रोबोट" एक मानक इवोल्यूशनरी एल्गोरिदम (एक प्रकार का AI जो समाधान विकसित करता है) है। इसका काम गणित की एक समस्या का सबसे अच्छा उत्तर खोजना है।

  • समस्या: रोबोट के पास एक "नॉब" (knob) है जिसे वह घुमा सकता है (जिसे पैरामीटर kk कहा जाता है)। यह नॉब नियंत्रित करता है कि वह अपने समाधान को कितनी तीव्रता से बदलता है।
    • कम घुमाना: यह बहुत छोटे, सुरक्षित बदलाव करता है। बारीक ट्यूनिंग के लिए अच्छा है।
    • ज़्यादा घुमाना: यह बहुत बड़े, अराजक (chaotic) उछाल लेता है। डेड एंड्स (बंद रास्तों) से बाहर निकलने के लिए अच्छा है, लेकिन जोखिम भरा है।
  • चुनौती: रोबोट को यह नहीं पता कि नॉब को कब ऊपर या नीचे घुमाना है। यदि वह इसे गलत दिशा में घुमाता है, तो वह एक "भ्रामक घाटी" (deceptive valley) में फंस जाता है—एक ऐसा जाल जो पहाड़ी के शिखर जैसा दिखता है लेकिन वास्तव में एक गड्ढा है।

2. पुराना तरीका बनाम नया तरीका

  • पुराना तरीका (अनुकूली नियम - Adaptive Rules): पारंपरिक तरीके सरल नियमों का उपयोग करते हैं जैसे, "यदि आप सुधार नहीं कर रहे हैं, तो नॉब को नीचे करें।" यह चिकनी पहाड़ियों पर बहुत अच्छा काम करता है लेकिन भ्रामक घाटियों में बुरी तरह विफल हो जाता है क्योंकि रोबोट नॉब को तब तक नीचे करता रहता है जब तक कि वह हमेशा के लिए फंस न जाए।
  • नया तरीका (कोड वर्ल्ड मॉडल्स - Code World Models):
    1. देखना (Watch): शोधकर्ता रोबोट को रैंडम सेटिंग्स के साथ चलने देते हैं, जिससे कई "विफल" या "उप-इष्टतम" (sub-optimal) प्रयास एकत्र होते हैं।
    2. ओरेकल से पूछना (Ask the Oracle): वे इन विफल प्रयासों को एक सुपर-स्मार्ट AI (LLM) को देते हैं और कहते हैं, "इन गलतियों को देखो। क्या तुम एक पायथन (Python) प्रोग्राम लिख सकते हो जो यह अनुमान लगा सके कि अगर हम नॉब बदलें तो क्या होगा?"
    3. जादू (The Magic): LLM केवल अनुमान नहीं लगाता; वह एक सिम्युलेटर लिखता है। वह कोड का एक टुकड़ा बनाता है जो एक क्रिस्टल बॉल की तरह काम करता है।
    4. योजना (The Plan): वास्तविक दुनिया में कोई कदम उठाने से पहले, रोबोट सिम्युलेटर से पूछता है: "अगर मैं नॉब को 5 पर घुमाता हूँ, तो क्या होगा? अगर मैं इसे 10 पर घुमाता हूँ, तो क्या होगा?" सिम्युलेटर तुरंत जवाब देता है। रोबोट फिर सबसे अच्छा कदम चुनता है।

3. परिणाम: जाल को हराना

शोधकर्ताओं ने चार अलग-अलग प्रकार की "भूलभुलैया" पर इसका परीक्षण किया:

  • चिकनी पहाड़ियाँ (LeadingOnes और OneMax): ये आसान समस्याएं हैं। नया तरीका केवल विफलताओं को देखकर एकदम सही रणनीति सीख गया। इसने लगभग उस प्रदर्शन को प्राप्त किया जो "परफेक्ट" रणनीति के बराबर था, भले ही उसने प्रशिक्षण के दौरान कभी भी उस परफेक्ट रणनीति को नहीं देखा था।
  • भ्रामक घाटी (Jumpk): यह बड़ी जीत है। इस भूलभुलैया में, रोबोट एक गड्ढे में फंस जाता है। पारंपरिक नियम कहते हैं, "आप फंस गए हैं, इसलिए सावधान रहें (नॉब नीचे करें)।" यह 0% सफलता दर की ओर ले जाता है।
    • CWM समाधान: सिम्युलेटर ने महसूस किया, "हे, सावधान रहना यहाँ काम नहीं करेगा। हमें बाहर निकलने के लिए ज़ोर से कूदना (jump) होगा!" इसने जाल से बाहर निकलने के लिए आवश्यक सटीक जंप साइज का पता लगा लिया।
    • परिणाम: जबकि अन्य तरीके 100% बार विफल हुए, इस तरीके ने 100% बार सफलता प्राप्त की।
  • ऊबड़-खाबड़ पर्वत (NK-Landscape): यह एक अस्त-व्यस्त, अराजक भूलभुलैया है जिसमें कोई स्पष्ट नियम नहीं हैं। LLM यहाँ गणितीय सूत्रों का उपयोग नहीं कर सका। इसके बजाय, उसने एक तालिका (table) को देखा कि "X को आज़माने पर क्या हुआ था।" उसने शुद्ध रूप से डेटा से पैटर्न सीखा और अभी भी अन्य सभी तरीकों को हरा दिया।

4. यह एक बड़ी बात क्यों है?

  • यह सस्ता है: नए तरीके ने 200 "ऑफलाइन" प्रयासों से सीखा। एक प्रतिस्पर्धी AI (DQN) को 500 "ऑनलाइन" प्रयासों की आवश्यकता थी (जहाँ AI को वास्तव में सिमुलेशन चलाना पड़ता है, जो धीमा और महंगा है) और फिर भी वह अक्सर विफल रहा।
  • यह पारदर्शी है: एक "ब्लैक बॉक्स" न्यूरल नेटवर्क के बजाय, जहाँ आप नहीं जानते कि उसने निर्णय क्यों लिया, LLM ने वास्तविक पायथन कोड लिखा। आप कोड को पढ़ सकते हैं और देख सकते हैं कि उसने नॉब घुमाने का निर्णय कैसे लिया। यह ऐसा है जैसे AI ने अपना खुद का निर्देश मैनुअल लिखा हो।
  • यह सामान्यीकरण (Generalizes) करता है: रोबोट ने एक विशिष्ट भूलभुलैया के आकार के लिए रणनीति सीखी, और जब उन्होंने भूलभुलैया को बड़ा किया या नियम थोड़े बदले, तो रोबोट को अभी भी पता था कि क्या करना है। उसने केवल याद नहीं किया; वह तर्क को समझ गया।

निष्कर्ष

यह शोध पत्र दिखाता है कि हमें हर नियम को हाथ से कोड करने की आवश्यकता नहीं है। इसके बजाय, हम एक AI को चीजों के गलत होने के कुछ उदाहरण दिखा सकते हैं, उसे एक सिम्युलेटर लिखने के लिए कह सकते हैं ताकि वह समस्या के भौतिक विज्ञान (physics) को समझ सके, और फिर उस सिम्युलेटर को सफलता की ओर मार्गदर्शन करने के लिए छोड़ सकते हैं।

यह एक शतरंज खिलाड़ी को उसकी अपनी पिछली हार की किताब देने, उसे उन हारों के आधार पर एक नया नियम पुस्तिका लिखने के लिए कहने, और फिर उसे उस नई नियम पुस्तिका का उपयोग करके एक आदर्श खेल खेलने के लिए कहने जैसा है। परिणाम? उसने विशेषज्ञों को हरा दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →