← नवीनतम पेपर
💬 NLP

AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization

AdaEvolve एक पदानुक्रमित अनुकूलन ढांचा (hierarchical adaptive optimization framework) है जो स्थिर शेड्यूल्स को गतिशील, LLM-संचालित तंत्रों से बदल देता है ताकि अन्वेषण (exploration) को नियंत्रित किया जा सके, संसाधनों को रूट किया जा सके और नवीन रणनीतियाँ उत्पन्न की जा सकें, जिससे यह विविध ओपन-एंडेड ऑप्टिमाइज़ेशन समस्याओं में मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Mert Cemri, Shubham Agrawal, Akshat Gupta, Shu Liu, Audrey Cheng, Qiuyang Mang, Ashwin Naren, Lutfi Eren Erdogan, Koushik Sen, Matei Zaharia, Alex Dimakis, Ion Stoica

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mert Cemri, Shubham Agrawal, Akshat Gupta, Shu Liu, Audrey Cheng, Qiuyang Mang, Ashwin Naren, Lutfi Eren Erdogan, Koushik Sen, Matei Zaharia, Alex Dimakis, Ion Stoica

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े जिद्दी रोबोट (एक Large Language Model) को एक जटिल पहेली हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक वर्ग के भीतर वृत्तों (circles) को पैक करना या एक नए प्रकार का कंप्यूटर कोड लिखना।

अतीत में, हम रोबोट को बताते थे: "यह रही पहेली। 100 बार प्रयास करो। हर बार, एक यादृच्छिक (random) बदलाव करने की कोशिश करो। यदि यह बेहतर होता है, तो इसे रख लो। यदि नहीं, तो फिर से प्रयास करो।"

यह एक हाइकर (पदमयात्री) को नक्शा देने और यह कहने जैसा है कि, "100 कदम तक सीधी रेखा में चलो, फिर 90 डिग्री मुड़ो और 100 और कदम चलो, चाहे तुम कुछ भी देखो।" यह कठोर है। यदि हाइकर किसी दीवार से टकरा जाता है, तो वह उसमें चलते रहना जारी रखता है। यदि उसे एक शानदार रास्ता मिल जाता है, तो वे अन्य संभावनाओं की खोज करना बहुत जल्दी बंद कर सकते हैं।

AdaEvolve उस हाइकर को एक स्मार्ट, अनुकूलन योग्य मार्गदर्शक (adaptive guide) देने जैसा है जो वास्तविक समय में उनकी प्रगति को देखता है और चलते-चलते रणनीति बदल देता है।

यह कैसे काम करता है, यहाँ तीन सरल स्तरों में दिया गया है:

1. खोज की "गति" (स्थानीय अनुकूलन - Local Adaptation)

कल्पना कीजिए कि आप एक छिपे हुए खजाने की तलाश कर रहे हैं।

  • जब आप किसी सुराग के करीब हों: आप बहुत सावधान रहना चाहते हैं और हर छोटी बारीकी को देखना चाहते हैं। आप भटकना नहीं चाहते।
  • जब आप किसी बंद रास्ते (dead end) में फंस जाएं: आपको उसी जगह को देखना बंद करना होगा और एक नया रास्ता खोजने के लिए नई, जंगली दिशाओं में दौड़ना शुरू करना होगा।

AdaEvolve यह काम स्वचालित रूप से करता है। यह देखता है कि रोबोट का समाधान कितना सुधर रहा है।

  • यदि रोबोट बहुत अच्छा सुधार कर रहा है, तो सिस्टम कहता है, "बहुत बढ़िया! आइए इस विशिष्ट विचार को और अधिक परिष्कृत (refine) करने के लिए धीमे हो जाएं।" (Exploitation)।
  • यदि सुधार रुक जाता है, तो सिस्टम कहता है, "तुम फंस गए हो! इस जगह को देखना बंद करो और कुछ पूरी तरह से अलग आज़माओ!" (Exploration)।
  • जादू: इसे यह बताने की आवश्यकता नहीं है कि कब स्विच करना है। यह प्रगति के "वाइब" (vibe) को खुद महसूस करता है।

2. "टीम मैनेजर" (वैश्विक अनुकूलन - Global Adaptation)

अब, कल्पना कीजिए कि आपके पास केवल एक हाइकर नहीं है; आपके पास हाइकर्स की एक पूरी टीम है, जो एक ही समय में जंगल के विभिन्न हिस्सों की खोज कर रही है।

  • पुराना तरीका: आप प्रत्येक हाइकर को भोजन और पानी की बिल्कुल समान मात्रा देते हैं, चाहे उन्हें नदी मिली हो या वे दलदल में फंसे हों।
  • AdaEvolve का तरीका: यह एक स्मार्ट मैनेजर की तरह कार्य करता है। यह टीम को देखता है।
    • यदि हाइकर A को एक शानदार रास्ता मिलता है, तो मैनेजर हाइकर A को और आगे बढ़ने में मदद करने के लिए अधिक भोजन और पानी भेजता है।
    • यदि हाइकर B एक दलदल में फंसा हुआ है और काफी समय से आगे नहीं बढ़ा है, तो मैनेजर उसे आपूर्ति भेजना बंद कर देता है और वे संसाधन हाइकर A को भेज देता है।
    • यदि पूरी टीम ही फंसी हुई लगती है, तो यह नए हाइकर (नई खोज टीमें) भी बनाता है, जिससे यह सुनिश्चित होता है कि कोई भी मृत अंत (dead end) पर समय बर्बाद नहीं कर रहा है।

3. "कोच" (मेटा-मार्गदर्शन - Meta-Guidance)

कभी-कभी, चाहे आप कितनी भी दौड़ लें या टीम को कितना भी भोजन दे दें, वे पहेली को हल नहीं कर पाते। वे गलत तरीके का उपयोग कर रहे हैं। शायद वे पहाड़ चढ़ने की कोशिश कर रहे हैं जब उन्हें नदी पार करने के लिए तैरना चाहिए।

यहीं पर कोच की भूमिका आती है।

  • जब सिस्टम को एहसास होता है कि सभी फंस गए हैं, तो यह रोबोट को केवल "अधिक प्रयास करने" के लिए नहीं कहता। यह रोबोट को पीछे हटने और रणनीति के बारे में सोचने के लिए कहता है।
  • कोच कहता है: "हे, हम इन वृत्तों को एक-एक करके हिलाकर व्यवस्थित करने की कोशिश कर रहे हैं। यह काम नहीं कर रहा है। आइए एक पूरी तरह से नई ट्रिक आज़माते हैं: क्या होगा यदि हम एक गणितीय सूत्र का उपयोग करें जिससे वे सभी एक साथ फिसल सकें?"
  • यह गतिरोध तोड़ने के लिए खेल के नियमों को बदल देता है।

यह एक बड़ी बात क्यों है?

इस सिस्टम का परीक्षण 185 अलग-अलग समस्याओं पर किया गया, नए कंप्यूटर एल्गोरिदम डिजाइन करने से लेकर आकृतियों को पूरी तरह से पैक करने तक।

  • परिणाम: AdaEvolve ने न केवल पुराने, कठोर तरीकों को हराया; इसने अक्सर सर्वश्रेष्ठ मानव-निर्मित समाधानों और यहाँ तक कि अन्य उन्नत AI सिस्टमों को भी मात दी।
  • उपमा: यदि पुराने तरीके एक अंधे रोबोट की तरह थे जो एक स्क्रिप्ट का आँख मूंदकर पालन करता है, तो AdaEvolve एक शतरंज के ग्रैंडमास्टर की तरह है जो जानता है कि कब हमला करना है, कब बचाव करना है, कब एक मोहरा कुर्बान करना है और कब पूरी खेल योजना को बदलना है।

संक्षेप में: AdaEvolve AI प्रोग्राम जनरेशन को "अंधा अनुमान और जाँच" (guess-and-check) की प्रक्रिया से बदलकर एक स्मार्ट, स्व-सुधारात्मक यात्रा में बदल देता है जिसे ठीक पता होता है कि कब आगे बढ़ना है, कब आराम करना है और कब अपना विचार पूरी तरह से बदलना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →