← नवीनतम पेपर
🤖 machine learning

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++ एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो एक प्रशिक्षित सलाहकार (advisor) और एक फ्रंटियर मॉडल का उपयोग करके रणनीतिक परिकल्पना चयन को कार्यान्वयन से अलग करता है, जो विविध इंजीनियरिंग और वैज्ञानिक कार्यों में तेज़ अभिसरण (convergence) और स्थिर टेस्ट-टाइम लर्निंग प्राप्त करने के लिए एक चरण-अनुकूली (phase-adaptive) प्रशिक्षण रणनीति को नियोजित करता है।

मूल लेखक: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिल्कुल नया, अत्यंत कुशल मशीन बनाने की कोशिश कर रहे हैं। आपके पास एक शानदार लेकिन थोड़ा अराजक आइडिया जनरेटर (एक छोटा AI) और एक अत्यधिक कुशल मास्टर बिल्डर (एक शक्तिशाली AI) है।

पिछले अधिकांश प्रयासों में, एक ही AI को दोनों काम करने के लिए मजबूर किया गया था: मशीन का विचार लाना और फिर उस मशीन को बनाना। यदि मशीन काम करने में विफल रही, तो AI यह नहीं बता पाता था कि विचार बुरा था या बिल्डर ने कोई गलती की थी। यह कुछ ऐसा था जैसे किसी छत के टपकने के लिए आर्किटेक्ट को दोष देना, जबकि निर्माण टीम ने गलत ईंटों का उपयोग किया हो।

PACEvolve++ एक नया सिस्टम है जो भूमिकाओं को अलग करके और "आइडिया जनरेटर" को काम करते समय स्मार्ट बनाना सिखाकर इस समस्या को ठीक करता है। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

1. दो-टीम रणनीति (The Two-Team Strategy)

एक ही AI द्वारा सब कुछ करने के बजाय, PACEvolve++ दो-सदस्यीय टीम का उपयोग करता है:

  • सलाहकार (रणनीतिकार): यह एक छोटा, प्रशिक्षित AI है। इसका एकमात्र काम वर्तमान में सबसे अच्छी मशीन को देखना, नए विचारों के लिए मंथन करना, यह अनुमान लगाना कि कौन से विचार नए हैं, और अगला प्रयास करने के लिए सबसे अच्छे विचार को चुनना है। यह सीखता है कि क्या आज़माना है।
  • फ्रंटियर मॉडल (बिल्डर): यह एक विशाल, शक्तिशाली AI है जो कोडिंग में पहले से ही बहुत अच्छा है। यह सलाहकार द्वारा चुने गए विचार को लेता है और उसे वास्तविक, काम करने वाले कोड में बदल देता है। यह इसे कैसे बनाना है, इसका भारी काम संभालता है।

इन दोनों को अलग करके, सिस्टम सलाहकार को कोड के पूर्ण होने की चिंता किए बिना रणनीति में बेहतर होने के लिए प्रशिक्षित कर सकता है। यदि कोड विफल होता है, तो यह एक निर्माण संबंधी समस्या है, रणनीति संबंधी समस्या नहीं।

2. "फेज-एडेप्टिव" कोच (The "Phase-Adaptive" Coach)

सबसे बड़ी चुनौती यह है कि जैसे-जैसे आप पूर्ण समाधान के करीब पहुँचते हैं, "खेल" बदल जाता है। शोध का तर्क है कि आपको खोज के दौरान सलाहकार को अलग-अलग तरह से प्रशिक्षित करने की आवश्यकता होती है।

  • चरण 1: अनियंत्रित अन्वेषण (शुरुआती खेल - Early Game)

    • स्थिति: आप अभी शुरुआत कर रहे हैं। विचार इधर-उधर बिखरे हुए हैं—कुछ पागलपन भरे हैं, कुछ उबाऊ हैं, कुछ शानदार हैं।
    • कोचिंग: सिस्टम सलाहकार को बताता है: "विचारों के पूरे समूह को देखो। कौन से विचार औसत से बेहतर हैं? नई दिशाएँ खोजने की कोशिश करो!"
    • उपमा: कल्पना कीजिए कि एक स्काउट नए कैंपसाइट की तलाश में है। शुरुआत में, वे एक विस्तृत जाल फैलाते हैं, कई घाटियों और पहाड़ियों की तलाश करते हैं। कोच उन्हें किसी भी आशाजनक क्षेत्र को खोजने के लिए पुरस्कृत करता है, भले ही वह अभी तक सबसे अच्छा न हो।
  • चरण 2: सूक्ष्म-ट्यूनिंग (अंतिम खेल - Late Game)

    • स्थिति: आपने एक बेहतरीन स्थान ढूंढ लिया है, लेकिन अब आप केवल कुछ इंच ऊंचाई बढ़ाने या दृश्य सुधारने की कोशिश कर रहे हैं। विचारों के बीच का अंतर बहुत कम है।
    • कोचिंग: सिस्टम नियमों को बदल देता है। यह पूछना बंद कर देता है, "कौन सा विचार औसत से बेहतर है?" और पूछना शुरू करता है, "क्या इस विशिष्ट विचार ने वास्तव में 'सर्वश्रेष्ठ संभव' रिकॉर्ड को आगे बढ़ाया?"
    • उपमा: अब स्काउट द्वारा खोजे गए सबसे अच्छे टीले पर खड़ा है। कोच अब "अच्छे" टीलों की परवाह नहीं करता और केवल इस बात की परवाह करता है कि क्या स्काउट ने वर्तमान चैंपियन से बेहतर कोई स्थान खोजा है। यदि नया स्थान बस "ठीक-ठाक" है, तो उसे कोई श्रेय नहीं मिलता। यह सिस्टम को छोटी, अर्थहीन भिन्नताओं से भ्रमित होने से रोकता है।

3. यह क्यों महत्वपूर्ण है

अतीत में, विकासशील समाधानों को आज़माने वाले AI सिस्टम अक्सर अटक जाते थे या क्रैश हो जाते थे क्योंकि वे शुरुआत से अंत तक एक ही प्रकार की "कोचिंग" पद्धति का उपयोग करने की कोशिश करते थे।

  • यदि आप बहुत देर से "शुरुआती खेल" के नियमों का उपयोग करते हैं, तो AI छोटी भिन्नताओं से भ्रमित होकर अनियंत्रित हो जाता है (अस्थिरता)।
  • यदि आप बहुत जल्दी "अंतिम खेल" के नियमों का उपयोग करते हैं, तो AI अन्वेषण करना छोड़ देता है और केवल वही सुरक्षित विचार दोहराता रहता है (फँस जाना)।

PACEvolve++ खोज के दौरान अपनी कोचिंग शैली को स्वचालित रूप से बदल देता है। यह व्यापक अन्वेषण को प्रोत्साहित करने से शुरू होता है और फिर केवल उन सूक्ष्म सुधारों को पुरस्कृत करने की ओर सहजता से बढ़ता है जो वास्तव में रिकॉर्ड तोड़ते हैं।

परिणाम

लेखकों ने तीन कठिन वास्तविक दुनिया के इंजीनियरिंग कार्यों पर इसका परीक्षण किया:

  1. कंप्यूटर वर्कलोड को संतुलित करना: यह सुनिश्चित करना कि विभिन्न कंप्यूटर चिप्स कार्यों को समान रूप से साझा करें।
  2. रेकमेंडेशन सिस्टम: ऐप्स यह सुझाव देने में सुधार करना कि उपयोगकर्ता को अगला वीडियो या उत्पाद क्या दिखाया जाए।
  3. प्रोटीन डिजाइन: यह अनुमान लगाना कि प्रोटीन की संरचना को बदलने से उसके कार्य पर क्या प्रभाव पड़ता है।

इन तीनों मामलों में, PACEvolve++ ने पिछले तरीकों की तुलना में बेहतर समाधान तेजी से खोजे। इसने केवल एक अच्छा उत्तर ही नहीं दिया; इसने बिना सिस्टम क्रैश हुए या भ्रमित हुए अधिक तेज़ी से सर्वश्रेष्ठ उत्तर खोजा।

संक्षेप में: PACEvolve++ यह सिखाने का एक स्मार्ट तरीका है कि AI आविष्कार कैसे करे। यह काम को एक रणनीतिकार और एक बिल्डर के बीच विभाजित करता है, और यह कोचिंग शैली को ठीक उसी समय बदल देता है जब स्थिति की मांग होती है—"जाकर खोजो" से लेकर "विवरणों को पूर्ण करो" तक।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →