← नवीनतम पेपर
💻 computer science

GEAR: Genetic AutoResearch for Agentic Code Evolution

यह शोध पत्र GEAR (जेनेटिक ऑटोरिसर्च) को प्रस्तुत करता है, जो स्वायत्त अनुसंधान एजेंटों के लिए एक जनसंख्या-आधारित ढांचा है जो विविध संभावित समाधानों को बनाए रखने और स्थानीय इष्टतम (local optima) से बचने तथा निरंतर सुधार खोजने के लिए खोज रणनीतियों को विकसित करने के माध्यम से पारंपरिक एकल-पथ खोज से बेहतर प्रदर्शन करता है।

मूल लेखक: Ahmadreza Jeddi, Minh Ngoc Le, Hakki C. Karaimer, Konstantinos G. Derpanis, Babak Taati

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmadreza Jeddi, Minh Ngoc Le, Hakki C. Karaimer, Konstantinos G. Derpanis, Babak Taati

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कंप्यूटर को बेहतर कहानियाँ लिखना सिखाना। आपके पास एक रोबोट सहायक है जिसका काम कंप्यूटर को स्मार्ट बनाने के लिए कोड में बदलाव करना है।

पुराना तरीका: "एक ही दिशा में सोचने वाला मन" (The One-Track Mind)

पिछली विधि, जिसे AutoResearch कहा जाता था, एक ऐसे व्यक्ति की तरह है जो भूलभुलैया सुलझाने की कोशिश कर रहा है।

  • वह एक कदम उठाता है।
  • यदि वह कदम उसे निकास के करीब ले जाता है, तो वह उसे बरकरार रखता है।
  • यदि वह कदम एक बंद रास्ता (dead end) है, तो वह उसे फेंक देता है और वहीं वापस चला जाता है जहाँ से उसने शुरुआत की थी।
  • वह केवल उस एक सबसे अच्छे रास्ते को याद रखता है जो उसने अब तक खोजा है।

समस्या: यह एक ऐसे हाइकर (पर्वतारोही) की तरह है जो केवल अपने सामने की जमीन को देखता है। यदि वह एक छोटी पहाड़ी (एक "लोकल ऑप्टिमम") से टकराता है, तो वह वहीं रुक सकता है, यह सोचकर कि वह शिखर पर पहुँच गया है, भले ही अगली पहाड़ी के ठीक पीछे एक बहुत ऊँचा पर्वत हो। वह "विफल" विचारों को बहुत जल्दी त्याग देता है, भले ही उन विफल विचारों में एक शानदार समाधान का एक छोटा सा हिस्सा छिपा हो जो बाद में उपयोगी हो सकता है।

नया तरीका: GEAR (एक्सप्लोरेशन टीम)

लेखक GEAR (जेनेटिक ऑटोरिसर्च) पेश करते हैं। एक अकेले हाइकर के बजाय, GEAR एक्सप्लोरर्स (खोजकर्ताओं) की एक टीम भेजता है जिसके पास एक नक्शा है।

GEAR इस प्रकार काम करता है, यहाँ कुछ उपमाएँ दी गई हैं:

1. द फ्रंटियर (एक्सप्लोरर्स की टीम)
केवल एक "सबसे अच्छे" रास्ते को रखने के बजाय, GEAR एक समय में कई सबसे आशाजनक रास्तों को जीवित रखता है। इसे एक माली के नर्सरी की तरह समझें।

  • कुछ पौधे सबसे ऊँचे हैं (सर्वश्रेष्ठ प्रदर्शन)।
  • कुछ सबसे कठोर या कम पानी का उपयोग करने वाले हैं (सबसे कुशल)।
  • कुछ पौधे दूसरों की तुलना में अजीब या अलग दिखते हैं (विविध विचार)।
  • माली उन "अजीब" पौधों को केवल इसलिए नहीं फेंकता क्योंकि वे अभी तक सबसे ऊँचे नहीं हैं; वह उन्हें रखता है क्योंकि उनमें कोई अनूठा गुण हो सकता है जो बाद में उपयोगी होगा।

2. म्यूटेशन और क्रॉसओवर (मिलाना और जोड़ना)
GEAR दो तरीकों से नए विचार बनाता है:

  • म्यूटेशन (Mutation): एक एक्सप्लोरर एक रास्ते को लेता है और उसमें थोड़ा सा बदलाव करता है (जैसे किसी रेसिपी में एक अकेला घटक बदलना)।
  • क्रॉसओवर (Crossover): यह जादुई हिस्सा है। GEAR दो अलग-अलग सफल रास्तों को लेता है और उन्हें मिला देता है। कल्पना कीजिए कि आप एक पौधे से "सबसे अच्छा स्वाद" और दूसरे से "सबसे मजबूत तना" लेते हैं ताकि एक नया, सुपर-प्लांट बना सकें। पेपर नोट करता है कि यह रोबोट को अलग-अलग शाखाओं में खोजे गए विचारों को मिलाने की अनुमति देता है, जो सिंगल-हाइकर विधि कभी नहीं कर सकती थी।

3. GEAR के तीन संस्करण
शोधकर्ताओं ने इस टीम को चलाने के तीन तरीके का परीक्षण किया:

  • GEAR-Prompt: रोबोट को अंग्रेजी में नियमों की एक लंबी सूची दी जाती है (जैसे एक कोच जो मैदान के किनारे से निर्देश चिल्ला रहा हो) जो उसे टीम को प्रबंधित करने का तरीका बताती है।
  • GEAR-Fixed: नियम एक सख्त कंप्यूटर प्रोग्राम में लिखे गए हैं। रोबोट को प्रोग्राम के तर्क का सटीक रूप से पालन करना होता है, जैसे एक ट्रेन एक तय ट्रैक पर चलती है।
  • GEAR-Evolve: यह सबसे उन्नत संस्करण है। रोबोट न केवल टीम का प्रबंधन करता है, बल्कि उसे अपने नियमों को खुद लिखने की भी अनुमति है। यदि नियम काम नहीं कर रहे हैं, तो रोबोट उस कोड को ठीक कर सकता है जो उसे माता-पिता चुनने या विचारों को मिलाने का तरीका बताता है।

क्या हुआ?

शोधकर्ताओं ने यह देखने के लिए कि कौन सा सिस्टम कंप्यूटर को सबसे अच्छी कहानियाँ लिखने के लिए प्रशिक्षित कर सकता है (जिसे "बिट्स-पर-बाइट" नामक स्कोर से मापा गया है, जहाँ कम होना बेहतर है), इन प्रणालियों को 100 "प्रयोगों" (प्रयासों) के लिए चलाया।

  • पुराना तरीका (AutoResearch): यह बहुत जल्दी अटक गया। लगभग 50 प्रयासों के बाद, इसने सुधार करना बंद कर दिया। इसने एक "काफी अच्छा" समाधान ढूंढ लिया था और यह बेहतर समाधान को देख नहीं पाया जो बस बगल में ही था।
  • नए तरीके (GEAR): तीनों संस्करण पुराने तरीके के रुकने के बहुत बाद तक बेहतर होते रहे।
    • GEAR-Evolve स्पष्ट विजेता था। क्योंकि यह अपने स्वयं के नियमों को ठीक कर सकता था, इसने एक चतुर चाल सीखी: इसने महसूस किया कि मॉडल को एक तरह से थोड़ा छोटा करने से उसे दूसरी तरह से गहरा (deeper) होने की अनुमति मिलती है, जिससे एक बहुत अधिक स्मार्ट परिणाम प्राप्त होता है।
    • "फिक्स्ड" और "प्रॉम्प्ट" संस्करण भी पुराने तरीके से बेहतर थे, जो यह साबित करता है कि केवल एक "सबसे अच्छे" विचार के बजाय विचारों की एक विविध टीम होना बेहतर है।

मुख्य निष्कर्ष

पेपर का तर्क है कि स्वायत्त अनुसंधान (autonomous research) केवल "एक चीज़ आज़माने, यदि वह काम करती है तो उसे रखने और बाकी को छोड़ने" के बारे में नहीं होना चाहिए। वास्तविक प्रगति विविध विचारों के एक समूह को जीवित रखने, उनके सबसे अच्छे हिस्सों को आपस में मिलाने और कभी-कभी शोधकर्ता को अपनी खोज प्रक्रिया को बदलने देने से आती है।

अनुसंधान को एक एकल सीढ़ी के बजाय एक जेनेटिक फैमिली ट्री (वंशवृक्ष) की तरह मानकर, GEAR रोबोट को बहुत जल्दी हार मानने से रोकता है और इसे बहुत लंबे समय तक प्रगति करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →