← नवीनतम पेपर
🤖 AI

SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery

SwarmResearch एक ऑर्केस्ट्रेटर-सबएजेंट फ्रेमवर्क पेश करता है जो एक शेफर्ड एजेंट (Shepherd Agent) का उपयोग करके सर्च एजेंट्स (Search Agents) की एक संदर्भ-पृथक (context-isolated) आबादी को निर्देशित करता है, जिससे एकल दीर्घकालिक कोडिंग एजेंटों की अभिसरण सीमाओं (convergence limitations) को कम किया जा सके, और इस प्रकार अनुकूली समानांतरता (adaptive parallelism) और उच्च-स्तरीय अन्वेषण के माध्यम से उत्कृष्ट ओपन-एंडेड खोज प्राप्त की जा सके।

मूल लेखक: Yuvraj Virk, Zack Edds, Chunqiu Steven Xia, Lingming Zhang

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuvraj Virk, Zack Edds, Chunqiu Steven Xia, Lingming Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप केक बनाने का एक नया, सुपर-फास्ट तरीका खोजने की कोशिश कर रहे हैं। आपके पास प्रतिभाशाली बेकर्स (AI कोडिंग एजेंट) की एक टीम है, लेकिन आप चाहते हैं कि वे केवल एक थोड़ा बेहतर नुस्खा नहीं, बल्कि सबसे बेहतरीन संभव नुस्खा खोजें।

यह पेपर इन बेकर्स को व्यवस्थित करने का एक नया तरीका पेश करता है जिसे SWARMRESEARCH कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

समस्या: "एक ही ढर्रे पर चलने" का जाल (The "One-Track Mind" Trap)

अतीत में, यदि आप एक एकल AI बेकर से केक के नुस्खे को सुधारने के लिए कहते, तो यह इस तरह होता:

  1. वह एक नया घटक (ingredient) आजमाता है।
  2. वह उसे चखता है। यदि वह अच्छा है, तो वह उसे रखता है। यदि वह बुरा है, तो वह उसे फेंक देता है।
  3. वह घंटों तक एक ही रेसिपी में छोटे-छोटे बदलाव करते हुए इसे बार-बार करता रहता है।

समस्या: बेकर एक "लोकल ऑप्टिमम" (local optimum) में फंस जाता है। वे एक "चॉकलेट केक" को ही बेहतर बनाने में लगे रहते हैं क्योंकि वह पहले से ही काफी अच्छा है, लेकिन उन्हें कभी यह अहसास नहीं होता कि "लेमन टार्ट" वाला तरीका अपनाना 10 गुना तेज़ हो सकता है। वे वर्तमान पथ के सूक्ष्म विवरणों पर इतने केंद्रित हो जाते हैं कि वे एक पूरी तरह से नए, बेहतर पथ को देख ही नहीं पाते। वे अपने पुराने विचारों को भी भूलते जाते हैं क्योंकि वे लगातार एक ही नोटबुक को बार-बार लिख रहे होते हैं।

समाधान: स्वार्म (Swarm) दृष्टिकोण

लेखकों ने इस समस्या को ठीक करने के लिए SWARMRESEARCH नामक एक प्रणाली बनाई है। इसे एक रिसर्च फार्म के रूप में सोचें जिसमें दो प्रकार के कर्मचारी हैं:

  1. द शेफर्ड (The Shepherd - प्रबंधक): यह मुख्य AI है। यह खुद केक नहीं बनाता। इसके बजाय, यह पूरे फार्म को देखता है, देखता है कि क्या काम कर रहा है, और तय करता है कि मदद के लिए कहाँ भेजा जाए।
  2. द सर्च एजेंट्स (The Search Agents - बेकर्स): ये वे कार्यकर्ता हैं जो वास्तव में बेकिंग करते हैं।

यहाँ बताया गया है कि वे कैसे व्यवस्थित हैं:

  • ताज़ा शुरुआत (The "Explorer" Bakers): एक बेकर द्वारा एक ही नोटबुक पर काम करने के बजाय, शेफर्ड नए बेकर्स को खाली नोटबुक के साथ भेजता है। इन "एक्सप्लोरर" बेकर्स को पुराने नुस्खे को अनदेखा करने और शुरू से ही जंगली, नए विचार आजमाने के लिए कहा जाता है। वे "चॉकलेट केक" वाली मानसिकता में फंसे नहीं होते।
  • विशेषज्ञ रिफाइनर्स (The "Optimizer" Bakers): यदि शेफर्ड को कोई वास्तव में आशाजनक नया विचार (जैसे कि "लेमन टार्ट") दिखता है, तो वह उस विशिष्ट शाखा के लिए एक अलग प्रकार के बेकर को भेजता है। इस "ऑप्टिमाइज़र" को उस विशिष्ट विचार का विस्तृत इतिहास देखने को मिलता है ताकि वे उसे पूर्णता तक निखार सकें।
  • अलग कार्यक्षेत्र (The Git Branches): यह सबसे महत्वपूर्ण हिस्सा है। प्रत्येक बेकर अपने स्वयं के अलग किचन (एक अलग "git branch") में काम करता है।
    • यदि बेकर A एक बुरा विचार आजमाता है, तो वे बस अपना किचन फेंक देते हैं। इससे बेकर B का किचन खराब नहीं होता।
    • यदि बेकर B एक शानदार तकनीक खोज लेता है, तो शेफर्ड उस किचन को बेकर C को बिना यह कराए कॉपी कर सकता कि बेकर C को अपना वर्तमान काम डिलीट करना पड़े।
    • यह टीम को किसी बुरे विचार को ठीक करने के चक्कर में अच्छे विचारों को गलती से डिलीट करने से रोकता है।

यह प्रतियोगिता को कैसे हराता है

इस पेपर ने अन्य तरीकों (जैसे एक लंबे समय तक काम करने वाला एकल बेकर, या एक बड़े नोटबुक को साझा करने वाले बेकर्स का समूह) के मुकाबले इस सिस्टम का परीक्षण किया।

  • परिणाम: 13 में से 15 कठिन पहेलियों पर (गणित की समस्याओं से लेकर कंप्यूटर सिस्टम अनुकूलन तक), स्वार्म ने दूसरों की तुलना में बेहतर समाधान खोजे।
  • क्यों? क्योंकि स्वार्म ने केवल मौजूदा समाधान को "ट्वीक" नहीं किया। यह पूरी तरह से अलग दृष्टिकोण अपनाने के लिए साहसी था।
    • उदाहरण: एक कार्य में, पुराने तरीकों ने केवल ओवन के तापमान को थोड़ा समायोजित किया। स्वार्म ने पूरी तरह से एक नया प्रकार का ओवन बनाने की कोशिश की।

एक वास्तविक दुनिया का उदाहरण: AI की गति बढ़ाना

लेखकों ने इस सिस्टम का उपयोग AI को "तेज़" सोचने (विशेष रूप से, "स्पेक्युलेटिव डिकोडिंग" नामक तकनीक) के लिए किया।

  • पुराना तरीका: AI कोड में छोटे बदलाव करने की कोशिश करता था, जैसे यहाँ-वहाँ एक वेरिएबल बदलना। इससे गति में थोड़ी वृद्धि हुई।
  • स्वार्म का तरीका: स्वार्म एजेंटों ने विभिन्न रणनीतियों को आजमाया। एक एजेंट ने महसूस किया कि हर एक शब्द को एक-एक करके चेक करने के बजाय, वे शब्दों के समूहों को एक साथ चेक कर सकते हैं (जैसे बैचिंग)। दूसरे एजेंट ने महसूस किया कि वे आसान शब्दों को चेक करने के लिए कम "विशेषज्ञों" का उपयोग कर सकते हैं।
  • परिणाम: स्वार्म ने एक ऐसा तरीका खोजा जिससे AI मानक तरीके की तुलना में 4.58 गुना तेज़ हो गया, जबकि अन्य तरीकों ने केवल लगभग 2x की स्पीड वृद्धि ही हासिल की।

मुख्य बात (The Bottom Line)

SWARMRESEARCH शोधकर्ताओं को प्रबंधित करने का एक नया तरीका है। एक AI को एक ही ढर्रे में फंसने देने के बजाय, यह एक मैनेजर का उपयोग करता है जो एक साथ कई अलग-अलग रास्तों को खोजने के लिए कई टीमों को भेजता है। यह उनके कार्यक्षेत्रों को अलग रखता है ताकि अच्छे विचार खो न जाएं, और इसे पता होता है कि कब "नई चीजें आजमाने" से "सबसे अच्छी चीज को निखारने" की ओर स्विच करना है।

यह एक व्यक्ति द्वारा कार के हर बोल्ट को कसकर उसे ठीक करने की कोशिश करने और एक मैकेनिक की टीम द्वारा एक साथ एक नया इंजन, एक नया ट्रांसमिशन और एक नया चेसिस बनाने की कोशिश करने के बीच का अंतर है, और फिर सबसे अच्छा संयोजन चुनने का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →