← नवीनतम पेपर
🤖 AI

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS स्वायत्त एआई अनुसंधान के लिए एक नवीन ढांचा है जो बजट-जागरूक मोंटे कार्लो ट्री सर्च प्लानिंग, एक मॉड्यूलर डिज़ाइन-डिकंपोज़-इम्प्लीमेंट पाइपलाइन, और तुलनात्मक रिफ्लेक्टिव मेमोरी को एकीकृत करके जटिल मशीन लर्निंग इंजीनियरिंग की बाधाओं को दूर करता है ताकि MLE-Bench पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-दांव वाली कुकिंग प्रतियोगिता जीतने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत सख्त नियम है: आपके पास खाना पकाने के लिए केवल 24 घंटे हैं, और प्याज काटने में बिताया गया हर मिनट आपकी जेब से पैसे खर्च कराता है।

अधिकांश कंप्यूटर प्रोग्राम जो इस समस्या को हल करने की कोशिश करते हैं, वे उन नौसिखिए शेफ की तरह होते हैं जो एक साथ सब कुछ काटने लगते हैं। वे एक विशाल, अव्यवस्थित रेसिपी ("मोनोलिथिक स्क्रिप्ट") लिखते हैं जो एक बार में सब कुछ करने की कोशिश करती है। यदि उनका सूप जल जाता है, तो वे पूरा बर्तन फेंक देते हैं और बिल्कुल शुरुआत से शुरू करते हैं। उन्हें इस बात की परवाह नहीं होती कि पानी उबलने में कितना समय लगता है; वे बस चाहते हैं कि सूप का स्वाद अच्छा हो। वास्तविक दुनिया में AI अनुसंधान के मामले में, यह एक आपदा है क्योंकि AI मॉडल को प्रशिक्षित करना—सूप का एक बड़ा बर्तन उबालने जैसा है—इसमें बहुत समय और बिजली लगती है।

यह पेपर MARS (Modular Agent with Reflective Search) को पेश करता है, जो विशेषज्ञों की एक टीम और एक स्मार्ट नोटबुक वाले एक मास्टर शेफ की तरह है।

यहाँ बताया गया है कि MARS कैसे काम करता है, जिसे तीन सरल भागों में बांटा गया है:

1. "बजट-जागरूक" खोज (स्मार्ट प्लानर)

कल्पना कीजिए कि आप "सबसे अच्छी रेसिपी का अनुमान लगाने" का खेल खेल रहे हैं, लेकिन आपके पास सामग्री और समय के लिए एक सीमित बजट है।

  • पुराना तरीका: आप जितनी भी रेसिपी सोच सकते हैं, उन सभी को आज़माते हैं, भले ही एक को पकाने में 10 घंटे लगते हों। यदि उसका स्वाद थोड़ा बेहतर होता है, तो आप उसे चुन लेते हैं, भले ही आपके पास कुछ और पकाने के लिए समय खत्म हो जाए।
  • MARS का तरीका: MARS एक रणनीति का उपयोग करता है जिसे बजट-अवेयर MCTS (Budget-Aware MCTS) कहा जाता है। इसे एक स्मार्ट प्लानर के रूप में सोचें जो घड़ी देखता है। यदि रेसिपी A में 1 घंटा लगता है और स्वाद "ठीक" है, और रेसिपी B में 10 घंटे लगते हैं और स्वाद थोड़ा बेहतर है, तो MARS रेसिपी A को चुनता है। वह जानता है कि मामूली सुधार के लिए 9 घंटे बर्बाद करना एक बुरा सौदा है। वह लगातार पूछता है, "क्या यह सुधार अतिरिक्त समय और पैसे के लायक है?"

2. मॉड्यूलर निर्माण (असेंबली लाइन)

एक ही 50 पन्नों की लंबी रेसिपी लिखने के बजाय, MARS खाना पकाने की प्रक्रिया को छोटे, अलग-अलग स्टेशनों में तोड़ देता है।

  • पुराना तरीका: एक शेफ एक ही, भ्रमित करने वाला स्क्रिप्ट लिखता है। यदि सॉस गलत है, तो उन्हें पूरी 50 पन्नों की दस्तावेज़ को फिर से लिखना पड़ता है।
  • MARS का तरीका: MARS एक "डिज़ाइन-डिकंपोज़-इम्प्लीमेंट" (Design-Decompose-Implement) पाइपलाइन का उपयोग करता है। यह विशिष्ट कार्यों के लिए अलग-अलग "एजेंट्स" (विशेषज्ञ शेफ) को नियुक्त करता है:
    • एजेंट A सब्जियों (डेटा) को संभालता है।
    • एजेंट B मसालों (मॉडल आर्किटेक्चर) को संभालता है।
    • एजेंट C खाना पकाने (ट्रेनिंग) को संभालता है।
      यदि सॉस बहुत नमकीन है, तो MARS केवल "स्पाइस एजेंट" के निर्देशों को बदलता है। वह सब्जियों या मांस को नहीं छेड़ता। यह कोड को ठीक करने में आसान, परीक्षण करने में आसान और पूरे सिस्टम के क्रैश होने की संभावना को बहुत कम बनाता है।

3. तुलनात्मक चिंतनशील स्मृति (The "Aha!" नोटबुक)

यही सबसे जादुई हिस्सा है। एक सामान्य रसोई में, यदि कोई व्यंजन विफल हो जाता है, तो आप शायद सिर्फ यह कह सकते हैं, "यह काम नहीं किया," और आगे बढ़ सकते हैं।

  • पुराना तरीका: AI एजेंट अक्सर भूल जाते हैं कि कोई व्यंजन क्यों विफल हुआ। वे वही गलती दोबारा कर सकते हैं क्योंकि उन्होंने विशिष्ट कारण को नहीं सीखा।
  • MARS का तरीका: MARS एक "तुलनात्मक चिंतनशील स्मृति" (Comparative Reflective Memory) रखता है। जब कोई नया व्यंजन पुराने वाले से बेहतर निकलता है, तो MARS केवल यह नहीं कहता कि "अच्छा काम किया।" यह एक जासूस की तरह व्यवहार करता है। यह पुरानी रेसिपी और नई रेसिपी के बीच के सटीक अंतर की तुलना करता है।
    • उदाहरण: "आह! नया व्यंजन बेहतर है क्योंकि हमने इसमें एक चुटकी नमक डाला और इसे 2 मिनट अधिक पकाया। नमक मुख्य था, समय नहीं।"
    • यह इसे एक "पाठ" (Lesson) के रूप में लिखता है। बाद में, यदि यह एक पूरी तरह से अलग व्यंजन आज़माता है, तो यह कह सकता है, "हे, मैंने सीखा है कि इस प्रकार की समस्या के लिए नमक मदद करता है," और उस सबक को एक पूरी तरह से अलग शाखा में लागू कर सकता है।
    • शोध ने पाया कि MARS द्वारा उपयोग किए गए सबक में से 63% इन "क्रॉस-ब्रांच ट्रांसफर्स" से आए थे—जिसका अर्थ है कि इसने एक प्रकार की समस्या से सीखा और सफलतापूर्वक उसे एक अलग समस्या पर लागू किया। यह "Aha!" क्षण है।

परिणाम

शोधकर्ताओं ने MLE-Bench पर MARS का परीक्षण किया, जो एक विशाल, कठिन कुकिंग प्रतियोगिता की तरह है जिसमें 75 अलग-अलग चुनौतियाँ (टेक्स्ट का विश्लेषण करने से लेकर छवियों को पहचानने तक) शामिल हैं।

  • प्रतियोगिता: अन्य AI एजेंट (जैसे AIDE या AIRA) ने इन समस्याओं को हल करने की कोशिश की लेकिन अक्सर फंस गए, अव्यवस्थित कोड लिखा, या महंगे प्रयोगों पर समय बर्बाद किया जिनका कोई लाभ नहीं मिला।
  • विजेता: MARS ने किसी भी अन्य ओपन-सोर्स सिस्टम की तुलना में अधिक पदक (स्वर्ण, रजत, कांस्य) जीते। यह केवल भाग्यशाली नहीं था; यह अधिक कुशल था। इसने महंगे, कम मूल्य वाले प्रयोगों पर समय बर्बाद न करके और एक संरचित तरीके से अपनी गलतियों से सीखकर बेहतर समाधान तेजी से खोजे।

संक्षेप में: MARS एक ऐसा AI शोधकर्ता है जो केवल "रैंडम चीजें" नहीं आज़माता है। यह अपने समय की सावधानीपूर्वक योजना बनाता है, बड़ी समस्याओं को छोटे, प्रबंधनीय टुकड़ों में तोड़ता है, और इस बात का विस्तृत विवरण रखता है कि चीजें क्यों सफल हुईं या विफल हुईं, जिससे यह अपने प्रतिस्पर्धियों की तुलना में बहुत तेज़ी से सीख और सुधार कर पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →