← नवीनतम पेपर
🤖 AI

ROMA: Recursive Open Meta-Agent Framework for Long-Horizon Multi-Agent Systems

यह शोध पत्र ROMA को प्रस्तुत करता है, जो एक पुनरावर्ती (recursive), मॉड्यूलर मल्टी-एजेंट फ्रेमवर्क है जो डिपेंडेंसी-अवेयर टास्क डिकंपोजिशन, स्ट्रक्चर्ड एग्रीगेशन और एक GEPA+ प्रॉम्प्ट ऑप्टिमाइज़ेशन स्ट्रैटेजी के माध्यम से लॉन्ग-होराइजन कार्यों में वर्तमान प्रणालियों की सीमाओं को दूर करता है, और रीजनिंग एवं लॉन्ग-फॉर्म जनरेशन बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Salaheddin Alzu'bi, Baran Nama, Arda Kaz, Anushri Eswaran, Weiyuan Chen, Sarvesh Khetan, Rishab Bala, Tu Vu, Sewoong Oh

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Salaheddin Alzu'bi, Baran Nama, Arda Kaz, Anushri Eswaran, Weiyuan Chen, Sarvesh Khetan, Rishab Bala, Tu Vu, Sewoong Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, 500 पन्नों का उपन्यास लिखने की कोशिश कर रहे हैं, या एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं जिसमें सैकड़ों अलग-अलग वेबसाइटों की जांच शामिल है। यदि आप एक ही AI (जैसे कि एक स्मार्ट चैटबॉट) से यह सब एक साथ करने के लिए कहते हैं, तो वह अक्सर अभिभूत (overwhelmed) हो जाता है। वह कहानी के अंत तक पहुँचते-पहुँचते शुरुआत को भूल सकता है, विरोधाभासी जानकारी से भ्रमित हो सकता है, या बस काम बहुत बड़ा होने के कारण हार मान सकता है (यह उसके "कॉन्टेक्स्ट विंडो" या मस्तिष्क की सीमा के कारण होता है)।

ROMA एक नया फ्रेमवर्क है जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है। इसे एक एकल सुपर-ब्रेन के रूप में नहीं, बल्कि AI कार्यों के लिए एक अत्यधिक संगठित निर्माण कंपनी (construction company) के रूप में समझें।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "एक-व्यक्ति बैंड" बनाम "ऑर्केस्ट्रा"

वर्तमान AI सिस्टम अक्सर एक ही लंबी विचार प्रक्रिया में सब कुछ करने की कोशिश करते हैं। यह एक ही व्यक्ति से वास्तुकार (architect), राजमिस्त्री (bricklayer), इलेक्ट्रीशियन और इंटीरियर डिजाइनर बनने के लिए कहने जैसा है, और वह भी एक 50 मंजिला इमारत के हर एक विवरण को याद रखते हुए। वे थक जाते हैं, गलतियाँ करते हैं, और योजना से भटक जाते हैं।

ROMA इसे एक श्रेणीबद्ध टीम (hierarchical team) बनाकर बदल देता है। एक विशाल मस्तिष्क के बजाय, यह एक रिकर्सिव (दोहराव वाली) संरचना का उपयोग करता है जहाँ बड़ी समस्याओं को छोटे, प्रबंधनीय टुकड़ों में तोड़ दिया जाता है।

2. चार प्रमुख भूमिकाएँ (निर्माण दल)

ROMA कार्य को चार विशिष्ट भूमिकाओं में व्यवस्थित करता है। हर बार जब कोई कार्य आता है, तो वह इस चक्र से गुजरता है:

  • द एटोमाइज़र (The Atomizer - फोरमैन/सुपरवाइजर):
    • यह क्या करता है: यह एक बड़े कार्य को देखता है और पूछता है, "क्या हम इसे एक बार में कर सकते हैं, या हमें इसे तोड़ने की आवश्यकता है?"
    • उपमा: कल्पना करें कि आपने एक कस्टम घर का ऑर्डर दिया है। फोरमैन ब्लूप्रिंट को देखता है। यदि आपको केवल एक ईंट चाहिए, तो वह इसे एक कार्यकर्ता को सौंप देता है। लेकिन यदि आपको पूरा घर चाहिए, तो वह कहता है, "नहीं, हमें इसे नींव, ढांचा, प्लंबिंग और छत में तोड़ना होगा।"
  • द प्लानर (The Planner - आर्किटेक्ट/नक्शा बनाने वाला):
    • यह क्या करता है: यदि कार्य बहुत बड़ा है, तो प्लानर एक मानचित्र तैयार करता है। यह कार्यों के क्रम और एक-दूसरे पर उनकी निर्भरता का पता लगाता है।
    • उपमा: आर्किटेक्ट ब्लूप्रिंट बनाता है। वे जानते हैं कि दीवारें पेंट करने से पहले आपको ढांचा बनाना होगा। वे एक ऐसा शेड्यूल बनाते हैं जहाँ विभिन्न टीमें एक-दूसरे के काम में बाधा डाले बिना, अलग-अलग हिस्सों पर एक साथ (parallel) काम कर सकें।
  • द एक्सेक्यूटर्स (The Executors - कार्यकर्ता):
    • यह क्या करता है: ये वास्तविक काम करने वाले हैं। वे छोटे, "एटॉमिक" (अविभाज्य) कार्यों को संभालते हैं।
    • उपमा: ये विशेषज्ञ कार्यकर्ता हैं। एक टीम ईंटें बिछाती है, दूसरी बिजली का काम करती है, और तीसरी पेंट करती है। क्योंकि कार्य छोटे हैं, वे भ्रमित नहीं होते या अपना काम नहीं भूलते।
  • द एग्रीगेटर (The Aggregator - प्रोजेक्ट मैनेजर):
    • यह क्या करता है: एक बार जब कार्यकर्ता अपने छोटे कार्य पूरे कर लेते हैं, तो एग्रीगेटर उनके काम को एकत्र करता है, उसकी जाँच करता है, उसका सारांश बनाता है, और उसका "सारांश" अगले स्तर पर भेज देता है।
    • उपमा: इसके बजाय कि CEO हर एक ईंट की रिपोर्ट पढ़े, प्रोजेक्ट मैनेजर फ्रेमिंग टीम, प्लंबिंग टीम और इलेक्ट्रिकल टीम की रिपोर्ट लेता है, उन्हें सारांशित करता है, और एक "लेवल 1 पूर्ण" रिपोर्ट बनाकर मुख्य बॉस को सौंप देता है। यह मुख्य बॉस को बहुत अधिक विवरण से अभिभूत होने से बचाता है।

3. जादुई ट्रिक: "रिकर्सिव" और "कंप्रेशन"

रिकर्सिव (Recursive) शब्द का अर्थ है कि प्रक्रिया खुद को दोहराती है।

  • प्रोजेक्ट मैनेजर (एग्रीगेटर) को एक ऐसी रिपोर्ट मिल सकती है जो अभी भी बहुत बड़ी है। इसलिए, वह रिपोर्ट एक नए फोरमैन के लिए एक नया कार्य बन जाती है, जो उसे फिर से तोड़ देता है, और यह सिलसिला चलता रहता है।
  • कंप्रेशन (Compression): यह असली सफलता का मंत्र है। जैसे-जैसे काम श्रृंखला में ऊपर बढ़ता है, एग्रीगेटर सब कुछ नहीं भेजते। वे सारांशित, सत्यापित परिणाम भेजते हैं।
    • उपमा: कल्पना करें कि आप 1,000 पन्नों की किताब पढ़ रहे हैं। हर वाक्य को याद रखने के बजाय, आप प्रत्येक अध्याय का एक-पृष्ठ का सारांश लिखते हैं। जब तक आप अंत तक पहुँचते हैं, आपके पास पूरी किताब का 10-पृष्ठ का सारांश होता है, न कि 1,000 पन्ने। यह AI को कार्य की शुरुआत को "भूलने" (जिसे "कॉन्टेक्स्ट रोट" कहा जाता है) से बचाता है।

4. GEPA+: "ट्यूनिंग नॉब" (समायोजन का साधन)

एक बेहतरीन टीम होने के बावजूद, कभी-कभी कार्यकर्ताओं को दिए गए निर्देश (प्रॉम्प्ट्स) सटीक नहीं होते।

  • GEPA+ एक स्मार्ट कोच की तरह है जो टीम को काम करते हुए देखता है।
  • यह फोरमैन, आर्किटेक्ट और वर्कर्स को निर्देश देने के विभिन्न तरीकों को आज़माता है। यह परीक्षण करता है, देखता है कि कौन से तरीके सबसे अच्छे काम करते हैं, और फिर सबसे अच्छे विचारों को नए, बेहतर निर्देशों के सेट में मिला देता है।
  • उपमा: यह एक शेफ की तरह है जो सूप चखता है और उसमें नमक, काली मिर्च और जड़ी-बूटियों को समायोजित करता है। GEPA+ इसे स्वचालित रूप से और तेज़ी से करता है, जिससे पूरे AI को फिर से प्रशिक्षित किए बिना विशिष्ट कार्य के लिए एकदम सही रेसिपी मिल जाती है।

यह क्यों मायने रखता है?

पेपर दिखाता है कि यह "निर्माण कंपनी" वाला दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है:

  • बेहतर तर्क (Reasoning): जब AI को इंटरनेट पर ऐसे तथ्य खोजने होते हैं जो एक-दूसरे का खंडन करते हैं, तो ROMA खोज को छोटे टुकड़ों में तोड़ देता है, उन्हें व्यक्तिगत रूप से जाँचता है, और फिर सत्य का संश्लेषण करता है। इसने अन्य शीर्ष AI रिसर्च एजेंटों को बड़े अंतर से पीछे छोड़ दिया।
  • बेहतर लेखन: लंबी कहानियाँ लिखते समय, ROMA पहले कथानक और पात्रों की योजना बनाता है, फिर अध्याय दर अध्याय लिखता है, जिससे यह सुनिश्चित होता है कि कहानी शुरू से अंत तक सुसंगत बनी रहे। इसने एक ओपन-सोर्स मॉडल को सबसे महंगे, क्लोज्ड-सोर्स मॉडल्स की गुणवत्ता के बराबर पहुँचा दिया।

निचोड़ (The Bottom Line)

ROMA यह सिद्ध करता है कि कठिन समस्याओं को हल करने के लिए आपको एक एकल, सर्वशक्तिमान AI की आवश्यकता नहीं है। इसके बजाय, आपको एक संरचित प्रणाली (structured system) की आवश्यकता है जो बड़ी समस्याओं को छोटी समस्याओं में तोड़ती है, उन्हें विशिष्ट कार्यकर्ताओं को सौंपती है, और जैसे-जैसे परिणाम वापस ऊपर आते हैं, सावधानीपूर्वक उनका सारांश बनाती है। यह एक स्पष्ट योजना के साथ घर बनाने वाली एक सुव्यवस्थित निर्माण टीम और एक अराजक भीड़ के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →