← नवीनतम पेपर
🤖 AI

To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG

यह शोध पत्र MADARA को प्रस्तुत करता है, जो एक मॉडल-अनुकूली रूटिंग आर्किटेक्चर है जो यह पहचानकर लागत-कुशल मल्टी-एजेंट RAG को अनुकूलित करता है कि क्या कमजोर मॉडलों को संदर्भ भ्रम (context confusion) को हल करने के लिए मुख्य रूप से प्रति-दस्तावेज़ अलगाव (per-document isolation) से लाभ होता है या मजबूत मॉडलों को स्कोरिंग-आधारित मूल्यांकन की आवश्यकता होती है, जिससे शून्य-शॉट सामान्यीकरण योग्य नैदानिक थ्रेशोल्ड (zero-shot generalizable diagnostic thresholds) के माध्यम से अनावश्यक कम्प्यूटेशनल ओवरहेड को समाप्त किया जाता है।

मूल लेखक: Jungseob Lee, Chanjun Park, Heuiseok Lim

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jungseob Lee, Chanjun Park, Heuiseok Lim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं और इसके लिए आपने जासूसों की एक टीम को 10 अलग-अलग गवाहों की रिपोर्ट पढ़ने के लिए कहा है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है। आमतौर पर, सबसे अच्छा उत्तर पाने के लिए, आप एक "सीनियर डिटेक्टिव" (एक विशाल, महंगा AI मॉडल) को उन सभी 10 रिपोर्टों को पढ़ने, उन पर बहस करने और उनमें से सबसे अच्छी रिपोर्ट चुनने के लिए काम पर रख सकते हैं।

लेकिन हर एक सवाल के लिए सीनियर डिटेक्टिव को काम पर रखना अविश्वसनीय रूप से महंगा और धीमा है। इसलिए, कंपनियाँ "जूनियर डिटेक्टिव" (छोटे, सस्ते 7B–9B AI मॉडल) को काम पर रखने की कोशिश कर रही हैं।

समस्या यह है कि जूनियर डिटेक्टिव अक्सर एक साथ कागजों के पूरे ढेर को देखते समय भ्रमित हो जाते हैं। वे तथ्यों को मिला सकते हैं, ढेर के बीच में खो सकते हैं, या बस अंदाजे लगाने लगते हैं।

यह पेपर, "To Isolate or to Score?", एक सरल प्रश्न पूछता है: जब हम इन जूनियर डिटेक्टिव का उपयोग करते हैं, तो क्या हमें वास्तव में बेहतर उत्तर इसलिए मिल रहे हैं क्योंकि वे "ज़्यादा गहराई से सोच रहे हैं" (scoring), या इसलिए मिल रहे हैं क्योंकि हमने उन्हें भ्रमित होने से रोक दिया है (isolating)?

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है:

1. बड़ी खोज: "आइसोलेशन" बनाम "स्कोरिंग"

शोधकर्ताओं ने "कमजोर" मॉडलों और "मजबूत" मॉडलों के बीच एक स्पष्ट विभाजन पाया है।

  • कमजोर मॉडल (भ्रमित इंटर्न):
    कल्पना कीजिए कि एक जूनियर इंटर्न को 10 विरोधाभासी गवाह रिपोर्टों का एक अस्त-व्यस्त ढेर थमा दिया गया है। यदि आप उनसे पूरी ढेर को पढ़ने और उनमें से सबसे अच्छी रिपोर्ट चुनने के लिए कहते हैं, तो वे घबरा जाते हैं। वे केवल इसलिए गलत रिपोर्ट चुन सकते हैं क्योंकि वे भ्रमित हैं।

    • समाधान: इस पेपर ने पाया कि इन कमजोर मॉडलों के लिए, सबसे अच्छी रणनीति आइसोलेशन (Isolation) है। आपको उन्हें रिपोर्टों पर बहस करने की ज़रूरत नहीं है। आपको बस उन्हें एक बार में एक रिपोर्ट देनी है, उन्हें उत्तर लिखने के लिए कहना है, और फिर सूची में से सबसे अच्छे उत्तर को चुनना है।
    • आश्चर्य: इससे कोई फर्क नहीं पड़ता था कि उन्होंने कौन सी रिपोर्ट पढ़ी! यदि आप उन्हें केवल एक-एक करके रैंडम रिपोर्ट देते (बिना किसी जटिल सिस्टम या रिपोर्ट की गुणवत्ता को परखने के), तो वे उतना ही अच्छा प्रदर्शन करते जितना कि एक जटिल सिस्टम जो रिपोर्ट की गुणवत्ता का आकलन करने की कोशिश करता।
    • सबक: कमजोर मॉडलों के लिए, समस्या यह नहीं है कि वे गुणवत्ता का निर्णय नहीं कर सकते; समस्या यह है कि वे एक साथ बहुत अधिक जानकारी को नहीं संभाल सकते। "भ्रम" को हल करना, उन्हें "ज़्यादा गहराई से सोचने" के लिए मजबूर करने की तुलना में 50% अधिक प्रदर्शन देता है।
  • मजबूत मॉडल (अनुभवी जासूस):
    अब एक सीनियर डिटेक्टिव की कल्पना करें। वे 10 रिपोर्टों के ढेर को आसानी से संभाल सकते हैं। वे भ्रमित नहीं होते।

    • समाधान: इन मॉडलों के लिए, "आइसोलेशन" (एक-एक करके पढ़ना) वास्तव में समय की बर्बादी है। उन्हें स्कोरिंग (Scoring) की आवश्यकता होती है। उन्हें सभी रिपोर्टों को पढ़ने, तथ्यों पर बहस करने और सबसे अच्छा चुनने के लिए अपने तर्क का उपयोग करने की आवश्यकता है।
    • सबक: यदि आप एक मजबूत डिटेक्टिव को केवल एक बार में एक रिपोर्ट देखने के लिए मजबूर करते हैं, तो आप वास्तव में उनकी पूरी मानसिक शक्ति का उपयोग करने से उन्हें रोक देते हैं।

2. नया टूल: MADARA (स्मार्ट मैनेजर)

चूंकि हमारे पास दोनों प्रकार के लोग हैं—"भ्रमित इंटर्न" और "अनुभवी जासूस"—हमें एक ऐसे मैनेजर की आवश्यकता है जो जानता हो कि किसे किस काम के लिए उपयोग करना है। लेखकों ने MADARA नामक एक सिस्टम बनाया है।

MADARA को एक स्मार्ट मैनेजर के रूप में सोचें जिसे जांच चलाने के लिए पूरे केस फाइल को पढ़ने की आवश्यकता नहीं है।

  • डायग्नोस्टिक टेस्ट: वास्तविक काम शुरू करने से पहले, MADARA एक छोटा, मुफ्त टेस्ट चलाता है (केवल 100 सैंपल प्रश्नों का उपयोग करके) यह देखने के लिए कि मॉडल कैसा व्यवहार करता है।
    • यह जाँचता है: "यदि मैं रिपोर्टों में तर्क (logic) को बिगाड़ दूँ, तो क्या मॉडल का कॉन्फिडेंस स्कोर एक अनुमानित तरीके से कम होता है?"
    • यदि हाँ: तो वह एक "मजबूत डिटेक्टिव" है। MADARA उसे स्कोरिंग (रिपोर्टों पर बहस करना और रैंक देना) का उपयोग करने के लिए कहता है।
    • यदि नहीं: तो वह एक "भ्रमित इंटर्न" है। MADARA उसे आइसोलेशन (एक-एक करके रिपोर्ट पढ़ना, बहस को अनदेखा करना) का उपयोग करने के लिए कहता है।

3. यह क्यों महत्वपूर्ण है

यह पेपर दावा करता है कि कई वर्तमान, लागत प्रभावी AI मॉडलों के लिए, हम उन्हें दस्तावेजों पर "बहस" करने और "स्कोर" करने के लिए लगाकर पैसा और समय बर्बाद कर रहे हैं।

  • "अहा!" मोमेंट: कमजोर मॉडलों के लिए, "बहस" बेकार है। असली जादू केवल दस्तावेजों को अलग करने में है ताकि मॉडल खो न जाए।
  • परिणाम: MADARA का उपयोग करके, आप स्वचालित रूप से "भ्रमित इंटर्न" को "एक-एक करके" वाली रणनीति की ओर और "अनुभवी जासूसों" को "बहस" वाली रणनीति की ओर भेज सकते हैं। यह बहुत अधिक कंप्यूटिंग पावर बचाते हुए (इसे 4 गुना सस्ता बनाते हुए) बेहतर उत्तर प्राप्त करता है।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप घास के ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप घास के पूरे ढेर को देखने, सुई कहाँ है इस पर बहस करने और वोट देने के लिए लोगों की एक टीम को काम पर रखते हैं। यह धीमा और महंगा है।
  • पेपर का तरीका:
    • यदि आपके टीम के सदस्य नए लोग (newbies) हैं, तो बहस करना बंद कर दें। बस उन्हें एक बार में घास का एक छोटा सा हिस्सा दें। उन्हें उस छोटे हिस्से में सुई खोजने दें। फिर सबसे अच्छी खोज को चुनें। बहस उन्हें केवल विचलित कर रही थी।
    • यदि आपके टीम के सदस्य विशेषज्ञ (experts) हैं, तो उन्हें पूरे घास के ढेर को देखने और बहस करने दें। काम करने के लिए उन्हें पूरी तस्वीर की आवश्यकता है।
    • MADARA वह सुपरवाइजर है जो तुरंत जान जाता है कि कौन नया है और कौन विशेषज्ञ है, और समय और पैसा बचाने के लिए सही कार्य सौंपता है।

मुख्य बात: बेहतर परिणाम प्राप्त करने के लिए आपको हमेशा एक स्मार्ट AI की आवश्यकता नहीं होती; कभी-कभी, आपको बस AI को एक साथ बहुत अधिक जानकारी से अभिभूत (overwhelmed) होने से रोकने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →