NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track
NightFeats एक संदर्भ-अनुकूलित (context-optimized), मल्टी-एजेंट RAG सिस्टम है जिसने संकीर्ण मीट्रिक अनुकूलन के बजाय वास्तुशिल्प पारदर्शिता और सत्यापन योग्य साक्ष्य ग्राउंडिंग के माध्यम से प्रोप्रायटरी बेसलाइन्स को पछाड़ने के लिए रिट्रीवल (retrieval), क्यूरेशन (curation) और कंपोजिशन (composition) के एक सिद्धांत-आधारित तीन-चरणीय पाइपलाइन का उपयोग करके NeurIPS 2025 में 'बेस्ट डायनेमिक इवैल्यूएशन' जीता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल विषय पर एक आदर्श, विश्वसनीय रिपोर्ट लिखने की कोशिश कर रहे हैं, लेकिन आपके पास एक व्यक्ति द्वारा सब कुछ करने के बजाय तीन विशेषज्ञों की एक टीम है जो मिलकर काम कर रही है। मूल रूप से NightFeats यही है: AI एजेंटों की एक स्मार्ट, तीन-सदस्यीय टीम जिसे सवालों के सटीक उत्तर देने, अपने काम की जांच करने और हमेशा अपना होमवर्क (उद्धरण/citations) दिखाने के लिए डिज़ाइन किया गया है।
यह टीम हाल ही में NeurIPS 2025 में MMU-RAGent नामक एक बड़ी प्रतियोगिता में शामिल हुई थी। जबकि अन्य टीमों ने केवल कंप्यूटर टेस्ट पर "सही" दिखने वाले उत्तर देकर जीतने की कोशिश की, NightFeats ने "Best Dynamic Evaluation" नामक एक विशेष पुरस्कार जीता। इसका अर्थ है कि वास्तविक मनुष्यों ने उनके उत्तरों को पसंद किया क्योंकि वे अधिक विश्वसनीय और भरोसेमंद थे, भले ही कंप्यूटर के स्वचालित स्कोरिंग ने उन्हें उच्चतम अंक न दिए हों।
यहाँ NightFeats टीम के काम करने का तरीका सरल चरणों में दिया गया है:
1. तीन विशेषज्ञ (एजेंट्स)
एक AI द्वारा एक साथ सब कुछ करने के बजाय, NightFeats इस काम को एक न्यूज़रूम की तरह तीन अलग-अलग भूमिकाओं में विभाजित करता है:
द रिसर्चर (ResearchAgent - शोधकर्ता): यह एक जासूस है। जब आप कोई प्रश्न पूछते हैं, तो रिसर्चर केवल पहली मिली चीज़ को नहीं उठाता। यह जानकारी खोजने के लिए दो अलग-अलग जगहों से खोज करता है:
- "फ्रेश" लाइब्रेरी (ताज़ा जानकारी): समाचार या हाल की घटनाओं के लिए, यह नवीनतम वेब परिणामों को देखता है।
- "हिस्ट्री" लाइब्रेरी (इतिहास): पुराने, मौलिक तथ्यों के लिए, यह विशाल अभिलेखागारों (archives) की गहराई में जाता है।
- ट्रिक: यह प्रासंगिकता (उत्तर कितना अच्छा है) और नवीनता (वह कितना नया है) के बीच संतुलन बनाने के लिए एक विशेष फॉर्मूले का उपयोग करता है। यह एक ऐसे लाइब्रेरियन की तरह है जो जानता है कि इतिहास के लिए 10 साल पुरानी किताब एकदम सही हो सकती है, लेकिन आज के शेयर बाजार के लिए 10 मिनट पुराना ब्लॉग पोस्ट बेहतर होगा।
द एडिटर (GeneratorAgent - संपादक): यह एक तथ्य-जांचकर्ता (fact-checker) है। रिसर्चर, एडिटर को दस्तावेजों का एक ढेर भेजता है। एडिटर उन्हें पढ़ता है, मुख्य तथ्यों को निकालता है और विरोधाभासों की तलाश करता है।
- "विरोधाभास" की जाँच: यदि एक स्रोत कहता है "आकाश नीला है" और दूसरा कहता है "आकाश हरा है," तो एडिटर केवल अनुमान नहीं लगाता। वह इसे एक समस्या के रूप में चिह्नित करता है। यदि संघर्ष गंभीर है, तो एडिटर रिसर्चर को बहस को सुलझाने के लिए और अधिक सबूत खोजने के लिए वापस भेजता है। यह केवल एक अंतहीन लूप में फंसने से बचने के लिए कुछ ही बार ऐसा करता है।
द राइटर (WriterAgent - लेखक): यह एक कहानीकार है। एक बार जब एडिटर के पास तथ्यों की एक साफ और सत्यापित सूची होती है, तो राइटर उन्हें एक सहज, पठनीय उत्तर में बदल देता है।
- स्वर्ण नियम: राइटर द्वारा बनाया गया प्रत्येक वाक्य एक "रसीद" (citation) के साथ जुड़ा होना चाहिए। आप केवल कुछ कह नहीं सकते; आपको साबित करना होगा कि आपने वह कहाँ सुना। यह अंतिम उत्तर को पूरी तरह से पता लगाने योग्य (traceable) बनाता है।
2. वे क्यों जीते ("डायनेमिक इवैल्यूएशन" पुरस्कार)
प्रतियोगिता में, सिस्टम को परखने के दो मुख्य तरीके थे:
- रोबोट जज: एक कंप्यूटर प्रोग्राम जो यह जाँचता है कि क्या उत्तर "परफेक्ट" उत्तर के समान शब्दों का उपयोग करता है।
- मानव जज: वास्तविक लोग जिन्होंने उत्तरों को पढ़ा और उस उत्तर को चुना जिसे उन्होंने सबसे अधिक पसंद किया।
रोबोट जज के साथ समस्या:
NightFeats ने वास्तव में रोबट जज के टेस्ट (विशेष रूप से ROUGE-L नामक मीट्रिक पर) में कम स्कोर किया। क्यों? क्योंकि NightFeats बहुत सारे उद्धरण और संदर्भ (जैसे "स्रोत A, स्रोत B") शामिल करता है। रोबोट जज ने सोचा, "इस उत्तर में बहुत सारे अतिरिक्त शब्द और नंबर हैं, यह सटीक परफेक्ट उत्तर से मेल नहीं खाता!"
मानव जज के साथ जीत:
हालाँकि, वास्तविक मनुष्यों ने NightFeats को पसंद किया। उन्होंने "Claude-SonnetV2" और "Nova-Pro" जैसे महंगे, हाई-टेक सिस्टम की तुलना में इसे प्राथमिकता दी। मनुष्यों ने महसूस किया कि स्पष्ट स्रोतों और सत्यापित तथ्यों वाला उत्तर, उस उत्तर की तुलना में बहुत अधिक भरोसेमंद है जो सुनने में तो अच्छा लगता है लेकिन शायद मनगढ़ंत हो सकता है।
3. मुख्य दर्शन (Core Philosophy)
पेपर का तर्क है कि AI बनाने का मतलब केवल कंप्यूटर को उच्च स्कोर देने के लिए धोखा देना नहीं होना चाहिए। इसे एक ऐसा सिस्टम बनाने के बारे में होना चाहिए जो:
- अपने काम की स्वयं जाँच करे (एक तथ्य-जांचकर्ता की तरह)।
- जानता हो कि चीजें कब पुरानी हैं (टेम्पोरल अवेयरनेस)।
- अपने स्रोत दिखाए (साइटेशन ट्रेसेबिलिटी)।
ट्रेड-ऑफ (समझौता)
पेपर एक नुकसान के बारे में ईमानदार है: क्योंकि NightFeats को तथ्यों की जांच करने के लिए रिसर्चर को बाहर भेजना पड़ता है और विरोधाभासों की जांच के लिए एडिटर को भेजना पड़ता है, इसलिए इसे उत्तर देने में थोड़ा अधिक समय लगता है (लगभग 10-15 सेकंड), जो कि एक तेज़, सरल सिस्टम (6-8 सेकंड) की तुलना में अधिक है।
सारांश में:
NightFeats एक उच्च श्रेणी के न्यूज़रूम की तरह है जो तब तक कहानी प्रकाशित करने से इनकार करता है जब तक कि तीन अलग-अलग लोग तथ्यों की जांच न कर लें, तारीखों को सत्यापित न कर लें, और हर दावे के साथ रसीदें न लगा दें। हालांकि इसमें थोड़ा अधिक समय लग सकता है और यह एक कंप्यूटर स्कैनर के लिए "अव्यवस्थित" लग सकता है, लेकिन वास्तविक लोग इस पर अधिक भरोसा करते हैं क्योंकि यह ईमानदार, सटीक और पारदर्शी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।