← नवीनतम पेपर
💬 NLP

RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation

RaguTeam के SemEval-2026 टास्क 8 के लिए विजेता सिस्टम ने, जो सबसे अच्छे रिस्पॉन्स को चुनने के लिए GPT-4o-mini जज द्वारा ऑर्केस्ट्रेटेड सात LLMs के एक हेट्रोजेनियस एनसेम्बल का उपयोग करता है, सबसे मजबूत बेसलाइन से काफी बेहतर प्रदर्शन करते हुए और लागत प्रभावी Meno-Lite-0.1 मॉडल को पेश करते हुए और टास्क की एनोटेशन सीमाओं की आलोचना करते हुए प्रथम स्थान प्राप्त किया।

मूल लेखक: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस पेपर का हिंदी अनुवाद दिया गया है:

बड़ी तस्वीर: AI के लिए एक "टैलेंट शो"

कल्पना कीजिए कि आप एक कठिन सवाल का सबसे अच्छा जवाब खोजने के लिए एक टैलेंट शो आयोजित कर रहे हैं। आपके पास सात अलग-अलग जज (AI मॉडल) हैं, जिनमें से प्रत्येक की अपनी अनूठी शैली, ताकत और कमजोरियां हैं। कुछ विशाल, सुपर-स्मार्ट दिग्गज हैं; अन्य छोटे, विशिष्ट विशेषज्ञ हैं।

नोवोसिबिर्स्क स्टेट यूनिवर्सिटी की टीम, जिसे RaguTeam कहा जाता है, ने केवल "सबसे स्मार्ट" जज को नहीं चुना। इसके बजाय, उन्होंने एक ऐसी प्रणाली बनाई जहाँ सातों जज एक उत्तर लिखते हैं, और फिर एक हेड जज (एक हल्का AI जिसे GPT-4o-mini कहा जाता है) उन सातों उत्तरों को पढ़ता है और उस विशिष्ट प्रश्न के लिए सबसे अच्छा एक उत्तर चुनता है।

उन्होंने इस प्रणाली को SemEval-2026 Task 8 (विशेष रूप से Task B) नामक प्रतियोगिता में उतारा, जो यह परीक्षण करता है कि AI दिए गए दस्तावेजों के आधार पर (एक लंबी बातचीत के दौरान भी) सवालों के जवाब कितनी अच्छी तरह दे सकता है। उनकी प्रणाली ने 26 टीमों में से प्रथम स्थान प्राप्त किया।

समस्या: "हैलुसिनेशन" (भ्रम) का जाल

वास्तविक दुनिया में, AI अक्सर बहुत अधिक मददगार होने की कोशिश करता है। यदि उसे उत्तर नहीं पता होता है, तो वह आत्मविश्वास से दिखने के लिए कुछ भी बना सकता है (हैलुसिनेट कर सकता है)। जब AI को एक तथ्य-जांचकर्ता (fact-checker) के रूप में काम करना होता है, तो यह खतरनाक होता है।

प्रतियोगिता का कार्य पेचीदा था क्योंकि इसमें शामिल था:

  1. मल्टी-टर्न बातचीत: AI को यह याद रखना होगा कि चैट में पहले क्या कहा गया था।
  2. सख्त नियम: AI को केवल प्रदान किए गए "संदर्भ अनुच्छेदों" (जैसे एक क्लोज्ड-बुक परीक्षा) का ही उपयोग करना चाहिए।
  3. "मुझे नहीं पता" का परीक्षण: कभी-कभी दस्तावेजों में उत्तर नहीं होता है। AI को अनुमान लगाने के बजाय "मुझे नहीं पता" कहना चाहिए।

वे कैसे जीते: "स्विस आर्मी नाइफ" रणनीति

1. विविध टीम (द एनसेंबल)

एक सुपर-कंप्यूटर पर भरोसा करने के बजाय, उन्होंने सात अलग-अलग AI मॉडलों की एक टीम का उपयोग किया।

  • दिग्गज (The Giants): उन्होंने विशाल मॉडलों को शामिल किया (जैसे 357 बिलियन पैरामीटर्स वाला GLM-4.6), जो विश्वकोश की तरह हैं।
  • विशेषज्ञ (The Specialists): उन्होंने Meno-Lite-0.1 नामक एक कस्टम-निर्मित, छोटा मॉडल शामिल किया। इसे एक 7-बिलियन पैरामीटर वाले मॉडल के रूप में सोचें जिसे विशेष रूप से एक "क्रिएटिव राइटर" के बजाय एक "फैक्ट-चेकर" बनने के लिए प्रशिक्षित किया गया था। यह एक फुर्तीले जासूस की तरह है जो यह पहचानने में बहुत अच्छा है कि जानकारी कब गायब है।
  • मिश्रण (The Mix): उन्होंने विभिन्न कंपनियों (Google, Meta, Microsoft, आदि) और विभिन्न आकारों के मॉडलों का उपयोग किया। विचार यह है कि यदि एक मॉडल गलती करता है, तो दूसरा उसे सही कर सकता है।

2. दो प्रॉम्प्टिंग शैलियाँ

उन्होंने मॉडलों से केवल एक ही तरह से नहीं पूछा। उन्होंने दो अलग-अलग "निर्देश शैलियों" का उपयोग किया:

  • शैली A (नियम पुस्तिका): नियमों का एक सख्त सेट जो AI को केवल दिए गए टेक्स्ट तक ही सीमित रहने के लिए कहता है।
  • शैली B (उदाहरण): उन्होंने AI को पेचीदा स्थितियों (जैसे जब कोई दस्तावेज़ न हो या जब बातचीत का इतिहास खाली हो) को संभालने के तरीके के कुछ उदाहरण दिए। यह एक छात्र को वास्तविक परीक्षा से पहले अभ्यास टेस्ट दिखाने जैसा है।

3. हेड जज (चयन)

यही असली सफलता का मंत्र है। प्रत्येक प्रश्न के लिए, सातों मॉडलों ने एक उत्तर तैयार किया। फिर, हेड जज (GPT-4o-mini) ने उन सभी को पढ़ा और पूछा: "इनमें से कौन सा उत्तर दस्तावेजों के प्रति सबसे अधिक वफादार है?"

  • यदि दस्तावेज़ खाली थे, तो सिस्टम ने स्वचालित रूप से "मुझे नहीं पता" कहा (एक सुरक्षित, सटीक कदम)।
  • यदि दस्तावेजों में उत्तर था, तो हेड जज ने उस उत्तर को चुना जिसने तथ्य नहीं गढ़े।

मुख्य निष्कर्ष ("अहा!" क्षण)

  • विविधता > आकार: जीतने वाली टीम ने साबित किया कि विभिन्न मॉडलों का मिश्रण होना एक सबसे बड़े, सबसे महंगे मॉडल के होने से बेहतर है। उनकी "टीम" ने अकेले दौड़ने वाले धावक (GLM-4.6) को काफी बड़े अंतर से हराया। यह एक रिले टीम के मुकाबले एकल धावक की तरह है, क्योंकि टीम ने अधिक क्षेत्र कवर किया।
  • उदाहरण नियमों से बेहतर हैं: जब उन्होंने AI को "मुझे नहीं पता" वाली स्थितियों को संभालने के लिए विशिष्ट उदाहरण दिए (Few-shot prompting), तो इसने अमूर्त नियमों की तुलना में बहुत बेहतर प्रदर्शन किया। यह एक बच्चे को केवल "अच्छे बनो" कहने के बजाय, किसी को साझा करते हुए वीडियो दिखाने जैसा है।
  • छोटे मॉडल की भूमिका: कस्टम 7B मॉडल (Meno-Lite-0.1) ने सबसे अधिक वोट नहीं जीते, लेकिन जब इसे चुना गया, तो यह अक्सर एक सटीक उत्तर था। यह एक "विशेषज्ञ" था जिसने विशिष्ट स्थितियों में काम बचाया, जिससे सिद्ध हुआ कि हर काम के लिए आपको विशाल मस्तिष्क की आवश्यकता नहीं होती है।

आलोचना: खेल थोड़ा पक्षपाती था

लेखकों ने स्वयं प्रतियोगिता में एक खामी की ओर इशारा किया।

  • "खाली बॉक्स" का शॉर्टकट: टेस्ट में, जब भी कोई प्रश्न "अनुत्तरित" था, तो दिए गए दस्तावेज़ पूरी तरह से खाली थे। इसने AI के लिए जीतना बहुत आसान बना दिया: उसे बस "खाली बॉक्स" का पता लगाना था और "मुझे नहीं पता" कहना था।
  • वास्तविक जीवन कठिन है: वास्तविक दुनिया में, अनुत्तरित प्रश्नों के साथ अप्रासंगिक दस्तावेज़ (डिस्ट्रैक्टर्स) भी आते हैं। लेखकों का तर्क है कि भविष्य के परीक्षणों में इन "डिस्ट्रैक्टर्स" को शामिल किया जाना चाहिए ताकि AI को कड़ी मेहनत करनी पड़े और यह साबित हो सके कि वह वास्तव में टेक्स्ट को समझता है, न कि केवल खाली जगह को पहचान रहा है।

सारांश

Ragu-Team ने AI जनरेशन को एक टैलेंट शो की तरह मानकर जीत हासिल की। उन्होंने पात्रों की एक विविध कास्ट (विभिन्न AI मॉडल) इकट्ठा की, उन्हें तैयारी करने के अलग-अलग तरीके दिए (प्रॉम्प्ट्स), और हर राउंड के विजेता को चुनने के लिए एक स्मार्ट रेफरी (हेड जज) को नियुक्त किया। उन्होंने दिखाया कि विविध AI की एक अच्छी तरह से समन्वित टीम, अकेले काम करने वाले किसी भी एकल AI की तुलना में अधिक स्मार्ट और अधिक विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →