← नवीनतम पेपर
💬 NLP

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो विश्लेषणात्मक निबंध स्कोरिंग को बेहतर बनाने के लिए मल्टी-एजेंट डिबेट को रिट्रीवल-ऑगमेंटेड ग्राउंडिंग के साथ जोड़ता है ताकि मानक LLM-एज़-जज दृष्टिकोणों के पूर्वाग्रह और अस्थिरता को कम करते हुए पर्यवेक्षित प्रणालियों (supervised systems) के तुलनीय प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जिसके पास ग्रेड करने के लिए 100 निबंधों का ढेर लगा है। आपको लेखन के विभिन्न हिस्सों पर विशिष्ट फीडबैक देना है, जैसे कि "विचार" (Ideas), "संगठन" (Organization), और "व्याकरण" (Grammar)। यह अकेले करना थका देने वाला है, और यदि आप अपना सर्वश्रेष्ठ देने की कोशिश करते हैं, तो भी आप थक सकते हैं और काम खत्म करने के चक्कर में हर चीज़ को एक "औसत" स्कोर दे सकते हैं।

यह शोध पत्र MADRAG को पेश करता है, जो AI (आर्टिफिशियल इंटेलिजेंस) का उपयोग करके इन निबंधों को ग्रेड करने का एक नया तरीका है, जिसमें AI को पहले से कुछ भी नया सिखाने की आवश्यकता नहीं है। MADRAG को एक एकल रोबोट शिक्षक के रूप में नहीं, बल्कि कंप्यूटर के भीतर एक लघु-अदालत (mini-courtroom) के रूप में समझें।

यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:

1. नियमित AI ग्रेडर्स के साथ समस्या

आमतौर पर, जब आप किसी मानक AI को निबंध ग्रेड करने के लिए कहते हैं, तो वह एक अकेले न्यायाधीश की तरह कार्य करता है। वह निबंध पढ़ता है और एक स्कोर देता है। शोध पत्र कहता है कि यह अक्सर दो तरीकों से गलत हो जाता है:

  • "मध्यम" का जाल (The "Middle" Trap): AI बहुत अधिक या बहुत कम स्कोर देने से डरता है, इसलिए यह अक्सर हर चीज़ को "C" या "B" दे देता है, भले ही निबंध अद्भुत हो या बहुत खराब।
  • "भ्रम" (Hallucination) का जोखिम: बिना किसी संदर्भ के, AI अपने सामान्य प्रशिक्षण के आधार पर अनुमान लगा सकता है कि एक "अच्छा" निबंध कैसा दिखता है, जो कि गलत हो सकता है।

2. MADRAG समाधान: एक तीन-सदस्यीय टीम

इसे ठीक करने के लिए, MADRAG इस काम को एक बहस टीम की तरह तीन अलग-अलग भूमिकाओं में विभाजित करता है:

  • वकील/समर्थक (The Advocate - द चीयरलीडर): यह AI एजेंट निबंध को देखता है और केवल अच्छी चीज़ों को ढूंढता है। यह तर्क देता है कि निबंध क्यों महान है। यह बुरी चीज़ों को अनदेखा कर देता है।
  • संदेहवादी (The Skeptic - द क्रिटिक): यह एजेंट उसी निबंध को देखता है और केवल बुरी चीज़ों को ढूंढता है। यह तर्क देता है कि निबंध क्यों विफल होता है। यह अच्छी चीज़ों को अनदेखा कर देता है।
  • न्यायाधीश (The Judge - द रेफरी): यह अंतिम निर्णय लेने वाला है। यह दोनों पक्षों (चीयरलीडर और क्रिटिक) की दलीलें सुनता है। यह अंतिम स्कोर तय करने के लिए उनके तर्कों को तौलता है।

यह क्यों मदद करता है: AI को दोनों पक्षों पर बहस करने के लिए मजबूर करके, यह "मध्यम के जाल" को रोकता है। न्यायाधीश को एक सुरक्षित औसत संख्या का अनुमान लगाने के बजाय, एक मजबूत "यह महान है!" और एक मजबूत "यह बहुत बुरा है!" के बीच चुनाव करना पड़ता है।

3. गुप्त हथियार: "स्कोर किया गया निबंध पुस्तकालय" (Retrieval)

शोध पत्र न्यायाधीश को और भी सटीक बनाने के लिए एक दूसरा स्तर जोड़ता है। निर्णय लेने से पहले, न्यायाधीश पहले से ग्रेड किए गए निबंधों के एक पुस्तकालय को खोजता है।

कल्पना कीजिए कि न्यायाधीश यह तय करने की कोशिश कर रहा है कि कोई निबंध "4" है या "5"। अनुमान लगाने के बजाय, सिस्टम न्यायाधीश को उस निबंध के समान दिखने वाले एक "4" स्कोर वाले निबंध और एक "5" स्कोर वाले निबंध को पुस्तकालय से प्रदान करता है।

  • उपमा (Analogy): यह एक नए कर्मचारी की तरह है जो यह समझने की कोशिश कर रहा है कि एक पुरानी कार की कीमत कैसे तय की जाए। अनुमान लगाने के बजाय, वह 10,000मेंबिकीएकसमानकारकीफोटोऔर10,000 में बिकी एक समान कार की फोटो और 12,000 में बिकी दूसरी कार की फोटो देखता है। वह नई कार की तुलना उन फोटो से करता है ताकि सही कीमत मिल सके।

इस चरण को रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation - RAG) कहा जाता है। यह न्यायाधीश को स्कोर को "कैलिब्रेट" करने में मदद करता है ताकि वह मानवीय सोच से दूर न जाए।

4. जब उन्होंने इसे आज़माया तो क्या हुआ?

शोधकर्ताओं ने वास्तविक छात्र निबंधों (ASAP नामक डेटासेट) पर इस प्रणाली का परीक्षण किया। यहाँ उनके निष्कर्ष दिए गए हैं:

  • अकेले AI से बेहतर: MADRAG ने अकेले काम करने वाले एकल AI की तुलना में निबंधों को बहुत अधिक सटीकता से स्कोर किया।
  • विशेषज्ञों के बराबर: आमतौर पर, AI को अच्छी तरह से ग्रेड करने के लिए, आपको इसे हजारों उदाहरणों पर "प्रशिक्षित" करना होता है (जैसे किसी छात्र को वर्षों तक सिखाना)। MADRM को इस प्रशिक्षण की आवश्यकता नहीं थी। इसने उन अत्यधिक प्रशिक्षित प्रणालियों के समान प्रदर्शन किया, लेकिन यह तुरंत काम करने के लिए तैयार था।
  • "मध्यम" के जाल को ठीक करना: यह प्रणाली बहुत अच्छे निबंधों और बहुत खराब निबंधों को पहचानने में बहुत बेहतर थी, बजाय इसके कि वह सबको "B" दे दे।
  • बहस मायने रखती है: "समर्थक बनाम संदेहवादी" की बहस "विचारों" और "संगठन" जैसी बड़ी अवधारणाओं को परखने के लिए विशेष रूप से अच्छी थी।
  • पुस्तकालय मायने रखता है: "ग्रेड किए गए निबंधों का पुस्तकालय" विशिष्ट विवरणों के लिए स्कोर को ठीक करने की कुंजी थी, जिससे AI को यह समझने में मदद मिली कि स्कोर वास्तव में कहाँ होना चाहिए।

5. कमी (सीमाएं)

शोध पत्र कुछ बातों के बारे में ईमानदार है जो अभी तक पूरी तरह से काम नहीं करती हैं:

  • इसे चलाना महंगा है: क्योंकि यह तीन अलग-अलग AI "मस्तिष्क" का उपयोग करता है और प्रत्येक निबंध के लिए एक पुस्तकालय खोजता है, इसमें एक साधारण AI ग्रेडर की तुलना में अधिक कंप्यूटर पावर और समय लगता है।
  • इसे एक पुस्तकालय की आवश्यकता है: आप इस प्रणाली का उपयोग तब नहीं कर सकते जब आपके पास पहले से ग्रेड किए गए निबंधों का संग्रह न हो जिसे "पुस्तकालय" के रूप में उपयोग किया जा सके।
  • प्लेसहोल्डर्स के साथ भ्रम: परीक्षण किए गए निबंधों में गोपनीयता बनाए रखने के लिए नकली नाम और तारीखें (जैसे "@PERSON") थीं। AI कभी-कभी भ्रमित हो गया, यह मानकर कि "@PERSON" एक व्याकरण संबंधी गलती है, जिससे स्कोर प्रभावित हुआ।

सारांश

MADRAG निबंधों को ग्रेड करने का एक स्मार्ट, प्रशिक्षण-मुक्त तरीका है। एक एकल AI द्वारा स्कोर का अनुमान लगाने के बजाय, यह एक टीम (एक चीयरलीडर, एक क्रिटिक और एक रेफरी) और पिछले उदाहरणों के एक संदर्भ पुस्तकालय का उपयोग करता है ताकि यह सुनिश्चित हो सके कि स्कोर निष्पक्ष, सटीक और केवल बीच में न फंसा रहे। यह साबित करता है कि आप उच्च गुणवत्ता वाली ग्रेडिंग बिना महीनों प्रशिक्षण के प्राप्त कर सकते हैं, बशर्ते आप उन्हें बहस करने और तुलना करने के सही उपकरण दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →