← नवीनतम पेपर
💬 NLP

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

यह शोध पत्र DoGMaTiQ को प्रस्तुत करता है, जो एक स्वचालित तीन-चरणीय पाइपलाइन है जो बहुभाषी दस्तावेज़ों से उच्च-गुणवत्ता वाले प्रश्न-उत्तर आधारित नगेट्स (nuggets) उत्पन्न करता है ताकि लंबे, उद्धरण-आधारित रिपोर्टों के स्केलेबल और पूर्णतः स्वचालित मूल्यांकन को सक्षम बनाया जा सके, जो क्रॉस-लिंगुअल बेंचमार्क में मानवीय निर्णयों के साथ मजबूत सहसंबंध प्रदर्शित करता है।

मूल लेखक: Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र की लंबी, विस्तृत शोध रिपोर्ट (research report) का मूल्यांकन कर रहे हैं। छात्र ने एक जटिल प्रश्न का उत्तर देने के लिए कई अलग-अलग पुस्तकों और लेखों (कुछ तो अलग-अलग भाषाओं में भी) से जानकारी एकत्र की है।

आपका काम यह जांचना है: क्या छात्र ने वास्तव में सबसे महत्वपूर्ण तथ्यों को खोजा और शामिल किया है?

पारंपरिक रूप से, शिक्षक (या स्वचालित प्रणालियाँ) विशिष्ट तथ्यों की एक चेकलिस्ट बनाते हैं, जैसे "रिपोर्ट में उल्लेख होना चाहिए कि माचू पिचू पेरू में है।" लेकिन इस दृष्टिकोण में कुछ समस्याएँ हैं:

  1. यह कठोर है: यदि छात्र "पेरू" कहता है लेकिन चेकलिस्ट में "दक्षिण अमेरिका" लिखा है, तो सिस्टम भ्रमित हो सकता है।
  2. इसमें बहुत मेहनत लगती है: ऐसी चेकलिस्ट को हाथ से बनाने में बहुत समय लगता है।
  3. यह दोहराव वाला है: यदि दस अलग-अलग स्रोत एक ही बात कहते हैं, तो चेकलिस्ट में उस तथ्य को दस बार लिखा जा सकता है, जिससे ग्रेडिंग गलत हो सकती है।

यहाँ आता है DoGMaTiQ।

यह शोध पत्र एक नया, स्वचालित सिस्टम पेश करता है जिसे DoGMaTiQ (एक फैंसी नाम जिसका अर्थ है "Document-Grounded, Merged, and Top-Criteria Question-based Nuggets") कहा जाता है। DoG-MaTiQ को एक बेहतर, स्मार्ट चेकलिस्ट बनाने वाले सुपर-स्मार्ट टीचिंग असिस्टेंट के रूप में समझें।

यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:

1. "इंटरव्यू" चरण (Generation)

केवल एक दस्तावेज़ को पढ़कर तथ्य निकालने के बजाय, DoGMaTiQ एक पत्रकार की तरह व्यवहार करता है। यह एक स्रोत दस्तावेज़ को पढ़ता है और खुद से पूछता है: "यदि मैं एक जिज्ञासु पाठक होता, तो मैं इस बारे में क्या प्रश्न पूछता?"

  • यह प्रश्न-और-उत्तर (QA) जोड़े बनाता है।
  • उदाहरण: केवल यह लिखने के बजाय कि "माचू पिचू पेरू में स्थित है," यह बनाता है: "माचू पिचू कहाँ स्थित है?" उत्तर के साथ "पेरू।"
  • यह बेहतर क्यों है: यह प्रश्न (जो हम जानना चाहते हैं) को उत्तर (जो तथ्य है) से अलग करता है। यह विभिन्न भाषाओं को आसानी से संभाल लेता है क्योंकि प्रश्न वही रहता है, भले ही उत्तर रूसी या चीनी दस्तावेज़ से आया हो।

2. "ग्रुपिंग" चरण (Clustering)

अब, सिस्टम के पास सैकड़ों दस्तावेज़ों से सैकड़ों प्रश्न हैं। इनमें से कुछ डुप्लिकेट हैं।

  • उदाहरण: एक दस्तावेज़ पूछता है, "माचू पिचू कब बनाया गया था?" दूसरा पूछता है, "माचू पिचू का निर्माण किस वर्ष हुआ था?"
  • DoGMaTiQ इतना स्मार्ट है कि वह समझ जाता है कि ये एक ही प्रश्न हैं। यह उन्हें एक ही "नगेट" (Nugget) में समूहित करता है जिसमें एक ही प्रश्न लेकिन कई संभावित उत्तर होते हैं (जैसे, "1500 का दशक" और "1440")।
  • यह चेकलिस्ट को एक ही तथ्य को बार-बार दोहराकर अनावश्यक रूप से भरने से रोकता है।

3. "क्यूरेटर" चरण (Selection)

अब सिस्टम के पास बेहतरीन प्रश्नों का एक बड़ा ढेर है। लेकिन एक रिपोर्ट में सब कुछ शामिल नहीं हो सकता। ग्रेड करने के लिए शिक्षक को शीर्ष 20 सबसे महत्वपूर्ण प्रश्नों की एक अंतिम सूची की आवश्यकता होती है।

  • DoGMaTiQ एक "क्वालिटी फ़िल्टर" का उपयोग करता है। यह केवल सबसे आम तथ्यों को नहीं चुनता; यह चुने हुए प्रश्नों को स्पष्ट, उपयोगी और विषय के लिए महत्वपूर्ण बनाने के लिए एक सीखे हुए मॉडल (जैसे एक प्रशिक्षित जज) का उपयोग करता है।
  • यह जाँचता है जैसे: "क्या यह प्रश्न समझने में आसान है?" "क्या यह वास्तव में विषय के लिए महत्वपूर्ण है?"

बड़ा परीक्षण: क्या यह काम करता है?

शोधकर्ताओं ने वास्तविक दुनिया की प्रतियोगिताओं (TREC) पर DoGMaTiQ का परीक्षण किया, जहाँ कंप्यूटर रिपोर्ट तैयार करते हैं। उन्होंने DoGMaTiQ द्वारा दिए गए ग्रेड की तुलना मानवीय विशेषज्ञों द्वारा दिए गए ग्रेड से की।

  • परिणाम: DoGMaTiQ का ग्रेडिंग, मानवीय विशेषज्ञों की ग्रेडिंग के बहुत समान था।
  • "सर्कुलैरिटी" (Circularity) का जाल: शोध पत्र ने एक छिपे हुए खतरे का भी पता लगाया। यदि आप रिपोर्ट लिखने के लिए एक ही AI मस्तिष्क का उपयोग करते हैं और रिपोर्ट को ग्रेड करने के लिए भी उसी का उपयोग करते हैं, तो AI खुद को फर्जी उच्च स्कोर दे सकता है (जैसे एक छात्र अपने स्वयं के होमवर्क को ग्रेड कर रहा हो)। DoGMaTiQ इस खतरे से बचता है क्योंकि यह रिपोर्ट लिखने वाले AI से अलग "मस्तिष्क" का उपयोग करके प्रश्न उत्पन्न करता है, जिससे निष्पक्ष ग्रेडिंग सुनिश्चित होती है।

निचोड़ (The Bottom Line)

DoGMaTiQ एक ऐसा टूल है जो AI-जनरेटेड रिपोर्ट को ग्रेड करने के लिए एक उच्च-गुणवत्ता वाला, निष्पक्ष और कुशल "उत्तर कुंजी" (answer key) स्वचालित रूप से बनाता है। यह एक उबाऊ, मैनुअल काम को एक तेज़, स्वचालित प्रक्रिया में बदल देता है जो अभी भी ऐसा महसूस कराता है जैसे इसे किसी सतर्क मानव शिक्षक द्वारा किया गया हो।

यह क्या नहीं है:

  • यह रिपोर्ट बनाने के लिए कोई टूल नहीं है।
  • यह कोई मेडिकल या क्लिनिकल टूल नहीं है।
  • यह पूरी तरह से मानव शिक्षकों का विकल्प नहीं है; बल्कि, यह शोधकर्ताओं को यह समझने में मदद करने के लिए एक उपकरण है कि AI सिस्टम कहाँ विफल हो रहे हैं ताकि मनुष्य उन्हें ठीक कर सकें।

संक्षेप में, DoGMaTiQ वह स्वचालित ग्रेडर है जो यह सुनिश्चित करता है कि AI रिपोर्ट वास्तव में सच बोल रही हैं, बिना किसी इंसान द्वारा हर एक शब्द को पढ़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →