← नवीनतम पेपर
💬 NLP

LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

यह शोधपत्र LongSumEval को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो संरचित प्रश्न-उत्तर फीडबैक का उपयोग करके व्याख्या योग्य स्कोर और कार्रवाई योग्य मार्गदर्शन प्रदान करके लंबे दस्तावेज़ों के सारांश (long document summarization) के लिए मूल्यांकन और पीढ़ी (generation) के बीच के अंतर को पाटता है, जिससे मॉडल को पुन: प्रशिक्षित किए बिना सारांश की गुणवत्ता और मानवीय निर्णयों के साथ संरेखण में महत्वपूर्ण सुधार होता है।

मूल लेखक: Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding

प्रकाशित 2026-04-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, 50 पन्नों का कानूनी अनुबंध या एक सघन वैज्ञानिक रिपोर्ट है। आप एक स्मार्ट AI से इसे कुछ अनुच्छेदों में सारांशित करने के लिए कहते हैं। AI अपना सर्वश्रेष्ठ प्रयास करता है, लेकिन आप यह कैसे जानेंगे कि सारांश वास्तव में अच्छा है या नहीं?

यह वह समस्या है जिसे शोध पत्र LongSumEval हल करने की कोशिश करता है।

समस्या: "ब्लैक बॉक्स" ग्रेडर

वर्तमान में, सारांशों को ग्रेड देने वाले अधिकांश कंप्यूटर प्रोग्राम एक सख्त गणित के शिक्षक की तरह हैं जो केवल यह देखते हैं कि छात्र ने पाठ्यपुस्तक के बिल्कुल उन्हीं शब्दों का उपयोग किया है या नहीं। यदि छात्र एक वाक्य को पूरी तरह से फिर से लिखता है लेकिन अलग शब्दों का उपयोग करता है, तो कंप्यूटर उसे खराब ग्रेड दे सकता है।

इससे भी बुरा यह है कि ये प्रोग्राम आपको केवल एक संख्या (जैसे "75/100") देते हैं। वे आपको यह नहीं बताते कि आप क्यों असफल हुए। क्या आपने कोई मुख्य बिंदु छोड़ दिया? क्या आपने कोई ऐसा तथ्य बना दिया जो वहां मौजूद ही नहीं था? यह बिना किसी टिप्पणी के टेस्ट में "F" ग्रेड प्राप्त करने जैसा है, जिससे आपको यह समझने का कोई तरीका नहीं मिलता कि अगली बार पढ़ाई कैसे करनी है।

समाधान: "क्विज़ मास्टर" दृष्टिकोण

लेखकों ने LongSumEval नामक एक नई प्रणाली बनाई है। केवल शब्दों को गिनने के बजाय, वे सारांश को एक क्विज़ (प्रश्नोत्तरी) देने वाले छात्र की तरह मानते हैं।

यह कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करते हैं:

1. क्विज़ (मूल्यांकन)
कल्पना कीजिए कि मूल लंबा दस्तावेज़ एक पाठ्यपुस्तक है। सिस्टम पहले एक शिक्षक की तरह कार्य करता है और उस पाठ्यपुस्तक के आधार पर महत्वपूर्ण प्रश्नों की एक सूची बनाता है (जैसे, "घटना का मुख्य कारण क्या था?" या "इसमें कौन शामिल था?")।

फिर, यह AI के सारांश से इन प्रश्नों के उत्तर देने के लिए कहता है।

  • कवरेज चेक (Coverage Check): क्या सारांश इन प्रश्नों के उत्तर दे सकता है? यदि सारांश "कौन शामिल था" के उत्तर को छोड़ देता है, तो सिस्टम को पता चल जाता है कि जानकारी का एक प्रमुख हिस्सा गायब है।
  • फैक्ट चेक (Fact Check): यदि सारांश प्रश्न का उत्तर देता है, तो क्या वह मूल पाठ्यपुस्तक के सत्य से मेल खाता है? यदि पाठ्यपुस्तक कहती है "बैठक मंगलवार को थी" और सारांश कहता है "बुधवार को," तो सिस्टम इस झूठ को पकड़ लेता है।

2. रिपोर्ट कार्ड (संरचित फीडबैक)
केवल एक स्कोर देने के बजाय, यह सिस्टम AI के लिए एक विशिष्ट "टू-डू लिस्ट" (करने योग्य कार्यों की सूची) तैयार करता है।

  • खराब फीडबैक: "आपका सारांश 60% अच्छा है।" (बेकार)
  • LongSumEval फीडबैक: "आपने 'कौन शामिल था' का उत्तर छोड़ दिया, और आपने तारीख गलत बताई। मूल पाठ से सही तारीख यहाँ दी गई है।"

3. स्टडी सेशन (स्व-सुधार)
यही जादुई हिस्सा है। सिस्टम उस विशिष्ट "टू-डू लिस्ट" को लेता है और उसे एक निर्देश के रूप में AI को वापस देता है: "हे, आपने इस व्यक्ति को छोड़ दिया और तारीख गलत कर दी। कृपया इन विशिष्ट चीजों को ठीक करने के लिए अपने सारांश को फिर से लिखें।"

AI फिर सारांश को फिर से लिखता है, ठीक वही चीज़ें सुधारता है जो गलत थीं। यह इसे बार-बार कर सकता है, हर बार बेहतर होता जाता है, बिना खुद को फिर से प्रशिक्षित किए या नए कौशल सीखे।

उन्होंने क्या पाया

शोधकर्ताओं ने सात अलग-अलग प्रकार के दस्तावेजों पर इसका परीक्षण किया, जिसमें छोटी समाचार रिपोर्टों से लेकर विशाल 27,000 शब्दों की सरकारी रिपोर्टें और पेटेंट दस्तावेज शामिल थे।

  • बेहतर ग्रेडिंग: उनके "क्विज़ मास्टर" पद्धति ने पुराने शब्द-गिनती वाले तरीकों की तुलना में मानव विशेषज्ञों के साथ बहुत अधिक सहमति दिखाई। यह विशेष रूप से तब प्रभावी था जब लंबे दस्तावेजों के सारांश महत्वपूर्ण विवरणों को छोड़ देते थे या तथ्य बना लेते थे।
  • बेहतर सारांश: जब उन्होंने AI को अपना काम ठीक करने में मदद करने के लिए सिस्टम के फीडबैक का उपयोग किया, तो सारांश काफी बेहतर हो गए। कुछ मामलों में, "छूटी हुई जानकारी" का स्कोर 80% से अधिक बढ़ गया, और "तथ्यात्मक सटीकता" लगभग 50% सुधर गई।
  • नया बेंचमार्क: उन्होंने पेटेंट दस्तावेजों (आविष्कारों के बारे में कानूनी दस्तावेज) के लिए विशेष रूप से एक नया टेस्ट सेट भी बनाया क्योंकि मौजूदा परीक्षणों में इन्हें अच्छी तरह से कवर नहीं किया गया था।

निष्कर्ष

LongSumEval मूल्यांकन को एक बातचीत में बदलकर खेल बदल देता है। केवल यह कहने के बजाय कि "आप असफल रहे," यह कहता है "यहाँ वह है जो आपने छोड़ा, यहाँ सत्य है, और यहाँ बताया गया है कि इसे कैसे ठीक किया जाए।" यह AI को वास्तविक समय में अपनी गलतियों से सीखने की अनुमति देता है, जिससे ऐसे सारांश बनते हैं जो न केवल छोटे हैं, बल्कि वास्तव में सटीक और पूर्ण भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →