Abstractiveness Metrics for Evaluating Text Summarization: A Refined Formulation with Empirical Validation
यह शोध पत्र टेक्स्ट सारांशों में अमूर्तता (abstraction) की डिग्री को मापने के लिए संदर्भ अमूर्तता (Reference Abstraction), सारांश अमूर्तता (Summary Abstraction) और अमूर्तता अनुपात (Abstraction Ratio) को सिद्धांतगत ह्यूरिस्टिक मेट्रिक्स के रूप में प्रस्तुत करता है, जो XSUM डेटासेट पर अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि ये माप निष्कर्षणत्मक (extractive) और अमूर्तकारी (abstractive) मॉडलों के बीच प्रभावी ढंग से अंतर करते हैं और संभावित मतिभ्रम (hallucinations) की पहचान करते हैं।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र की बुक रिपोर्ट (किताब की समीक्षा) को ग्रेड कर रहे हैं। छात्र को 50 पन्नों के उपन्यास का एक पन्ने में सारांश लिखना है।
वर्षों से, शिक्षकों ने इन रिपोर्टों को ग्रेड करने के लिए ROUGE नामक टूल का उपयोग किया है। ROUGE एक सख्त 'कॉपी-पेस्ट डिटेक्टर' की तरह है। यह छात्र को उच्च अंक देता है यदि छात्र की रिपोर्ट में ठीक वही शब्द और वाक्य होते हैं जो किसी अन्य शिक्षक द्वारा लिखे गए "परफेक्ट" उत्तर कुंजी (answer key) में होते हैं। लेकिन इसमें एक पेंच है: ROUGE इस बात की परवाह नहीं करता कि छात्र ने वास्तव में किताब पढ़ी है या नहीं। यदि छात्र ने उत्तर कुंजी को शब्द-दर-शब्द कॉपी किया है, तो उसे 'A' ग्रेड मिलता है। यदि उसने कुछ बिल्कुल नया लिखा है लेकिन कुछ कीवर्ड्स छूट गए हैं, तो उसे 'C' ग्रेड मिलता है।
इस शोध पत्र के लेखक, प्रवींद्रकुमार, राकेश और काली कहते हैं, "ठहरिए! हमें यह मापने के लिए एक तरीके की आवश्यकता है कि छात्र वास्तव में कितना सोच रहा है और पुनर्लेखन (एब्स्ट्रैक्शन/abstracting) कर रहा है बनाम केवल कॉपी (एक्सट्रैक्टिंग/extracting) कर रहा है।" वे उन छात्रों को भी पकड़ना चाहते हैं जो ऐसी बातें बना रहे हैं (हैलुसिनेशन/hallucinating) जो किताब में हैं ही नहीं।
इसे करने के लिए, उन्होंने तीन नए "सुपर-मेट्रिक्स" बनाए: रेफरेंस एब्स्ट्रैक्शन (RA), समरी एब्स्ट्रैक्शन (SA), और एब्स्ट्रैक्शन रेशियो (AR)।
तीन नए उपकरण
मूल किताब को एक सोर्स (Source) के रूप में, परफेक्ट उत्तर कुंजी को एक रेफरेंस (Reference) के रूप में, और छात्र के काम को एक समरी (Summary) के रूप में सोचें।
- रेफरेंस एब्स्ट्रैक्शन (RA): यह मापता है कि उत्तर कुंजी स्वयं किताब को कितनी बार लिख रही है। क्या कुंजी केवल वाक्यों को कॉपी कर रही है, या वह उन्हें रचनात्मक रूप से सारांशित कर रही है?
- समरी एब्स्ट्रैक्शन (SA): यह मापता है कि छात्र का सारांश किताब को कितनी बार लिख रहा है।
- एब्स्ट्रैक्शन रेशियो (AR): यह मुख्य आकर्षण है। यह छात्र की रचनात्मकता की तुलना उत्तर कुंजी की रचनात्मकता से करता है। यह पूछता है: "क्या छात्र अधिक, कम, या लगभग उतना ही पुनर्लेखन कर रहा है जितना कि शिक्षक ने किया?"
यह कैसे मापते हैं (गुप्त नुस्खा)
लेखकों ने केवल शब्दों को नहीं गिना। उन्होंने एक हारमोनिक मीन (harmonic mean) (एक प्रकार का औसत जो आकार के अत्यधिक अंतर को दंडित करता है) और एक क्यूबिक नॉन-ओवरलैप फैक्टर (cubic non-overlap factor) से जुड़े एक विशेष सूत्र का उपयोग किया।
यहाँ जादू का कमाल है: वे पाठ के उस हिस्से को लेते हैं जो मूल पुस्तक के साथ ओवरलैप (मेल) नहीं करता है और उसे तीसरी घात (cube) तक ले जाते हैं।
इसे क्यूब क्यों किया जाता है? कल्पना कीजिए कि आप दो लगभग एक जैसे दिखने वाले जुड़वा बच्चों के बीच सूक्ष्म अंतर को पहचानने की कोशिश कर रहे हैं। यदि आप उन्हें सामान्य रूप से देखते हैं, तो वे एक जैसे दिखते हैं। लेकिन यदि आप उन्हें एक सूक्ष्मदर्शी (microscope) के नीचे रखते हैं जो अंतरों को 1000 गुना बड़ा कर देता है, तो अचानक आपको एक पर एक छोटा सा तिल दिखाई देता है जो दूसरे पर नहीं है।
- यदि छात्र टेक्स्ट का 95% कॉपी करता है, तो "नया" हिस्सा बहुत छोटा होता है।
- यदि वे 98% कॉपी करते हैं, तो "नया" हिस्सा और भी छोटा होता है।
- इस अंतर को क्यूब करने से, गणित उस छोटे से अंतर को बहुत बड़ा बना देता है। कॉपी करने का 3% का अंतर स्कोर में 16 गुना बड़ा अंतर बन जाता है। यह मेट्रिक उन छात्रों को पकड़ने के लिए सुपर-सेंसिटिव बनाता है जो पुनर्लेखन करने की बहुत कम कोशिश कर रहे हैं।
उन्होंने क्या पाया (प्रयोग)
टीम ने XSUM डेटासेट (जो बहुत रचनात्मक, छोटे सारांशों का उपयोग करता है) और CNN/DailyMail डेटासेट (जो अधिक कॉपी-पेस्ट शैली के सारांशों का उपयोग करता है) से 100 लेखों पर परीक्षण किया। उन्होंने चार अलग-अलग AI मॉडलों को टेस्ट किया: BART-large-cnn, Pegasus-xsum, DistilBart, और MT5-small।
यहाँ आंकड़ों ने उन्हें क्या बताया:
- कॉपी करने वाले (The Copycats): BART और DistilBart नाम के मॉडल परम कॉपीकैट थे। XSUM टेस्ट पर, उनका SA (समरी एब्स्ट्रैक्शन) स्कोर 0.12 और 0.26 के बीच था। इसका मतलब है कि वे लगभग कुछ भी पुनर्लेखन नहीं कर रहे थे; वे बस मूल टेक्स्ट से वाक्यों को जोड़ रहे थे।
- रचनात्मक लोग (The Creatives): Pegasus और MT5 नाम के मॉडल लेखक थे। XSUM पर, उनके SA स्कोर 1.15 और 1.99 के बीच थे। वे वास्तव में सामग्री को फिर से लिख रहे थे।
- हैलुसिनेशन का जाल (The Hallucination Trap): यह सबसे महत्वपूर्ण निष्कर्ष है, लेकिन यह इस बात पर निर्भर करता है कि आप किस प्रकार की "उत्तर कुंजी" (Reference) का उपयोग कर रहे हैं।
- जब "उत्तर कुंजी" (Reference) पहले से ही बहुत रचनात्मक होती है (जैसे XSUM में), तो मॉडल आमतौर पर शिक्षक की तुलना में कम पुनर्लेखन करते हैं (AR < 1)।
- हालाँकि, जब "उत्तर कुंजी" मुख्य रूप से किताब की नकल (copy-heavy) होती है (जैसे CNN/DailyMail में), तो रचनात्मक मॉडलों (Pegasus और MT5) के साथ कुछ अजीब हुआ। उनका एब्स्ट्रैक्शन रेशियो (AR) 1.0 से बहुत ऊपर चला गया।
- 1.0 का AR का अर्थ है कि छात्र ठीक उतना ही पुनर्लेखन कर रहा है जितना कि शिक्षक।
- 3.74 का AR (जो Pegasus ने CNN/DailyMail के लिए अनिग्रैम्स पर छुआ) का अर्थ है कि छात्र शिक्षक की तुलना में बहुत अधिक पुनर्लेखन कर रहा है।
- महत्वपूर्ण रूप से, लेखकों ने पाया कि जब 'रेफरेंस' एक्सट्रैक्टिव (कॉपी-भारी) है और AR > 1 है, तो यह हैलुसिनेशन (Hallucination) के उच्च जोखिम को दर्शाता है। मॉडल रचनात्मक दिखने के लिए उन तथ्यों को बना रहा है जो किताब में नहीं हैं, जो कि मानव संदर्भ (human reference) द्वारा आवश्यक समझे गए दायरे से बाहर जा रहा है।
यह क्यों मायने रखता है (और ROUGE पर्याप्त क्यों नहीं है)
पेपर का तर्क है कि ROUGE इसके प्रति अंधा है।
- BART को CNN/DailyMail पर उच्च ROUGE स्कोर (0.393) मिला क्योंकि उसने टेक्स्ट को वफादारी से कॉपी किया। ROUGE के लिए वह परफेक्ट लग रहा था।
- Pegasus को कम ROUGE स्कोर (0.197) मिला क्योंकि उसने पुनर्लेखन किया। ROUGE ने इसे खराब माना।
- लेकिन, नए AR मेट्रिक ने दिखाया कि एक्सट्रैक्टिव डेटासेट पर, Pegasus वास्तव में हैलुसिनेट (Hallucinating) कर रहा था क्योंकि उसका AR 3.74 (unigrams के लिए) था।
यह पेपर सुझाव देता है कि इन नए मेट्रिक्स के बिना, हम यह सोच सकते हैं कि कॉपी करने वाला (BART) सबसे अच्छा मॉडल है, जबकि रचनात्मक मॉडल (Pegment) वास्तव में खतरनाक है क्योंकि वह तथ्य गढ़ रहा है।
वे क्या दावा नहीं करते
लेखक सावधान हैं कि वे यह नहीं कह रहे हैं कि उन्होंने फेक न्यूज या पूर्ण सारांशीकरण की समस्या को "हल" कर दिया है।
- वे स्वीकार करते हैं कि उनका मेट्रिक केवल सतही स्तर के शब्दों (n-grams) को देखता है, गहरे अर्थ को नहीं। यदि कोई छात्र अलग शब्दों का उपयोग करता है लेकिन उनका अर्थ बिल्कुल समान है, तो मेट्रिक उसे "पुनर्लेखन" के रूप में गिनेगा, जो कि इस विशिष्ट परीक्षण के लिए उनका उद्देश्य है।
- वे कहते हैं कि क्यूबिक पावर (3) का उपयोग करना एक डिज़ाइन विकल्प था जिसे उन्होंने टेस्ट किया और पाया कि यह अच्छा काम करता है, न कि यह भौतिकी का कोई नियम है।
- वे सुझाव देते हैं कि ये मेट्रिक्स एक स्क्रीनिंग टूल हैं। वे उन सारांशों को चिह्नित करते हैं जिन्हें झूठ की जांच के लिए मानव की आवश्यकता होती है। वे झूठ को स्वचालित रूप से ठीक नहीं करते हैं; वे बस उंगली उठाते हैं।
निचोड़ (The Bottom Line)
यह पेपर AI सारांशों को ग्रेड करने का एक नया तरीका पेश करता है जो केवल कॉपी-पेस्ट करने की जाँच नहीं करता है। यह एक विशेष गणितीय ट्रिक (गैर-ओवरलैपिंग हिस्सों को क्यूब करना) का उपयोग करता है ताकि यह पहचाना जा सके कि कोई AI बहुत अधिक रचनात्मक होकर क्या बना रहा है।
उन्होंने साबित किया कि 100 दस्तावेजों पर, ये मेट्रिक्स स्पष्ट रूप से कॉपी करने वाले मॉडल (SA ≈ 0.12–0.26) और लिखने वाले मॉडल (SA ≈ 1.15–1.99) के बीच अंतर कर सकते हैं। उन्होंने यह भी दिखाया कि जब किसी मॉडल का एब्स्ट्रैक्शन रेशियो (AR) कॉपी-भारी रेफरेंस वाले डेटासेट पर 1.0 से ऊपर निकल जाता है, तो यह संकेत देता है कि मॉडल मानव संदर्भ से अधिक पुनर्लेखन कर रहा है, जो एक संभावित हैलुसिनेशन जोखिम को दर्शाता है जिसे अन्य स्कोर मिस कर देते हैं।
यह एक शिक्षक को नया आवर्धक लेंस (magnifying glass) देने जैसा है जो उन "बनाए गए तथ्यों" के सूक्ष्म निशान दिखा देता है जिन्हें पुराना ग्रेडिंग सिस्टम पूरी तरह से अनदेखा कर देता था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।