← नवीनतम पेपर
💬 NLP

Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa

यह शोध पत्र ट्रांसफॉर्मर-आधारित मॉडलों, विशेष रूप से BERT, RoBERTa और BART का एक तुलनात्मक समीक्षा प्रस्तुत करता है, जो निष्कर्षण (extractive) और सारगर्भित (abstractive) स्वचालित पाठ सारांशीकरण कार्यों के लिए उनकी उपयुक्तता का मूल्यांकन करने हेतु उनकी संरचनाओं और प्रीट्रेनिंग रणनीतियों का विश्लेषण करता है।

मूल लेखक: Daisy Aptovska, Vinayak Elangovan

प्रकाशित 2026-08-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daisy Aptovska, Vinayak Elangovan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया में जहाँ सूचना हमारे पढ़ने की गति से भी तेज़ पहुँच रही है, एक लंबे दस्तावेज़ को उसके आवश्यक बिंदुओं में संक्षिप्त करने की क्षमता एक महत्वपूर्ण कौशल बन गई है। यह ऑटोमैटिक टेक्स्ट समराइजेशन (स्वचालित पाठ सारांशीकरण) का क्षेत्र है, जो कंप्यूटर विज्ञान का वह क्षेत्र है जो मशीनों को मानव भाषा को पढ़ने, समझने और संक्षिप्त करने के लिए प्रशिक्षित करने के लिए समर्पित है। दशकों से, शोधकर्ताओं ने कंप्यूटर को या तो पाठ से सबसे महत्वपूर्ण वाक्यों को चुनने या पूरी सामग्री को नए शब्दों में पूरी तरह से फिर से लिखने के लिए प्रशिक्षित करके इसे हल करने का प्रयास किया है। पहला तरीका, जिसे अक्सर 'एक्सट्रैक्टिव' (निष्कर्षण) कहा जाता है, एक पुस्तक में सबसे अच्छी पंक्तियों को हाइलाइट करने जैसा है; दूसरा तरीका, जिसे 'एब्स्ट्रैक्टिव' (सार संकलन) के रूप में जाना जाता है, एक पत्रकार द्वारा किसी अलग दर्शक के लिए कहानी को फिर से लिखने जैसा है। हाल ही में, 'ट्रांसफॉर्मर' नामक संरचना पर निर्मित कंप्यूटर प्रोग्रामों की एक नई पीढ़ी ने इस क्षेत्र पर कब्ज़ा कर लिया है। इन प्रोग्रामों को भारी मात्रा में पाठ पर प्रशिक्षित किया जाता है ताकि वे भाषा कैसे काम करती है, यह सीख सकें, जिससे वे इन सारांशीकरण कार्यों को उल्लेखनीय गति और सटीकता के साथ करने में सक्षम होते हैं।

पेन स्टेट यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने हाल ही में इस नई पीढ़ी के तीन सबसे लोकप्रिय प्रोग्रामों: BERT, RoBERTa और BART की तुलना करने का निर्णय लिया। हालाँकि ये तीनों एक ही बुनियादी तकनीक पर आधारित हैं, लेकिन इन्हें अलग-अलग आंतरिक संरचनाओं और प्रशिक्षण विधियों के साथ डिज़ाइन किया गया है, जो इन्हें विभिन्न प्रकार के कार्यों के लिए उपयुक्त बनाता है। शोधकर्ता यह समझना चाहते थे कि ये अंतर समाचार लेखों को सारांशित करने की उनकी क्षमता को वास्तव में कैसे प्रभावित करते हैं। उन्होंने नए मॉडल का आविष्कार नहीं किया, बल्कि इसके बजाय इन तीन मौजूदा मॉडलों को एक कठोर परीक्षण से गुजारा ताकि यह देखा जा सके कि विशिष्ट परिस्थितियों में कौन सबसे अच्छा प्रदर्शन करता है। ऐसा करने के लिए, उन्होंने वास्तविक समाचार कहानियों और उनके साथ दिए गए मानव-लिखित सारांशों के संग्रह का उपयोग किया, जो इस प्रकार के शोध के लिए एक मानक सामग्री है। चूंकि वे सीमित कंप्यूटिंग शक्ति के साथ काम कर रहे थे, इसलिए वे पूर्ण, विशाल डेटासेट का उपयोग नहीं कर सके, इसलिए उन्होंने प्रशिक्षण के लिए 15,000 कहानियों और परीक्षण के लिए 100 कहानियों वाला एक छोटा, प्रबंधनीय हिस्सा चुना।

प्रयोग ने यह स्पष्ट किया कि ये मॉडल इस कार्य के प्रति कैसे दृष्टिकोण रखते हैं। पहले दो मॉडल, BERT और RoBERTa, पाठ को समझने के लिए डिज़ाइन किए गए हैं लेकिन नए वाक्य उत्पन्न करने के लिए नहीं। इस अध्ययन में, उनका उपयोग एक्सट्रैक्टिव समराइजेशन करने के लिए किया गया था, जिसका अर्थ था कि उन्हें मूल लेख से सीधे सबसे महत्वपूर्ण वाक्यों की पहचान करनी थी और उन्हें चुनना था। तीसरा मॉडल, BART, अलग तरह से बनाया गया है; इसकी संरचना ऐसी है जो इसे शून्य से नया पाठ उत्पन्न करने की अनुमति देती है, जो इसे एक एब्स्ट्रैक्टिव समराइज़र बनाती है। जब शोधकर्ताओं ने परीक्षण किए, तो परिणामों ने दिखाया कि जनरेशन (उत्पत्ति) के लिए डिज़ाइन किए गए मॉडल, BART ने अन्य दोनों की तुलना में मानव-लिखित संदर्भों के काफी करीब सारांश प्रस्तुत किए। क्षेत्र की भाषा में, जो कंप्यूटर के आउटपुट और मानव के बीच शब्दों और वाक्यांशों के ओवरलैप को मापता है, BART का स्कोर बहुत अधिक रहा। इसने अपने प्राथमिक माप पर लगभग 0.41 का स्कोर प्राप्त किया, जबकि एक्सट्रेक्टिव मॉडलों में सबसे अच्छे, RoBERTa ने केवल लगभग 0.18 का स्कोर किया।

अध्ययन ने दोनों एक्सट्रैक्टिव मॉडलों के बीच के अंतर को भी रेखांकित किया। RoBERTa, जो मूल BERT का एक परिष्कृत और अधिक मजबूत संस्करण है, लगातार BERT से बेहतर प्रदर्शन करता है जब दोनों को समान प्रशिक्षण समय और डेटा दिया जाता है। यह सुझाव देता है कि एक मॉडल को भाषा समझने के लिए शुरू में कैसे सिखाया जाता है, यह उतना ही मायने रखता है जितना कि इसे किसी विशिष्ट कार्य पर कैसे लागू किया जाता है। हालाँकि, एक्सट्रैक्टिव मॉडलों और जेनेरेटिव मॉडल के बीच का अंतर बहुत अधिक था। शोधकर्ताओं ने नोट किया कि जहाँ BART ने ऐसे सारांश तैयार किए जो बेहतर प्रवाह वाले थे और अर्थ को अधिक स्वाभाविक रूप से पकड़े हुए थे, वहीं इसका मूल्यांकन ऐसी स्थिति में किया गया था जहाँ इसे विशेष रूप से समाचार डेटासेट पर प्रशिक्षित नहीं किया गया था, जबकि अन्य दो मॉडलों को इस कार्य के लिए फाइन-ट्यून किया गया था। एक्सट्रैक्टिव मॉडलों को यह लाभ दिए जाने के बावजूद, जेनेरेटिव दृष्टिकोण ने परिणामों में दबदबा बनाए रखा।

जेनेरेटिव मॉडल के उच्च प्रदर्शन के बावजूद, शोधकर्ताओं ने महत्वपूर्ण समझौतों (trade-offs) की ओर इशारा किया। वह मॉडल जो नए वाक्य बनाता है, BART, प्रवाहपूर्ण और पठनीय पाठ उत्पन्न करने में उत्कृष्ट है, लेकिन इसमें "हैलुसिनेशन" (भ्रम) का जोखिम होता है, जहाँ यह कहानी के प्रवाह को बेहतर बनाने के लिए कोई विवरण बना सकता है या तथ्य को थोड़ा बदल सकता है। इसके विपरीत, एक्सट्रैक्टिव मॉडल, जो स्रोत से वाक्यों की नकल करते हैं, तथ्यात्मक रूप से सटीक होने की गारंटी देते हैं क्योंकि वे कुछ भी नया आविष्कार नहीं करते हैं, लेकिन उनके सारांश कभी-कभी टूटे-फूटे या असंबद्ध लग सकते हैं। अध्ययन ने यह भी स्वीकार किया कि परिणाम उनके उपकरणों की सीमाओं से आकार लेते थे; उन्होंने प्रयोगों को विशेष उच्च-गति चिप्स के बजाय मानक कंप्यूटर प्रोसेसर पर चलाया, जिसने उनके द्वारा प्रोसेस किए जा सकने वाले डेटा की मात्रा को सीमित कर दिया।

अंततः, यह कार्य पुष्टि करता है कि मॉडल की संरचना उसकी ताकत तय करती है। यदि लक्ष्य मुख्य वाक्यों को निकालकर एक त्वरित, तथ्यात्मक रूप से सुरक्षित सारांश प्राप्त करना है, तो RoBERT जैसे एक्सट्रैक्टिव मॉडल एक मजबूत विकल्प हैं। लेकिन यदि लक्ष्य किसी दस्तावेज़ का एक सहज, मानव-समान पुनर्लेखन तैयार करना है, तो जेनेरेटिव मॉडल BART कहीं अधिक श्रेष्ठ है, यहाँ तक कि अतिरिक्त प्रशिक्षण के बिना भी। शोधकर्ताओं ने निष्कर्ष निकाला कि जबकि ये उपकरण शक्तिशाली हैं, चुनाव इस बात पर निर्भर करता है कि आप सख्त तथ्यात्मक निष्ठा को महत्व देते हैं या प्राकृतिक भाषा की तरलता को। जैसे-जैसे यह क्षेत्र आगे बढ़ रहा है, अगला कदम संभवतः इन मॉडलों को कानून या चिकित्सा जैसे विशेष विषयों पर परीक्षण करना होगा, जहाँ प्रवाह और पूर्ण सटीकता के बीच संतुलन और भी महत्वपूर्ण हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →