← नवीनतम पेपर
💬 NLP

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)

जॉर्ज वाशिंगटन यूनिवर्सिटी का यह फॉल 2023 का अध्ययन प्रदर्शित करता है कि समराइज़ चेन्स (Summarize Chains) के साथ फाल्कन-7बी (Falcon-7B) का उपयोग करने वाला एक पाइपलाइन, दस प्रमुख कंपनियों के लिए वित्तीय समाचारों के सारांशीकरण को प्रभावी ढंग से स्वचालित करता है, जो आरएजी-आधारित (RAG-based) दृष्टिकोणों और लीड-3 (Lead-3) बेसलाइन दोनों से बेहतर प्रदर्शन करता है और छोटे मॉडलों में मतिभ्रम (hallucination) जैसी निरंतर चुनौतियों को उजागर करता है।

मूल लेखक: Pranav Chandaliya

प्रकाशित 2026-08-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pranav Chandaliya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हर दिन, वित्तीय दुनिया सूचनाओं की एक बाढ़ लेकर आती है। हजारों लेख ऑनलाइन दिखाई देते हैं, जिनमें से प्रत्येक कंपनियों की गतिविधियों, कार्यकारियों के निर्णयों और शेयर बाजार के बदलते रुझानों का विवरण देता है। एक निवेशक या विश्लेषक के लिए, जो इन कंपनियों में से एक छोटी सी संख्या का भी ट्रैक रखने की कोशिश कर रहा है, हर एक कहानी को पढ़ना एक असंभव कार्य है। एक महत्वपूर्ण विवरण चूक जाना एक समझदारी भरे निवेश और एक महंगी गलती के बीच का अंतर हो सकता है। यहीं पर नेचुरल लैंग्वेज प्रोसेसिंग (प्राकृतिक भाषा प्रसंस्करण) का क्षेत्र काम आता है, विशेष रूप से टेक्स्ट समराइजेशन (पाठ सारांश) नामक शाखा। दशकों से, कंप्यूटरों को लंबे दस्तावेजों को पढ़ने और सबसे महत्वपूर्ण वाक्यों को निकालने के लिए सिखाया गया है। हाल ही में, आर्टिफिशियल इंटेलिजेंस की एक नई पीढ़ी उभरी है, जिसे लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल) कहा जाता है। ये वे सिस्टम हैं जिन्हें मानव लेखन की विशाल मात्रा पर प्रशिक्षित किया गया है जो न केवल मुख्य वाक्यों को चुन सकते हैं बल्कि जानकारी को अपने शब्दों में फिर से लिख भी सकते हैं, जिससे टेक्स्ट के एक पहाड़ से एक नया, संक्षिप्त वृत्तांत तैयार होता है। शोधकर्ताओं के सामने सवाल यह था कि क्या इन शक्तिशाली उपकरणों पर वित्त की उच्च-दांव वाली दुनिया के लिए यह काम करने के लिए भरोसा किया जा सकता है, जहाँ सटीकता गैर-परक्राम्य है और डेटा दो बहुत अलग रूपों में आता है: समाचार लेखों की बहती कहानियाँ और स्टॉक की कीमतों की कठोर, संख्यात्मक तालिकाएँ।

2023 की शरद ऋतु में, जॉर्ज वाशिंगटन यूनिवर्सिटी के एक शोधकर्ता ने इस विचार का परीक्षण करने का निर्णय लिया। लक्ष्य एक ऐसा सिस्टम बनाना था जो दस प्रमुख निगमों के लिए समाचार, कंपनी की पृष्ठभूमि और शेयर बाजार का डेटा स्वचालित रूप से एकत्र कर सके और फिर एक एकल, आसानी से पढ़ने योग्य दैनिक ब्रीफिंग तैयार कर सके। चुनौती दोहरी थी। पहला, सिस्टम को टेक्स्ट की भारी मात्रा को संभालना था। दूसरा, और शायद अधिक कठिन, संख्याओं को समझना था। लार्ज लैंग्वेज मॉडल्स भाषा समझने में उत्कृष्ट होते हैं, लेकिन जब उनके सामने स्टॉक की कीमतों और ट्रेडिंग वॉल्यूम के कच्चे स्प्रेडशीट रखे जाते हैं, तो वे अक्सर लड़खड़ा जाते हैं। वे एक कॉलम को गलत पढ़ सकते हैं, प्रतिशत की गलत गणना कर सकते हैं, या सीधे तौर पर संख्याओं को अनदेखा कर सकते हैं। इसे हल करने के लिए, शोधकर्ता ने एक सरल लेकिन चतुर सेतु विकसित किया। आर्टिफिशियल इंटेलिजेंस को डेटा खिलाने से पहले, एक कंप्यूटर प्रोग्राम कच्चे नंबरों को साधारण अंग्रेजी वाक्यों में बदल देता है। मॉडल को तारीख और कीमत वाली एक टेबल दिखाने के बजाय, सिस्टम एक वाक्य लिखता है जैसे, "4 अक्टूबर को, स्टॉक 261.16 पर बंद हुआ, जो 5.93 प्रतिशत ऊपर है और ट्रेडिंग वॉल्यूम में 27.20 प्रतिशत की वृद्धि हुई है।" इसने भाषा मॉडल को गणित करने के बजाय कहानी का सारांश बनाने पर ध्यान केंद्रित करने की अनुमति दी, जो कि एक ऐसा कार्य है जिसमें वे स्वाभाविक रूप से अच्छे नहीं हैं।

शोधकर्ता ने फिर इस जानकारी को कंप्यूटर के पढ़ने के लिए व्यवस्थित करने के दो अलग-अलग तरीकों का परीक्षण किया। पहला तरीका, जिसे 'समराइज चेन्स' (Summarize Chains) दृष्टिकोण कहा जाता है, एक रिले रेस की तरह काम करता है। सिस्टम समाचार और पृष्ठभूमि की लंबी संग्रह को छोटे टुकड़ों में तोड़ देता है। यह कंप्यूटर को पहले टुकड़े का सारांश बनाने के लिए कहता है, फिर दूसरे का, और इसी तरह। अंत में, यह उन सभी छोटे सारांशों को लेता है और उन्हें एक मास्टर सारांश में मिला देता है। दूसरा तरीका, जिसे 'रिट्रीवल-ऑगमेंटेड जनरेशन' (Retrieval-Augmented Generation) के रूप में जाना जाता है, एक लाइब्रेरियन की तरह है। जब सिस्टम को सारांश लिखने की आवश्यकता होती है, तो वह वर्तमान प्रश्न के लिए सबसे प्रासंगिक विशिष्ट वाक्यों को खोजने के लिए दस्तावेजों के पूरे संग्रह में खोज करता है, और फिर वह केवल उन चयनित वाक्यों को कंप्यूटर को काम करने के लिए देता है। अध्ययन ने इन विधियों का उपयोग करके तीन अलग-अलग ओपन-सोर्स आर्टिफिशियल इंटेलिजेंस मॉडल का मूल्यांकन किया, साथ ही स्टॉक डेटा सारांशों के लिए एक अधिक महंगे, प्रोप्रायटरी मॉडल का भी।

परिणामों ने एक स्पष्ट तस्वीर पेश की कि क्या काम करता है और क्या नहीं। सबसे सफल दृष्टिकोण 'समराइज चेन्स' तरीका निकला जो 'फाल्कन-7बी' (Falcon-7B) नामक एक विशिष्ट ओपन-सोर्स मॉडल का उपयोग करता है। इस संयोजन ने हर प्रमुख समाचार घटना को सटीक रूप से कवर किया, महत्वपूर्ण विवरणों जैसे कि एक टेक दिग्गज द्वारा कर्मचारियों की छंटनी की सटीक संख्या को सुरक्षित रखा, और ऐसा उसने बिना खुद को दोहराए या मनगढ़ंत बातें बनाए किया। इसके विपरीत, लाइब्रेरियन-शैली के रिट्रीवल (प्राप्ति) तरीके ने महत्वपूर्ण समस्याएं पैदा कीं। जब सिस्टम ने एक साथ बहुत अधिक प्रासंगिक वाक्यों को खोजने की कोशिश की, तो कंप्यूटर भ्रमित हो गया, और एक ही सारांश में दर्जनों बार एक ही तीन समाचारों को दोहराने लगा। अन्य मामलों में, रिट्रीवल पद्धति ने कंप्यूटर को तथ्यों को मिलाने पर मजबूर कर दिया, जैसे कि एक कंपनी द्वारा दिए गए जुर्माने को पूरी तरह से दूसरी कंपनी के नाम पर जोड़ देना। ये त्रुटियां, जिन्हें 'हैलुसिनेशन' (Hallucinations) कहा जाता है, तब अधिक हुईं जब कंप्यूटर को एक साथ छाँटने के लिए बहुत अधिक जानकारी दी गई।

अध्ययन ने यह भी पुष्टि की कि संख्याओं को वाक्यों में बदलने की रणनीति पूरी तरह से काम करती है। जब कंप्यूटर को स्टॉक की कीमतों के बारे में पहले से लिखे गए वाक्य दिए गए, तो इसने परीक्षण किए गए सभी छह कंपनियों में तथ्यात्मक रूप से सटीक सारांश तैयार किए, जिसमें कोई भी आविष्कार की गई संख्या या गलत गणना नहीं थी। इसने साबित कर दिया कि गणित को आर्टिफिशियल इंटेलिजेंस के हाथों से निकालकर एक सरल कंप्यूटर स्क्रिप्ट में डालना सही कदम था। हालांकि रिट्रीवल विधि ने सिद्धांत में आशा दिखाई, अध्ययन ने पाया कि व्यवहार में, यह महत्वपूर्ण बदलावों के बिना वित्तीय रिपोर्टिंग के लिए बहुत अधिक त्रुटियों और पुनरावृत्तियों को पेश करती है। शोधकर्ता ने एक कामकाजी डैशबोर्ड बनाया है जो उपयोगकर्ताओं को स्टॉक चार्ट देखने और इन स्वचालित सारांशों को पढ़ने की अनुमति देता है, जो यह प्रदर्शित करता है कि यह सिस्टम एक वास्तविक उपकरण के रूप में उपयोग किए जाने के लिए व्यावहारिक है। यह कार्य सुझाव देता है कि जबकि आर्टिफिशियल इंटेलिजेंस वास्तव में वित्तीय समाचारों को पढ़ने को स्वचालित कर सकता है, मशीन को जानकारी कैसे दी जाती है, यह मशीन के अपने आप जितने महत्वपूर्ण है। फिलहाल के लिए सबसे विश्वसनीय रास्ता यह है कि कंप्यूटर को वह करने दें जिसमें वह सबसे अच्छा है—भाषा को समझना—जबकि एक सरल स्क्रिप्ट को नंबरों को संभालने और जानकारी को इस तरह व्यवस्थित करने दें जो मशीन को अभिभूत होने से रोके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →