← नवीनतम पेपर
💬 NLP

Taxonomy-Aligned Risk Extraction from 10-K Filings with Autonomous Improvement Using LLMs

यह शोध पत्र 10-K फाइलिंग से एक पूर्व-निर्धारित वर्गीकरण (taxonomy) के अनुरूप संरचित जोखिम कारकों को निकालने के लिए एक तीन-चरणीय LLM-आधारित पाइपलाइन प्रस्तुत करता है और इसमें निरंतर वर्गीकरण परिशोधन के लिए एक स्वायत्त एजेंट शामिल है, जो उच्च निष्कर्षण सटीकता और आर्थिक रूप से सार्थक उद्योग-विशिष्ट जोखिम प्रोफाइल को कैप्चर करने की क्षमता दोनों को प्रदर्शित करता है।

मूल लेखक: Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike

प्रकाशित 2026-01-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वित्तीय जासूस (financial detective) हैं जो यह समझने की कोशिश कर रहे हैं कि हज़ारों अलग-अलग कंपनियाँ क्यों विफल हो सकती हैं। आपके पास वार्षिक रिपोर्टों (जिन्हें "10-K फाइलिंग" कहा जाता है) का एक विशाल पुस्तकालय है, लेकिन प्रत्येक रिपोर्ट में "जोखिम कारक" (Risk Factors) वाला भाग अव्यवस्थित और अनूठी मानवीय भाषा में लिखा गया है। एक कंपनी कह सकती है, "हमें डर है कि डॉलर बहुत मजबूत हो सकता है," जबकि दूसरी कह सकती है, "विदेशी मुद्रा के उतार-चढ़ाव हमें नुकसान पहुँचा सकते हैं।" दोनों का अर्थ एक ही है, लेकिन एक कंप्यूटर इन्हें पूरी तरह से अलग समस्याएँ देखेगा।

यदि आप बस एक स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल या LLM) को ये रिपोर्ट पढ़ने और जोखिमों की सूची बनाने के लिए छोड़ देते हैं, तो आपको लेबल का एक अराजक ढेर मिल जाएगा। यह एक सौ लोगों से खिलौनों के मिले-जुले ढेर को बक्सों में छाँटने के लिए कहने जैसा है, लेकिन हर कोई बक्सों के लिए अपने स्वयं के नाम उपयोग करता है। अंत में, आपको "पहिए", "गोल चीजें" और "कार के पुर्जे" मिलेगा, बजाय इसके कि एक व्यवस्थित "पहिए" श्रेणी मिले।

यह शोध पत्र उस अव्यवस्था को ठीक करने और जोखिमों को एक साफ, सुसंगत सूची में व्यवस्थित करने के लिए, साथ ही सिस्टम को खुद बेहतर होने के लिए सिखाने हेतु एक तीन-चरणीय प्रणाली (three-step system) प्रस्तुत करता है।

तीन-चरणीय पाइपलाइन (The Three-Step Pipeline)

इस प्रक्रिया को एक कारखाने में उच्च-स्तरीय गुणवत्ता नियंत्रण लाइन की तरह समझें:

1. विशेषज्ञ पाठक (निष्कर्षण - Extraction)
सबसे पहले, एक AI अव्यवस्थित टेक्स्ट को पढ़ता है और उसमें पाए जाने वाले प्रत्येक जोखिम को बाहर निकालता है। महत्वपूर्ण बात यह है कि यह अभी जोखिम को किसी बॉक्स में डालने की कोशिश नहीं करता है। इसके बजाय, यह एक वकील की तरह कार्य करता है: यह जोखिम को ढूंढता है और रिपोर्ट से उस सटीक वाक्य की प्रतिलिपि बनाता है जो इस जोखिम के अस्तित्व को सिद्ध करता है।

  • उपमा: कल्पना कीजिए कि एक जासूस हर सुराग और उस सटीक पृष्ठ संख्या को लिख रहा है जहाँ उसने उसे पाया, बिना इस बात की चिंता किए कि वह किस "केस फ़ाइल" से संबंधित है।

2. सिमेंटिक मैचमेकर (मैपिंग - Mapping)
इसके बाद, सिस्टम एक "सिमेंटिक मैप" (एक प्रकार का AI जो केवल कीवर्ड नहीं, बल्कि अर्थ को समझता है) का उपयोग करके जासूस के सुरागों की तुलना आधिकारिक जोखिम श्रेणियों (एक टैक्सोनॉमी) की पूर्व-निर्मित सूची से करता है। इस सूची में 140 विशिष्ट श्रेणियाँ हैं, जैसे "ब्याज दर जोखिम" (Interest Rate Risk) या "साइबर सुरक्षा जोखिम" (Cybersecurity Risk)।

  • उपमा: सिस्टम सुराग को देखता है और पूछता है, "क्या यह 'मौसम' वाली फ़ाइल जैसा लगता है या 'कानूनी' वाली फ़ाइल जैसा?" यह सबसे करीबी मिलान खोजने के लिए गणित का उपयोग करता है।
  • समस्या: कभी-कभी, गणित गलत हो जाता है। यह किसी सुराग को किसी बॉक्स में केवल इसलिए डाल सकता है क्योंकि वह "सबसे बुरा विकल्प" नहीं है, भले ही वह वास्तव में वहां का न हो।

3. सख्त न्यायाधीश (सत्यापन - Validation)
यह सबसे महत्वपूर्ण चरण है। एक दूसरा AI एक "न्यायाधीश" (Judge) के रूप में कार्य करता है। यह सुराग, प्रस्तावित बॉक्स और उस बॉक्स के आधिकारिक विवरण को देखता है। यह मिलान को 1 से 5 तक का स्कोर देता है।

  • उपमा: कल्पना कीजिए कि एक सख्त शिक्षक छात्र के होमवर्क को ग्रेड दे रहा है। यदि छात्र गणित के सवाल को "इतिहास" के फोल्डर में डालने की कोशिश करता है, तो शिक्षक कहता है, "नहीं, यह 1/5 है। यह यहाँ नहीं होना चाहिए।"
  • परिणाम: सिस्टम कम स्कोर वाले मिलान (खराब फिट) को हटा देता है और केवल उच्च-गुणवत्ता वाले मिलान को रखता है। यह सुनिश्चित करता है कि अंतिम सूची सटीक है।

"स्वयं-सुधार" की विशेषता (The "Self-Improving" Feature)

यह शोध पत्र एक शानदार नई विशेषता पेश करता है: स्वायत्त सुधार (Autonomous Improvement)

आमतौर पर, यदि सूची में कोई श्रेणी भ्रमित करने वाली है, तो एक इंसान को त्रुटि ढूंढनी होती है और उसे ठीक करना होता है। यहाँ, सिस्टम इसे स्वयं करता है।

  • यह कैसे काम करता है: "न्यायाधीश" AI हर उस बार का एक लॉग रखता है जब उसने कम स्कोर दिया था। एक स्वचालित एजेंट (एक रोबोटिक सहायक) इन लॉग्स को देखता है, पैटर्न ढूंढता है, और पता लगाता है कि सिस्टम क्यों भ्रमित है।
  • समाधान: एजेंट भ्रमित करने वाली श्रेणी के विवरण को फिर से लिखता है ताकि उसे अधिक स्पष्ट बनाया जा सके।
  • वास्तविक उदाहरण: इस शोध पत्र ने इसका परीक्षण "फार्मास्युटिकल अप्रूवल" नामक श्रेणी पर किया। सिस्टम अमेरिकी नियमों (FDA) और यूरोपीय नियमों (EMA) के बीच भ्रमित हो रहा था। एजेंट ने इस पैटर्न को देखा, महसूस किया कि विवरण बहुत अधिक अमेरिकी-केंद्रित है, और इसे "अंतर्राष्ट्रीय एजेंसियों" को शामिल करने के लिए फिर से लिखा।
  • परिणाम: इस स्व-सुधार ने सही और गलत मिलान के बीच अंतर करने की सिस्टम की क्षमता को 104.7% तक सुधार दिया। सिस्टम ने वास्तव में चीजों को छाँटने में खुद को बेहतर बनाना सीखा।

क्या यह वास्तव में काम करता है? (प्रमाण)

यह सिद्ध करने के लिए कि उनका सिस्टम केवल मनगढ़ंत बातें नहीं कर रहा है, लेखकों ने 500 प्रमुख अमेरिकी कंपनियों (S&P 500) पर इसका परीक्षण किया। उन्होंने एक सरल प्रश्न पूछा: "क्या एक ही उद्योग की कंपनियों के जोखिम प्रोफाइल समान होते हैं?"

  • परीक्षण: उन्होंने साफ की गई जोखिम सूचियों को लिया और उनकी तुलना की। उन्होंने कंप्यूटर को यह नहीं बताया कि कौन सी कंपनियाँ बैंक हैं या कौन सी दवा निर्माता हैं। उन्होंने बस कंप्यूटर को जोखिम देखने दिया।
  • निष्कर्ष: कंप्यूटर ने स्वाभाविक रूप से बैंकों को एक साथ और दवा कंपनियों को एक साथ समूहबद्ध किया।
    • एक ही उद्योग की कंपनियों के जोखिम प्रोफाइल अन्य उद्योगों की कंपनियों की तुलना में 63% अधिक समान थे।
    • उदाहरण के लिए, 83% बैंकों को "ब्याज दर जोखिम" के लिए चिह्नित किया गया था, जबकि अन्य सभी कंपनियों में केवल 22% ऐसा था। वहीं, बैंकों के पास "कच्चा माल" (Raw Materials) के बारे में जोखिम शायद ही कभी थे, जो कारखानों के लिए एक बड़ी चिंता है।
  • निष्कर्ष: सिस्टम ने इन कंपनियों के बारे में वास्तविक आर्थिक सत्य निकाले, बिना यह बताए कि वे किस उद्योग के हैं।

सारांश

यह शोध पत्र एक विधि का वर्णन करता है जो अव्यवस्थित, असंरचित वित्तीय टेक्स्ट को जोखिमों की एक साफ, व्यवस्थित सूची में बदल देता है। सटीकता सुनिश्चित करने के लिए यह तीन-चरणीय टीम (पाठक, मिलानकर्ता, न्यायाधीश) का उपयोग करता है और इसमें एक "स्व-सुधार" करने वाला रोबोट भी शामिल है जो समय के साथ अपनी गलतियों को ठीक करता है। परिणाम एक ऐसा सिस्टम है जो स्वचालित रूप से विभिन्न प्रकार के व्यवसायों के सामने आने वाले विशिष्ट खतरों को समझ सकता है, ठीक वैसे ही जैसे एक मानव विशेषज्ञ करेगा, लेकिन कंप्यूटर की गति के साथ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →