FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
यह शोध पत्र FinTagging को प्रस्तुत करता है, जो पहला व्यापक बेंचमार्क है जो XBRL टैगिंग के जटिल कार्य को 'वित्तीय संख्यात्मक पहचान' (Financial Numeric Identification) और 'वित्तीय अवधारणा लिंकिंग' (Financial Concept Linking) में विभाजित करता है ताकि यह स्पष्ट किया जा सके कि जहाँ लार्ज लैंग्वेज मॉडल्स वित्तीय संस्थाओं को निकालने में उत्कृष्ट हैं, वहीं वे वास्तविक, संरचना-जागरूक स्थितियों के तहत उन्हें पूर्ण US GAAP टैक्सोनॉमी से मैप करने में काफी संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ FinTagging पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें कुछ रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।
बड़ी समस्या: वित्तीय "लाइब्रेरियन" का दुस्वप्न
कल्पना कीजिए कि आप 20 लाख किताबों (कंपनियों की वित्तीय रिपोर्ट) वाले एक विशाल पुस्तकालय के प्रभारी लाइब्रेरियन हैं। हर दिन, इन किताबों में हज़ारों नंबर भरे होते हैं: लाभ, ऋण, वेतन और टैक्स।
इन नंबरों को कंप्यूटर, नियामकों (regulators) और निवेशकों के लिए उपयोगी बनाने के लिए, हर एक नंबर को US-GAAP नामक एक विशाल शब्दकोश से एक विशिष्ट लेबल (एक "टैग") की आवश्यकता होती है। इस शब्दकोश में 17,688 अलग-अलग लेबल हैं।
- पुराना तरीका: यह किसी इंसान से किताब पढ़ने और हर नंबर पर एक स्टिकी नोट चिपकाने के लिए कहने जैसा है जिसमें लिखा हो, "यह राजस्व (Revenue) है" या "यह ऋण (Debt) है।" यह धीमा, उबाऊ है और इंसान गलतियाँ करते हैं।
- AI की उम्मीद: हम लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे टूल्स के पीछे के सुपर-स्मार्ट AI दिमाग हैं—का उपयोग करके इस टैगिंग को स्वचालित रूप से करना चाहते थे।
चुनौती: इन एआई के पिछले परीक्षण ऐसे थे जैसे उन्हें केवल 5 आसान सवालों वाला पॉप क्विज़ देना। वास्तविक दुनिया में, AI को एक साथ 17,000 सवालों के जवाब देने होते हैं, और अक्सर उसे अस्त-व्यस्त स्प्रेडशीट और भ्रमित करने वाले टेक्स्ट को देखना पड़ता है। पुराने परीक्षणों ने हमें यह नहीं दिखाया कि क्या AI वास्तव में वास्तविक काम के लिए पर्याप्त स्मार्ट है।
समाधान: FinTagging (द "टू-स्टेप डांस")
इस पेपर के लेखकों ने FinTagging नामक एक नया, कठिन परीक्षण बनाया। AI को एक ही बड़े कदम में लेबल का अनुमान लगाने के लिए कहने के बजाय, उन्होंने इस काम को एक दो-चरणीय नृत्य (two-step dance) में विभाजित कर दिया:
चरण 1: "तथ्य खोजने वाला" (FinNI)
- उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल का निरीक्षण कर रहा है। उसका एकमात्र काम सुराग (नंबर) खोजना और यह पता लगाना है कि वे किस प्रकार के सुराग हैं।
- यह क्या करता है: AI दस्तावेज़ (टेक्स्ट या टेबल) को पढ़ता है और कहता है, "मुझे एक नंबर मिला: $50 मिलियन। यह एक पैसे (money) की राशि है, न कि प्रतिशत या लोगों की संख्या।"
- परिणाम: AI इसमें काफी अच्छा है। यह एक ऐसे जासूस की तरह है जो पैरों के निशान पहचानने में माहिर है।
चरण 2: "लेबल मैचमेकर" (FinCL)
- उपमा: अब जासूस के पास सुराग तो है, लेकिन उसे 17,000 दराजों वाले कैबिनेट में सही दराज में फाइल करना है। यह कठिन हिस्सा है। क्या "$50 मिलियन" "हाथ में नकद" (Cash on Hand) है? "प्रतिबंधित नकद" (Restricted Cash) है? या "निवेश आय" (Investment Income) है?
- यह क्या करता है: AI संदर्भ (नंबर के आसपास के वाक्य) को देखता है और इसे विशाल शब्दकोश में एकदम सही लेबल से मिलाने की कोशिश करता है।
- परिणाम: यहीं पर AI संघर्ष करता है। यहाँ तक कि सबसे स्मार्ट मॉडल भी भ्रमित हो जाते हैं। वे ऐसा दराज चुन सकते हैं जो करीब तो है लेकिन बिल्कुल सही नहीं है। यह "एप्पल" शब्द जानने जैसा है, लेकिन यह न जानना कि व्यक्ति का मतलब फल से था या टेक कंपनी से, बिना अधिक संदर्भ के।
उन्होंने क्या खोजा?
शोधकर्ताओं ने 13 अलग-अलग AI मॉडल्स (GPT-4o, Llama और DeepSeek जैसे बड़े नामों सहित) का इस नए, वास्तविक परीक्षण पर परीक्षण किया। उन्हें क्या मिला:
- "एक्सट्रैक्शन गैप" (Extraction Gap): AI एक बेहतरीन जासूस है (चरण 1)। वह अस्त-व्यस्त टेबल्स और टेक्स्ट में नंबरों को लगभग पूरी तरह से ढूंढ सकता है।
- "अलाइनमेंट गैप" (Alignment Gap): AI एक भ्रमित लाइब्रेरियन है (चरण 2)। जब उसे 17,000 विकल्पों में से सटीक लेबल चुनना होता है, तो वह अक्सर गलत चुन लेता है। वह नंबर को तो समझ जाता है, लेकिन वह जटिल लेखांकन (accounting) नियमों को पूरी तरह से नहीं समझ पाता।
- पुराने परीक्षण "चीटिंग" थे: पिछले परीक्षणों में AI को केवल 100 लेबल्स की एक छोटी सूची में से चुनने के लिए कहा जाता था। यह एक पायलट को केवल बिना हवा वाले रनवे पर उतरने के लिए टेस्ट करने जैसा है। FinTagging उन्हें तूफान में लैंडिंग करने के लिए टेस्ट करता है। जब आप उन्हें पूरे 17,000 लेबल्स की सूची पर टेस्ट करते हैं, तो दो-चरणीय विधि का उपयोग न करने पर उनका प्रदर्शन शून्य के करीब गिर जाता है।
यह क्यों मायने रखता है?
वित्तीय रिपोर्टिंग को पैसे की भाषा के रूप में सोचें। यदि लेबल गलत हैं, तो "अनुवाद" गलत होगा।
- यदि कोई AI ऋण (debt) को लाभ (profit) के रूप में गलत लेबल देता है, तो निवेशक ऐसी कंपनी के शेयर खरीद सकते हैं जो वास्तव में मुसीबत में है।
- यदि नियामक (regulators) टैग पर भरोसा नहीं कर सकते, तो वे नियमों को लागू नहीं कर सकते।
मुख्य बात (Takeaway):
यह पेपर कहता है, "AI को एक बार में पूरा काम करने के लिए केवल भरोसा न करें।" हमें ऐसे सिस्टम बनाने की आवश्यकता है जहाँ AI पहले नंबरों को खोजे (जिसमें वह अच्छा है) और फिर एक स्मार्ट, चरण-दर-चरण प्रक्रिया का उपयोग करके उन्हें नियमों से मिलाए (जिसमें उसे मदद की ज़रूरत है)।
उन्होंने डेटासेट और कोड (एक रेसिपी बुक की तरह) भी जारी किया है ताकि अन्य शोधकर्ता इस "लेबल मैचमेकर" समस्या को ठीक करने का प्रयास कर सकें और सभी के लिए बेहतर वित्तीय AI बना सकें।
एक वाक्य में सारांश
FinTagging एक नया, वास्तविक परीक्षण है जो दिखाता है कि AI वित्तीय रिपोर्टों में नंबर खोजने में तो माहिर है, लेकिन जटिल लेखांकन नियमों के अनुसार उन्हें सही ढंग से लेबल करने के लिए उसे अभी भी बहुत मदद की आवश्यकता है, जो यह साबित करता है कि हमें वित्तीय रिपोर्टिंग को स्वचालित करने के लिए एक स्मार्ट, दो-चरणीय दृष्टिकोण की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।