← नवीनतम पेपर
💬 NLP

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

यह शोध पत्र FinTagging को प्रस्तुत करता है, जो पहला व्यापक बेंचमार्क है जो XBRL टैगिंग के जटिल कार्य को 'वित्तीय संख्यात्मक पहचान' (Financial Numeric Identification) और 'वित्तीय अवधारणा लिंकिंग' (Financial Concept Linking) में विभाजित करता है ताकि यह स्पष्ट किया जा सके कि जहाँ लार्ज लैंग्वेज मॉडल्स वित्तीय संस्थाओं को निकालने में उत्कृष्ट हैं, वहीं वे वास्तविक, संरचना-जागरूक स्थितियों के तहत उन्हें पूर्ण US GAAP टैक्सोनॉमी से मैप करने में काफी संघर्ष करते हैं।

मूल लेखक: Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Hu
प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Qianqian Xie, Jian-Yun Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ FinTagging पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें कुछ रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: वित्तीय "लाइब्रेरियन" का दुस्वप्न

कल्पना कीजिए कि आप 20 लाख किताबों (कंपनियों की वित्तीय रिपोर्ट) वाले एक विशाल पुस्तकालय के प्रभारी लाइब्रेरियन हैं। हर दिन, इन किताबों में हज़ारों नंबर भरे होते हैं: लाभ, ऋण, वेतन और टैक्स।

इन नंबरों को कंप्यूटर, नियामकों (regulators) और निवेशकों के लिए उपयोगी बनाने के लिए, हर एक नंबर को US-GAAP नामक एक विशाल शब्दकोश से एक विशिष्ट लेबल (एक "टैग") की आवश्यकता होती है। इस शब्दकोश में 17,688 अलग-अलग लेबल हैं।

  • पुराना तरीका: यह किसी इंसान से किताब पढ़ने और हर नंबर पर एक स्टिकी नोट चिपकाने के लिए कहने जैसा है जिसमें लिखा हो, "यह राजस्व (Revenue) है" या "यह ऋण (Debt) है।" यह धीमा, उबाऊ है और इंसान गलतियाँ करते हैं।
  • AI की उम्मीद: हम लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे टूल्स के पीछे के सुपर-स्मार्ट AI दिमाग हैं—का उपयोग करके इस टैगिंग को स्वचालित रूप से करना चाहते थे।

चुनौती: इन एआई के पिछले परीक्षण ऐसे थे जैसे उन्हें केवल 5 आसान सवालों वाला पॉप क्विज़ देना। वास्तविक दुनिया में, AI को एक साथ 17,000 सवालों के जवाब देने होते हैं, और अक्सर उसे अस्त-व्यस्त स्प्रेडशीट और भ्रमित करने वाले टेक्स्ट को देखना पड़ता है। पुराने परीक्षणों ने हमें यह नहीं दिखाया कि क्या AI वास्तव में वास्तविक काम के लिए पर्याप्त स्मार्ट है।


समाधान: FinTagging (द "टू-स्टेप डांस")

इस पेपर के लेखकों ने FinTagging नामक एक नया, कठिन परीक्षण बनाया। AI को एक ही बड़े कदम में लेबल का अनुमान लगाने के लिए कहने के बजाय, उन्होंने इस काम को एक दो-चरणीय नृत्य (two-step dance) में विभाजित कर दिया:

चरण 1: "तथ्य खोजने वाला" (FinNI)

  • उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल का निरीक्षण कर रहा है। उसका एकमात्र काम सुराग (नंबर) खोजना और यह पता लगाना है कि वे किस प्रकार के सुराग हैं।
  • यह क्या करता है: AI दस्तावेज़ (टेक्स्ट या टेबल) को पढ़ता है और कहता है, "मुझे एक नंबर मिला: $50 मिलियन। यह एक पैसे (money) की राशि है, न कि प्रतिशत या लोगों की संख्या।"
  • परिणाम: AI इसमें काफी अच्छा है। यह एक ऐसे जासूस की तरह है जो पैरों के निशान पहचानने में माहिर है।

चरण 2: "लेबल मैचमेकर" (FinCL)

  • उपमा: अब जासूस के पास सुराग तो है, लेकिन उसे 17,000 दराजों वाले कैबिनेट में सही दराज में फाइल करना है। यह कठिन हिस्सा है। क्या "$50 मिलियन" "हाथ में नकद" (Cash on Hand) है? "प्रतिबंधित नकद" (Restricted Cash) है? या "निवेश आय" (Investment Income) है?
  • यह क्या करता है: AI संदर्भ (नंबर के आसपास के वाक्य) को देखता है और इसे विशाल शब्दकोश में एकदम सही लेबल से मिलाने की कोशिश करता है।
  • परिणाम: यहीं पर AI संघर्ष करता है। यहाँ तक कि सबसे स्मार्ट मॉडल भी भ्रमित हो जाते हैं। वे ऐसा दराज चुन सकते हैं जो करीब तो है लेकिन बिल्कुल सही नहीं है। यह "एप्पल" शब्द जानने जैसा है, लेकिन यह न जानना कि व्यक्ति का मतलब फल से था या टेक कंपनी से, बिना अधिक संदर्भ के।

उन्होंने क्या खोजा?

शोधकर्ताओं ने 13 अलग-अलग AI मॉडल्स (GPT-4o, Llama और DeepSeek जैसे बड़े नामों सहित) का इस नए, वास्तविक परीक्षण पर परीक्षण किया। उन्हें क्या मिला:

  1. "एक्सट्रैक्शन गैप" (Extraction Gap): AI एक बेहतरीन जासूस है (चरण 1)। वह अस्त-व्यस्त टेबल्स और टेक्स्ट में नंबरों को लगभग पूरी तरह से ढूंढ सकता है।
  2. "अलाइनमेंट गैप" (Alignment Gap): AI एक भ्रमित लाइब्रेरियन है (चरण 2)। जब उसे 17,000 विकल्पों में से सटीक लेबल चुनना होता है, तो वह अक्सर गलत चुन लेता है। वह नंबर को तो समझ जाता है, लेकिन वह जटिल लेखांकन (accounting) नियमों को पूरी तरह से नहीं समझ पाता।
  3. पुराने परीक्षण "चीटिंग" थे: पिछले परीक्षणों में AI को केवल 100 लेबल्स की एक छोटी सूची में से चुनने के लिए कहा जाता था। यह एक पायलट को केवल बिना हवा वाले रनवे पर उतरने के लिए टेस्ट करने जैसा है। FinTagging उन्हें तूफान में लैंडिंग करने के लिए टेस्ट करता है। जब आप उन्हें पूरे 17,000 लेबल्स की सूची पर टेस्ट करते हैं, तो दो-चरणीय विधि का उपयोग न करने पर उनका प्रदर्शन शून्य के करीब गिर जाता है।

यह क्यों मायने रखता है?

वित्तीय रिपोर्टिंग को पैसे की भाषा के रूप में सोचें। यदि लेबल गलत हैं, तो "अनुवाद" गलत होगा।

  • यदि कोई AI ऋण (debt) को लाभ (profit) के रूप में गलत लेबल देता है, तो निवेशक ऐसी कंपनी के शेयर खरीद सकते हैं जो वास्तव में मुसीबत में है।
  • यदि नियामक (regulators) टैग पर भरोसा नहीं कर सकते, तो वे नियमों को लागू नहीं कर सकते।

मुख्य बात (Takeaway):
यह पेपर कहता है, "AI को एक बार में पूरा काम करने के लिए केवल भरोसा न करें।" हमें ऐसे सिस्टम बनाने की आवश्यकता है जहाँ AI पहले नंबरों को खोजे (जिसमें वह अच्छा है) और फिर एक स्मार्ट, चरण-दर-चरण प्रक्रिया का उपयोग करके उन्हें नियमों से मिलाए (जिसमें उसे मदद की ज़रूरत है)।

उन्होंने डेटासेट और कोड (एक रेसिपी बुक की तरह) भी जारी किया है ताकि अन्य शोधकर्ता इस "लेबल मैचमेकर" समस्या को ठीक करने का प्रयास कर सकें और सभी के लिए बेहतर वित्तीय AI बना सकें।

एक वाक्य में सारांश

FinTagging एक नया, वास्तविक परीक्षण है जो दिखाता है कि AI वित्तीय रिपोर्टों में नंबर खोजने में तो माहिर है, लेकिन जटिल लेखांकन नियमों के अनुसार उन्हें सही ढंग से लेबल करने के लिए उसे अभी भी बहुत मदद की आवश्यकता है, जो यह साबित करता है कि हमें वित्तीय रिपोर्टिंग को स्वचालित करने के लिए एक स्मार्ट, दो-चरणीय दृष्टिकोण की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →