← नवीनतम पेपर
💬 NLP

HiFi-KPI: A Dataset for Hierarchical KPI Extraction from Earnings Filings

यह शोध पत्र HiFi-KPI प्रस्तुत करता है, जो एक बड़े पैमाने का डेटासेट है जिसमें 1.65 मिलियन पैराग्राफ और iXBRL टैक्सोनॉमी से जुड़े 198,000 पदानुक्रमित रूप से व्यवस्थित लेबल शामिल हैं ताकि अर्निंग फाइलिंग से मुख्य प्रदर्शन संकेतकों (Key Performance Indicators) के निष्कर्षण और वर्गीकरण को सुगम बनाया जा सके, साथ ही इसमें तीव्र मूल्यांकन के लिए एक क्यूरेटेड Lite सबसेट और ओपन-सोर्स कोड भी दिया गया है।

मूल लेखक: Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एप्पल या टेस्ला जैसी किसी विशाल कंपनी की वित्तीय रिपोर्ट (financial report) पढ़ने की कोशिश कर रहे हैं। ये रिपोर्ट संख्याओं और टेक्स्ट के विशाल, घने जंगलों की तरह हैं। इन्हें समझने के लिए, कंप्यूटरों को एक मानचित्र (map) की आवश्यकता होती है।

वर्षों से, वित्तीय दुनिया ने iXBRL नामक एक डिजिटल मानचित्र का उपयोग किया है। यह एक विशाल फाइलिंग कैबिनेट की तरह है जहाँ हर एक संख्या (जैसे "राजस्व" या "लाभ") को एक विशिष्ट लेबल के साथ टैग किया गया है। लेकिन यहाँ समस्या यह है कि ये लेबल बहुत अधिक विशिष्ट हैं।

इसे इस प्रकार समझें:

  • पुराना तरीका: "फल" लेबल कहने के बजाय, कंप्यूटर देखता है "लाल सेब, 2023, वाशिंगटन स्टेट, गाला वैरायटी, 150 ग्राम।" यदि आप विभिन्न कंपनियों के बीच "सेब" की तुलना करना चाहते हैं, तो कंप्यूटर भ्रमित हो जाता है क्योंकि एक कंपनी इसे "गाला सेब" कहती है और दूसरी "रेड डिलीशियस" कहती है। यह दो पुस्तकालयों की तुलना करने जैसा है जहाँ एक में किताबें "लेखक के मध्य नाम" से व्यवस्थित हैं और दूसरे में "किताब के कवर के रंग" से। यह एक बड़ी गड़बड़ी है।
  • परिणाम: कंप्यूटर पढ़ने में बहुत अच्छे हैं, लेकिन वे संदर्भ (context) को समझने में बहुत खराब हैं (जैसे कि पैसा किस मुद्रा में है, या वे संख्याएँ किन तारीखों को कवर करती हैं) जब लेबल इतने अति-विशिष्ट होते हैं।

पेश है: HiFi-KPI ("हाई-फिडेलिटी" मैप)

इस शोध पत्र के लेखकों ने HiFi-KPI नामक एक नया टूल बनाया है। इसे एक यूनिवर्सल ट्रांसलेटर और एक स्मार्ट लाइब्रेरियन के रूप में सोचें जो दोनों का काम करता है।

उन्होंने क्या किया, इसे सरल रूप में यहाँ दिया गया है:

1. विशाल संग्रह (पुस्तकालय)

उन्होंने हजारों आधिकारिक वित्तीय रिपोर्टों (जैसे कि कंपनियाँ सरकार के पास जमा करती हैं 10-K और 10-Q फॉर्म) से 1.65 मिलियन पैराग्राफ निकाले।

  • उपमा: कल्पना कीजिए कि उन्होंने पिछले सात वर्षों में अमेरिका में दायर की गई प्रत्येक वित्तीय रिपोर्ट के प्रत्येक पृष्ठ को पढ़ा है। यह बहुत सारा पढ़ना है!

2. "स्मार्ट पदानुक्रम" (संगठित प्रणाली)

पुराने सिस्टम में 198,000 अलग-अलग, भ्रमित करने वाले लेबल थे। HiFi-KPI ने इन्हें एक पदानुक्रम (एक फैमिली ट्री) में व्यवस्थित किया।

  • उपमा: कंप्यूटर को 198,000 विशिष्ट नाम याद करने के लिए मजबूर करने के बजाय, उन्होंने इसे परिवार को समझना सिखाया।
    • दादा (Grandparent): "पैसा कमाया" (राजस्व/Revenue)
    • पिता (Parent): "चीजें बेचने से मिला पैसा"
    • बच्चा (Child): "2023 में एक विशिष्ट इमारत को किराए पर देने से मिला पैसा"
  • यह कंप्यूटर को ज़ूम इन या ज़ूम आउट करने की अनुमति देता है। यदि वह सटीक "2023 बिल्डिंग रेंट" नहीं ढूँढ पाता है, तो भी वह आत्मविश्वास से कह सकता है, "आह, यह केवल राजस्व (Revenue) है।" यह सिस्टम को बहुत अधिक स्मार्ट और लचीला बनाता है।

3. "संदर्भ संकेत" (जासूसी कार्य)

"$50 मिलियन" जैसी संख्या बिना संदर्भ के बेकार है। क्या यह अमेरिकी डॉलर है? यूरो है? क्या यह पिछले साल के लिए है या अगले साल के लिए?

  • उपमा: HiFi-KPI केवल संख्या को नहीं पकड़ता; यह पूरा दृश्य पकड़ता है। यह "$50 मिलियन" को विशिष्ट तारीखों (जनवरी 1 से दिसंबर 31) और मुद्रा (USD) से जोड़ता है। यह एक जासूस की तरह है जो न केवल सुराग पाता है बल्कि यह भी लिखता है कि उसने उसे कहाँ और कब पाया।

4. "लाइट" संस्करण (ट्रेनिंग व्हील्स)

पूर्ण डेटासेट बहुत बड़ा और जटिल है। इसलिए, लेखकों ने HiFi-KPI-Lite भी बनाया है।

  • उपमा: यह एक "स्टडी गाइड" या "फ्लैशकार्ड सेट" की तरह है। उन्होंने एक मानव वित्तीय विशेषज्ञ से सबसे महत्वपूर्ण 4 चीजों को चुनने के लिए कहा: अर्निंग्स (Earnings), EBIT (ब्याज और कर से पहले लाभ), EPS (प्रति शेयर आय), और राजस्व (Revenue)।
  • उन्होंने हजारों भ्रमित करने वाले टैग्स को इन 4 सरल मानवीय अवधारणाओं के साथ मैप किया। यह शोधकर्ताओं को सुपरकंप्यूटर की आवश्यकता के बिना नए AI मॉडल का तेजी से परीक्षण करने की अनुमति देता है।

उन्होंने क्या परीक्षण किया? (दौड़)

लेखकों ने यह देखने के लिए कि कौन इन रिपोर्टों को सबसे अच्छी तरह पढ़ सकता है, विभिन्न प्रकार के AI को परखने के लिए रखा:

  1. "पुराना स्कूल" AI (एनकोडर मॉडल): ये उन मेहनती छात्रों की तरह हैं जिन्होंने पाठ्यपुस्तक को कई बार पढ़ा है।
    • परिणाम: वे लेबल की पहचान करने में उत्कृष्ट थे (90%+ सटीकता के साथ)। वे यह कहने में माहिर हैं कि "यह वाक्य राजस्व (Revenue) के बारे में है।"
  2. "नया जीनियस" AI (लार्ज लैंग्वेज मॉडल्स जैसे GPT, Qwen, आदि): ये वे चमकदार, रचनात्मक AI हैं जो कहानियाँ लिख सकते हैं और चैट कर सकते हैं।
    • परिणाम: वे बुनियादी बातों में ठीक-ठाक थे लेकिन विवरणों में संघर्ष करते थे। वे अक्सर तारीखें गलत कर देते थे या मुद्राओं को मिला देते थे।
    • समस्या: यदि आप एक जीनियस (Genie) से एक विशिष्ट संख्या को उसकी तारीख और मुद्रा के साथ निकालने के लिए कहते हैं, तो वह कभी-कभी अनुमान लगाने लगता है। यह एक स्मार्ट दोस्त की तरह है जो सामान्य विचार तो जानता है लेकिन आपकी मीटिंग का सटीक समय गलत बता सकता है।

यह क्यों मायने रखता है?

  • निवेशकों के लिए: कल्पना कीजिए कि 500 कंपनियों के "राजस्व" की तुलना करने के लिए 500 PDF को मैन्युअल रूप से पढ़े बिना इसे तुरंत करना संभव हो। यह टूल इसे स्वचालित करता है, जिससे निवेशक रुझानों को तेजी से पकड़ पाते हैं।
  • कंपनियों के लिए: यह उन्हें फाइल करने से पहले अपनी ही रिपोर्टों में त्रुटियों की जांच करने में मदद करता है।
  • नियामकों (Regulators) के लिए: यह यह देखना आसान बनाता है कि क्या कोई कंपनी कुछ छिपा रही है या चीजों को गलत तरीके से टैग कर रही है।

मुख्य निष्कर्ष (The Bottom Line)

पेपर कहता है: "हमने वित्तीय डेटा का एक विशाल, व्यवस्थित पुस्तकालय बनाया है जो कंप्यूटर को केवल संख्याओं को नहीं, बल्कि संख्याओं के संदर्भ को समझना सिखाता है।"

हालांकि नवीनतम, सबसे चमकदार AI मॉडल (LLMs) प्रभावशाली हैं, लेकिन पेपर दिखाता है कि इस विशिष्ट, उच्च-जोखिम वाले काम के लिए, विशेषज्ञ, फाइन-ट्यून किए गए मॉडल (मेहनती छात्र) "चमकदार जीनियस" की तुलना में वर्तमान में अधिक विश्वसनीय हैं। फिर भी, यह नया डेटासेट सभी को भविष्य में और भी स्मार्ट उपकरण बनाने के लिए एक बेहतर आधार प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →