← नवीनतम पेपर
💬 NLP

FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models

यह शोध पत्र FINESSE-Bench को प्रस्तुत करता है, जो एक पदानुक्रमित बेंचमार्क सुइट है जिसमें आठ विशिष्ट कार्यों—जिनमें प्रमाणन-शैली की परीक्षाएँ, ट्रेडिंग अनुप्रयोग और एक रूसी-भाषा ओलंपियाड शामिल हैं—के माध्यम से 3,993 प्रश्न शामिल हैं, ताकि बड़े भाषा मॉडलों (LLMs) में वित्तीय डोमेन ज्ञान और तकनीकी तर्क क्षमताओं की प्रगति का व्यापक मूल्यांकन किया जा सके।

मूल लेखक: Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए वित्तीय सलाहकार (financial advisor) को काम पर रखने की कोशिश कर रहे हैं। आपके पास रेज़्यूमे का एक ढेर है और मानक साक्षात्कार प्रश्नों की एक सूची है। लेकिन यहाँ एक समस्या है: सिर्फ इसलिए कि कोई व्यक्ति बुनियादी अर्थशास्त्र के बारे में एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) में महारत हासिल कर सकता है, इसका मतलब यह नहीं है कि वह वास्तव में एक जटिल निवेश पोर्टफोलियो का प्रबंधन कर सकता है या अचानक आई बाजार की गिरावट का सामना कर सकता है।

यह ठीक वही समस्या है जिसे इस शोध पत्र के लेखकों ने वित्त (finance) में आर्टिफिशियल इंटेलिजेंस (AI) के लिए वर्तमान "परीक्षणों" (tests) के साथ पहचाना है। उन्होंने एक नया, बहुत कठिन परीक्षण सूट बनाया है जिसे FINESSE-Bench कहा जाता है, ताकि यह देखा जा सके कि क्या AI मॉडल वास्तव में वास्तविक दुनिया के लिए तैयार हैं या वे केवल पाठ्यपुस्तकों के उत्तर रटने में अच्छे हैं।

यहाँ इसका एक सरल विवरण दिया गया है कि उन्होंने क्या किया और उन्हें क्या मिला:

1. समस्या: "आसान क्विज़" का जाल

मौजूदा AI परीक्षणों (जैसे FinQA या TAT-QA) को एक ड्राइवर के परमिट टेस्ट की तरह समझें। वे सरल प्रश्न पूछते हैं जैसे, "स्टॉप साइन का क्या अर्थ है?" या "आप स्पीडोमीटर को कैसे पढ़ते हैं?"

  • समस्या: कई AI मॉडल इन परीक्षणों में शानदार प्रदर्शन करते हैं। लेकिन परमिट टेस्ट पास करने का मतलब यह नहीं है कि आप बर्फीले पहाड़ की सड़क पर बर्फबारी के दौरान गाड़ी संभाल सकते हैं।
  • अंतराल (Gap): वर्तमान परीक्षण मुख्य रूप से वित्तीय रिपोर्ट पढ़ने और सरल गणित करने पर केंद्रित हैं। वे यह परीक्षण नहीं करते कि क्या AI स्टॉक ट्रेडिंग, जोखिम प्रबंधन या तकनीकी चार्ट का विश्लेषण करने जैसे उच्च-दांव वाले, जटिल परिदृश्यों को संभाल सकता है। उनमें एक स्पष्ट "कठिनाई सीढ़ी" (difficulty ladder) की भी कमी है—वे आपको यह नहीं दिखाते कि यदि प्रश्न कठिन हो जाएं तो क्या AI भ्रमित हो जाता है।

2. समाधान: FINESSE-Bench (एक "वास्तविक दुनिया का बाधा दौड़")

लेखकों ने FINESSE-Bench नामक एक नया बेंचमार्क सूट बनाया है। एक साधारण क्विज़ के बजाय, इसे एक बहु-स्तरीय बाधा दौड़ (multi-level obstacle course) के रूप में कल्पना करें जिसे एक वित्तीय विशेषज्ञ बनने की वास्तविक यात्रा की नकल करने के लिए डिज़ाइन किया गया है।

इसमें 8 अलग-अलग स्टेशन (डेटासेट) हैं जिनमें लगभग 4,000 प्रश्न हैं:

  • "स्कूल" स्तर (CFA-जैसे): ये वास्तविक पेशेवर प्रमाणपत्रों (जैसे CFA) के मॉडल पर आधारित हैं।
    • स्तर 1: बुनियादी वित्तीय साक्षरता (जैसे हाई स्कूल अर्थशास्त्र)।
    • स्तर 2: मध्यवर्ती, जटिल केस स्टडीज (जैसे कॉलेज फाइनेंस)।
    • स्तर 3: विशेषज्ञ-स्तरीय रणनीति और नैतिकता (जैसे एक वरिष्ठ पोर्टफोलियो मैनेजर)।
  • "विशेषज्ञ" स्तर:
    • तकनीकी विश्लेषण (Technical Analysis): चार्ट और बाजार के पैटर्न को पढ़ना (जैसे एक ट्रेडर जो रडार स्क्रीन को देख रहा हो)।
    • डेरिवेटिव्स ट्रेडिंग (Derivatives Trading): जटिल ऑप्शंस और फ्यूचर्स मैथ (जैसे उच्च-स्तरीय भौतिकी पहेली को हल करना)।
    • रूसी ओलंपियाड (Russian Olympiad): रूसी भाषा में कठिन गणित और तर्क संबंधी समस्याएं (यह परीक्षण करने के लिए कि क्या AI अन्य भाषाओं में भी काम करता है)।

3. उन्होंने AI को कैसे ग्रेड किया

उन्होंने केवल सही या गलत उत्तरों को नहीं देखा। उन्होंने खुले अंत वाले (open-ended) उत्तरों को ग्रेड करने के लिए एक "जज AI" (एक अन्य स्मार्ट AI) का उपयोग किया, जो बिल्कुल वैसा ही है जैसे एक मानव शिक्षक निबंध को ग्रेड करता है। उन्होंने जांचा कि:

  • क्या मॉडल ने बुनियादी तथ्य सही प्राप्त किए?
  • क्या प्रश्न कठिन होने पर इसके प्रदर्शन में गिरावट आई?
  • क्या यह विभिन्न प्रकार के प्रश्नों (बहुविकल्पीय, गणितीय समस्याएँ, लघु निबंध) को संभाल सकता था?

4. बड़ी खोजें

जब उन्होंने परीक्षण चलाए, तो परिणाम चौंकाने वाले थे:

  • "ट्रांसफर गैप" (The Transfer Gap): कई AI मॉडल जिन्होंने पुराने, आसान "परमिट टेस्ट" पर 90% स्कोर किया था, वे FINESSE-Bench के "बाधा दौड़" में काफी पिछड़ गए। कुछ मॉडल जो मानक परीक्षणों पर वित्तीय जीनियस लग रहे थे, वे वास्तविक दुनिया के ट्रेडिंग कार्यों में संघर्ष करते हुए पाए गए। यह एक ऐसे छात्र की तरह है जो गणित की कक्षा में 'A' ग्रेड प्राप्त करता है लेकिन मौके पर बंधक (mortgage) की गणना करने के लिए पूछा जाने पर घबरा जाता है।
  • "कठिनाई सीढ़ी" काम करती है: उन्होंने एक स्पष्ट पैटर्न देखा: जैसे-जैसे प्रश्न कठिन होते गए (स्तर 1 से स्तर 3 की ओर बढ़ते हुए), लगभग हर AI मॉडल कमजोर होता गया। इसने साबित कर दिया कि FINESSE-Bench वास्तव में यह माप सकता है कि एक मॉडल कितना स्मार्ट है, न कि केवल यह कि वह कुछ तथ्य जानता है या नहीं।
  • सभी मॉडल एक समान नहीं हैं: कुछ मॉडल "विशेषज्ञ" (एक चीज़ में महान, दूसरों में खराब) थे, जबकि अन्य "ऑल-राउंडर" (हर चीज़ में अच्छे) थे। उदाहरण के लिए, एक मॉडल रिपोर्ट पढ़ने में सर्वश्रेष्ठ हो सकता है लेकिन ट्रेडिंग में बहुत खराब, जबकि दूसरा सभी क्षेत्रों में लगातार अच्छा हो सकता है।

5. यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि हम यह तय करने के लिए पुराने, आसान परीक्षणों पर भरोसा नहीं कर सकते कि कौन सा AI वित्त के लिए तैयार है।

  • पुराने परीक्षण: आपको बताते हैं कि क्या AI ने टेक्स्टबुक पढ़ी है।
  • FINESSE-Bench: आपको बताता है कि क्या AI वास्तव में काम कर सकता है।

यह शतरंज के नियम जानने और वास्तव में ग्रैंडमास्टर को हराने में सक्षम होने के बीच का अंतर है। FINESSE-Bench वह ग्रैंडमास्टर मैच है जो हमें दिखाता है कि कौन से AI मॉडल वास्तव में वित्तीय दुनिया के लिए तैयार हैं और कौन से केवल दिखावा कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →