← नवीनतम पेपर
💬 NLP

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

IndiaFinBench पहला सार्वजनिक रूप से उपलब्ध बेंचमार्क है जिसे भारतीय वित्तीय नियामक पाठ पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें SEBI और RBI के दस्तावेजों से 406 विशेषज्ञ-एनोटेटेड प्रश्न-उत्तर युग्म शामिल हैं जो मॉडल्स के बीच, विशेष रूप से संख्यात्मक तर्क (numerical reasoning) में, महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करते हैं, जबकि गैर-विशेषज्ञ मानव बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

मूल लेखक: Rajveer Singh Pall

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rajveer Singh Pall

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है जिसने दुनिया की लगभग हर किताब पढ़ ली है। आप उससे न्यूयॉर्क की एक लाइब्रेरी के बारे में सवाल पूछते हैं और वह उसका सटीक जवाब देता है। लेकिन फिर आप उससे भारत की एक बहुत ही विशिष्ट, पुरानी और जटिल लाइब्रेरी के बारे में सवाल पूछते हैं, जो अनूठे नियमों और स्थानीय शब्दावली से भरी है। अचानक, वह रोबोट लड़खड़ा जाता है। उसे स्थानीय रीति-रिवाजों का ज्ञान नहीं है, और वह भारतीय कानूनों के लिखने के विशिष्ट तरीके से भ्रमित हो जाता है।

यह पेपर IndiaFinBench पेश करता है, जो एक नया "टेस्ट" है जिसे यह देखने के लिए बनाया गया है कि ये AI रोबोट भारतीय वित्तीय नियमों (Indian financial regulations) की विशिष्ट और पेचीदा दुनिया को कितनी अच्छी तरह संभाल सकते हैं।

यहाँ इस पेपर की कहानी है, जिसे सरल भागों में विभाजित किया गया है:

1. समस्या: "पश्चिमी पूर्वाग्रह" (The "Western Bias")

अब तक, AI के लिए सभी परीक्षण केवल अमेरिकी राजमार्गों पर ड्राइविंग टेस्ट करने जैसे थे। उन्होंने अमेरिकी कानूनों, अमेरिकी बैंक रिपोर्टों और अमेरिकी समाचारों का उपयोग किया।

  • वास्तविकता: भारत के अपने वित्तीय "राजमार्ग" हैं जिन्हें दो मुख्य ट्रैफिक पुलिस द्वारा चलाया जाता है: SEBI (शेयर बाजार के लिए) और RBI (केंद्रीय बैंक के लिए)।
  • मुद्दा: भारतीय वित्तीय नियम अव्यवस्थित हैं। वे पैराग्राफ में छिपे हुए नंबरों, समय के साथ बदलते नियमों (जैसे कि एक रेसिपी जिसे हर साल अपडेट किया जाता है) और विशेष शब्दों से भरे हुए हैं जिन्हें केवल भारतीय विशेषज्ञ ही जानते हैं। मौजूदा AI परीक्षण यह जांचने में विफल रहे कि क्या रोबोट इस विशिष्ट उलझन को संभाल सकते हैं।

2. समाधान: "भारतीय ड्राइविंग टेस्ट"

लेखकों ने IndiaFinBench बनाया है, जो 406 प्रश्नों की एक बिल्कुल नई परीक्षा है।

  • प्रश्न कहाँ से आए? उन्होंने SEBI और RBI के 192 आधिकारिक दस्तावेजों को खंगाला, जो 1992 से 2026 तक के हैं।
  • किस तरह के प्रश्न?
    • "इसका क्या अर्थ है?" टेस्ट: क्या AI एक नियम को पढ़ सकता है और बता सकता है कि एक बैंक को वास्तव में क्या करने की अनुमति है?
    • "गणित" टेस्ट: क्या AI टेक्स्ट में छिपे गणित को कर सकता है? (जैसे, "यदि एक बैंक का इतना लाभ है, तो वे कितना लाभांश (dividend) दे सकते हैं?")
    • "झूठ पकड़ने वाला" टेस्ट: क्या AI यह पहचान सकता है कि दो अलग-अलग नियम एक-दूसरे का विरोध करते हैं?
    • "टाइम ट्रैवल" टेस्ट: क्या AI यह पता लगा सकता है कि 2015 बनाम 2023 में कौन सा नियम सक्रिय था, क्योंकि नियम अक्सर अपडेट होते रहते हैं?

3. परीक्षार्थी: 12 अलग-अलग रोबोट

शोधकर्ताओं ने 12 अलग-अलग AI मॉडल (रोबोट) को इस टेस्ट के माध्यम से गुजारा। कुछ विशाल दिग्गज थे (जैसे Gemini 2.5 Flash और LLaMA-3.3-70B), और कुछ छोटे, हल्के मॉडल थे (जैसे Gemma 4)।

  • नियम: रोबोटों को प्रश्न में दिए गए टेक्स्ट का उपयोग करके ही उत्तर देना था। वे इंटरनेट की अपनी "याददाश्त" का उपयोग नहीं कर सकते थे। यह सुनिश्चित करता है कि वे वास्तव में पढ़ और समझ रहे हैं, न कि केवल अनुमान लगा रहे हैं।

4. परिणाम: कौन पास हुआ?

परिणाम आश्चर्यजनक थे और उन्होंने तीन स्पष्ट समूह दिखाए:

  • शीर्ष स्तर (A-ग्रेड छात्र):

    • Gemini 2.5 Flash लगभग 90% सटीकता के साथ शीर्ष पर रहा। यह नियमों को पढ़ने और गणित करने में सर्वश्रेष्ठ था।
    • Qwen3-32B और LLaMA-3.3-70B इसके ठीक पीछे थे, लगभग बराबरी पर।
    • आश्चर्य: Llama 4 Scout 17B (एक बहुत छोटा रोबोट) ने विशाल 70B रोबोट के समान प्रदर्शन किया। यह एक छोटी कार के बड़े ट्रक के समान माइलेज देने जैसा है। यह सुझाव देता है कि रोबोट को कैसे प्रशिक्षित किया गया है, यह उसके आकार से अधिक महत्वपूर्ण है।
  • मध्यम स्तर (C-ग्रेड छात्र):

    • GPT-OSS और Mistral जैसे मॉडल 75-79% के आसपास रहे। वे ठीक थे, लेकिन उन्होंने कठिन गणित और टाइम-ट्रैवल वाले प्रश्नों में गलतियाँ कीं।
  • निचला स्तर (F-ग्रेड छात्र):

    • Gemma 4 E4B (एक बहुत छोटा मॉडल) का स्कोर लगभग 70% रहा। इसे सबसे अधिक संघर्ष करना पड़ा, विशेष रूप से गणित और नियमों के कालक्रम (timeline) को समझने में।

मानवीय आधार (The Human Baseline):
यहाँ तक कि एक व्यक्ति जो वित्त विशेषज्ञ नहीं है, उसने भी केवल 60% स्कोर किया। यह साबित करता है कि यह टेस्ट वास्तव में कठिन है! सबसे अच्छे AI (Gemini) ने औसत मानव से बहुत बड़ा अंतर बनाए हुए जीत हासिल की, लेकिन सबसे खराब AI एक गैर-विशेषज्ञ मानव से मुश्किल से बेहतर था।

5. रोबोट कहाँ विफल हुए? (त्रुटि विश्लेषण)

सबसे स्मार्ट रोबोटों को भी कठिनाई वाले स्थान मिले:

  • "टाइम ट्रैवल" की समस्या: लगभग सभी के लिए सबसे कठिन हिस्सा टेम्पोरल रीजनिंग (Temporal Reasoning) था। भारतीय नियम अक्सर कहते हैं, "2010 का यह नियम अब 2022 के नियम द्वारा प्रतिस्थापित किया गया है, जब तक कि आप 2015 के अपवाद के अंतर्गत नहीं आते।" रोबोट इस बात को लेकर भ्रमित हो गए कि कब कौन सा नियम लागू होता है।
  • "गणित" की समस्या: न्यूमेरिकल रीजनिंग (Numerical Reasoning) सबसे बड़ा अंतर पैदा करने वाला कारक था। गणित पर सबसे अच्छे और सबसे खराब रोबोट के बीच का अंतर बहुत बड़ा था (35% से अधिक)।
  • "ज्ञान" की समस्या: छोटे रोबोट अक्सर इसलिए विफल हुए क्योंकि वे वास्तव में नहीं जानते थे कि "AIF" या "FEMA" जैसे शब्दों का क्या अर्थ है। वे केवल अनुमान लगा रहे थे।

6. यह क्यों मायने रखता है

यह पेपर एक चेतावनी है। यह दिखाता है कि:

  1. एक ही आकार सबके लिए सही नहीं है: एक AI जिसे अमेरिकी कानूनों पर प्रशिक्षित किया गया है, वह स्वतः ही भारतीय कानूनों में अच्छा नहीं होगा।
  2. बड़ा होना हमेशा बेहतर नहीं होता: एक छोटा, अच्छी तरह से प्रशिक्षित मॉडल विशिष्ट स्थानीय कार्यों पर एक विशाल मॉडल को हरा सकता है।
  3. हमें स्थानीय परीक्षणों की आवश्यकता है: यदि हम चाहते हैं कि AI भारतीय बैंकों, वकीलों और नियामकों की मदद करे, तो हमें उन्हें भारतीय डेटा पर परखना होगा, न कि केवल अमेरिकी डेटा पर।

निष्कर्ष:
लेखकों ने इस टेस्ट, इसके प्रश्नों और उत्तरों को सार्वजनिक रूप से जारी कर दिया है। वे चाहते हैं कि हर कोई नए रोबोटों को भारतीय नियमों पर टेस्ट करता रहे ताकि हम ऐसे AI बना सकें जो वास्तव में भारतीय वित्तीय दुनिया को समझते हों, न कि केवल पश्चिमी दुनिया को। यह रोबोटों को केवल अमेरिकी लाइसेंस के बजाय एक स्थानीय ड्राइवर का लाइसेंस देने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →