Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval
DS@GT टीम बहुभाषी वित्तीय QA के लिए एक भाषा-निर्देशित, रिट्रीवल-ऑगमेंटेड पाइपलाइन का प्रस्ताव करती है जो BGE-M3 एम्बेडिंग्स को वेटेड रिकिप्रोकल रैंक फ्यूजन और नेक्स्ट-टोकन लॉग-प्रोबेबिलिटी के माध्यम से डायरेक्ट ऑप्शन स्कोरिंग के साथ जोड़ती है, जो यह प्रदर्शित करता है कि इष्टतम प्रदर्शन के लिए भाषा-विशिष्ट मॉडल चयन और कुछ भाषाओं के लिए चेन-ऑफ-थॉट प्रॉम्प्टिंग के सावधानीपूर्वक बचाव की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कठिन पहेली को हल करने की कोशिश कर रहे हैं, लेकिन केवल अपने दिमाग का उपयोग करने के बजाय, आपके पास बगल में संदर्भ पुस्तकों की एक विशाल लाइब्रेरी है। यह रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) की दुनिया है। इसे एक ऐसे छात्र के रूप में सोचें जो उत्तर देने से पहले तथ्यों को देखने के लिए पाठ्यपुस्तक का उपयोग करने की अनुमति रखता है। आमतौर पर, कंप्यूटर इस काम में बहुत अच्छे होते हैं यदि प्रश्न अंग्रेजी में हों, लेकिन जब प्रश्न स्पेनिश, ग्रीक या हिंदी में होते हैं, तो चीजें उलझ जाती हैं। "लाइब्रेरी" अंग्रेजी किताबों से भरी हो सकती है लेकिन अन्य भाषाओं के लिए खाली हो सकती है, और छात्र उन विदेशी किताबों को पढ़ नहीं पाता होगा भले ही वह उन्हें ढूंढ ले।
यह शोध पत्र इस समस्या के एक बहुत ही विशिष्ट, उच्च-दांव वाले संस्करण को संबोधित करता है: वित्तीय प्रमाणन परीक्षा (Financial Certification Exams)। ये केवल सामान्य ज्ञान नहीं हैं; ये प्रमाणित वित्तीय विश्लेषक या लेखाकार बनने के लिए जटिल परीक्षण हैं, जिनमें धन, कानूनों और लेखांकन नियमों के बारे में गहरी तर्कशक्ति की आवश्यकता होती है। लेखक एक बड़ा सवाल पूछते हैं: क्या हम एक ऐसा कंप्यूटर सिस्टम बना सकते हैं जो पांच अलग-अलग भाषाओं (अंग्रेजी, स्पेनिश, ग्रीक, चीनी और हिंदी) में इन कठिन वित्तीय परीक्षाओं को अंग्रेजी जितना ही अच्छी तरह से पास कर सके? इसका उत्तर महत्वपूर्ण है क्योंकि वित्त वैश्विक है, लेकिन अधिकांश कंप्यूटर मस्तिष्क मुख्य रूप से अंग्रेजी पर प्रशिक्षित होते हैं, जिससे अन्य भाषाओं में वित्तीय चर्चाओं को संभालने में बड़ी कमियां रह जाती हैं।
टीम का बड़ा प्रयोग: एक स्मार्ट, बहुभाषी जासूस
जॉर्जिया टेक के शोधकर्ताओं ने, अपनी टीम को DS@GT कहते हुए, इन वित्तीय परीक्षा प्रश्नों को हल करने के लिए एक डिजिटल जासूसी प्रणाली बनाई। केवल अनुमान लगाने के बजाय, उनका सिस्टम एक सख्त तीन-चरणीय प्रक्रिया का पालन करता है, जिसे वे एक "पाइपलाइन" कहते हैं।
चरण 1: भाषा का जासूस
सबसे पहले, सिस्टम प्रश्न को देखता है और पूछता है, "यह कौन सी भाषा है?" यह एक क्लब के बाउंसर की तरह है जो आईडी चेक करता है। यदि प्रश्न ग्रीक में है, तो सिस्टम को पता चल जाता है कि उसे अपनी लाइब्रेरी के "ग्रीक सेक्शन" से किताबें निकालनी होंगी। यदि लाइब्रेरी उस भाषा के लिए खाली है (जो ग्रीक या हिंदी जैसी छोटी भाषाओं के साथ होता है), तो वह "ग्लोबल सेक्शन" से किताबें उठाता है जो समान विचार रख सकती हैं, भले ही वे किसी अन्य भाषा में हों। उन्होंने BGE-M3 नामक एक विशेष उपकरण का उपयोग किया ताकि प्रश्नों के अर्थ को एक सार्वभौमिक कोड में अनुवादित किया जा सके ताकि सिस्टम भाषा की बाधाओं के पार प्रासंगिक उदाहरण खोज सके।
चरण 2: मॉडल राउटर (सही काम के लिए "दायां मस्तिष्क")
यहाँ टीम को एक आश्चर्यजनक बात पता चली। उन्होंने हर चीज़ के लिए केवल एक विशाल कंप्यूटर मस्तिष्क का उपयोग नहीं किया। उन्होंने पाया कि अलग-अलग कंप्यूटर मस्तिष्क अलग-अलग भाषाओं के लिए बेहतर होते हैं।
- अंग्रेजी के लिए, उन्होंने Qwen2.5-14B नामक एक मॉडल का उपयोग किया।
- ग्रीक के लिए, उन्होंने आश्चर्यजनक रूप से पाया कि एक छोटा मॉडल, Llama-3.1-8B, वास्तव में सुपरस्टार था, जिसने बड़े मॉडलों को भारी अंतर (लगभग 19.5 प्रतिशत अंक) से पीछे छोड़ दिया!
- चीनी, हिंदी और अरबी के लिए, उन्होंने Qwen3-14B का उपयोग किया।
यदि उन्होंने सभी के लिए एक ही "सर्वश्रेष्ठ" मॉडल का उपयोग किया होता, तो सिस्टम अंग्रेजी और ग्रीक के मामले में बुरी तरह विफल हो जाता। यह यह समझने जैसा है कि जबकि एक मैराथन धावक लंबी दूरी के लिए महान है, आप नहीं चाहेंगे कि वह शतरंज खेले; आपको प्रत्येक कार्य के लिए एक अलग विशेषज्ञ की आवश्यकता होती है।
चरण 3: स्कोरर (अब अनुमान लगाने का खेल नहीं)
आमतौर पर, जब कंप्यूटर उत्तर देते हैं, तो वे उत्तर "लिखने" की कोशिश करते हैं, जैसे "उत्तर C है।" इससे अक्सर ऐसी गलतियाँ होती हैं जहाँ कंप्यूटर एक लंबा पैराग्राफ लिख देता है और यह बताना भूल जाता है कि उसने कौन सा अक्षर चुना। DS@GT टीम ने रिट्रीवल-ऑगमेंटेड डायरेक्ट स्कोरिंग (RADS) नामक एक चतुर तकनीक का उपयोग किया। उत्तर लिखने के बजाय, सिस्टम बस गणित की जाँच करता है: "अक्षर 'A' अगला शब्द होने की कितनी संभावना है? 'B' की कितनी संभावना है? 'C' की कितनी संभावना है?" यह उस अक्षर को चुनता है जिसका गणितीय स्कोर सबसे अधिक होता है। यह एक बहुविकल्पीय परीक्षा की तरह है जहाँ कंप्यूटर को निबंध लिखने की आवश्यकता नहीं होती; वह बस सही गोले (बबल) की ओर इशारा करता है। इस पद्धति ने लगभग सभी "पार्स फेल्योर" (कंप्यूटर के अपने उत्तर को पढ़ने में होने वाली गलतियों) को समाप्त कर दिया, जिससे चीनी प्रश्नों पर 100% सफलता दर प्राप्त हुई जहाँ अन्य तरीके संघर्ष कर रहे थे।
आश्चर्यजनक खोजें
टीम ने हजारों परीक्षण किए और कुछ नियम खोजे जो AI के बारे में सामान्य धारणाओं को तोड़ते हैं:
- बहुत अधिक सोचना बुरा हो सकता है: अधिकांश लोगों के लिए, "चेन-ऑफ-थॉट" (AI से अपने तर्क को चरण-दर-चरण समझाने के लिए कहना) मददगार होता है। लेकिन ग्रीक प्रश्नों के लिए, इसने वास्तव में प्रदर्शन को नष्ट कर दिया। सटीकता शानदार 90.7% से गिरकर भयानक 20.9% हो गई। यह पता चला कि इन विशिष्ट ग्रीक प्रश्नों के लिए, जो गणितीय समस्याओं को हल करने के बजाय तथ्यों को वर्गीकृत करने के बारे में अधिक हैं, AI को "ज़ोर से सोचने" के लिए कहना उसे भ्रमित कर देता है। वह सही श्रेणी चुनने के बजाय कहानियाँ लिखने लगता है।
- "थिंकिंग मोड" का जाल: Qwen3 मॉडल में एक डिफ़ॉल्ट सेटिंग है जहाँ वह उत्तर से पहले एक "सोचने वाला" (thinking) भाग लिखता है। टीम ने पाया कि यदि उन्होंने इसे चालू छोड़ दिया, तो अरबी के लिए सही अक्षर चुनने की सिस्टम की क्षमता (RADS) गिरकर लगभग रैंडम गेसिंग (यादृच्छिक अनुमान) के स्तर पर आ गई। सिस्टम को काम करने के लिए उन्हें मैन्युअल रूप से इस "थिंकिंग मोड" को बंद करना पड़ा।
- अनुवाद एक जाल है: उन्होंने अन्य भाषाओं के प्रश्नों को अंग्रेजी में अनुवाद करने, उन्हें हल करने और फिर वापस अनुवाद करने का प्रयास किया। यह एक आपदा थी। अनुवाद ने महत्वपूर्ण वित्तीय विवरणों को खो दिया, और मूल भाषा में हल करने की तुलना में स्कोर में लगभग 20 प्रतिशत अंक की गिरावट आई।
- डेटा मायने रखता है, लेकिन मॉडल अधिक मायने रखते हैं: उन्होंने हिंदी के लिए, उनकी लाइब्रेरी में अधिक मूल हिंदी उदाहरण जोड़ने का प्रयास किया, लेकिन इससे केवल मामूली वृद्धि (लगभग 1 प्रतिशत अंक) हुई। हालाँकि, उनके सिस्टम और शीर्ष वाणिज्यिक AI (Claude Opus 4.7) के बीच का अंतर बहुत बड़ा था (17 प्रतिशत अंक)। यह सुझाव देता है कि कम-संसाधन वाली भाषाओं के लिए, समस्या केवल लाइब्रेरी में अधिक किताबें होने की नहीं है; बल्कि यह है कि कंप्यूटर मस्तिष्क को स्वयं उस विशिष्ट भाषा के वित्तीय शब्दों पर अधिक गहराई से प्रशिक्षित करने की आवश्यकता है।
अंतिम स्कोरकार्ड
जब टीम ने अपने सिस्टम को आधिकारिक FinMMEval 2026 प्रतियोगिता में प्रस्तुत किया, तो उन्होंने अच्छा प्रदर्शन किया, अधिकांश भाषाओं में शीर्ष 10 में स्थान बनाया।
- अरबी: 76.0% (10वां स्थान)
- हिंदी: 73.5% (7वां स्थान)
- अंग्रेजी: 69.5% (9वां स्थान)
- चीनी: 64.5% (9वां स्थान)
हालाँकि वे प्रथम स्थान नहीं जीत पाए (शीर्ष टीमों ने 90% से अधिक स्कोर किया), उनके काम ने एक महत्वपूर्ण सबक सिद्ध किया: एक आकार सभी के लिए उपयुक्त नहीं है। एक स्मार्ट वैश्विक वित्तीय AI बनाने के लिए, आप केवल एक मॉडल और एक रणनीति का उपयोग नहीं कर सकते। आपको अलग-अलग भाषाओं को अलग-अलग मॉडलों तक पहुँचाने, कार्य के आधार पर अलग-अलग सोचने की रणनीतियों को चुनने, और उत्तरों को लिखकर बताने के बजाय गणितीय रूप से स्कोर करने की आवश्यकता है। वैश्विक वित्त AI का भविष्य एक एकल सुपर-ब्रेन के बारे में नहीं है; यह विशेषज्ञों की एक टीम के बारे में है, जिनमें से प्रत्येक सही भाषा बोलता है और सही उपकरणों का उपयोग करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।