AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA
AgentFinVQA एक तैनात करने योग्य, मल्टी-एजेंट पाइपलाइन है जो विनियमित वातावरण के लिए डेटा रेजिडेंसी सुनिश्चित करते हुए और ट्रैसेबल वेरिफिकेशन प्रदान करते हुए FinMME बेंचमार्क पर स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त करता है जो ऑडिट करने योग्य वित्तीय चार्ट प्रश्न उत्तर (क्वेश्चन अनस्वर्सिंग) के लिए है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वित्तीय विश्लेषक (financial analyst) हैं जो एक जटिल चार्ट को पढ़कर इस तरह के सवाल का जवाब देने की कोशिश कर रहे हैं: "किन वर्षों में बिक्री 25k के बीच थी?"
यदि आप एक मानक AI (एक "जीरो-शॉट" मॉडल) से यह करने को कहते हैं, तो यह एक बुद्धिमान लेकिन अधीम इंटर्न को चार्ट पर एक नज़र डालने और उत्तर चिल्लाने के लिए कहने जैसा है। वे सही उत्तर दे सकते हैं, लेकिन वे अनुमान भी लगा सकते हैं, गलत संख्याएँ बता सकते (hallucinate), या किसी सूक्ष्म विवरण को मिस कर सकते हैं। इससे भी बुरा यह है कि आपको पता ही नहीं चलेगा कि उन्होंने उत्तर कैसे प्राप्त किया, और यदि वे गलत हैं, तो आप इसे सिद्ध नहीं कर सकते। वित्तीय दुनिया में, जहाँ नियम सख्त हैं और डेटा संवेदनशील है, आप केवल एक "ब्लैक बॉक्स" वाले उत्तर पर भरोसा नहीं कर सकते। आपको चरणों को जानने की आवश्यकता है, और आप अपना निजी क्लाइंट डेटा किसी अजनबी के कंप्यूटर पर नहीं भेज सकते।
AgentFinVQA वह समाधान है जिसे लेखकों ने बनाया है। इसे एक एकल जीनियस के रूप में नहीं, बल्कि चार्ट संबंधी प्रश्नों के उत्तर देने के लिए एक विशेषज्ञ फैक्ट्री असेंबली लाइन के रूप में समझें। इसमें एक व्यक्ति सब कुछ करने के बजाय, काम को विशेषज्ञों की एक टीम में विभाजित किया जाता है, जिसमें से प्रत्येक का एक विशिष्ट कार्य है, और हर एक चरण को एक स्थायी "रसीद" (जिसे मॉडल इवैल्यूएशन पैकेट या MEP कहा जाता है) में लिखा जाता है ताकि आप ऑडिट कर सकें कि वास्तव में क्या हुआ।
यहाँ बताया गया है कि उनका यह "फैक्ट्री" कैसे काम करता है, चरण-दर-चरण:
- द प्लानर (द आर्किटेक्ट - योजनाकार): चार्ट को देखने से पहले, यह टेक्स्ट-ओनली एजेंट प्रश्न और बहुविकल्पीय विकल्पों को पढ़ता है। यह अभी तक इमेज नहीं देखता है। यह एक चेकलिस्ट बनाता है: "ठीक है, हमें रंगों की जांच करनी है, वर्षों को देखना है, और बार्स (bars) की तुलना करनी है।" यह टीम को बताता है कि उन्हें वास्तव में क्या देखना है।
- द OCR रीडर (द स्क्राइब - लिपिक): यह एजेंट चार्ट को देखता है और केवल टेक्स्ट (शीर्षक, अक्ष लेबल, संख्याएँ) को पढ़ता है। यह इसे एक साफ सूची के रूप में लिख देता है। यह सुनिश्चित करता कि अगले चरणों में लेबल को गलत न पढ़ा जाए।
- द लीजेंड ग्राउंडर (द ट्रांसलेटर - अनुवादक): चार्ट अक्सर रंगों (लाल रेखा, नीला बार) का उपयोग करते हैं। यह एजेंट रंगों को उनके नामों (जैसे, "लाल = 2023 की बिक्री") से मिलाता है। यह एक मैप तैयार करता है ताकि बाद में कोई रंगों को लेकर भ्रमित न हो।
- द कलर-एरिया टूल (द मेजरिंग टेप - मापने वाला टेप): पाई चार्ट या स्टैक्ड बार जैसे कठिन चार्ट के लिए, आँखों से आकार का अनुमान लगाना कठिन होता है। यह एक स्मार्ट AI नहीं है; यह एक सरल, साधारण कैलकुलेटर है। यह एक विशिष्ट रंग के पिक्सेल (pixels) को गिनकर सटीक माप देता है। यह आँखों से अनुमान लगाने के बजाय एक रूलर (पैमाने) का उपयोग करने जैसा है।
- द विजन एजेंट (द इंस्पेक्टर - निरीक्षक): अब, मुख्य एजेंट चेकलिस्ट, टेक्स्ट लिस्ट, कलर मैप और पिक्सेल माप के साथ चार्ट को देखता है। यह सब मिलाकर एक उत्तर का मसौदा तैयार करता है।
- द वेरीफायर (क्वालिटी कंट्रोल मैनेजर - गुणवत्ता नियंत्रण प्रबंधक): विश्वास के लिए यह सबसे महत्वपूर्ण चरण है। एक दूसरा, स्वतंत्र एजेंट मसौदे वाले उत्तर और चार्ट को फिर से देखता है। वह पूछता है, "क्या यह वास्तव में डेटा से मेल खाता है?"
- यदि वह सहमत है, तो वह कहता है "पुष्टि की गई" (Confirmed)।
- यदि वह असहमत है, तो वह कहता है "संशोधन करें" (Revise)।
- महत्वपूर्ण रूप से, सिस्टम एक "कॉन्फिडेंस स्कोर" रिकॉर्ड करता है। यदि मैनेजर अनिश्चित है, तो वह उत्तर को मानव जांच के लिए फ्लैग करता है। यह कंपनियों को अपने मानव समीक्षकों का ध्यान केवल उन उत्तरों पर केंद्रित करने में मदद करता है जिनके गलत होने की संभावना अधिक है, जिससे समय बचता है।
यह एक बड़ी बात क्यों है?
- यह ऑडिट योग्य है: क्योंकि हर चरण को उस "रसीद" (MEP) में रिकॉर्ड किया जाता है, आप पीछे मुड़कर देख सकते हैं और कह सकते हैं, "आह, सिस्टम विफल हुआ क्योंकि इसने लाल और नीली रेखाओं को भ्रमित कर दिया।" आप जानते हैं कि यह क्यों हुआ।
- यह निजी है: आप इस पूरी फैक्ट्री को अपने स्वयं के कंप्यूटरों (ऑन-प्रिमाइज़) पर ओपन-सोर्स सॉफ्टवेयर का उपयोग करके चला सकते हैं। आपको अपना गुप्त क्लाइंट चार्ट किसी बड़ी टेक कंपनी के क्लाउड पर भेजने की आवश्यकता नहीं है।
- यह सटीक है: लेखकों ने इसे FinMME नामक एक कठिन वित्तीय चार्ट डेटासेट पर परखा।
- जब उन्होंने एक शीर्ष-स्तरीय कमर्शियल AI (Gemini-3) का उपयोग किया, तो उनकी फैक्ट्री ने सीधे AI से पूछने की तुलना में 7.68% अधिक सही उत्तर दिए।
- जब उन्होंने अपने स्वयं के सर्वर पर चलने वाले एक मुफ्त, ओपन-सोर्स AI (Qwen) का उपयोग किया, तब भी उन्हें 4.84% अधिक सही उत्तर मिले।
- "क्वालिटी कंट्रोल मैनेजर" (वेरीफायर) त्रुटियों को पकड़ने में बहुत अच्छा था: जब उसने "पुष्टि की गई" कहा, तो उत्तर 68.2% बार सही था। जब उसने "संशोधन करें" कहा, तो मूल उत्तर अक्सर गलत था।
क्या काम नहीं किया?
लेखक स्वीकार करते हैं कि सिस्टम जादुई नहीं है। लगभग दो-तिहाई गलतियाँ इसलिए हुईं क्योंकि:
- AI ने प्रश्न को गलत समझा (जैसे, "उच्चतम" को "निम्नतम" समझना)।
- यह लीजेंड (legend) से भ्रमित हो गया (इस बात में कि कौन सा रंग किस वर्ष को दर्शाता है)।
- इसने चार्ट पर सही स्थान मिलने के बावजूद एक संख्या को गलत पढ़ लिया।
दिलचस्प बात यह है कि "क्वालिटी कंट्रोल मैनेजर" इन विशिष्ट प्रकार की गलतियों को पकड़ने में बहुत अच्छा नहीं था। यह लेखकों को बताता है कि उन्हें आगे क्या सुधारने की आवश्यकता है।
संक्षेप में: AgentFinVQA एक जोखिम भरे, अपारदर्शी AI अनुमान को एक पारदर्शी, चरण-दर-चरण फैक्ट्री प्रक्रिया में बदल देता है। यह साबित करता है कि आप उच्च सटीकता, पूर्ण गोपनीयता और एक स्पष्ट पेपर ट्रेल (रिकॉर्ड) एक साथ प्राप्त कर सकते हैं, जो बिल्कुल वही है जिसकी वित्तीय संस्थानों को अपने डेटा के साथ AI पर भरोसा करने के लिए आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।