← नवीनतम पेपर
💰 quantitative finance

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

यह शोध पत्र PyFi को प्रस्तुत करता है, जो एक मल्टी-एजेंट एडवरसैरियल मैकेनिज्म का उपयोग करके 600K-स्केल के पिरामिड-संरचित वित्तीय डेटासेट को संश्लेषित करता है, जिससे विजन लैंग्वेज मॉडल्स (Vision Language Models) को बुनियादी धारणा से लेकर विशेषज्ञ-स्तरीय विश्लेषण तक प्रश्नों को क्रमिक रूप से विघटित करके जटिल वित्तीय तर्क में महत्वपूर्ण सटीकता सुधार प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Yuqun Zhang, Yuxuan Zhao, Sijia Chen

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuqun Zhang, Yuxuan Zhao, Sijia Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वित्तीय विशेषज्ञ (financial expert) बनना सिखाने की कोशिश कर रहे हैं। आप उसे किसी देश की अर्थव्यवस्था का एक चार्ट दिखाते हैं और पूछते हैं, "इसे ठीक करने के लिए हमें क्या करना चाहिए?"

आज के अधिकांश रोबोट समझदार लेकिन अधीमी पर्यटकों (smart but impatient tourists) की तरह हैं। वे मानचित्र पर लगे संकेतों (चार्ट) को तो पढ़ सकते हैं, लेकिन यदि आप उनसे ट्रैफिक जाम और डायवर्जन वाले एक जटिल शहर में रास्ता खोजने को कहें (एक जटिल वित्तीय निर्णय), तो वे अक्सर खो जाते हैं, बेतरतीब ढंग से अनुमान लगाते हैं, या ऐसा समाधान गढ़ लेते हैं जो सुनने में तो अच्छा लगता है लेकिन गलत होता है।

यह शोध पत्र PyFi पेश करता है, जो इन रोबोट्स को प्रशिक्षित करने का एक नया तरीका है ताकि वे केवल अनुमान न लगाएं—बल्कि सोचें

यहाँ इसका विवरण दिया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "छलांग" बहुत बड़ी है

वर्तमान में, यदि आप किसी रोबोट से कठिन वित्तीय प्रश्न पूछते हैं, तो वह सीधे उत्तर तक पहुँचने की कोशिश करता है। यह एक बच्चे को गणित (calculus) सिखाने जैसा है बिना उसे पहले जोड़ या घटाव सिखाए। वे शायद एक बार भाग्यशाली हो सकते हैं, लेकिन वे अधिकांश समय विफल होंगे क्योंकि उनमें चरण-दर-चरण आधार की कमी है।

2. समाधान: "वित्तीय पिरामिड" (The Financial Pyramid)

लेखकों ने PyFi-600K नामक एक विशाल प्रशिक्षण डेटासेट बनाया है। इसे यादों का ढेर नहीं, बल्कि एक 6-मंजिला पिरामिड के रूप में सोचें।

  • स्तर 1 (आधार): "यह रेखा किस रंग की है?" (बुनियादी धारणा/perception)।
  • स्तर 2: "वहाँ क्या संख्या लिखी है?" (डेटा निष्कर्षण/extraction)।
  • स्तर 3: "यदि आप इन दो संख्याओं को घटाते हैं, तो आपको क्या प्राप्त होता है?" (गणना/calculation)।
  • स्तर 4: "क्या यह रेखा समय के साथ ऊपर जा रही है या नीचे?" (पैटर्न पहचान/pattern recognition)।
  • स्तर 5: "यह नीचे क्यों गई? इसका क्या अर्थ है?" (तार्किक तर्क/logical reasoning)।
  • स्तर 6 (शीर्ष): "इस सब के आधार पर, सरकार को कौन सी नीति अपनानी चाहिए?" (निर्णय लेना/decision making)।

जादू यह है कि रोबोट स्तर 6 का उत्तर तब तक नहीं दे सकता जब तक कि उसने स्तर 1 से 5 तक के उत्तर सही न दिए हों। यह रोबोट को शीर्ष तक चढ़ने से पहले तर्क की एक सीढ़ी बनाने के लिए मजबूर करता है।

3. शिक्षक: "प्रतिस्पर्धी गेम शो" (The Adversarial Game Show)

उन्होंने हजारों मानव विशेषज्ञों को नियुक्त किए बिना इन 6,00,000 पिरामिड प्रश्नों को कैसे बनाया? उन्होंने PyFi-adv का आविष्कार किया, जो एक मल्टी-एजेंट सिस्टम है जो एक गेम शो की तरह कार्य करता है।

कल्पित कीजिए कि दो AI एजेंट एक खेल खेल रहे हैं:

  • द सॉल्वर (The Solver): प्रश्न का उत्तर देने का प्रयास करता है।
  • द चैलेंजर (The Challenger): सॉल्वर को चकमा देने का प्रयास करता है।

यहाँ का चक्र (loop) इस प्रकार है:

  1. चैलेंजर एक सरल प्रश्न (स्तर 1) पूछता है।
  2. सॉल्वर उसका उत्तर देता है।
  3. यदि सॉल्वर सही उत्तर देता है, तो चैलेंजर क्रोधित हो जाता है और उस उत्तर के आधार पर एक कठिन फॉलो-अप प्रश्न (स्तर 2) पूछता है।
  4. वे तब तक खेलते रहते हैं, और सवाल कठिन होते जाते हैं, जब तक कि वे एक जटिल निर्णय (स्तर 6) तक नहीं पहुँच जाते।
  5. यदि सॉल्वर विफल हो जाता है, तो खेल फिर से शुरू होता है। यदि वे सफल होते हैं, तो पूरे प्रश्न श्रृंखला को एक "परफेक्ट लेसन" के रूप में सहेज लिया जाता है।

यह एक स्पैरिंग मैच की तरह है जहाँ प्रतिद्वंद्वी तब तक दांव बढ़ाता रहता है जब तक कि फाइटर खुद को मास्टर साबित न कर दे। यह स्वचालित रूप से होता है, जिससे चरण-दर-चरण वित्तीय तर्क की एक विशाल लाइब्रेरी तैयार होती है।

4. परिणाम: "अनुमान लगाने" से "तर्क करने" तक

लेखकों ने इसका परीक्षण 15 अलग-अलग AI मॉडलों पर किया।

  • प्रशिक्षण से पहले: जब स्तर 6 के प्रश्न का सामना किया गया, तो रोबोट उस छात्र की तरह थे जिसने उत्तर कुंजी (answer key) रट ली है लेकिन गणित नहीं समझा। वे लगभग 33% सही थे।
  • प्रशिक्षण के बाद: जब उन्हें पिरामिड चरणों (क्वेश्चन चेन्स का उपयोग करके) को तोड़कर सिखाया गया, तो उनकी सटीकता में उल्लेखनीय वृद्धि हुई। एक छोटे मॉडल में लगभग 20% का सुधार हुआ।

5. यह क्यों मायने रखता है: "ब्लैक बॉक्स" अब खुला है

PyFi की सबसे अच्छी बात इसकी पारदर्शिता है।

  • पुराना तरीका: रोबोट एक उत्तर देता है। यदि वह गलत है, तो आपको पता ही नहीं चलता कि वह क्यों गलत है। क्या उसने चार्ट को गलत पढ़ा? क्या उसने गणित गलत किया? क्या उसने तर्क को गलत समझा?
  • PyFi का तरीका: क्योंकि रोबोट को पहले छोटे चरणों का उत्तर देने के लिए मजबूर किया जाता है, हम उसके पथ का पता लगा सकते हैं। यदि वह अंतिम निर्णय में विफल रहता है, तो हम पीछे देख सकते हैं और कह सकते हैं, "आह, वह स्तर 3 (गणना) पर विफल रहा।" यह एक GPS होने जैसा है जो आपको केवल यह बताने के बजाय कि "आप खो गए हैं, यह बताता है कि आपने कहाँ गलत मोड़ लिया था।"

सारांश

PyFi एक नया प्रशिक्षण तरीका है जो वित्तीय AI को अनुमान लगाना छोड़ने और सीढ़ी चढ़ना सीखने की शिक्षा देता है। निष्कर्ष पर कूदने के बजाय, यह सीखता है कि:

  1. डेटा को देखना।
  2. संख्याओं को निकालना।
  3. गणित करना।
  4. रुझानों (trends) को पहचानना।
  5. तर्क को समझना।
  6. निर्णय लेना।

इन चरणों को स्वचालित रूप से उत्पन्न करने के लिए AI एजेंटों के "गेम शो" का उपयोग करके, उन्होंने एक विशाल, उच्च-गुणवत्ता वाली पाठ्यपुस्तक बनाई है जो वित्तीय AI को स्मार्ट, अधिक विश्वसनीय और अधिक भरोसेमंद बनाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →