← नवीनतम पेपर
🤖 AI

BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

यह शोध पत्र BigFinanceBench प्रस्तुत करता है, जो एक व्यापक 928-आइटम वाला बेंचमार्क है जिसे केवल अंतिम उत्तर की सटीकता पर निर्भर रहने के बजाय विस्तृत रूब्रिक्स के माध्यम से पूर्ण, ऑडिट योग्य व्युत्पत्ति वर्कफ़्लो का आकलन करके वित्तीय-अनुसंधान एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Alex Wang, Georg Meinhardt, Jacob Katz, Joseph H. Kim, Pratyush K. Chaudhary, Chase Blagden, Eric Xu

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alex Wang, Georg Meinhardt, Jacob Katz, Joseph H. Kim, Pratyush K. Chaudhary, Chase Blagden, Eric Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक जटिल रहस्य सुलझाने के लिए एक प्रतिभाशाली वित्तीय जासूस (financial detective) को काम पर रखा है: "क्या इस कंपनी का रिपोर्ट किया गया लाभ सटीक है, या वे कुछ छिपा रहे हैं?"

अतीत में, यदि आप एक AI से यह प्रश्न पूछते, तो आप केवल उस अंतिम संख्या की परवाह करते जो वह आपको देता। यदि AI कहता, "लाभ $10 मिलियन है," और वह सही संख्या होती, तो आप उसे एक 'गोल्ड स्टार' दे देते। लेकिन वित्त की वास्तविक दुनिया में, एक गोल्ड स्टार काफी नहीं है। एक मानव विशेषज्ञ पूछेगा: "आप वहां तक कैसे पहुंचे? क्या आपने सही दस्तावेज़ देखा? क्या आपने सही समय अवधि का उपयोग किया? क्या आप सॉफ्टवेयर लागतों के लिए समायोजन (adjust) करना जानते थे?" यदि AI ने अनुमान लगाकर या भ्रम (hallucination) के माध्यम से सही उत्तर प्राप्त किया होता, तो भी वह एक विफलता ही मानी जाती क्योंकि उसका "क्यों" (reasoning) गलत था।

BIGFINANCEBENCH एक नया परीक्षण है जिसे AI को भाग्यशाली अनुमानों के लिए गोल्ड स्टार पाने से रोकने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "रेसिपी" बनाम "केक"

अधिकांश पुराने AI परीक्षण एक बेकर (baker) का न्याय केवल इस आधार पर करने जैसे हैं कि केक कैसा स्वाद देता है। यदि केक मीठा है, तो बेकर पास हो जाता है।
BIGFINANCEBENCH अलग है। यह बेकर का न्याय पूरी रेसिपी पर करता है।

  • क्या उन्होंने सही आटा चुना (स्रोत/source)?
  • क्या उन्होंने अंडों को सही ढंग से मापा (डेटा निष्कर्षण/data extraction)?
  • क्या उन्होंने सामग्री को सही क्रम में मिलाया (लेखांकन तर्क/accounting logic)?
  • क्या उन्होंने इसे सही तापमान पर पकाया (गणना/calculation)?

यह परीक्षण AI को एक "चेकलिस्ट" (जिसे रूब्रिक कहा जाता है) देता है जिसमें 36,000 छोटे कदम शामिल हैं। भले ही अंतिम उत्तर गलत हो, AI को शुरुआती चरणों को सही ढंग से करने के लिए अंक मिल सकते हैं। यह एक छात्र को गणित का काम दिखाने के लिए आंशिक क्रेडिट देने जैसा है, भले ही अंत में उसने एक छोटी सी अंकगणितीय त्रुटि की हो।

2. "विशेषज्ञ पैनल"

इस परीक्षण के प्रश्न कंप्यूटर या साधारण क्विज़ द्वारा नहीं लिखे गए थे। इन्हें वास्तविक वित्तीय विशेषज्ञों द्वारा लिखा गया था—ऐसे लोग जिन्होंने इन्वेस्टमेंट बैंकिंग और प्राइवेट इक्विटी में काम किया है।

  • चुनौती: उन्होंने ऐसे प्रश्न लिखे जो विशेष रूप से वर्तमान AI को उलझाने के लिए डिज़ाइन किए गए थे। उन्होंने ऐसी चीजें पूछीं जिनमें कई दस्तावेजों को खोजना, स्मार्ट धारणाएं बनाना और जटिल गणित करना शामिल है।
  • ऑडिट: किसी भी प्रश्न को टेस्ट में जोड़ने से पहले, एक दूसरे विशेषज्ञ ने इसकी समीक्षा की ताकि यह सुनिश्चित किया जा सके कि इसे हल करने का केवल एक ही सही तरीका है, ठीक वैसे ही जैसे एक रेफरी खेल के प्ले की जांच करता है।

3. "स्कोरकार्ड"

जब AI परीक्षण देता है, तो वह केवल एक उत्तर नहीं देता। उसे अपना काम दिखाना पड़ता है:

  1. खोज (Search): उसे सही वित्तीय रिपोर्ट (जैसे 10-K फॉर्म) ढूंढनी होती है।
  2. निष्कर्षण (Extract): उसे उन रिपोर्टों से विशिष्ट संख्याएं निकालनी होती हैं।
  3. समायोजन (Adjust): उसे लेखांकन नियमों को लागू करना होता है (जैसे यह समझना कि सॉफ्टवेयर विकास लागतों को अलग तरह से माना जाना चाहिए)।
  4. गणना (Calculate): उसे गणित करना होता है।

दो स्वतंत्र "जज" AI फिर विशेषज्ञ चेकलिस्ट के विरुद्ध जासूस के काम का मूल्यांकन करते हैं। वे केवल अंतिम संख्या को नहीं देखते; वे उन ब्रेडक्रंब्स के निशान (trail of breadcrumbs) को भी देखते हैं जिन्हें AI ने पीछे छोड़ा है।

4. उन्हें क्या मिला (परिणाम)

शोधकर्ताओं ने आज उपलब्ध 10 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया। यहाँ क्या हुआ:

  • सीलिंग (छत) कम है: सबसे अच्छा AI भी कुल संभावित अंकों में से केवल लगभग 59% अंक ही प्राप्त कर सका। इसका मतलब है कि AI जो कर सकता है और एक मानव वित्तीय विश्लेषक जो कर सकता है, उसके बीच अभी भी एक बड़ा अंतर है।
  • "भाग्यशाली अनुमान" की समस्या: यदि आप केवल अंतिम उत्तरों को देखते, तो AI के स्कोर थोड़े बेहतर दिखते। लेकिन जब आपने चरणों (रूब्रिक) को देखा, तो स्कोर गिर गए। यह साबित करता है कि AI अक्सर गलत कारणों से सही उत्तर प्राप्त करता है, या रास्ते में महत्वपूर्ण चरणों को छोड़ देता है।
  • विशेषज्ञता (Specialization): कोई भी एक AI हर चीज़ में सर्वश्रेष्ठ नहीं था। एक AI दस्तावेज़ खोजने में अच्छा था लेकिन गणित में बुरा था; दूसरा गणित में अच्छा था लेकिन सही स्रोत खोजने में बुरा था। यह एक "सुपर-हीरो" होने के बजाय विशेषज्ञों की एक टीम होने जैसा है जो सब कुछ कर सके।

निचोड़ (The Bottom Line)

यह पेपर तर्क देता है कि पैसे के साथ AI पर भरोसा करने के लिए, हम केवल यह नहीं पूछ सकते, "क्या उत्तर सही है?" हमें पूछना होगा, "क्या आप साबित कर सकते हैं कि आप वहां तक कैसे पहुंचे?"

BIGFINANCEBENCH एक ऐसा उपकरण है जो AI को अपना होमवर्क दिखाने के लिए मजबूर करता है। यह हमें दिखाता है कि हालांकि AI बेहतर हो रहा है, फिर भी वह वास्तविक दुनिया के वित्तीय अनुसंधान की अस्त-व्यस्त, चरण-दर-चरण वास्तविकता के साथ संघर्ष कर रहा है। यह केवल उत्तर जानने के बारे में नहीं है; यह उत्तर के पीछे की कहानी जानने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →