← नवीनतम पेपर
💻 computer science

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

यह शोध पत्र FinED-Bench प्रस्तुत करता है, जो तीन संज्ञानात्मक जटिलता स्तरों के माध्यम से वित्तीय त्रुटि का पता लगाने के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि जबकि वर्तमान बड़े भाषा मॉडल (Large Language Models) इस महत्वपूर्ण कार्य में संघर्ष करते हैं, सुपरवाइज्ड फाइन-ट्यूनिंग उनके प्रदर्शन को महत्वपूर्ण रूप से बढ़ा सकती है।

मूल लेखक: Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाले समाचार पत्र के संपादक हैं। आपका काम केवल "the" के बजाय "teh" जैसी टाइपिंग की गलतियों को सुधारना नहीं है; आपका काम यह सुनिश्चित करना है कि कहानी समझ में आए, गणित सही हो, और तथ्य वास्तविकता के अनुरूप हों। यदि आपसे कोई गलती छूट जाती है, तो इसके परिणाम बहुत बड़े हो सकते हैं: लोग पैसा खो सकते हैं, कंपनियाँ गलत निर्णय ले सकती हैं, या कानून टूट सकते हैं। यह वित्तीय दस्तावेजों की दुनिया है, जहाँ एक रिपोर्ट में एक छोटी सी त्रुटि भी व्यापक प्रभाव डाल सकती है।

यहाँ हमारे समय के "सुपर-रीडर्स" का प्रवेश होता है: लार्ज लैंग्वेज मॉडल्स (LLMs)। इन मॉडल्स को ऐसे अविश्वसनीय रूप से स्मार्ट, पढ़े-लिखे रोबोट के रूप में सोचें जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। वे कहानियाँ लिखने, सवालों के जवाब देने और यहाँ तक कि स्टॉक ट्रेंड्स की भविष्यवाणी करने में माहिर हैं। लेकिन यहाँ एक बड़ा सवाल है: क्या ये रोबोट वास्तव में यह पहचान सकते हैं कि एक जटिल वित्तीय रिपोर्ट में क्या गलत है? क्या वे ऐसी तारीख पकड़ सकते हैं जो अस्तित्व में ही नहीं है, किसी वित्तीय शब्द का गलत उपयोग, या एक टेबल में दिया गया वह नंबर जो टेक्स्ट के एक वाक्य का खंडन करता है? यह शोध उसी रहस्य की गहराई में जाता है, यह परीक्षण करते हुए कि क्या हमारे वर्तमान AI सुपर-रीडर्स अंतिम वित्तीय प्रूफरीडर बनने के लिए तैयार हैं या वे अभी भी स्पष्ट गलतियों को पकड़ने में चूक जाते हैं।

महान वित्तीय प्रूफरीडिंग परीक्षण

इस अध्ययन के पीछे के शोधकर्ताओं ने, जो फुदान यूनिवर्सिटी और एंट ग्रुप की एक टीम है, अनुमान लगाना बंद कर दिया और परीक्षण करना शुरू किया। उन्होंने एक नया खेल का मैदान बनाया जिसे FinED-Bench कहा जाता है, जो अनिवार्य रूप से एक विशाल, कठिन बाधा दौड़ (obstacle course) है जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि AI वित्तीय दस्तावेजों में गलतियाँ खोजने में कितना सक्षम है।

इससे पहले, AI के अधिकांश परीक्षण व्याकरण की गलतियों के लिए एक छोटे वाक्य की जाँच करने जैसे थे। लेकिन वित्तीय दस्तावेज़ अलग होते हैं। वे लंबे, सघन और विशेष शब्दावली (jargon) से भरे होते हैं। यहाँ एक गलती केवल एक टाइपो नहीं है; यह एक "वित्तीय तर्क त्रुटि" (Financial Reasoning Error) हो सकती है, जहाँ एक रिपोर्ट कहती है कि बिक्री 10% बढ़ी है, लेकिन अगले अनुभाग में दी गई तालिका दिखाती है कि वास्तव में वे 5% कम हुई हैं। इसे पकड़ने के लिए AI को पूरी कहानी को अपने दिमाग में रखना होगा और कड़ियों को जोड़ना होगा, न कि केवल एक बार में एक पंक्ति पढ़ना होगा।

अपने परीक्षण को बनाने के लिए, टीम ने 900 से अधिक वास्तविक वित्तीय दस्तावेजों (जैसे स्टॉक रिपोर्ट और कानूनी अनुबंध) को इकट्ठा किया जो 2025 में प्रकाशित हुए थे—जिसका अर्थ है कि वे बिल्कुल नए हैं और AI मॉडल्स ने उन्हें पहले नहीं देखा है। फिर उन्होंने इन दस्तावेजों में हजारों विशिष्ट त्रुटियों को डालने के लिए एक चतुर अर्ध-स्वचालित प्रणाली का उपयोग किया। उन्होंने तीन स्तरों की कठिनाई बनाई:

  1. सामान्य ज्ञान संबंधी त्रुटियाँ (General Knowledge Errors): ऐसी चीजें जिन्हें कोई भी पकड़ सकता है, जैसे कि ऐसी तारीख जो मौजूद नहीं है (जैसे, "फरवरी 30") या एक गायब फोन नंबर।
  2. वित्तीय डोमेन ज्ञान संबंधी त्रुटियाँ (Financial Domain Knowledge Errors): ऐसी गलतियाँ जिनमें शब्दावली का ज्ञान आवश्यक है, जैसे "प्राइस-टू-अर्निंग रेशियो" को "प्राइस-टू-बुक रेशियो" के साथ मिला देना।
  3. वित्तीय तर्क संबंधी त्रुटियाँ (Financial Reasoning Errors): सबसे कठिन स्तर, जहाँ AI को दस्तावेज़ के विभिन्न हिस्सों की तुलना करके विरोधाभास खोजना होगा, जैसे कि विकास का दावा जो कच्चे डेटा (raw data) का खंडन करता हो।

परिणाम: स्मार्ट, लेकिन पूर्ण नहीं

जब शोधकर्ताओं ने शीर्ष AI मॉडल्स (GPT-4o और Qwen के कई संस्करणों सहित) को इस परीक्षण के माध्यम से गुजारा, तो परिणाम "प्रभावशाली" और "ओह नहीं" का मिश्रण थे।

मुख्य निष्कर्ष यह है कि वर्तमान AI मॉडल अभी भी विश्वसनीय वित्तीय समीक्षक बनने के लिए संघर्ष कर रहे हैं। यहाँ तक कि सबसे अच्छा मॉडल, GPT-4o, कुल मिलाकर केवल 48.34% त्रुटियों को ही सही ढंग से पहचान पाया। यह मुश्किल से पास होने वाला ग्रेड है। मॉडल सरल गलतियों (जैसे गलत तारीखों) को खोजने में ठीक थे, लेकिन जब त्रुटियों के लिए जटिल तर्क की आवश्यकता हुई, तो वे विफल हो गए। सबसे कठिन "वित्तीय तर्क" त्रुटियों के लिए, GPT-4o का स्कोर गिरकर केवल 38.00% रह गया।

यह तब और भी दिलचस्प हो जाता है जब आप दस्तावेजों की लंबाई देखते हैं। AI मॉडल उन पाठकों की तरह हैं जो कुछ पन्ने पढ़ने के बाद थक जाते हैं। जब दस्तावेज़ छोटे थे (लगभग 2,500 शब्द), तो मॉडल्स का प्रदर्शन ठीक था। लेकिन जैसे-जैसे दस्तावेज़ लंबे होते गए—50,000 शब्दों या उससे अधिक तक पहुँचे—उनका प्रदर्शन गिरता चला गया। सबसे लंबे दस्तावेजों के लिए, F1 स्कोर (सटीकता का एक माप) गिरकर मात्र 16.66% रह गया। ऐसा लगता है कि सबसे स्मार्ट AI भी एक विशाल रिपोर्ट के "मध्य" में खो जाता है, उन गलतियों को छोड़ देता है जिन्हें एक इंसान पकड़ सकता है।

शोध ने विशेष रूप से वित्त के लिए प्रशिक्षित मॉडल्स (जैसे Fin-R1) को भी देखा। आश्चर्यजनक रूप से, इन विशिष्ट मॉडल्स ने सामान्य मॉडल्स की तुलना में बहुत अधिक सुधार नहीं दिखाया। वास्तव में, कुछ का प्रदर्शन तो और भी खराब रहा। यह सुझाव देता है कि केवल AI को वित्त के बारे में सिखाना पर्याप्त नहीं है; इसे दस्तावेजों के माध्यम से तर्क करना सीखना होगा, न कि केवल तथ्यों को याद करना।

आशा की किरण: प्रशिक्षण मदद करता है

वहाँ एक उज्ज्वल बिंदु था। जब शोधकर्ताओं ने एक थोड़े कमजोर मॉडल (Qwen3-14B) को लिया और उसे विशेष रूप से इन वित्तीय त्रुटियों को पहचानने के लिए अतिरिक्त प्रशिक्षण दिया, तो इसका प्रदर्शन 10.70% बढ़ गया। यह सुझाव देता है कि भले ही वर्तमान AI पूर्ण नहीं है, लेकिन सही प्रकार के अभ्यास के साथ यह बहुत बेहतर हो सकता है। यह एक छात्र को उस परीक्षा के लिए एक विशिष्ट अध्ययन गाइड देने जैसा है जिसे वह देने जा रहा है; उन्हें पास होने के लिए जीनियस होने की आवश्यकता नहीं है, उन्हें बस यह जानने की आवश्यकता है कि क्या देखना है।

निचोड़

तो, क्या लार्ज लैंग्वेज मॉडल्स अभी विश्वसनीय वित्तीय समीक्षक हैं? उत्तर एक सतर्क "नहीं" है। वे शक्तिशाली उपकरण हैं जो कुछ गलतियों को पकड़ सकते हैं, लेकिन वे अभी मानव विशेषज्ञों को बदलने के लिए तैयार नहीं हैं। वे लंबे दस्तावेजों, जटिल तर्क और सूक्ष्म विरोधाभासों के साथ संघर्ष करते हैं। हालाँकि, यह शोध दिखाता है कि लक्षित प्रशिक्षण के साथ, वे काफी बेहतर हो सकते हैं। फिलहाल, यदि आप अरबों डॉलर की वित्तीय रिपोर्ट के साथ काम कर रहे हैं, तो आप संभवतः AI के काम की दोबारा जाँच के लिए एक इंसान को ही चाहेंगे। रोबोट सीख रहे हैं, लेकिन उन्होंने अभी तक वित्तीय प्रूफरीडिंग की कला में महारत हासिल नहीं की है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →