← नवीनतम पेपर
💬 NLP

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

यह शोध पत्र INS-ActBench को प्रस्तुत करता है, जो ज्ञान, दीर्घ-संदर्भ केस तर्क (long-context case reasoning) और टूल-आधारित अभ्यास के माध्यम से लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए 16 एक्चुरियल एसोसिएशनों से 12,000 से अधिक प्रश्नों वाला एक व्यापक बेंचमार्क है, जो यह दर्शाता है कि जहाँ अत्याधुनिक मॉडल्स मानकीकृत ज्ञान में उत्कृष्ट हैं, वहीं वे जटिल पेशेवर वर्कफ़्लो में अभी भी काफी पीछे हैं।

मूल लेखक: Changyu Chen, Chenwei Lin, Xian Xu

प्रकाशित 2026-07-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changyu Chen, Chenwei Lin, Xian Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वित्तीय जादूगर (financial wizard) बनने की शिक्षा दे रहे हैं। आपने पहले ही उसे पैसे से जुड़े शब्दों की डिक्शनरी पढ़ना और बुनियादी गणित करना सिखा दिया है। लेकिन एक सच्चा जादूगर बनने के लिए केवल मंत्रों को जानना ही काफी नहीं है; यह भी जानना ज़रूरी है कि कब उनका उपयोग करना है, जब स्थिति जटिल हो तो उन्हें कैसे मिलाना है, और वास्तव में मंत्र चलाने के लिए कितने स्थिर हाथों की आवश्यकता है ताकि महल में आग न लग जाए। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है—अति-बुद्धिमान कंप्यूटर प्रोग्राम जो मनुष्यों की तरह पढ़, लिख और तर्क कर सकते हैं। लंबे समय तक, हमने इन रोबोटों का परीक्षण अलग-थलग कार्यों पर किया है: "क्या तुम इस शब्द की परिभाषा दे सकते हो?" या "क्या तुम इस गणित की समस्या को हल कर सकते हो?" लेकिन वास्तविक दुनिया में, पेशेवर अकेले काम नहीं करते हैं। उन्हें सौ पन्नों का अनुबंध पढ़ना पड़ता है, उस एक छोटे से क्लॉज (clause) को ढूँढना पड़ता है जो महत्वपूर्ण है, जोखिम की गणना करनी पड़ती है, और फिर अपना उत्तर सही साबित करने के लिए स्प्रेडशीट या कोड का उपयोग करना पड़ता है। यह शोध पत्र एक बड़ा सवाल पूछता है: क्या ये AI जादूगर वास्तव में पूरा काम कर सकते हैं, या वे केवल फ्लैशकार्ड रटने में अच्छे हैं?

यहाँ आता है INS-ActBench, एक नया, विशाल "अंतिम परीक्षा" जिसे फुदान यूनिवर्सिटी (Fudan University) के शोधकर्ताओं द्वारा AI का विशेष रूप से एक्चुअरियल साइंस (Actuarial Science) के उच्च-दांव वाले कार्य पर परीक्षण करने के लिए बनाया गया है। एक एक्टुअरी (actuary) को एक पेशेवर जोखिम जासूस के रूप में समझें जो बीमा कंपनियों के लिए काम करता है। वे यह पता लगाने के लिए गणित, सांख्यिकी और अर्थशास्त्र का उपयोग करते हैं कि कोई बुरी घटना (जैसे कार दुर्घटना या घर में आग लगना) होने की कितनी संभावना है और कंपनी को उसका भुगतान करने के लिए कितनी बचत करने की आवश्यकता है। यह एक ऐसा काम है जिसके लिए नियमों को जानने, वास्तविक दुनिया की आपदाओं के बारे में जटिल कहानियाँ पढ़ने और सटीक गणना करने की आवश्यकता होती है जो गलत नहीं हो सकतीं। शोधकर्ताओं ने 12,050 प्रश्नों का एक टेस्ट बैंक बनाया है जो दुनिया भर के एक्टुअरीज द्वारा दी गई वास्तविक परीक्षाओं से लिया गया है। उन्होंने केवल साधारण सामान्य ज्ञान नहीं पूछा; उन्होंने टेस्ट को इस तरह डिज़ाइन किया कि यह देख सके कि क्या AI तीन अलग-अलग कठिनाई स्तरों को संभाल सकता है:

  1. फ्लैशकार्ड्स (INS-Act-Know): क्या AI परिभाषाओं और सूत्रों को याद रख सकता है?
  2. मिस्ट्री नॉवेल (INS-Act-Case): क्या AI किसी कंपनी के वित्त के बारे में एक लंबी, जटिल कहानी पढ़ सकता है, छिपे हुए सुरागों को खोज सकता है, और भविष्य के बारे में एक स्मार्ट अनुमान लगा सकता है?
  3. वर्कशॉप (INS-Act-Practice): क्या AI वास्तव में सही कंप्यूटर कोड या स्प्रेडशीट फॉर्मूला लिखकर काम कर सकता है जिससे एक संख्या प्राप्त हो सके जिसे जांचा जा सके?

जब शोधकर्ताओं ने नौ अलग-अलग AI मॉडल्स को इस कठिन परीक्षा से गुजारा, तो परिणाम "वाह" और "ओह" का मिश्रण थे। AI मॉडल पहले स्तर पर आश्चर्यजनक रूप से अच्छे थे। उन्होंने फ्लैशकार्ड्स में महारत हासिल की, और अक्सर मानकीकृत ज्ञान संबंधी प्रश्नों पर मानव विशेषज्ञों से अधिक स्कोर किया। यह स्पष्ट है कि यदि आप केवल AI से किसी नियम को दोहराने या सरल गणित की समस्या को हल करने के लिए कहते हैं, तो वह एक जीनियस है।

हालाँकि, जैसे ही टेस्ट जटिल हुआ, रोबोट लड़खड़ा गए। जब AI को एक लंबी, जटिल बीमा केस ( "मिस्ट्री नॉवेल" स्तर) पढ़नी थी, तो उनके स्कोर नाटकीय रूप से गिर गए। उन्हें कहानी के विभिन्न हिस्सों के बीच संबंध जोड़ने में संघर्ष करना पड़ा। इससे भी बुरा यह था कि जब उन्हें "वर्कशॉप" में प्रवेश करना था और एक अंतिम संख्या प्राप्त करने के लिए सही कोड या स्प्रेडशीट फॉर्मूला लिखना था, तो वे इसे विश्वसनीय रूप से करने में विफल रहे। अध्ययन में पाया गया कि जबकि AI गणित के बारे में बात कर सकता था, लेकिन वह अक्सर गणित को इस तरह से करने में विफल रहा जो सुसंगत और सत्यापन योग्य हो।

शोधकर्ताओं ने यह भी पाया कि AI का प्रदर्शन इस बात पर निर्भर करता था कि नियम कहाँ से आए हैं। बीमा कानून अमेरिका, यूके और जापान में अलग-अलग होते हैं। AI मॉडल उन "मानक" नियमों में बहुत अच्छे थे जिन्हें उन्होंने अपने प्रशिक्षण के दौरान अक्सर देखा था, लेकिन जब प्रश्न अलग-अलग देशों से आए जिनमें अलग-अलग स्थानीय नियम थे, तो वे भ्रमित हो गए। उन्होंने यह भी पाया कि AI की सबसे बड़ी विफलताएं आमतौर पर इसलिए नहीं थीं कि वे किसी उपकरण (जैसे कैलकुलेटर) का उपयोग करना भूल गए थे; बल्कि इसलिए थीं क्योंकि उन्होंने उपकरण का सही उपयोग किया लेकिन समस्या पर गलत तर्क या सूत्र लागू किया।

संक्षेप में, यह शोध पत्र सुझाव देता है कि जबकि AI एक्चुअरियल ज्ञान के लिए एक शानदार विश्वकोश बन गया है, यह अभी तक एक विश्वसनीय पेशेवर सहायक नहीं है। यह लिखित परीक्षा पास कर सकता है, लेकिन यह कार्यालय में बैठकर वे अंतिम निर्णय लेने के लिए तैयार नहीं है जो बीमा कंपनियों को सुरक्षित रखते हैं। शोधकर्ता निष्कर्ष निकालते हैं कि इस क्षेत्र में AI को वास्तव में मदद करने के लिए, इसे लंबी कहानियों में कड़ियों को जोड़ने और छोटी लेकिन महंगी गलतियाँ किए बिना जटिल, चरण-दर-चरण वर्कफ़्लो को निष्पादित करने में बहुत बेहतर होना होगा। फिलहाल, मानव विशेषज्ञ ही है जिसके हाथ में कलम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →