An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs
यह शोध पत्र INS-S1 को प्रस्तुत करता है, जो बीमा-विशिष्ट लार्ज लैंग्वेज मॉडल का एक परिवार है जो सामान्य बुद्धिमत्ता से समझौता किए बिना, सत्यापन योग्य डेटा संश्लेषण और एक प्रगतिशील SFT-RL पाठ्यक्रम वाली एक नवीन एंड-टू-एंड अलाइनमेंट पद्धति का उपयोग करते हुए, सत्यापन योग्य डोमेन महारत और रिकॉर्ड-लो हैलुसिनेशन दर प्राप्त करता है, साथ ही व्यापक INSEva बेंचमार्क भी जारी करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सर्वज्ञानी लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल) को एक बहुत ही सख्त, उच्च-दांव वाले बीमा कार्यालय (insurance office) में काम करने के लिए रख रहे हैं।
समस्या क्या है? यह लाइब्रेरियन कविता लिखने, कोडिंग करने और बातचीत करने में तो बहुत अच्छा है, लेकिन यदि आप उनसे बीमा पॉलिसियों के बारे में पूछते हैं, तो वे भ्रमित (hallucinate) होने लगते हैं। वे एक ऐसा नियम बना सकते हैं जो अस्तित्व में ही नहीं है, एक काल्पनिक क्लेम परिदृश्य बना सकते हैं, या किसी नियम की व्याख्या इतने आत्मविश्वास से कर सकते हैं जो पूरी तरह से गलत हो। बीमा की दुनिया में, एक भी बनावटी तथ्य कानूनी मुकदमे, पैसे का नुकसान और नाराज ग्राहकों का कारण बन सकता है।
आमतौर पर, जब कंपनियाँ इसे ठीक करने की कोशिश करती हैं, तो उन्हें एक "क्षमता व्यापार-बंद" (Competency Trade-off) का सामना करना पड़ता है:
- विकल्प A: लाइब्रेरियन को बीमा विशेषज्ञ बनाएं, लेकिन वे लिखना या गणित करना भूल जाते हैं।
- विकल्प B: उन्हें हर चीज़ में स्मार्ट बनाए रखें, लेकिन वे बीमा के बारे में खतरनाक गलतियाँ करते रहते हैं।
यह पेपर INS-S1 पेश करता है, जो एक नए प्रकार का "इंश्योरेंस सुपर-लाइब्रेरियन" है जो इस समस्या को हल करता है। यह अपनी सामान्य बुद्धिमत्ता को खोए बिना बीमा का एक विशेषज्ञ है, और यह लगभग कभी झूठ नहीं बोलता।
इसे बनाने का तरीका, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:
1. "सत्यवादी पाठ्यपुस्तक" (Verifiable Data Synthesis)
मॉडल के दिमाग में लाखों बीमा कानूनों की PDF डाल देने के बजाय (जिससे अक्सर भ्रम पैदा होता है), टीम ने एक विशेष प्रशिक्षण प्रणाली बनाई।
- उपमा: कल्पना करें कि आप एक छात्र को मेडिकल परीक्षा के लिए पढ़ा रहे हैं। आप उन्हें केवल किताबों का ढेर नहीं देते। आप उन्हें एक क्विज़ जनरेटर देते हैं जो प्रश्न बनाता है, उत्तरों की आधिकारिक पाठ्यपुस्तक के साथ जाँच करता है, और छात्र को तभी आगे बढ़ने देता है जब वह 100% सही हो।
- उन्होंने क्या किया: उन्होंने एक ऐसी प्रणाली बनाई जो हजारों बीमा संबंधी प्रश्न उत्पन्न करती है और उनके उत्तरों को स्वचालित रूप से सत्यापित करती है। यदि AI अनुमान लगाने या कुछ मनगढ़ंत बनाने की कोशिश करता है, तो सिस्टम उसे तुरंत पकड़ लेता है। यह सुनिश्चित करता है कि मॉडल केवल सिद्ध तथ्यों को सीखे, न कि अनुमानों को।
2. "प्रगतिशील प्रशिक्षण शिविर" (Curriculum Learning)
आप एक नौसिखिया अग्निशमन कर्मी को सीधे जलती हुई इमारत में नहीं भेजेंगे। आप शुरुआत एक पाइप से करते हैं, फिर एक छोटी आग, और फिर एक बड़ी आग।
- उपमा: टीम ने एक "चरण-दर-चरण प्रशिक्षण शिविर" का उपयोग किया।
- चरण 1 (बुनियादी बातें): उन्होंने मॉडल को सामान्य ज्ञान और बीमा की बुनियादी अवधारणाएं सिखाईं ताकि वह एक स्मार्ट AI होना न भूले।
- चरण 2 (कठिन चीजें): उन्होंने धीरे-धीरे कठिनाई बढ़ाई, जटिल गणित (एक्चुअरियल साइंस) और पेचीदा कानूनी तर्क पर ध्यान केंद्रित किया।
- "एनीलिंग" (Annealing) का तरीका: जैसे-जैसे मॉडल कठिन चीजों में बेहतर होता गया, उन्होंने "आसान" अभ्यास की मात्रा को धीरे-धीरे कम कर दिया, जिससे उसका पूरा ध्यान कठिन, वास्तविक दुनिया के परिदृश्यों पर केंद्रित हो गया। इसने मॉडल को बोर होने या बुनियादी बातें भूलने से रोका।
3. "सख्त कोच" (RLVR & RLAIF)
एक बार जब मॉडल ने सीखना शुरू किया, तो उन्हें उसे झूठ बोलने के लिए दंडित करने और सटीक होने के लिए पुरस्कृत करने के तरीके की आवश्यकता थी।
- उपमा: कल्पना करें कि एक कोच के पास दो अलग-अलग सीटी है।
- सीटी 1 (गणित की सीटी): गणित की समस्याओं के लिए, कोच कैलकुलेटर के विरुद्ध उत्तर की जाँच करता है। यदि यह गलत है, तो मॉडल को "टाइम-आउट" मिलता है। इसे वेरिफाइड रीजनिंग (Verified Reasoning) कहा जाता है।
- सीटी 2 (नैतिकता की सीटी): खुले प्रश्नों के लिए (जैसे, "मैं क्लेम कैसे फाइल करूँ?"), कोच यह जाँचता है कि क्या उत्तर विनम्र, तार्किक है और क्या यह फर्जी नियम नहीं बना रहा है। इसे AI फीडबैक कहा जाता है।
- परिणाम: मॉडल ने सीखा कि "मनगढ़ंत बातें बनाना" दंडित करवाता है, जबकि "तथ्यों पर टिके रहना" उच्च स्कोर दिलाता है।
4. "अंतिम परीक्षा" (INSEva Benchmark)
यह साबित करने के लिए कि उनका मॉडल वास्तव में अच्छा था, उन्होंने केवल एक मानक परीक्षण का उपयोग नहीं किया। उन्होंने अब तक की सबसे व्यापक बीमा परीक्षा बनाई (जिसे INSEva कहा जाता है)।
- उपमा: यह एक ड्राइविंग टेस्ट की तरह है जो केवल आपको समानांतर पार्किंग (parallel park) के बारे में नहीं पूछता। यह आपको एक साथ बर्फबारी, निर्माण क्षेत्र और व्यस्त शहर के चौराहे में डाल देता है।
- परिणाम: INS-S1 ने इस परीक्षा में 90.14 का स्कोर किया, जो पिछले सर्वश्रेष्ठ मॉडलों (जैसे DeepSeek-R1 और Gemini) को पीछे छोड़ दिया, जिनका स्कोर केवल 82-84 के आसपास था।
बड़ी जीत: कोई "स्मृति लोप" (No "Amnesia") नहीं
सबसे प्रभावशाली हिस्सा? आमतौर पर, जब आप किसी मॉडल को विशेषज्ञ बनाने के लिए प्रशिक्षित करते हैं, तो वे एक सामान्यज्ञ (जैसे गणित पहेलियाँ हल करना या कोड लिखना) होना भूल जाते हैं।
- उपमा: आमतौर पर, यदि आप एक शेफ को मास्टर सुशी शेफ बनने के लिए प्रशिक्षित करते हैं, तो वे स्टेक (steak) बनाना भूल सकते हैं।
- वास्तविकता: INS-S1 एक सुशी मास्टर बना लेकिन वह अभी भी एक आदर्श स्टेक पका सकता था। वास्तव में, यह सामान्य तर्क (general reasoning) में और भी बेहतर हो गया क्योंकि बीमा के सख्त तर्क ने इसे अधिक स्पष्ट रूप से सोचने के लिए मजबूर किया।
"जीरो हैलुसिनेशन" चमत्कार
बीमा की दुनिया में, 1% त्रुटि दर भी एक आपदा है।
- परिणाम: INS-S1 ने 0.6% हैलुसिनेशन दर हासिल की। इसका मतलब है कि 1,000 उत्तरों में से, इसने केवल 6 बार कोई तथ्य मनगढ़ंत बनाया। यह एक रिकॉर्ड तोड़ कम दर है, जो इसे वास्तविक दुनिया के उच्च-दांव वाले व्यावसायिक उपयोग के लिए सुरक्षित बनाती है।
सारांश
Ant Group की टीम ने केवल AI में "बदलाव" नहीं किया। उन्होंने एक विशेष प्रशिक्षण पारिस्थितिकी तंत्र (ecosystem) बनाया जो:
- अपने स्वयं के प्रशिक्षण डेटा की जाँच (fact-checks) करता है।
- मॉडल को आसान से कठिन की ओर, चरण-दर-चरण प्रशिक्षित करता है।
- सत्यनिष्ठा के लिए पुरस्कृत करता है और झूठ बोलने के लिए दंडित करता है।
- अब तक की सबसे कठिन परीक्षा के साथ इसे सिद्ध करता है।
परिणाम एक ऐसा AI है जो सुरक्षित, स्मार्ट है, और बिना कुछ मनगढ़ंत बनाए आपके बीमा दावों को संभालने के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।