← नवीनतम पेपर
💬 NLP

An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs

यह शोध पत्र INS-S1 को प्रस्तुत करता है, जो बीमा-विशिष्ट लार्ज लैंग्वेज मॉडल का एक परिवार है जो सामान्य बुद्धिमत्ता से समझौता किए बिना, सत्यापन योग्य डेटा संश्लेषण और एक प्रगतिशील SFT-RL पाठ्यक्रम वाली एक नवीन एंड-टू-एंड अलाइनमेंट पद्धति का उपयोग करते हुए, सत्यापन योग्य डोमेन महारत और रिकॉर्ड-लो हैलुसिनेशन दर प्राप्त करता है, साथ ही व्यापक INSEva बेंचमार्क भी जारी करता है।

मूल लेखक: Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सर्वज्ञानी लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल) को एक बहुत ही सख्त, उच्च-दांव वाले बीमा कार्यालय (insurance office) में काम करने के लिए रख रहे हैं।

समस्या क्या है? यह लाइब्रेरियन कविता लिखने, कोडिंग करने और बातचीत करने में तो बहुत अच्छा है, लेकिन यदि आप उनसे बीमा पॉलिसियों के बारे में पूछते हैं, तो वे भ्रमित (hallucinate) होने लगते हैं। वे एक ऐसा नियम बना सकते हैं जो अस्तित्व में ही नहीं है, एक काल्पनिक क्लेम परिदृश्य बना सकते हैं, या किसी नियम की व्याख्या इतने आत्मविश्वास से कर सकते हैं जो पूरी तरह से गलत हो। बीमा की दुनिया में, एक भी बनावटी तथ्य कानूनी मुकदमे, पैसे का नुकसान और नाराज ग्राहकों का कारण बन सकता है।

आमतौर पर, जब कंपनियाँ इसे ठीक करने की कोशिश करती हैं, तो उन्हें एक "क्षमता व्यापार-बंद" (Competency Trade-off) का सामना करना पड़ता है:

  • विकल्प A: लाइब्रेरियन को बीमा विशेषज्ञ बनाएं, लेकिन वे लिखना या गणित करना भूल जाते हैं।
  • विकल्प B: उन्हें हर चीज़ में स्मार्ट बनाए रखें, लेकिन वे बीमा के बारे में खतरनाक गलतियाँ करते रहते हैं।

यह पेपर INS-S1 पेश करता है, जो एक नए प्रकार का "इंश्योरेंस सुपर-लाइब्रेरियन" है जो इस समस्या को हल करता है। यह अपनी सामान्य बुद्धिमत्ता को खोए बिना बीमा का एक विशेषज्ञ है, और यह लगभग कभी झूठ नहीं बोलता।

इसे बनाने का तरीका, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. "सत्यवादी पाठ्यपुस्तक" (Verifiable Data Synthesis)

मॉडल के दिमाग में लाखों बीमा कानूनों की PDF डाल देने के बजाय (जिससे अक्सर भ्रम पैदा होता है), टीम ने एक विशेष प्रशिक्षण प्रणाली बनाई।

  • उपमा: कल्पना करें कि आप एक छात्र को मेडिकल परीक्षा के लिए पढ़ा रहे हैं। आप उन्हें केवल किताबों का ढेर नहीं देते। आप उन्हें एक क्विज़ जनरेटर देते हैं जो प्रश्न बनाता है, उत्तरों की आधिकारिक पाठ्यपुस्तक के साथ जाँच करता है, और छात्र को तभी आगे बढ़ने देता है जब वह 100% सही हो।
  • उन्होंने क्या किया: उन्होंने एक ऐसी प्रणाली बनाई जो हजारों बीमा संबंधी प्रश्न उत्पन्न करती है और उनके उत्तरों को स्वचालित रूप से सत्यापित करती है। यदि AI अनुमान लगाने या कुछ मनगढ़ंत बनाने की कोशिश करता है, तो सिस्टम उसे तुरंत पकड़ लेता है। यह सुनिश्चित करता है कि मॉडल केवल सिद्ध तथ्यों को सीखे, न कि अनुमानों को।

2. "प्रगतिशील प्रशिक्षण शिविर" (Curriculum Learning)

आप एक नौसिखिया अग्निशमन कर्मी को सीधे जलती हुई इमारत में नहीं भेजेंगे। आप शुरुआत एक पाइप से करते हैं, फिर एक छोटी आग, और फिर एक बड़ी आग।

  • उपमा: टीम ने एक "चरण-दर-चरण प्रशिक्षण शिविर" का उपयोग किया।
    • चरण 1 (बुनियादी बातें): उन्होंने मॉडल को सामान्य ज्ञान और बीमा की बुनियादी अवधारणाएं सिखाईं ताकि वह एक स्मार्ट AI होना न भूले।
    • चरण 2 (कठिन चीजें): उन्होंने धीरे-धीरे कठिनाई बढ़ाई, जटिल गणित (एक्चुअरियल साइंस) और पेचीदा कानूनी तर्क पर ध्यान केंद्रित किया।
    • "एनीलिंग" (Annealing) का तरीका: जैसे-जैसे मॉडल कठिन चीजों में बेहतर होता गया, उन्होंने "आसान" अभ्यास की मात्रा को धीरे-धीरे कम कर दिया, जिससे उसका पूरा ध्यान कठिन, वास्तविक दुनिया के परिदृश्यों पर केंद्रित हो गया। इसने मॉडल को बोर होने या बुनियादी बातें भूलने से रोका।

3. "सख्त कोच" (RLVR & RLAIF)

एक बार जब मॉडल ने सीखना शुरू किया, तो उन्हें उसे झूठ बोलने के लिए दंडित करने और सटीक होने के लिए पुरस्कृत करने के तरीके की आवश्यकता थी।

  • उपमा: कल्पना करें कि एक कोच के पास दो अलग-अलग सीटी है।
    • सीटी 1 (गणित की सीटी): गणित की समस्याओं के लिए, कोच कैलकुलेटर के विरुद्ध उत्तर की जाँच करता है। यदि यह गलत है, तो मॉडल को "टाइम-आउट" मिलता है। इसे वेरिफाइड रीजनिंग (Verified Reasoning) कहा जाता है।
    • सीटी 2 (नैतिकता की सीटी): खुले प्रश्नों के लिए (जैसे, "मैं क्लेम कैसे फाइल करूँ?"), कोच यह जाँचता है कि क्या उत्तर विनम्र, तार्किक है और क्या यह फर्जी नियम नहीं बना रहा है। इसे AI फीडबैक कहा जाता है।
  • परिणाम: मॉडल ने सीखा कि "मनगढ़ंत बातें बनाना" दंडित करवाता है, जबकि "तथ्यों पर टिके रहना" उच्च स्कोर दिलाता है।

4. "अंतिम परीक्षा" (INSEva Benchmark)

यह साबित करने के लिए कि उनका मॉडल वास्तव में अच्छा था, उन्होंने केवल एक मानक परीक्षण का उपयोग नहीं किया। उन्होंने अब तक की सबसे व्यापक बीमा परीक्षा बनाई (जिसे INSEva कहा जाता है)।

  • उपमा: यह एक ड्राइविंग टेस्ट की तरह है जो केवल आपको समानांतर पार्किंग (parallel park) के बारे में नहीं पूछता। यह आपको एक साथ बर्फबारी, निर्माण क्षेत्र और व्यस्त शहर के चौराहे में डाल देता है।
  • परिणाम: INS-S1 ने इस परीक्षा में 90.14 का स्कोर किया, जो पिछले सर्वश्रेष्ठ मॉडलों (जैसे DeepSeek-R1 और Gemini) को पीछे छोड़ दिया, जिनका स्कोर केवल 82-84 के आसपास था।

बड़ी जीत: कोई "स्मृति लोप" (No "Amnesia") नहीं

सबसे प्रभावशाली हिस्सा? आमतौर पर, जब आप किसी मॉडल को विशेषज्ञ बनाने के लिए प्रशिक्षित करते हैं, तो वे एक सामान्यज्ञ (जैसे गणित पहेलियाँ हल करना या कोड लिखना) होना भूल जाते हैं।

  • उपमा: आमतौर पर, यदि आप एक शेफ को मास्टर सुशी शेफ बनने के लिए प्रशिक्षित करते हैं, तो वे स्टेक (steak) बनाना भूल सकते हैं।
  • वास्तविकता: INS-S1 एक सुशी मास्टर बना लेकिन वह अभी भी एक आदर्श स्टेक पका सकता था। वास्तव में, यह सामान्य तर्क (general reasoning) में और भी बेहतर हो गया क्योंकि बीमा के सख्त तर्क ने इसे अधिक स्पष्ट रूप से सोचने के लिए मजबूर किया।

"जीरो हैलुसिनेशन" चमत्कार

बीमा की दुनिया में, 1% त्रुटि दर भी एक आपदा है।

  • परिणाम: INS-S1 ने 0.6% हैलुसिनेशन दर हासिल की। इसका मतलब है कि 1,000 उत्तरों में से, इसने केवल 6 बार कोई तथ्य मनगढ़ंत बनाया। यह एक रिकॉर्ड तोड़ कम दर है, जो इसे वास्तविक दुनिया के उच्च-दांव वाले व्यावसायिक उपयोग के लिए सुरक्षित बनाती है।

सारांश

Ant Group की टीम ने केवल AI में "बदलाव" नहीं किया। उन्होंने एक विशेष प्रशिक्षण पारिस्थितिकी तंत्र (ecosystem) बनाया जो:

  1. अपने स्वयं के प्रशिक्षण डेटा की जाँच (fact-checks) करता है।
  2. मॉडल को आसान से कठिन की ओर, चरण-दर-चरण प्रशिक्षित करता है।
  3. सत्यनिष्ठा के लिए पुरस्कृत करता है और झूठ बोलने के लिए दंडित करता है।
  4. अब तक की सबसे कठिन परीक्षा के साथ इसे सिद्ध करता है।

परिणाम एक ऐसा AI है जो सुरक्षित, स्मार्ट है, और बिना कुछ मनगढ़ंत बनाए आपके बीमा दावों को संभालने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →