SteuerLLM: Local specialized large language model for German tax law analysis
यह शोध पत्र SteuerLLM को प्रस्तुत करता है, जो एक विशिष्ट 28B-पैरामीटर वाला जर्मन कर कानून मॉडल है, और SteuerEx को, जो प्रामाणिक विश्वविद्यालय परीक्षाओं से व्युत्पन्न पहला ओपन बेंचमार्क है, जो यह प्रदर्शित करता है कि डोमेन-विशिष्ट अनुकूलन और सिंथेटिक डेटा जनरेशन जटिल कानूनी तर्क कार्यों में सामान्य-उद्देश्य वाले मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित छात्र को जर्मन टैक्स कानून (कर कानून) की एक कठिन, उच्च-दांव वाली परीक्षा पास करने के लिए सिखाने की कोशिश कर रहे हैं। समस्या यह है कि सामान्य "बुद्धिमान" छात्र (स्टैंडर्ड लार्ज लैंग्वेज मॉडल्स) निबंध लिखने या बातचीत करने में बहुत अच्छे होते हैं, लेकिन वे तब विफल हो जाते हैं जब नियम कठोर हों, शब्दावली सटीक हो, और एक गलत संख्या भी पूरे उत्तर को बर्बाद कर सकती है।
यह शोध पत्र इस समस्या को हल करने के लिए दो मुख्य चीजें पेश करता है: एक नया, बहुत कठिन परीक्षा और एक नया विशेषज्ञ छात्र जिसे विशेष रूप से इसे पास करने के लिए डिज़ाइन किया गया है।
1. नई परीक्षा: "SteuerEx"
शोधकर्ताओं ने पहला ओपन बेंचमार्क SteuerEx बनाया। इसे AI के लिए एक "फाइनल एग्जाम" के रूप में समझें, लेकिन नकली सवालों के बजाय, इसमें पिछले एक दशक की वास्तविक जर्मन विश्वविद्यालय टैक्स लॉ परीक्षाओं के 115 वास्तविक प्रश्न शामिल हैं।
- यह कैसे काम करता है: एक सामान्य परीक्षा में, आपको शायद एक साधारण "सही या गलत" ग्रेड मिले। लेकिन टैक्स कानून में, एक छात्र सही कानूनी अवधारणा तो प्राप्त कर सकता है लेकिन एक विशिष्ट साइटेशन (उद्धरण) छोड़ सकता है, या गणित सही कर सकता है लेकिन तर्क गलत हो सकता है।
- ग्रेडिंग सिस्टम: शोधकर्ताओं ने प्रत्येक उत्तर को छोटे "बिल्डिंग ब्लॉक्स" (कथनों) में तोड़ दिया। एक AI ग्रेडर (एक दूसरा AI) प्रत्येक ब्लॉक की व्यक्तिगत रूप से जांच करता है। यदि आप आधा तर्क सही करते हैं, तो आपको आधे अंक मिलते हैं। यह इस बात की नकल करता है कि वास्तविक प्रोफेसर कैसे ग्रेड देते हैं: अच्छा तर्क देने के लिए आंशिक क्रेडिट देना, भले ही अंतिम उत्तर एकदम सटीक न हो।
- कठिनाई: यह परीक्षा छह क्षेत्रों को कवर करती है, जैसे कॉर्पोरेट टैक्स, इनकम टैक्स और VAT। इसे बेहद ईमानदार होने के लिए डिज़ाइन किया गया है; अधिकांश सामान्य AI मॉडल बहुत कम स्कोर करते हैं, जो यह साबित करता है कि टैक्स कानून एक कठिन चुनौती है।
2. विशेषज्ञ छात्र: "SteuerLLM"
इस परीक्षा से निपटने के लिए, टीम ने SteuerLLM बनाया। कल्पना कीजिए कि एक सामान्य उद्देश्य वाले जीनियस (एक 24-बिलियन-पैरामीटर वाला AI) को टैक्स कानून के लिए विशेष "ब्रेन ट्रांसप्लांट" या "अतिरिक्त ट्रेनिंग व्हील्स" दिए गए हैं।
- प्रशिक्षण पद्धति: उन्होंने इसे केवल एक टेक्स्टबुक नहीं खिलाया। उन्होंने "वॉटर फाउंटेन" (Water Fountain) पद्धति का उपयोग किया। उन्होंने वास्तविक परीक्षा प्रश्नों का एक छोटा सेट लिया और एक कंप्यूटर प्रोग्राम का उपयोग करके वास्तविक जर्मन कानूनों के आधार पर हजारों नए, यथार्थवादी अभ्यास प्रश्न और उत्तर स्वचालित रूप से उत्पन्न किए। यह एक छात्र को अभ्यास समस्याओं की एक विशाल, अनंत लाइब्रेरी देने जैसा है जो बिल्कुल वास्तविक परीक्षा जैसी दिखती हैं।
- आर्किटेक्चर: पूरे मस्तिष्क को फिर से प्रशिक्षित करने के बजाय (जो AI को सामान्य भाषा बोलना भूलने पर मजबूर कर सकता है), उन्होंने टैक्स कानून के लिए विशेष "न्यूरॉन्स" की नई परतें जोड़ीं। यह छात्र के बैग में एक विशेष कैलकुलेटर और कानून की डिक्शनरी जोड़ने जैसा है, बिना उसके चलने या बोलने के तरीके को बदले।
- परिणाम: इस विशेषज्ञ छात्र ने, जिसके 28 बिलियन पैरामीटर्स हैं, लगभग हर अन्य सामान्य AI मॉडल को हरा दिया, जिसमें वे मॉडल भी शामिल हैं जो उनसे 20 गुना बड़े (जैसे 671-बिलियन-पैरामीटर वाले मॉडल) हैं। इसने साबित कर दिया कि टैक्स कानून के लिए, कच्चे आकार (raw size) से अधिक विशेषज्ञ प्रशिक्षण मायने रखता है।
3. तुलना: AI बनाम वास्तविक छात्र
शोधकर्ताओं ने अपने AI छात्र की तुलना उन वास्तविक मानव छात्रों से की जिन्होंने ये परीक्षाएँ दी थीं।
- अंतर: औसत मानव छात्र अभी भी AI की तुलना में बहुत अधिक स्कोर करते हैं। AI अभी तक टैक्स लॉयर या शीर्ष छात्र की जगह लेने के लिए तैयार नहीं है।
- प्रगति: हालांकि, AI ने कई श्रेणियों में सबसे खराब मानव छात्रों से बेहतर प्रदर्शन किया। इसने दिखाया कि यह "आंशिक रूप से सही" कानूनी तर्क उत्पन्न कर सकता है जो वास्तविक परीक्षा में अंक दिला सकते हैं, बजाय इसके कि वह केवल मनगढ़ंत बातें बनाए।
4. "ओपन" बनाम "क्लोज्ड" का रहस्य
टीम ने अपने मॉडल का एक संस्करण भी जारी किया जिसे Open-SteuerLLM कहा जाता है। यह संस्करण चैंपियन मॉडल के समान ही है, सिवाय इसके कि उन्होंने इसमें से डेटा का एक छोटा हिस्सा हटा दिया है जिसे वे सार्वजनिक रूप से साझा नहीं कर सकते थे।
- निष्कर्ष: ओपन संस्करण क्लोज्ड संस्करण के लगभग उतना ही अच्छा प्रदर्शन करता है। यह सुझाव देता है कि प्रशिक्षण डेटा उत्पन्न करने की पद्धति (वह "वॉटर फाउंटेन" पाइपलाइन) ही असली सफलता का राज थी, न कि केवल उनके द्वारा उपयोग किए गए विशिष्ट निजी दस्तावेज़।
निष्कर्ष
यह शोध पत्र तर्क देता है कि टैक्स कानून जैसे अत्यधिक संरचित, नियम-प्रधान क्षेत्रों के लिए, आपको एक बड़े, अधिक महंगे AI की आवश्यकता नहीं है। आपको एक छोटे, स्मार्ट AI की आवश्यकता है जिसे सही प्रकार के डेटा पर विशेष रूप से प्रशिक्षित किया गया हो और जिसे सही प्रकार की सटीकता के साथ ग्रेड किया गया हो। उन्होंने अपनी परीक्षा, अपना प्रशिक्षण डेटा और अपना मॉडल सार्वजनिक रूप से जारी किया है ताकि अन्य लोग इससे सीख सकें और भविष्य में बेहतर लीगल AI बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।