Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning
यह शोध पत्र स्विस कानूनी मशीन अनुवाद में छोटे भाषा मॉडलों को बेहतर बनाने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) सहित विभिन्न पुन: प्रशिक्षण प्रतिमानों का मूल्यांकन और तुलना करता है, जिसमें यह पाया गया है कि हालांकि सुदृढीकरण शिक्षण फाइन-ट्यूनिंग से बेहतर प्रदर्शन करता है और फ्रंटियर रीजनिंग मॉडलों के साथ अंतर को कम करता है, फिर भी यह उनके प्रदर्शन से पीछे रह जाता है और मॉडल का आकार बढ़ने के साथ घटते प्रतिफल (डिमिमिनिशिंग रिटर्न्स) देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल कानूनी अनुबंध (legal contract) को एक भाषा से दूसरी भाषा में अनुवाद करना सिखाने की कोशिश कर रहे हैं। यह कुकीज़ की रेसिपी अनुवाद करने जैसा नहीं है; यह एक उच्च-दांव वाले वीडियो गेम के नियम पुस्तिका का अनुवाद करने जैसा है जहाँ हर एक शब्द खेल के नियमों को बदल देता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह न्यूरल मशीन ट्रांसलेशन (NMT) का क्षेत्र है। NMT को एक सुपर-स्मार्ट रोबोट मस्तिष्क के रूप में समझें जिसने लाखों किताबें पढ़ी हैं और वाक्य में अगले शब्द का अनुमान लगाना सीख लिया है। हाल ही में, वैज्ञानिकों ने पाया कि यदि आप इन रोबोटों को बोलने से पहले एक "सोचने" वाला चरण देते हैं—जैसे उनसे किसी समस्या पर विचार करने के लिए रुकने को कहना—तो वे कठिन कार्यों में बहुत बेहतर हो जाते हैं। यह रीज़निंग मॉडल्स (Reasoning Models) का युग है। लेकिन यहाँ एक पेंच है: सबसे बड़े, सबसे स्मार्ट रोबोटों को चलाना अविश्वसनीय रूप से महंगा है, जैसे एक ही बैटरी से शहर को चलाने की कोशिश करना। इसलिए, शोधकर्ता पूछ रहे हैं: क्या हम छोटे, सस्ते रोबोटों को केवल अधिक मेमोरी देने के बजाय उन्हें कैसे सोचना है, यह सिखाकर उतना ही स्मार्ट बना सकते हैं?
यह शोध पत्र ठीक इसी प्रश्न की गहराई में जाता है, विशेष रूप से स्विस कानूनी प्रणाली को देखते हुए, जो अनुवादकों के लिए एक दुःस्वप्न है क्योंकि इसमें चार आधिकारिक भाषाएँ हैं और कानून बहुत सख्त, जटिल तरीकों से लिखे गए हैं। शोधकर्ता यह देखना चाहते थे कि क्या वे छोटे, किफायती AI मॉडलों को दो अलग-अलग प्रशिक्षण विधियों का उपयोग करके उनकी कानूनी अनुवाद कौशल को बढ़ा सकते हैं: सुपरवाइज्ड फाइन-ट्यूनिंग (SFT), जो एक छात्र को सही उत्तर और वहां तक पहुँचने के लिए चरण-दर-चरण नोट्स दिखाने जैसा है, और रीइन्फोर्समेंट लर्निंग (RL), जो एक वीडियो गेम की तरह है जहाँ रोबोट को अच्छे अनुवादों के लिए अंक मिलते हैं और बुरे अनुवादों के लिए अंक कटते हैं, जिससे वह प्रयास और त्रुटि (trial and error) के माध्यम से सीखता है। उन्होंने यह भी परीक्षण किया कि क्या रोबोट को "ज़ोर से सोचने" (तर्क चरणों को उत्पन्न करने) के लिए मजबूर करने से वास्तव में मदद मिली, या इसने बेचारे को भ्रमित कर दिया।
टीम ने 40,000 कानूनी वाक्यों के डेटासेट का उपयोग करके एक विशाल प्रयोग स्थापित किया। उन्होंने पहले "ज़ोर से सोचने" वाली विधि को आज़माया जिसमें छोटे मॉडलों (जैसे Qwen3.5 4B, Qwen3.5 9B, और Gemma 3 12B) को एक विशाल, सुपर-स्मार्ट AI के तर्क चरणों (reasoning steps) की नकल करने के लिए प्रशिक्षित किया गया। आश्चर्यजनक रूप से, यह उम्मीद के मुताबिक काम नहीं आया। वास्तव में, सबसे छोटे मॉडलों के लिए, उन्हें अपने तर्क चरणों को लिखने के लिए मजबूर करने से उनके अनुवाद केवल अंतिम उत्तरों पर प्रशिक्षित होने की तुलना में बदतर हो गए। यह ऐसा है जैसे एक घबराए हुए छात्र को उत्तर देने से पहले "अपने हर विचार को लिखने" के लिए कहना उन्हें ओवरथिंकिंग करने और टेस्ट खराब करने पर मजबूर कर देता है।
हालाँकि, जब उन्होंने "वीडियो गेम" दृष्टिकोण का उपयोग करते हुए रीइन्फोर्समेंट लर्निंग (विशेष रूप से GRPO नामक एक विधि) की ओर रुख किया, तो परिणाम शानदार रहे। मॉडलों को उच्च-गुणवत्ता वाले अनुवादों के लिए पुरस्कृत करके और बुरे अनुवादों के लिए दंडित करके, छोटे मॉडलों ने अविश्वसनीय सटीकता के साथ स्विस कानूनों का अनुवाद करना सीख लिया। सर्वश्रेष्ठ प्रदर्शन करने वाले, 12-बिलियन-पैरामीटर वाले मॉडल जिसे Gemma 3 कहा जाता है, इतने अच्छे हो गए कि उनकी अनुवाद गुणवत्ता उन सबसे महंगे, फ्रंटियर मॉडलों के करीब पहुँच गई जिनका उपयोग करने के लिए हजारों डॉलर लगते हैं, फिर भी वे थोड़ा कम ही रहे। शोधकर्ताओं ने पाया कि "पुरस्कार-आधारित" (reward-based) सीखना, "नोट्स की नकल करने" वाले तरीके से लगातार बेहतर था। उन्होंने यह भी खोजा कि जैसे-जैसे मॉडल बड़े होते गए, इन फैंसी प्रशिक्षण विधियों से मिलने वाला अतिरिक्त लाभ कम होता गया; छोटे मॉडलों को सबसे अधिक लाभ हुआ, जबकि बड़े मॉडलों में केवल थोड़ा सुधार हुआ।
अंत में, यह शोध पत्र सुझाव देता है कि हालांकि विशाल, महंगे AI मॉडल अभी भी चैंपियन हैं, लेकिन हमें हर चीज़ के लिए उनकी आवश्यकता नहीं है। इन स्मार्ट प्रशिक्षण ट्रिक्स जैसे रीइन्फोर्समेंट लर्निंग का उपयोग करके, हम छोटे, ओपन-सोर्स मॉडल बना सकते हैं जो चलाने में सस्ते हैं और कानूनी अनुवाद के जटिल कार्यों को संभालने में आश्चर्यजनक रूप से अच्छे हैं। अध्ययन स्पष्ट रूप से इस विचार को खारिज करता है कि केवल एक बड़े AI से "तर्क चरणों" की नकल करने से छोटे मॉडलों को मदद मिलती है; इसके बजाय, यह सुझाव देता है कि उन्हें पुरस्कारों के माध्यम से सीखने देना ही असली सफलता का मंत्र है। हालाँकि छोटे मॉडल दिग्गजों को पूरी तरह से नहीं हरा सके, लेकिन उन्होंने अंतर को काफी हद तक कम कर दिया, यह साबित करते हुए कि सही प्रशिक्षण के साथ, एक छोटा रोबोट कानून की उच्च-दांव वाली दुनिया में एक बड़ा काम कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।