← नवीनतम पेपर
💬 NLP

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

यह शोध पत्र कम संसाधन वाली भाषाओं में बड़े भाषा मॉडलों (LLMs) के विस्तार के लिए सिमेंटिक रिवॉर्ड्स के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग करते हुए एक सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण प्रस्तावित करता है, जो सामान्य क्षमताओं और सिमेंटिक गुणवत्ता को बनाए रखते हुए सुपरवाइज्ड फाइन-ट्यूनिंग के कारण होने वाले "अलाइनमेंट टैक्स" और कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम करता है।

मूल लेखक: Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

प्रकाशित 2026-05-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र की व्याख्या दी गई है।

बड़ी समस्या: "अलाइनमेंट टैक्स" (Alignment Tax)

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, दुनिया घूमने वाला शेफ (एक लार्ज लैंग्वेज मॉडल) है जो अंग्रेजी, स्पेनिश और फ्रेंच में अद्भुत व्यंजन बना सकता है। लेकिन उसने कभी तिब्बती में खाना बनाना नहीं सीखा है।

उसे तिब्बती सिखाने के लिए, पुराना तरीका (जिसे सुपरवाइज्ड फाइन-ट्यूनिंग या SFT कहा जाता है) ऐसा है जैसे शेफ को एक रसोई में खड़े होकर एक ही रेसिपी बुक को शब्द-दर-शब्द कॉपी करने के लिए मजबूर करना। शेफ हर सामग्री की सटीक स्पेलिंग और हर कदम के सटीक क्रम को रट लेता है।

नुकसान: क्योंकि तिब्बती रेसिपी बुक छोटी है और शेफ उसे पूरी तरह से कॉपी करने पर बहुत अधिक केंद्रित है, वह अपने प्रसिद्ध फ्रेंच व्यंजन बनाना भूलने लगता है। इसे ही शोध पत्र में "अलाइनमेंट टैक्स" कहा गया है। आप एक नया कौशल (तिब्बती) प्राप्त करते हैं, लेकिन आप अपने पुराने कौशल (अंग्रेजी/फ्रेंच) खो देते हैं क्योंकि प्रशिक्षण बहुत कठोर था।

नया समाधान: "सिमेंटिक स्पेस" (Semantic Space) अलाइनमेंट

लेखक शेफ को सिखाने का एक अलग तरीका प्रस्तावित करते हैं। उन्हें पेज पर लिखे सटीक शब्दों को कॉपी करने के लिए मजबूर करने के बजाय, वे उन्हें व्यंजन के पीछे के अर्थ को समझने की शिक्षा देते हैं।

वे एक नई विधि का उपयोग करते हैं जिसे रीइन्फोर्समेंट लर्निंग विद सिमेंटिक रिवॉर्ड्स (Reinforcement Learning with Semantic Rewards) कहा जाता है। यह इस प्रकार काम करता है:

  1. लक्ष्य: लक्ष्य रेसिपी बुक से शब्द-दर-शब्द मेल खाना नहीं है। लक्ष्य एक ऐसा व्यंजन बनाना है जिसका स्वाद मूल रेसिपी जैसा ही हो, भले ही सामग्री को अलग तरह से सूचीबद्ध किया गया हो या चरणों को अनूठे तरीके से वर्णित किया गया हो।
  2. जज (रिवॉर्ड): हर अक्षर की जाँच करने वाले एक सख्त शिक्षक के बजाय, शेफ को एक स्मार्ट फूड क्रिटिक (एक एम्बेडिंग मॉडल) से "टेस्ट टेस्ट" मिलता है। क्रिटिक कहता है, "यह व्यंजन मूल रेसिपी के सार को पकड़ता है," भले ही शेफ ने इसे वर्णित करने के लिए अलग शब्दों का उपयोग किया हो।
  3. सुरक्षा जाल: यह सुनिश्चित करने के लिए कि शेफ गलती से फ्रेंच में खाना बनाना या भाषाओं को मिलाना शुरू न कर दे, एक सरल नियम है: "आपको रेसिपी तिब्बती लिपि में लिखनी होगी।"

उन्होंने यह कैसे किया (दो-चरणीय योजना)

शोधकर्ताओं ने केवल नई विधि पर छलांग नहीं लगाई; उन्होंने दो-चरणीय प्रक्रिया का उपयोग किया:

  • चरण 1: वार्म-अप (कोल्ड-स्टार्ट): सबसे पहले, उन्होंने शेफ को पुराने ज़माने के शब्द-दर-शब्द प्रशिक्षण का एक छोटा सा हिस्सा दिया। इसने बस शेफ को तिब्बती में पेन पकड़ना और बुनियादी वाक्य लिखना सिखाया। यह पूर्ण होने के बारे में नहीं था; यह बस उन्हें शुरू करने के लिए था ताकि वे खो न जाएं।
  • चरण 2: टेस्ट टेस्ट (रीइन्फोर्समेंट लर्निंग): एक बार जब शेफ लिखना सीख गया, तो उन्होंने नई विधि पर स्विच कर दिया। शेफ ने रेसिपी लिखने के कई तरीके आजमाए। हर बार जब उन्होंने अर्थ को सही पकड़ा (स्मार्ट क्रिटिक के अनुसार), तो उन्हें इनाम (रिवॉर्ड) मिला। यदि उन्होंने अर्थ गलत किया या भाषाएं मिला दीं, तो उन्हें कोई इनाम नहीं मिला।

क्या हुआ? (परिणाम)

शोधकर्ताओं ने तिब्बती और चीनी के बीच अनुवाद करने और तिब्बती समाचार हेडलाइन्स लिखने पर इसका परीक्षण किया।

  • पुराना तरीका (SFT): शेफ तिब्बती रेसिपी के सटीक शब्दों को कॉपी करने में बहुत अच्छा हो गया। हालाँकि, वह अपने कई फ्रेंच कुकिंग कौशल भूल गया (टैक्स अधिक था)।
  • नया तरीका (सिमेंटिक RL):
    • बेहतर मेमोरी: शेफ ने अपने फ्रेंच कौशल को लगभग पूरी तरह से बरकरार रखा। वह अपनी पुरानी क्षमताओं को नहीं भूला।
    • बेहतर अर्थ: भले ही नए शेफ की तिब्बती रेसिपी संदर्भ पुस्तक के शब्दों से मेल नहीं खाती थी (कम "n-gram ओवरलैप"), स्मार्ट फूड क्रिटिक (LLM जज) नए शेफ के व्यंजनों को पसंद करता था क्योंकि वे वास्तविक स्वाद और अर्थ को बेहतर ढंग से पकड़ते थे।
    • अधिक लचीलापन: नए शेफ ने एक ही विचार को कई अलग-अलग तरीकों से व्यक्त करना सीखा, न कि केवल एक कठोर तरीके से।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि जब AI को एक दुर्लभ भाषा सिखा रहे हों, तो हमें उसे डिक्शनरी रटने के लिए मजबूर नहीं करना चाहिए। इसके बजाय, हमें उसे अर्थ समझने के लिए पुरस्कृत करना चाहिए।

"टोकन-लेवल" (विशिष्ट अक्षरों और शब्दों की दुनिया) के बजाय "सिमेंटिक स्पेस" (विचारों और अर्थों की दुनिया) पर ध्यान केंद्रित करके, हम AI को उसकी अन्य चीजों को भुलाए बिना नई भाषाएँ सिखा सकते हैं। यह किसी को डिक्शनरी रटाने के बजाय कहानियाँ सुनाकर नई भाषा सिखाने जैसा है, जिससे यह सुनिश्चित होता है कि वे सभी भाषाओं में एक अच्छे कहानीकार बने रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →