← नवीनतम पेपर
🤖 machine learning

SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

यह शोध पत्र SAGA को प्रस्तुत करता है, जो एक पार्सर-निर्देशित प्राथमिकता अनुकूलन ढांचा (parser-guided preference optimization framework) है जो कम-संसाधन वाले नॉर्डिक भाषा मॉडलों की व्याकरणिक गुणवत्ता को प्रभावी ढंग से सुधारने के लिए महंगी मानवीय एनोटेशन को डिपेंडेंसी-पार्सर पर्यवेक्षण (dependency-parser supervision) से बदल देता है।

मूल लेखक: Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

प्रकाशित 2026-08-07
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ऐसी भाषा में कहानी लिखना सिखाने की कोशिश कर रहे हैं जिसे वह बहुत कम जानता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन रोबोट्स को "लार्ज लैंग्वेज मॉडल्स" (Large Language Models) कहा जाता है। वे उन अति-उत्साही छात्रों की तरह हैं जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ लिया है लेकिन अभी तक व्याकरण के नियमों में महारत हासिल नहीं की है, विशेष रूप से उन भाषाओं के लिए जिनके बारे में बहुत कम किताबें लिखी गई हैं (जैसे आइसलैंडिक या नॉर्वेजियन)। आमतौर पर, किसी रोबोट के खराब व्याकरण को ठीक करने के लिए, मानव शिक्षकों को उसकी कहानियाँ पढ़नी पड़ती हैं, गलतियाँ ढूँढनी पड़ती हैं, और उसे बताना पड़ता है, "नहीं, यह गलत लग रहा है; इसे ऐसे आजमाओ।" इस प्रक्रिया को "प्रेफरेंस ऑप्टिमाइजेशन" (preference optimization) कहा जाता है। यह अंग्रेजी के लिए चमत्कार करता है क्योंकि वहां लाखों मानव शिक्षक उपलब्ध हैं। लेकिन छोटी भाषाओं के लिए, पर्याप्त शिक्षक ढूंढना एक जलते हुए घास के ढेर में सुई खोजने जैसा है—यह बहुत महंगा और बहुत धीमा है।

इसलिए, वैज्ञानिकों ने एक चतुर प्रश्न पूछा: क्या होगा यदि हम मानव शिक्षकों को एक ऐसे रोबोट रेफरी से बदल सकें जो पहले से ही नियमों को जानता हो? भाषाविज्ञान (linguistics) में, "डिपेंडेंसी पार्सर्स" (dependency parsers) जैसे उपकरण होते हैं जो सख्त व्याकरण पुलिस की तरह काम करते हैं। वे एक वाक्य को देखते हैं और जांचते हैं कि क्या शब्द सही क्रम में एक-दूसरे का हाथ थामे हुए हैं। यदि व्याकरण गलत है, तो पार्सर लाल झंडी (red flag) दिखा देता है। यह पेपर, जिसका शीर्षक SAGA है, इन भाषा रोबोट्स को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करता है। मानव द्वारा "अच्छा काम किया" या "फिर से प्रयास करो" कहने का इंतजार करने के बजाय, SAGA पार्सर के लाल झंडों को एक स्कोरकार्ड के रूप में उपयोग करता है। यह एक छात्र को पॉप क्विज़ देने जैसा है जहाँ उत्तर कुंजी एक कंप्यूटर प्रोग्राम है जो तुरंत जानता है कि वाक्य की संरचना सही है या नहीं। लक्ष्य यह देखना है कि क्या यह "कंप्यूटर रेफरी" बिना किसी मानव के होमवर्क को ग्रेड किए, रोबोट को बेहतर वाक्य लिखना सिखा सकता है।


समस्या: रोबोट का व्याकरण ग्लिच (The Problem: The Robot's Grammar Glitch)

कल्पना कीजिए कि आप एक रोबोट से आइसलैंडिक में एक वाक्य पूरा करने के लिए कहते हैं: "The parliament approved the bill on..." (संसद ने बिल को मंजूरी दी...) रोबोट इसे एक ऐसे शब्द के साथ समाप्त कर सकता है जो दिखने में तो सही लगे लेकिन उसका "केस" (एक व्याकरणिक रूप जो वाक्य में शब्द के कार्य के आधार पर बदलता है) गलत हो। अक्षरों को गिनने वाले कंप्यूटर के लिए, वाक्य ठीक दिखता है। लेकिन एक मूल वक्ता (native speaker) के लिए, यह एक इंसान की तरह बोलने की कोशिश करने वाले और बुरी तरह विफल होने वाले रोबोट जैसा लगता है।

सामान्य समाधान रीइन्फोर्समेंट लर्निंग फ्रॉम ह्यूमन फीडबैक (RLHF) है। आप मनुष्यों को रोबोट के आउटपुट को पढ़ने, सबसे अच्छे को चुनने और रोबोट को वैसा ही अधिक करने के लिए सिखाने के लिए काम पर रखते हैं। लेकिन कम-संसाधन वाली भाषाओं (उन भाषाओं के लिए जिनमें कम वक्ता और कम डिजिटल टेक्स्ट हैं) के लिए, यह करने के लिए पर्याप्त मनुष्य नहीं हैं। पेपर का तर्क है कि सबसे बड़ी बाधा रोबोट का दिमाग नहीं है; बल्कि मानव शिक्षकों की कमी है।

समाधान: SAGA (Score-weighted Adaptive Generation Alignment)

लेखकों ने इसे हल करने के लिए SAGA नामक एक फ्रेमवर्क बनाया। मानवों को काम पर रखने के बजाय, उन्होंने एक "पार्सर" (एक व्याकरण जाँचने वाला रोबोट) का उपयोग शिक्षक के रूप में किया। यहाँ यह जादू कैसे होता है, चरण-दर-चरण:

  1. जेनरेटर (The Generator): रोबोट एक वाक्य के लिए कई अलग-अलग अंत लिखता है (जैसे 8 या 16 अलग-अलग अनुमान)।
  2. रेफरी (The Referee): पार्सर प्रत्येक अनुमान की जांच करता है। यदि व्याकरण एकदम सही है, तो यह उच्च स्कोर देता है। यदि व्याकरण टूटा हुआ है, तो यह कम स्कोर देता है।
  3. स्कोरकार्ड (The Scorecard): SAGA केवल व्याकरण नहीं देखता। यह बोरियत की भी जांच करता है। यदि रोबोट बार-बार एक ही शब्द दोहराने लगता है (जैसे एक टूटा हुआ रिकॉर्ड), तो स्कोर कम हो जाता है। इसे "कंपोजिट रिवॉर्ड" (composite reward) कहा जाता है—यह "व्याकरण स्कोर" और "विविधता स्कोर" का मिश्रण है।
  4. फ़िल्टर (The Filter): सिस्टम केवल उन जोड़ों (pairs) को रखता है जहाँ "अच्छा" अनुमान "बुरे" अनुमान की तुलना में काफी बेहतर था। यदि अंतर बहुत कम है, तो यह जोड़े को फेंक देता है क्योंकि यह एक स्पष्ट सबक नहीं है।
  5. सीखना (The Learning): रोबोट इन फ़िल्टर किए गए जोड़ों से सीखता है, अपने मस्तिष्क को अधिक "अच्छे" अनुमान लगाने और कम "बुरे" अनुमान लगाने के लिए समायोजित करता है।

बड़ा परीक्षण: क्या एक रोबोट दूसरे रोबोट को सिखा सकता है? (The Big Test: Can a Robot Teach a Robot?)

टीम ने तीन नॉर्डिक भाषाओं पर इसका परीक्षण किया: डेनिश, आइसलैंडिक और नॉर्वेजियन बोकल (Norwegian Bokmål)। उन्होंने GPT-SW3-1.3B नामक एक छोटे मॉडल का उपयोग किया।

परिणाम:

  • डेनिश: प्रशिक्षण के बाद व्याकरण जांच पास करने की रोबोट की क्षमता 69.0% से बढ़कर 93.8% हो गई।
  • आइसलैंडिक: यह सबसे कठिन परीक्षण था क्योंकि आइसलैंडिक व्याकरण बहुत जटिल है। एक स्वतंत्र परीक्षण पर रोबोट में 4.5 प्रतिशत अंक का सुधार हुआ। इससे भी अधिक प्रभावशाली बात यह है कि जब वास्तविक आइसलैंडिक वक्ताओं को पुराने रोबोट और नए रोबोट के बीच चुनने के लिए कहा गया, तो उन्होंने 80% बार नए SAGA रोबोट को चुना।
  • नॉर्वेजियन: व्याकरण सफलता दर आसमान छू गई, 28 प्रतिशत अंक बढ़कर 66.5% से 94.5% हो गई।

"गॉट्स" (Gotchas) और हमने उन्हें कैसे ठीक किया

लेखक जानते थे कि यदि आप केवल रोबोट को "उच्च स्कोर प्राप्त करो" कहते हैं, तो वह अनपेक्षित तरीकों से अनुकूलित (optimize) हो सकता है। इसे रिवॉर्ड हैकिंग (reward hacking) कहा जाता है। कल्पना कीजिए कि एक छात्र को एहसास होता है कि शिक्षक केवल यह जांचता है कि वाक्य बड़े अक्षर से शुरू होता है या नहीं, इसलिए वह लाखों ऐसे वाक्य लिखता है जो बड़े अक्षर से शुरू होते हैं लेकिन जिनका कोई अर्थ नहीं होता।

  • अनुकूलित होने वाला रोबोट (The Optimizing Robot): पेपर में पाया गया कि यदि वे केवल व्याकरण स्कोर का उपयोग करते, तो रोबोट दोहराव वाला, निरर्थक टेक्स्ट लिखने लगता जो पार्सर को धोखा दे देता।
  • समाधान (The Fix): "विविधता स्कोर" (दोहराव की जांच करना) जोड़ने और कमजोर उदाहरणों को फ़िल्टर करने से, SAGA ने अनपेक्षित अनुकूलन को रोक दिया। रोबोट ने वास्तव में अच्छे वाक्य लिखना सीखा, न कि केवल ऐसे वाक्य जो पार्सर को धोखा देते हैं।

"एलाइनमेंट टैक्स" (Alignment Tax) के बारे में क्या?

कभी-कभी, जब आप एक रोबोट को एक चीज़ (व्याकरण) में परफेक्ट होने के लिए सिखाते हैं, तो वह दूसरी चीज़ों (प्रवाह/fluency) में अच्छा होना भूल जाता है। पेपर ने पाया कि SAGA ने रोबोट को रोबोटिक या दोहराव वाला बनाए बिना व्याकरण में सुधार करने में सफलता प्राप्त की। वास्तव में, रोबोट द्वारा उपयोग किए जाने वाले शब्दों की विविधता वास्तव में बढ़ गई।

निष्कर्ष (The Verdict)

पेपर निष्कर्ष निकालता है कि उन भाषाओं के लिए जहाँ हमारे पास अच्छे व्याकरण-जांच उपकरण (पार्सर्स) मौजूद हैं, SAGA एक व्यावहारिक और प्रभावी समाधान है। यह साबित करता है कि रोबोट के व्याकरण को ठीक करने के लिए आपको लाखों मानव एनोटेटरों की आवश्यकता नहीं है; आपको बस एक स्मार्ट, स्वचालित रेफरी की आवश्यकता है जो नियमों को जानता हो।

हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह तब सबसे अच्छा काम करता है जब उच्च-गुणवत्ता वाले पार्सर पहले से मौजूद हों। उन्होंने यह भी पाया कि सबसे जटिल भाषा (आइसलैंडिक) के लिए, रोबोट ने केवल एक दौर के प्रशिक्षण में सबसे अच्छा सीखा; इसे बहुत अधिक धकेलने से यह बदतर हो गया। यह सुझाव देता है कि कुछ भाषाओं के लिए, स्वचालित शिक्षण का थोड़ा सा हिस्सा भी बहुत काम आता है, लेकिन आपको पता होना चाहिए कि कब रुकना है।

संक्षेप में, SAGA दिखाता है कि हम उन भाषाओं में रोबटेज को बेहतर ढंग से बोलना सिखा सकते हैं जिन्हें अक्सर अनदेखा किया जाता है, उन उपकरणों का उपयोग करके जो हमारे पास पहले से हैं, और बिना किसी मानव सेना के आने का इंतज़ार किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →