← नवीनतम पेपर
💬 NLP

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

यह शोध पत्र AdaMame को प्रस्तुत करता है, जो एक दो-चरणीय प्रशिक्षण विधि है जिसमें सुपरवाइज्ड फाइन-ट्यूनिंग को एक नवीन एडेप्टिव GRPO एल्गोरिदम (AdaMame-GRPO) के साथ संयोजित किया गया है ताकि लार्ज रीजनिंग मॉडल्स को सटीकता या टोकन दक्षता से समझौता किए बिना क्वेरी की भाषा में तर्क करने में सक्षम बनाया जा सके, जिससे भाषा पतन (language collapse) की घटना पर विजय प्राप्त की जा सके।

मूल लेखक: Dayeon Ki, Kevin Duh, Marine Carpuat

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dayeon Ki, Kevin Duh, Marine Carpuat

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एडा (Ada) नाम की एक प्रतिभाशाली, बहुभाषी छात्रा है। एडा गणित की समस्याओं को हल करने में अविश्वसनीय रूप से स्मार्ट है, लेकिन उसकी एक बुरी आदत है: आप उससे जिस भी भाषा में सवाल पूछें (फ्रेंच, तेलुगु या थाई), वह हमेशा अंग्रेजी में सोचने और उत्तर देने पर अड़ जाती है।

यह एक समस्या है जिसे "लैंग्वेज कोलैप्स" (भाषा का पतन) कहा जाता है। भले ही आप उससे फ्रेंच में पूछें, "एक दर्जन में कितने अंडे होते हैं?" एडा शायद सोचेगी, "ठीक है, मुझे अंग्रेजी में गणना करने दें... 12 अंडे," और फिर वह बस उत्तर का अनुवाद कर देगी। वह वास्तव में उस भाषा में नहीं सोचती जिसमें उससे पूछा गया है।

मौजूदा प्रयास एक सख्त शिक्षक की तरह हैं जो कहता है, "यदि तुम फ्रेंच नहीं बोलोगे, तो तुम्हें शून्य मिलेगा!" यह एडा को फ्रेंच बोलने के लिए मजबूर करता है, लेकिन इससे वह घबरा जाती है। वह हकलाने लगती है (वाक्य के बीच में फ्रेंच और अंग्रेजी के बीच स्विच करना) या गलत उत्तर दे सकती है क्योंकि वह भाषा के नियम पर बहुत अधिक ध्यान केंद्रित कर रही होती है, या वह यह साबित करने के लिए बहुत लंबी बात करती है कि वह कोशिश कर रही है।

एडामेम (AdaMame) एक नया, स्मार्ट प्रशिक्षण नुस्खा (training recipe) है जिसे एडा की इस बुरी आदत को बिना उसे घबराए या धीमा किए ठीक करने के लिए डिज़ाइन किया गया है। यह इस प्रकार काम करता है:

दो-चरणीय प्रशिक्षण प्रक्रिया (The Two-Stage Training Recipe)

लेखकों ने एडा को दो चरणों वाली प्रक्रिया का उपयोग करके प्रशिक्षित किया, जैसे कि एक कोच एक एथलीट को ओलंपिक के लिए तैयार करता है।

चरण 1: "इमर्सिव कैंप" (SFT)
सबसे पहले, उन्होंने एडा को एक ऐसे कैंप में रखा जहाँ वह केवल पाँच अलग-अलग भाषाओं (फ्रेंच, पुर्तगाली, जापानी, कोरियाई और थाई) के मूल भाषियों के साथ बातचीत करती है।

  • उन्होंने क्या किया: उन्होंने उसे हजारों गणित की समस्याएं दिखाईं जहाँ सोचने की प्रक्रिया (विचारों) को पहले से ही स्थानीय भाषा में पूरी तरह से लिखा गया था।
  • परिणाम: एडा ने सीखा कि इन भाषाओं में गणित की समस्याओं को हल करना संभव है। उसने तुरंत अंग्रेजी में वापस जाने की आदत छोड़ दी। हालाँकि, उन भाषाओं के सामने वह अभी भी थोड़ी डगमगा रही थी जिनका उसने अभ्यास नहीं किया था (जैसे स्वाहिली या बंगाली)।

चरण 2: "स्मार्ट कोच" (AdaMame-GRPO)
यही वह जादुई हिस्सा है। दूसरे चरण में, उन्होंने AdaMame-GRPO नामक एक विशेष प्रशिक्षण विधि का उपयोग किया।

  • पुराने कोचों के साथ समस्या: पिछले तरीके एडा को इनाम तभी देते थे जब वह सही उत्तर देती थी और सही भाषा बोलती थी। यह एक "सब-या-कुछ-नहीं" (all-or-nothing) स्विच की तरह था। यदि वह सही उत्तर देती थी लेकिन अंग्रेजी बोलती थी, तो उसे कोई इनाम नहीं मिलता था। इसने उसे प्रयोग करने से डरा दिया।
  • एडामेम का समाधान: नया कोच एक क्रमिक विकास रणनीति (gradual growth strategy) का उपयोग करता है।
    • प्रशिक्षण के शुरुआती दौर में: कोच उदार होता है। "हे, बस समस्या को हल करने की कोशिश करो! अभी यह मायने नहीं रखता कि तुम अंग्रेजी या फ्रेंच में सोच रही हो, बस गणित सही करो।" यह एडा को अन्वेषण करने और समस्या को हल करने का सबसे अच्छा तरीका खोजने की अनुमति देता है।
    • प्रशिक्षण के बाद के दौर में: जैसे-जैसे प्रशिक्षण आगे बढ़ता है, कोच धीरे-धीरे भाषा के नियम की तीव्रता बढ़ाता है। "ठीक है, तुम गणित में अच्छी हो रही हो। अब, तुम्हें उसी भाषा में सोचना होगा जिसमें उपयोगकर्ता ने पूछा है।"
    • उपमा (Analogy): कल्पना कीजिए कि एक बच्चे को साइकिल चलाना सिखा रहे हैं। शुरू में, आप उसे डगमगाते और गिरते हुए देखते हैं (अन्वेषण)। एक बार जब वह स्थिर हो जाती है, तो आप धीरे से उसे साइकिल लेन में रहने के लिए मार्गदर्शन करते हैं। आप पहले ही सेकंड में "लेन में रहो!" चिल्लाकर नहीं शुरू करते, अन्यथा वह टकरा जाएगी।

यह एक बड़ी बात क्यों है

पेपर ने पुराने तरीकों के मुकाबले इस नए तरीके का परीक्षण किया और तीन बड़ी जीत पाईं:

  1. "कोड-स्विचिंग" का अंत: एडा ने वाक्य के बीच में भाषा बदलने की परेशान करने वाली आदत (जैसे, एक विचार फ्रेंच में शुरू करना और अंग्रेजी में समाप्त करना) छोड़ दी। वह अब सुसंगत रहती है।
  2. "ओवरथिंकिंग" का अंत: पुराने तरीकों ने एडा को यह साबित करने के लिए बहुत लंबी बात करने पर मजबूर किया कि वह कोशिश कर रही है। एडामेम ने उसे कुशल बनाया। वह समान परिणाम प्राप्त करने के लिए कम शब्दों (टोकन) का उपयोग करती है।
  3. "अंडरडॉग" प्रभाव: सबसे बड़ा सुधार कम-संसाधन वाली भाषाओं (कम डेटा उपलब्ध वाली भाषाएं, जैसे तेलुगु या स्वाहिली) के साथ हुआ। जबकि अन्य तरीके इनके साथ संघर्ष करते थे, एडामेम ने एडा को आश्चर्यजनक रूप से अच्छा प्रदर्शन करने में मदद की, जिससे यह तकनीक सभी के लिए अधिक निष्पक्ष बन गई, न कि केवल प्रमुख भाषाओं के बोलने वालों के लिए।

निचोड़ (The Bottom Line)

लेखक दावा करते हैं कि AdaMame एक ऐसा मॉडल बनाता है जो है:

  • सटीक (Accurate): यह गणित को सही करता है।
  • निष्ठावान (Faithful): यह उसी भाषा में सोचता है जिसमें आपसे पूछा गया है।
  • कुशल (Efficient): यह समय या शब्दों को बर्बाद नहीं करता है।

यह वह उपलब्धि प्राप्त करता है जिसे लेखक "पारेटो-ऑप्टिमल प्रदर्शन" (Pareto-optimal performance) कहते हैं, जो एक फैंसी तरीका है यह कहने का कि: "हमने एक अन्य लक्ष्य की बलि दिए बिना इन तीनों लक्ष्यों का सर्वोत्तम संतुलन प्राप्त किया है।" यह एक ऐसी कार प्राप्त करने जैसा है जो तेज़, सुरक्षित और ईंधन-कुशल तीनों है, जबकि पिछले मॉडल आमतौर पर तेज़ लेकिन असुरक्षित, या सुरक्षित लेकिन धीमे होते थे।

लेखकों ने अपना डेटा और कोड जारी किया है ताकि अन्य लोग इस "प्रशिक्षण नुस्खे" का उपयोग बेहतर बहुभाषी AI बनाने के लिए कर सकें, विशेष रूप से गणितीय तर्क के लिए, बिना अंग्रेजी को डिफ़ॉल्ट सोचने वाली भाषा के रूप में उपयोग करने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →