← नवीनतम पेपर
💬 NLP

DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

यह शोध पत्र DynamixSFT का प्रस्ताव करता है, जो एक गतिशील और स्वचालित विधि है जो समस्या को प्रायर-स्केल्ड बोल्ट्ज़मैन एक्सप्लोरेशन (Prior-scaled Boltzmann Exploration) और 1-स्टेप लुक-अहेड रिवॉर्ड (1-Step Look-ahead Reward) के साथ एक मल्टी-आर्म्ड बैंडिट (multi-armed bandit) के रूप में फ्रेम करके इंस्ट्रक्शन-ट्यूनिंग डेटासेट मिश्रणों को अनुकूलित करती है, जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ कई बेंचमार्क पर मॉडल के प्रदर्शन को प्रभावी रूप से बढ़ाती है।

मूल लेखक: Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (एक लार्ज लैंग्वेज मॉडल) को एक सहायक बनने के लिए सिखाने की कोशिश कर रहे हैं। आपके पास विभिन्न पाठ्यपुस्तकों का एक विशाल पुस्तकालय है, जो "कोडिंग कैसे करें" और "उन्नत गणित" से लेकर "सामान्य ज्ञान" और "रचनात्मक लेखन" तक फैला हुआ है।

बड़ा सवाल यह है: आप छात्र की दैनिक अध्ययन योजना में इन किताबों को एक साथ कैसे मिलाएंगे?

यदि आप उन्हें एक साथ सारे किताबें एक रैंडम ढेर के रूप में थमा देते हैं, तो वे अभिभूत हो सकते हैं या महत्वपूर्ण किताबों को अनदेखा कर सकते हैं। यदि आप एक कठोर समय सारणी (जैसे, "सोमवार को गणित, मंगलवार को कोडिंग") पर टिके रहते हैं, तो आप इस तथ्य को मिस कर सकते हैं कि छात्र आज गणित में संघर्ष कर रहा है लेकिन कल कोडिंग के लिए तैयार है।

यही वह समस्या है जिसे DYNAMIXSFT हल करता है। यह कैसे काम करता है, इसे सरल रूप में यहाँ समझाया गया है:

1. समस्या: "स्थिर रेसिपी" बनाम "जीवंत आहार"

आजकल अधिकांश AI प्रशिक्षण एक स्थिर रेसिपी (Static Recipe) का उपयोग करते हैं। कल्पना कीजिए कि एक शेफ ने तय किया है, "मैं हमेशा इस मसाले का 10%, उस मसाले का 20% और उस मसाले का 5% उपयोग करूँगा," चाहे व्यंजन का स्वाद कैसा भी हो। भले ही व्यंजन को अभी अधिक नमक की आवश्यकता हो, शेफ रेसिपी को समान रखता है।

शोधकर्ताओं ने पाया कि AI मॉडल सीखते समय बदलते हैं। जो चीज़ उन्हें पहले दिन (Day 1) सीखने में मदद करती है, वह सौवें दिन (Day 100) मदद नहीं कर सकती। उन्हें एक डायनेमिक डाइट (Dynamic Diet) की आवश्यकता होती है जो उनकी वर्तमान भूख और कमजोरियों के आधार पर बदलती रहे।

2. समाधान: एक स्मार्ट "स्लॉट मशीन"

लेखकों ने इस समस्या को एक खेल में बदल दिया जिसे मल्टी-आर्म्ड बैंडिट (Multi-Armed Bandit) कहा जाता है।

  • उपमा: कल्पना कीजिए कि स्लॉट मशीनों (डेटासेट्स) की एक पंक्ति है। प्रत्येक मशीन अलग-अलग प्रकार के डेटा (गणित, कोडिंग, इतिहास, आदि) का प्रतिनिधित्व करती है।
  • लक्षत: आप उन मशीनों के लीवर (डेटा सैंपल) खींचना चाहते हैं जो आपको अभी सबसे अधिक "पॉइंट्स" (सीखना) दे रहे हैं।
  • चुनौती: यदि आप केवल उसी मशीन का लीवर खींचते हैं जिसने कल आपको पॉइंट्स दिए थे, तो आप उस मशीन को मिस कर सकते हैं जो आज बड़ा जैकपॉट देने वाली है। आपको यह देखने के लिए अलग-अलग मशीनें आज़माते रहना होगा कि आज सबसे अच्छा क्या काम कर रहा है।

3. सीक्रेट सॉस: दो विशेष ट्रिक्स

इस स्लॉट मशीन गेम को AI के लिए पूरी तरह से काम करने योग्य बनाने के लिए, शोधकर्ताओं ने इसमें दो चतुर विशेषताएं जोड़ीं:

A. "एंकर वाला दिशा सूचक" (प्रायर-स्केल्ड बोल्ट्ज़मैन एक्सप्लोरेशन)

यदि आप AI को केवल हाल ही में जो सबसे अच्छा काम कर रहा है उसके आधार पर डेटा चुनने देते हैं, तो वह पागल हो सकता है और एक सप्ताह के लिए केवल "गणित" की किताबें पढ़ सकता है, जिससे वह अंग्रेजी बोलना भूल सकता है।

  • समाधान: उन्होंने AI को मूल लाइब्रेरी के संतुलन की ओर इशारा करने वाला एक दिशा सूचक (Compass) दिया।
  • यह कैसे काम करता है: भले ही AI अभी गणित को बहुत पसंद करे, दिशा सूचक उसे किताबों के मूल मिश्रण की ओर वापस खींचता है। यह सुनिश्चित करता है कि AI एक विषय पर अत्यधिक ध्यान केंद्रित करते समय अन्य कौशल न भूल जाए। यह एक सख्त लेकिन निष्पक्ष माता-पिता की तरह है जो कहता है, "तुम आज गणित की अतिरिक्त पढ़ाई कर सकते हो, लेकिन तुम्हें संतुलित रहने के लिए थोड़ा इतिहास भी पढ़ना होगा।"

B. "फ्लैश फॉरवर्ड" टेस्ट (1-स्टेप लुक-अहेड रिवॉर्ड)

AI को कैसे पता चलता है कि अभी कौन सी किताब सबसे अच्छी है?

  • पुराना तरीका: कुछ तरीके एक अलग "शिक्षक" AI का उपयोग करते हैं जो यह अनुमान लगाता है कि कौन सी किताब अच्छी है। यह धीमा और महंगा है।
  • DYNAMIXSFT का तरीका: AI एक त्वरित मानसिक पूर्वाभ्यास (Mental Rehearsal) करता है।
    • वह पूछता है: "अगर मैं अभी गणित की किताब का एक पन्ना पढ़ूँ, तो मेरा टेस्ट स्कोर कितना सुधरेगा?"
    • फिर वह पूछता है: "क्या होगा अगर मैं कोडिंग की किताब का एक पन्ना पढ़ूँ?"
    • वह उस किताब को चुनता है जो तत्काल सबसे बड़ा उछाल (Boost) देती है।
  • यह क्यों शानदार है: यह सुपर फास्ट है। इसके लिए दूसरे AI या अलग टेस्ट सेट की आवश्यकता नहीं है। यह बस अगले सबक को तय करने के लिए भविष्य की एक छोटी सी "झलक" लेता है।

4. परिणाम: स्मार्ट, तेज़ और संतुलित

शोधकर्ताओं ने विभिन्न आकार के AI मॉडलों का उपयोग करके डेटा के दो बड़े संग्रहों (TÜLU-2 और TÜLU-3) पर इसका परीक्षण किया।

  • बेहतर ग्रेड: DYNAMIXSFT के साथ प्रशिक्षित AI ने पुराने स्थिर तरीकों की तुलना में 10 विभिन्न टेस्टों (गणित, कोडिंग, तर्क और सामान्य ज्ञान को कवर करते हुए) पर उच्च स्कोर किया।
  • कोई अतिरिक्त लागत नहीं: आमतौर पर, डेटा चयन के बारे में "स्मार्ट" होने से प्रशिक्षण धीमा हो जाता है। लेकिन क्योंकि उनका "फ्लैश फॉरवर्ड" टेस्ट बहुत हल्का है, इसने प्रशिक्षण प्रक्रिया में केवल लगभग 13% अतिरिक्त समय जोड़ा। अन्य तरीकों ने ऐसा करने की कोशिश की लेकिन उन्होंने 139% से 760% तक अतिरिक्त समय जोड़ दिया!
  • स्व-समायोजन (Self-Adjusting): सिस्टम ने स्वाभाविक रूप से अपना ध्यान बदला। उदाहरण के लिए, प्रशिक्षण के शुरुआती चरण में, यह सामान्य ज्ञान पर अधिक ध्यान केंद्रित कर सकता था, लेकिन जैसे-जैसे मॉडल स्मार्ट हुआ, इसने जटिल तर्क कार्यों (Reasoning tasks) पर ध्यान केंद्रित करने के लिए अपना रुख बदल लिया, ठीक उसी समय जब मॉडल को इसकी आवश्यकता थी।

सारांश

DYNAMIXSFT एक AI के लिए व्यक्तिगत ट्यूटर की तरह है जो:

  1. सुनता है छात्र की वर्तमान आवश्यकताओं को (क्या चीज़ उन्हें अभी सीखने में मदद कर रही है)।
  2. बड़ी तस्वीर को याद रखता है (यह सुनिश्चित करना कि वे अन्य विषयों को न भूलें)।
  3. पानी की जांच करता है (किसी भी सबक के प्रति प्रतिबद्ध होने से पहले त्वरित परीक्षण)।
  4. यह सब कुछ बिना किसी दूसरे शिक्षक की आवश्यकता के या क्लास को धीमा किए बिना करता है।

शोध निष्कर्ष निकालते हैं कि यह विधि AI मॉडलों को स्वचालित रूप से अपने सीखने के आहार को अनुकूलित करने की अनुमति देती है, जिससे बहुत कम अतिरिक्त प्रयास के साथ स्मार्ट मॉडल बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →