← नवीनतम पेपर
🤖 machine learning

torchtune: PyTorch native post-training library

यह शोधपत्र torchtune को प्रस्तुत करता है, जो एक PyTorch-नेटिव लाइब्रेरी है जिसे मॉडुलैरिटी (modularity), पारदर्शिता और विस्तारणीयता (extensibility) को प्राथमिकता देकर बड़े भाषा मॉडलों के पोस्ट-ट्रेनिंग जीवनचक्र को सुव्यवस्थित करने के लिए डिज़ाइन किया गया है, ताकि प्रतिस्पर्धी प्रदर्शन और मेमोरी दक्षता बनाए रखते हुए कुशल फाइन-ट्यूनिंग और तीव्र अनुसंधान पुनरावृत्ति को सक्षम बनाया जा सके।

मूल लेखक: Mark Obozov, Maxime Griot, Joseph Cummings, Evan Smothers, Felipe Mello, Rafi Ayub, Philip John Bontrager, Salman Mohammadi, Ariel Kwiatkowski, Nathan Azrak, Mircea Mironenco

प्रकाशित 2026-05-21✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mark Obozov, Maxime Griot, Joseph Cummings, Evan Smothers, Felipe Mello, Rafi Ayub, Philip John Bontrager, Salman Mohammadi, Ariel Kwiatkowski, Nathan Azrak, Mircea Mironenco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) है, जिसने पहले से ही किताबों के एक विशाल पुस्तकालय से पढ़ना और लिखना सीख लिया है। अब, आप उसे कुछ विशिष्ट नए कौशल सिखाना चाहते हैं, जैसे कविता लिखना या चिकित्सा संबंधी प्रश्नों के उत्तर देना। इस प्रक्रिया को "पोस्ट-ट्रेनिंग" (post-training) या "फाइन-ट्यूनिंग" (fine-tuning) कहा जाता है।

यह पेपर torchtune को पेश करता है, जो एक नया टूलकिट है जिसे इस शिक्षण प्रक्रिया को तेज़, सस्ता और समझने में आसान बनाने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसे सरल उपमाओं का उपयोग करके यहाँ समझाया गया है:

1. समस्या: "ब्लैक बॉक्स" बनाम "लेगो सेट"

इन रोबोटों को सिखाने के लिए torchtune से पहले के अधिकांश उपकरण पहले से असेंबल किए गए फर्नीचर की तरह थे। आप एक मेज (एक ट्रेनिंग रेसिपी) खरीद सकते थे, और यह बहुत अच्छा काम करती थी, लेकिन यदि आप इसकी एक टांग या फिनिश बदलना चाहते, तो आपको इसे तोड़ने के लिए एक हथौड़ा चलाना पड़ता। ये उपकरण अक्सर अन्य विशाल, जटिल प्रणालियों के ऊपर बनाए गए थे, जिससे उन्हें ठीक करना या उनमें बदलाव करना कठिन हो जाता था। यदि कुछ टूट जाता, तो आप देख नहीं पाते कि क्यों हुआ क्योंकि निर्देश अन्य सॉफ़्टवेयर की परतों के भीतर छिपे हुए थे।

torchtune अलग है। यह एक लेगो सेट (Lego set) की तरह है।

  • मॉड्यूलरिटी (Modularity): एक विशाल ब्लॉक के बजाय, यह आपको व्यक्तिगत ईंटें (मॉडल बिल्डर्स, डेटा लोडर्स, ऑप्टिमाइज़र) देता है। आप पूरे ढांचे को तोड़े बिना एक ईंट को दूसरे रंग या आकार की ईंट से बदल सकते हैं।
  • पारदर्शिता (Transparency): आप देख सकते हैं कि हर ईंट कैसे जुड़ती है। इसमें कोई छिपी हुई परतें नहीं हैं। यदि आप चाहते हैं कि रोबोट कैसे सीखता है, तो आप बस एक विशिष्ट हिस्से को बदल देते हैं, और बाकी सब वैसा ही रहता है।

2. "इन-बैकवर्ड" (In-Backward) ट्रिक: चलते-चलते खाना

इन रोबोटों को प्रशिक्षित करने में सबसे बड़े सिरदर्द में से एक मेमोरी (स्मृति) है। कल्पना कीजिए कि आप एक कमरे में कागजों का एक बड़ा ढेर (ग्रेडिएंट्स) ले जाने की कोशिश कर रहे हैं और साथ ही उन पर नोट्स लिखने की भी कोशिश कर रहे हैं। कुछ भी करने से पहले आपको उस ढेर को रखने के लिए बहुत सारी जगह की आवश्यकता होती है।

torchtune एक चतुर ट्रिक पेश करता है जिसे "इन-बैकवर्ड ऑप्टिमाइज़र फ्यूजन" (in-backward optimizer fusion) कहा जाता है।

  • पुराना तरीका: आप सभी कागजात इकट्ठा करते हैं, उन्हें डेस्क तक ले जाते हैं, और फिर नोट्स लिखते हैं। इसके लिए एक बहुत बड़ी डेस्क (मेमोरी) की आवश्यकता होती है।
  • torchtune का तरीका: आप प्रत्येक कागज को उठाते ही उस पर नोट्स लिखते हैं, और फिर तुरंत उस कागज को फेंक देते हैं। आपको एक बार में पूरा ढेर पकड़ने की आवश्यकता नहीं होती।
  • परिणाम: इससे मेमोरी की भारी बचत होती है। पेपर का दावा है कि यह एक कंप्यूटर के क्रैश होने (मेमोरी खत्म होने) और मानक हार्डवेयर पर एक विशाल मॉडल (जैसे Llama 3.3 70B) को सफलतापूर्वक प्रशिक्षित करने के बीच का अंतर है।

3. "लॉस पैरेलल" (Loss Parallel) ट्रिक: केक काटना

जब रोबोट यह गणना करता है कि वह कितना अच्छा प्रदर्शन कर रहा है (जिसे "लॉस" कहा जाता है), तो यह अक्सर संख्याओं का एक विशाल, घना स्प्रेडशीट बनाता है जो बहुत अधिक मेमोरी लेता है।

  • उपमा: कल्पना कीजिए कि आप एक साथ 1,000 लोगों के लिए केक बनाने की कोशिश कर रहे हैं। यह एक ओवन के लिए बहुत बड़ा है।
  • समाधान: torchtune केक को छोटे टुकड़ों में काटता है और उन्हें एक ही समय में अलग-अलग ओवन (अलग-अलग प्रोसेसरों) में पकाता है। यह कभी भी एक ही स्थान पर एक साथ पूरा विशाल केक रखने की कोशिश नहीं करता है। यह सिस्टम को विशाल शब्दावली वाले मॉडलों को बिना स्पेस खत्म हुए संभालने की अनुमति देता है।

4. "एसिंक" (Async) फैक्ट्री: असेंबली लाइन

उन्नत प्रशिक्षण (जैसे सुदृढीकरण सीखना या Reinforcement Learning) के लिए, रोबोट को "सोचना" (उत्तर उत्पन्न करना) होता है और फिर "सीखना" (अपने मस्तिष्क को अपडेट करना) होता है। आमतौर पर, ये एक के बाद एक होते हैं, जैसे एक फैक्ट्री जहाँ पेंटिंग स्टेशन तब खाली बैठा रहता है जब असेंबली लाइन व्यस्त होती है।

  • torchtune का दृष्टिकोण: उन्होंने एक एसिंक्रोनस (asynchronous) असेंबली लाइन बनाई है।
  • यह कैसे काम करता है: जबकि श्रमिकों की एक टीम पेंटिंग (उत्तर उत्पन्न करने) में व्यस्त है, दूसरी टीम पहले से ही असेंबली (प्रशिक्षण) में व्यस्त है। वे काम को एक दूसरे को पास करने के लिए एक कन्वेयर बेल्ट (क्यू/queue) का उपयोग करते हैं। यह पूरी फैक्ट्री को रुकने और शुरू होने के बजाय 100% क्षमता पर चलाने में मदद करता है।

5. परिणाम: गति और दक्षता

लेखकों ने अन्य लोकप्रिय उपकरणों (Axolotl और Unsloth) के मुकाबले torchtune का परीक्षण किया।

  • दौड़: आमने-सामने की दौड़ में, torchtune अक्सर प्रशिक्षण तेजी से पूरा करता है या कम मेमोरी का उपयोग करता है।
  • "ओओएम" (OOM - Out of Memory) फिक्स: सबसे बड़े मॉडलों के लिए, अन्य उपकरण अक्सर मेमोरी खत्म होने के कारण क्रैश हो जाते थे। torchtune, अपनी मेमोरी-बचत ट्रिक्स (जैसे "चलते-चलते खाना" वाली विधि) का उपयोग करके, इन विशाल मॉडलों को प्रशिक्षित करने में सक्षम था जहाँ अन्य विफल रहे।
  • लचीलापन (Flexibility): चूंकि यह लेगो की तरह बना है, शोधकर्ता इन ट्रिक्स को मिला और मिला सकते हैं। उन्होंने पाया कि सभी ट्रिक्स का एक साथ उपयोग करने से सबसे अच्छे परिणाम मिले, लेकिन आप केवल एक का उपयोग भी कर सकते हैं यदि आपको आवश्यकता हो।

सारांश

torchtune एक नया, ओपन-सोर्स टूलकिट है जो AI प्रशिक्षण को एक बंद ब्लैक बॉक्स के बजाय पारदर्शी, परिवर्तनीय बिल्डिंग ब्लॉक्स के सेट की तरह मानता है। यह डेटा को स्टोर करने के बजाय तुरंत प्रोसेस करके मेमोरी बचाता है, कार्यों को समानांतर (parallel) में चलाकर गति बढ़ाता है, और शोधकर्ताओं को पूरी प्रक्रिया को बदलने के लिए पूर्ण नियंत्रण देता है। पेपर दिखाता है कि यह छोटे प्रयोगों और बड़े, औद्योगिक स्तर के मॉडल प्रशिक्षण दोनों के लिए बेहतर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →