← नवीनतम पेपर
💻 computer science

TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training

TACO एक सुदृढ़ FP8-आधारित फ्रेमवर्क है जो एडेप्टिव क्वांटाइजेशन और एक फ्यूज्ड कम्प्रेशन ऑपरेटर का उपयोग करता है ताकि टेंसर-पैरेलल LLM ट्रेनिंग में इंटरमीडिएट टेंसरों को कुशलतापूर्वक कंप्रेस किया जा सके, जिससे लगभग लॉसलेस सटीकता बनाए रखते हुए 1.87x तक थ्रूपुट सुधार प्राप्त होता है।

मूल लेखक: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों की एक विशाल टीम (एक लार्ज लैंग्वेज मॉडल) को कहानी लिखना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आप काम को सैकड़ों समानांतर (parallel) काम करने वाले रोबोटों के बीच बांट देते हैं। इसे टेन्सर पैरेललिज्म (Tensor Parallelism) कहा जाता है।

हालाँकि, एक बड़ी समस्या है: इन रोबोटों को लगातार एक-दूसरे को अपनी प्रगति के बारे में फुसफुसाकर बताना पड़ता है। वे एक सेकंड में हजारों बार नोट्स का आदान-प्रदान करते हैं। समस्या यह है कि ये नोट्स बहुत बड़े हैं, और जिस गलियारे का वे उपयोग करते हैं (नेटवर्क), वह संकरा और धीमा है। रोबट कहानी लिखने के बजाय नोट्स का इंतज़ार करने में अधिक समय बिताते हैं।

TACO एक नया सिस्टम है जिसे इन नोट्स को सिकोड़ने (shrink) के लिए डिज़ाइन किया गया है ताकि रोबोट अर्थ खोए बिना तेज़ी से बात कर सकें।

TACO कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

1. समस्या: "जीरो" की भीड़ (The "Zero" Crowd)

जो नोट्स रोबोट पास करते हैं (जिन्हें इंटरमीडिएट टेंसर कहा जाता है), उनका आकार अजीब होता है। उनमें मौजूद अधिकांश संख्याएँ शून्य के ठीक आसपास बहुत छोटी होती हैं। कुछ संख्याएँ बहुत बड़ी हैं, लेकिन वे दुर्लभ हैं।

  • पुराना तरीका (INT8): कल्पना कीजिए कि आप एक ऐसी भीड़ का वर्णन करने की कोशिश कर रहे हैं जहाँ 99% लोग एक छोटे से घेरे में स्थिर खड़े हैं, और 1% लोग दूर कहीं दौड़ रहे हैं। यदि आप एक मानक पैमाने (INT8) का उपयोग करते हैं जिसमें हर इंच के लिए समान अंतराल होता है, तो आप उस छोटे घेरे को सटीक रूप से नहीं माप पाएंगे। घेरे में मौजूद सभी लोग एक ही स्थान पर दब जाएंगे, और जानकारी खो जाएगी। रोबोट भ्रमित हो जाते हैं, और ट्रेनिंग विफल हो जाती है।
  • TACO का समाधान (FP8): TACO एक विशेष पैमाने (FP8) का उपयोग करता है जिसमें शून्य के पास बहुत बारीक निशान होते हैं और दूर जाने पर चौड़े निशान होते हैं। यह "जीरो क्राउड" के लिए एकदम सही है। लेकिन इस पैमाने की भी सीमाएं हैं।

2. जादुई ट्रिक: "एडेप्टिव शफल" (ASH Transform)

FP8 पैमाने के साथ भी, नोट्स अभी भी शून्य के पास बहुत घने हैं। TACO एक चतुर जादुई ट्रिक करता है जिसे एडेप्टिव स्केल-हैडामार्ड ट्रांसफॉर्म (Adaptive Scale–Hadamard Transform) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक कमरा है जो लोगों से भरा हुआ है जो एक कोने में सिमटे हुए हैं (शून्य मान)। यदि आप बस उन्हें एक लाइन में खड़े होने के लिए कहते हैं, तो वे अभी भी सटीक रूप से गिनने के लिए एक-दूसरे के बहुत करीब होंगे।
  • TACO क्या करता है: यह पहले मापता है कि प्रत्येक छोटा समूह कितना "ऊर्जावान" है। फिर यह शांत समूहों (कम मानों) को दूर धकेलता है ताकि उन्हें देखना आसान हो सके, जबकि शोर मचाने वाले समूहों (उच्च मानों) को करीब खींचता है ताकि वे कमरे के किनारे से बाहर न निकल जाएं।
  • परिणाम: भीड़ अब कमरे में बिल्कुल सही ढंग से फैली हुई है, जो FP8 पैमाने के "स्वीट स्पॉट" में पूरी तरह फिट बैठती है। यह "जीरो-कोलैप्स" को रोकता है जहाँ जानकारी खो जाती है।

3. सुरक्षा जाल: "डुअल-स्केल" (DS)

कभी-कभी, शफल करने के बाद भी, कुछ संख्याएँ FP8 पैमाने के लिए बहुत बड़ी या बहुत छोटी हो सकती हैं।

  • उपमा: कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं। आपके पास भारी कपड़ों के लिए एक मुख्य पैमाना है, लेकिन आपको गहनों के लिए एक छोटे पैमाने की भी आवश्यकता है।
  • TACO क्या करता है: यह एक साथ दो पैमानों का उपयोग करता है। एक पैमाना पूरे समूह को सूटकेस में फिट होने के लिए समायोजित करता है (ओवरफ्लो को रोकने के लिए), और दूसरा यह सुनिश्चित करता है कि छोटा गहना (छोटे मान) कुचला न जाए। यह ट्रेनिंग को स्थिर रखता है और रोबोट को "डाइवर्जेंट" (पटरी से उतरने) से बचाता है।

4. स्पीड बूस्ट: "फ्यूजन किचन" (The Fusion Kitchen)

आमतौर पर, इन नोट्स को सिकोड़ने के लिए, कंप्यूटर को तीन अलग-अलग चरण करने होते हैं: भीड़ को मापना, उन्हें शफल करना और फिर पैक करना। यह एक शेफ द्वारा काटने, फिर मिलाने, और फिर प्लेटिंग करने जैसा है, लेकिन हर कदम के बीच उसे फ्रिज तक जाने के लिए मजबूर होना पड़ता है। यह धीमा है।

  • TACO का नवाचार: TACO एक "फ्यूज्ड किचन" बनाता है। यह काटने, मिलाने और प्लेटिंग को एक ही सुपर-फास्ट मोशन में जोड़ देता है। कंप्यूटर डेटा को मेमोरी में लिखने के लिए रुके बिना ये तीनों काम एक साथ करता है। यह प्रक्रिया को अविश्वसनीय रूप से तेज़ बनाता है और रोबोटों को सोचने के दौरान ही संचार करने की अनुमति देता है।

परिणाम

पेपर ने विशाल मॉडलों (जैसे GPT और Qwen) पर TACO का परीक्षण किया और पाया:

  • गति: इसने कुछ मामलों में ट्रेनिंग को 1.87 गुना तेज़ बना दिया।
  • सटीकता: डेटा को इतना सिकोड़ने के बावजूद, रोबोटों ने उतना ही अच्छा सीखा जितना कि यदि उन्होंने पूर्ण, अनकंप्रेस्ड नोट्स भेजे होते। "लॉस" (त्रुटि) लगभग नगण्य था।
  • स्केलेबिलिटी: यह तब भी बहुत अच्छा काम करता है जब आपके पास 8, 16 या अधिक रोबोट मिलकर काम कर रहे हों।

संक्षेप में: TACO, AI ट्रेनिंग रोबोटों के बीच भारी डेटा ट्रैफिक को सिकोड़ने का एक स्मार्ट और तेज़ तरीका है। यह डेटा को पुनर्गठित (reshuffling) करने की एक विशेष तकनीक का उपयोग करता है ताकि डेटा एक छोटे प्रारूप में पूरी तरह फिट हो सके, जिससे यह सुनिश्चित होता है कि AI अपनी बुद्धि खोए बिना तेज़ी से सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →