← नवीनतम पेपर
🤖 machine learning

Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training

लेकस्ट्रीम (Lakestream) एक ब्रोकरलेस, ऑब्जेक्ट-स्टोर-नेटिव डेटा प्लेन है जो बड़े फाउंडेशन मॉडल ट्रेनिंग के लिए डिज़ाइन किया गया है, जो ट्रांसेक्शनल ग्लोबल बैचों (Transactional Global Batches) और एक डिसेंट्रलाइज्ड एडेप्टिव कमिट (Decentralized Adaptive Commit) एल्गोरिदम को पेश करता है ताकि मौजूदा मैसेज क्यू या कोलोकेटेड समाधानों की तुलना में कम विलंबता (latency) के साथ ACID-समान निरंतरता, विफलता अलगाव (failure isolation) और उच्च-थ्रूपुट इनजेशन प्रदान किया जा सके।

मूल लेखक: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट (एक लार्ज फाउंडेशन मॉडल) को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको इसे वीडियो, इमेज और टेक्स्ट जैसे भारी मात्रा में डेटा, एक-एक "बैच" करके खिलाना होगा।

अतीत में, इस रोबोट को खिलाना एक कारखाने के साधारण कन्वेयर बेल्ट जैसा था। डेटा पहले से ही बक्सों में पैक किया गया था, और बेल्ट बस उसे एक स्थिर गति से रोबोट तक पहुँचा रही थी। लेकिन आधुनिक AI अलग है। डेटा अव्यवस्थित, विशाल और आकार में परिवर्तनशील है। कभी-कभी एक एकल वीडियो फ़ाइल को रोबोट द्वारा उपयोग करने से पहले उसे 1,000 गुना बड़ा करने के लिए अनपैक और फैलाना पड़ता है।

पुराने कन्वेयर बेल्ट (मौजूदा सिस्टम) यह नहीं संभाल सके। या तो वे जाम हो जाते थे, या यदि एक कर्मचारी ने एक बॉक्स गिरा दिया, तो पूरा कारखाना रुक जाता था।

प्रवेश: Lakestream: एक "स्मार्ट, ब्रोकरलेस" डेटा प्लेन।

इस पेपर के लेखकों ने एक नया सिस्टम बनाया है जिसे Lakestream कहा जाता है। इसे एक नए तरीके के रूप में सोचें जो इन विशाल AI मॉडल्स के लिए डेटा डिलीवरी को व्यवस्थित करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. पुराने तरीकों के साथ समस्या

  • "कोलोकेटेड" की समस्या (जिम में रसोई): कल्पना कीजिए कि रोबोट (ट्रेनर) वजन उठा रहा है, और उसका खाना तैयार करने वाला व्यक्ति (डेटा लोडर) उसी छोटे कमरे में उसके ठीक बगल में खड़ा है। यदि भोजन तैयार करने में बहुत अधिक समय लगता है, तो रोबोट को वजन उठाना रोकना पड़ता है। यदि भोजन तैयार करने वाला व्यक्ति लड़खड़ाकर गिर जाता है, तो रोबोट हमेशा के लिए रुक जाता है। वे आपस में बहुत उलझे हुए हैं।
  • "मैसेज क्यू" की समस्या (भ्रमित कूरियर): डेटा डिलीवर करने के लिए एक केंद्रीय डाकघर (जैसे Kafka) का उपयोग करने की कल्पना करें। डाकघर हर कागज के टुकड़े को एक अलग पत्र की तरह मानता है। लेकिन रोबोट को एक साथ एक पूर्ण भोजन (एक बैच) चाहिए। यदि डाकघर भोजन का "चिकन" वाला हिस्सा एक रोबोट हाथ को और "चावल" वाला हिस्सा दूसरे हाथ को अलग-अलग समय पर पहुँचाता है, तो रोबोट भ्रमित हो जाएगा और गलत चीजें सीखेगा। साथ ही, डाकघर विफलता का एक एकल बिंदु है; यदि पोस्टमास्टर बीमार हो जाता है, तो कोई भी खाना नहीं खा पाएगा।

2. Lakestream का समाधान: एक साझा डिजिटल गोदाम

Lakestream उस केंद्रीय डाकघर और तंग रसोई को हटा देता है। इसके बजाय, यह एक विशाल, साझा ऑब्जेक्ट स्टोरेज (एक विशाल, अनंत डिजिटल गोदाम की तरह, जैसे Amazon S3) और एक वर्जनड मेनिफेस्ट (एक मास्टर लेजर/बहीखाता) का उपयोग करता है।

यहाँ तीन जादुई तरकीबें दी गई हैं जिनका Lakestream उपयोग करता है:

A. "ट्रांसेक्शनल ग्लोबल बैच" (एक आदर्श भोजन)

पुराने दिनों में, डेटा केवल व्यक्तिगत रिकॉर्ड का एक प्रवाह था। Lakestream पूरे डेटा "बैच" को एक एकल, अटूट इकाई के रूप में मानता है जिसे ट्रांसेक्शनल ग्लोबल बैच (TGB) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक शेफ एक पूरा भोज तैयार कर रहा है। भोजन पकाया गया है और मेज पर रखा गया है, लेकिन यह एक ढक्कन से ढका हुआ है। ढक्कन लॉक है। अभी तक कोई भोजन देख नहीं सकता।
  • जादू: जब शेफ पूरी तरह सुनिश्चित होता है कि पूरा भोज तैयार है, तो वह मास्टर लेजर (मेनिफेस्ट) पर एक स्विच चालू करता है। अचानक, ढक्कन उठ जाता है, और हर रोबोट हाथ एक ही क्षण में पूर्ण, आदर्श भोजन देखता है। यदि शेफ स्विच दबाने से पहले एक प्लेट गिरा देता है, तो ढक्कन नीचे ही रहता है, और कोई भी गंदगी नहीं देख पाता। यह सुनिश्चित करता है कि सभी लोग हमेशा एक ही डेटा के साथ काम कर रहे हैं।

B. "डिसेंट्रलाइज्ड एडेप्टिव कमिट" (एक स्मार्ट ट्रैफिक लाइट)

जब कई शेफ (प्रोड्यूसर्स) एक ही समय में मास्टर लेजर को अपडेट करने की कोशिश करते हैं, तो वे एक ही पेज पर लिखने की कोशिश कर सकते हैं, जिससे संघर्ष पैदा होता है।

  • पुराना तरीका: वे बस तब तक दरवाजा खटखटाते रहते थे जब तक कि कोई उन्हें अंदर न आने दे, जिससे समय बर्बाद होता था।
  • Lakestream का तरीका (DAC): शेफ के पास एक स्मार्ट, स्व-शिक्षित लय होती है। वे देखते हैं कि लेजर कितना व्यस्त है। यदि लेजर बहुत बड़ा हो रहा है और अपडेट धीमा है, तो वे दोबारा लिखने की कोशिश करने से पहले स्वचालित रूप से थोड़ा लंबा इंतजार करते हैं। यदि यह शांत है, तो वे तेजी से लिखते हैं। वे यह सब एक-दूसरे से बात किए बिना करते हैं, बस लेजर को देखकर। यह सुनिश्चित करता है कि सैकड़ों शेफ एक साथ काम कर रहे होने पर भी ट्रैफिक सुचारू रूप से चलता रहे।

C. "चेकपॉइंट-अलाइन्ड लाइफसाइकिल" (एक टाइम-ट्रैवल सेफ)

AI मॉडल्स को अक्सर अपनी "प्रगति को सहेजने" (चेकपॉइंट) की आवश्यकता होती है और कभी-कभी एक अलग रास्ते को आज़माने के लिए पिछले सेव पॉइंट पर वापस जाने की आवश्यकता होती है।

  • समस्या: पुराने सिस्टम में, एक बार डेटा खा लिया गया, तो वह चला जाता है। यदि आपको वापस जाना है, तो आप नहीं जा सकते।
  • Lakestream का तरीका: सिस्टम द्वारा परोसे गए हर भोजन का इतिहास रखा जाता है, जो रोबोट के विशिष्ट "सेव पॉइंट" से जुड़ा होता है। जब रोबोट अपनी प्रगति को सहेजता है, तो वह लेजर में एक "वॉटरमार्क" (एक सुरक्षा रेखा) भी लिखता है। सिस्टम जानता है कि उस रेखा से पहले के सभी डेटा को सुरक्षित और व्यवस्थित रखना है। यह डेटा तभी हटाता है जब इसे पता चल जाता है कि अब किसी भी रोबोट सेव पॉइंट को इसकी आवश्यकता नहीं है। इसका मतलब है कि आप बिना डेटा खोए समय में पीछे जा सकते हैं, और आपको उस डेटा को स्टोर करने के लिए भुगतान नहीं करना पड़ता जिसकी अब कोई जरूरत नहीं है।

3. परिणाम

इस पेपर में इस सिस्टम का परीक्षण 64 शक्तिशाली GPUs और विशाल वीडियो एवं इमेज डेटासेट पर किया गया।

  • गति: यह सबसे अच्छे मौजूदा "कोलोकेटेड" सिस्टम (जहाँ डेटा तैयारी और ट्रेनिंग एक साथ होती है) की तुलना में 2.7 से 7.7 गुना तेज़ था।
  • विश्वसनीयता: इसने विफलताओं को बहुत बेहतर ढंग से संभाला। यदि डेटा तैयारी करने वाला कोई कार्यकर्ता क्रैश हो गया, तो भी रोबोट बिना रुके ट्रेनिंग जारी रखता रहा।
  • दक्षता: यह एक केंद्रीय मैसेज क्यू (जैसे Kafka) का उपयोग करने की तुलना में बहुत तेज़ था, जो डेटा के आकार और जटिलता के साथ तालमेल बिठाने में संघर्ष कर रहा था।

सारांश

Lakestream एक अराजक, सिंगल-लेन सड़क को एक स्मार्ट, विकेंद्रीकृत हाईवे सिस्टम में बदलने जैसा है। यह एक साझा गोदाम और एक मास्टर लेजर का उपयोग करता है ताकि यह सुनिश्चित हो सके कि:

  1. हर किसी को एक ही समय में डेटा का बिल्कुल एक जैसा "बैच" मिले।
  2. ट्रैफिक भारी होने पर भी सिस्टम तेज़ी से चलता रहे।
  3. आप अपने डेटा को खोए बिना इतिहास के किसी भी बिंदु पर ट्रेनिंग प्रक्रिया को रिवाइंड कर सकें।

यह सब यह किए बिना संभव होता है कि कोई केंद्रीय प्रबंधक (ब्रोकर) हो जो सबको निर्देश दे, जिससे यह दुनिया के सबसे बड़े AI मॉडल्स को प्रशिक्षित करने के लिए तेज़, सस्ता और अधिक विश्वसनीय बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →