← नवीनतम पेपर
💻 computer science

Versioned Late Materialization for Ultra-Long Sequence Training in Recommendation Systems at Scale

यह शोधपत्र एक वर्शन्ड लेट मटेरियलाइजेशन (versioned late materialization) प्रतिमान प्रस्तुत करता है जो उपयोगकर्ता इंटरैक्शन इतिहास को एक बार संग्रहीत करके और अनुक्रमों को जस्ट-इन-टाइम (just-in-time) पुनर्गठित करके अल्ट्रा-लॉन्ग सीक्वेंस ट्रेनिंग में डेटा रिडंडेंसी को समाप्त करता है, जिससे स्केलेबल, उच्च-गुणवत्ता वाले डीप लर्निंग रिकमेंडेशन मॉडल्स को सक्षम करने के लिए स्टोरेज और I/O बाधाओं को दूर किया जा सके।

मूल लेखक: Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Sreeshylan, Xiaoxuan Meng

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Sreeshylan, Xiaoxuan Meng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय चला रहे हैं जहाँ आप एक सुपर-स्मार्ट रोबोट (AI मॉडल) को यह सिखाना चाहते हैं कि हर आने वाले व्यक्ति को उनकी पसंद की एकदम सही फिल्म कैसे सुझाई जाए।

इसे करने के लिए, रोबोट को उपयोगकर्ता का पूरा इतिहास जानने की आवश्यकता है: पिछले कुछ वर्षों में उन्होंने क्या देखा, क्या पसंद किया या किसे अनदेखा कर दिया। इसे यूजर इंटरैक्शन हिस्ट्री (UIH) कहा जाता है।

पुराना तरीका: "फैट रो" (Fat Row) की समस्या

अतीत में, पुस्तकालय के पास इसे व्यवस्थित करने का एक बहुत ही अक्षम तरीका था। जब भी रोबोट को किसी उपयोगकर्ता का अध्ययन करने की आवश्यकता होती थी, तो लाइब्रेरियन उस उपयोगकर्ता के पूरे इतिहास की फोटोकॉपी करते थे और उस विशिष्ट अध्ययन सत्र के लिए उसे एक ही पन्ने पर चिपका देते थे।

यदि रोबoret को 1,000 अलग-अलग उपयोगकर्ताओं का अध्ययन करने की आवश्यकता होती, और प्रत्येक उपयोगकर्ता का इतिहास 10,000 घटनाओं का होता, तो लाइब्रेरियन को 1,000 अलग-अलग पन्ने बनाने पड़ते, जिनमें से प्रत्येक में 10,000 बार दोहराई गई तथ्य होते।

  • समस्या: इसने डेटा का एक "फैट रो" (मोटी पंक्ति) बना दिया। पुस्तकालय में शेल्फ की जगह (स्टोरेज) खत्म हो गई और लाइब्रेरियन वास्तविक रूप से रोबोट को सिखाने के बजाय केवल कागज की फोटोकॉपी करने में अपना समय बिताने लगे (I/O)।
  • बाधा (Bottleneck): इन विशाल, दोहराए गए इतिहास को कॉपी करने और स्टोर करने की लागत इतनी अधिक हो गई कि यह रोबोट को प्रशिक्षित करने के लिए उपयोग किए जाने वाले कंप्यूटरों (GPUs) की लागत से भी अधिक महंगी हो गई। यह ऐसा था जैसे शिक्षक पर खर्च करने के बजाय कागज की फोटोकॉपी करने पर अधिक पैसा खर्च करना।

नया समाधान: वर्जन्ड लेट मैटेरियलाइजेशन (Versioned Late Materialization)

Meta के रचनाकारों ने महसूस किया कि उन्हें हर बार इतिहास की फोटोकॉपी करने की आवश्यकता नहीं है। उन्होंने महसूस किया कि एक उपयोगकर्ता का इतिहास एक एकतरफा सड़क (one-way street) की तरह है: आप अंत में नई घटनाएं जोड़ते हैं, लेकिन आप अतीत में कभी वापस जाकर बदलाव नहीं करते हैं।

उन्होंने एक नया सिस्टम बनाया जिसे वर्जन्ड लेट मैटेरियलाइजेशन कहा जाता है। यह यहाँ कैसे काम करता है, इसका एक सरल उदाहरण है:

1. एकल मास्टर बुक (नॉर्मलाइज्ड स्टोरेज)
हर छात्र के लिए इतिहास की फोटोकॉपी करने के बजाय, पुस्तकालय प्रत्येक उपयोगकर्ता के इतिहास की एक ही, पूर्ण मास्टर बुक रखता है। इस पुस्तक को दिन में एक बार अपडेट किया जाता है और उसके बाद इसमें कोई बदलाव नहीं किया जाता है (यह अपरिवर्तनीय या "immutable" है)।

2. छोटा इंडेक्स कार्ड (वर्जन्ड पॉइंटर्स)
जब रोबोट को एक विशिष्ट समय पर एक विशिष्ट उपयोगकर्ता का अध्ययन करने की आवश्यकता होती है (उदाहरण के लिए, "यूजर A मंगलवार को दोपहर 2 बजे क्या जानता था?"), तो लाइब्रेरियन पूरे बुक की फोटोकॉपी नहीं करते। इसके बजाय, वे उस प्रशिक्षण सत्र के लिए एक छोटा सा इंडेक्स कार्ड लिखते हैं।

  • कार्ड बस इतना कहता है: "मास्टर बुक पर जाएँ, पेज 100 से 500 देखें, और दोपहर 2 बजे के एंट्री पर रुकें।"
  • पूरे बुक की तुलना में यह कार्ड बहुत छोटा (हल्का मेटाडेटा) होता है।

3. जस्ट-इन-टाइम रिकंस्ट्रक्शन (Just-in-Time Reconstruction)
जब रोबोट सीखने के लिए तैयार होता है, तो सिस्टम इंडेक्स कार्ड का उपयोग करके तुरंत मास्टर बुक के सटीक पन्नों को पलटता है और इतिहास को उसी समय तैयार करता है। यह "लेट मैटेरियलाइजेशन" है—डेटा को पहले से तैयार करने के बजाय, इसे तभी बनाना जब वास्तव में इसकी आवश्यकता हो।

यह गेम-चेंजर क्यों है

"फ्यूचर लीक" (भविष्य का रिसाव/टाइम ट्रैवल की समस्या) को हल करना
सिफारिश प्रणालियों (Recommendation systems) में, आपको सावधान रहना चाहिए कि रोबोट को उन घटनाओं को देखकर "चीटिंग" न करने दें जो उस क्षण के बाद हुई हों जब उसे निर्णय लेना था।

  • नया सिस्टम एक "टाइम-ट्रैवल" प्रोटोकॉल का उपयोग करता है। इंडेक्स कार्ड समय को लॉक कर देता है। भले ही मास्टर बुक में बाद में नई घटनाएं जुड़ जाएं, रोबोट केवल उसी संस्करण को देखेगा जो उस विशिष्ट क्षण में मौजूद था। यह सुनिश्चित करता है कि रोबोट ठीक वही सीखे जो एक इंसान वास्तविक समय में देख सकता था।

मल्टी-टेनेंट लाभ (अलग-अलग क्लास साइज)
कल्पना कीजिए कि पुस्तकालय दो प्रकार के छात्रों की सेवा करता है:

  • छात्र A को पिछले 10,000 पन्ने पढ़ने की आवश्यकता है (एक जटिल मॉडल)।
  • छात्र B को केवल पिछले 100 पन्ने पढ़ने की आवश्यकता है (एक सरल मॉडल)।
  • पुराना तरीका: दोनों छात्रों को पूरे 10,000 पन्नों की फोटोकॉपी दी जाती थी। छात्र B ने उन पन्नों को पढ़ने में समय बर्बाद किया जिनकी उसे आवश्यकता ही नहीं थी।
  • नया तरीका: छात्र B का इंडेक्स कार्ड बस कहता है "पेज 100 से 200 तक पढ़ें।" सिस्टम केवल उन विशिष्ट पन्नों को ही निकालता है। यह बहुत अधिक ऊर्जा और समय बचाता है।

परिणाम

"सब कुछ फोटोकॉपी करने" के बजाय "विशिष्ट पन्नों को प्राप्त करने के लिए इंडेक्स कार्ड का उपयोग करने" की ओर स्विच करके, Meta ने हासिल किया:

  1. भारी बचत: उन्होंने अपने डेटा को स्टोर करने और स्थानांतरित करने की मात्रा को लगभग 50% तक कम कर दिया।
  2. तेज़ प्रशिक्षण: कंप्यूटर (GPUs) डेटा के लिए प्रतीक्षा करना बंद कर दिए और तेजी से सीखने लगे।
  3. बेहतर रोबोट: क्योंकि वे अंततः रोबोट को बहुत लंबे इतिहास (4,000 के बजाय 64,000 घटनाओं तक) खिलाने में सक्षम हो गए, इसलिए रोबोट सामग्री की सिफारिश करने में काफी बेहतर हो गया।

संक्षेप में: उन्होंने एक ही इतिहास को बार-बार कॉपी करने में पैसा और समय बर्बाद करना बंद कर दिया। इसके बजाय, उन्होंने एक स्मार्ट, टाइम-ट्रैवलिंग फाइलिंग सिस्टम बनाया जो रोबोट को ठीक वही चीज़ पढ़ने देता है जिसकी उसे ज़रूरत है, ठीक उसी समय जब उसे ज़रूरत होती है, जिससे बिना भारी खर्च के बेहतर सिफारिशें संभव हो सकीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →