← नवीनतम पेपर
💬 NLP

D3^3: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

यह शोध पत्र D3D^3 का प्रस्ताव करता है, जो एक गतिशील डेटा शेड्यूलिंग फ्रेमवर्क है जो प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग दोनों चरणों में LLM सीखने की दक्षता में सुधार करने और प्रशिक्षण क्रम को अनुकूलित करने के लिए सैंपल इंटरैक्शन को एक दिशात्मक प्रभाव ग्राफ (directional influence graph) के रूप में मॉडल करता है।

मूल लेखक: Yuanjian Xu, Jianing Hao, Guang Zhang, Zhong Li

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanjian Xu, Jianing Hao, Guang Zhang, Zhong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) छात्र (Large Language Model) को बोलना, तर्क करना और कोड करना सिखा रहे हैं। आपके पास किताबों, लेखों और बातचीत का एक विशाल पुस्तकालय (प्रशिक्षण डेटा) है जिससे आप उन्हें सिखाएंगे।

लंबे समय तक, शोधकर्ताओं ने सोचा कि सबसे महत्वपूर्ण बात यह है कि आप शेल्फ पर क्या किताबें रखते हैं। उन्होंने कोशिश की कि "सर्वश्रेष्ठ" किताबों को सही अनुपात में मिलाया जाए। लेकिन उन्होंने ज्यादातर इस बात को नजरअंदाज कर दिया कि आपने उन किताबों को छात्र को किस क्रम में थमाया।

यह पेपर, जिसका शीर्षक D3 है, यह तर्क देता है कि सामग्री जितनी ही महत्वपूर्ण उसका क्रम भी है। यह प्रशिक्षण डेटा को शेड्यूल करने का एक नया तरीका प्रस्तावित करता है, जो सीखने की प्रक्रिया को एक साधारण सूची के बजाय एक जटिल, बदलते हुए नृत्य (dance) की तरह मानता है।

D3 कैसे काम करता है, इसका विवरण यहाँ सरल उपमाओं (analogies) के माध्यम से दिया गया है:

1. समस्या: "गैर-विनिमेय" (Non-Exchangeable) छात्र

कल्पना कीजिए कि आप किसी को केक बनाना सिखा रहे हैं।

  • पुराना तरीका: आप सोच सकते हैं, "इससे कोई फर्क नहीं पड़ता कि मैं उन्हें आटा मिलाने से पहले अंडा फोड़ना सिखाता हूँ या बाद में। जब तक वे दोनों सीख लेते हैं, वे ठीक रहेंगे।"
  • D3 का अंतर्दृष्टि (Insight): लेखक तर्क देते हैं कि यह गलत है। यदि आप उन्हें आटा मिलाने से पहले अंडा फोड़ना सिखाते हैं, तो वे भ्रमित हो सकते हैं या गड़बड़ी कर सकते हैं। लेकिन यदि आप उन्हें पहले अंडा फोड़ना सिखाते हैं, तो मिश्रण वाला चरण बहुत आसान हो जाता है।

AI की दुनिया में, इसका अर्थ है कि नमूना A (Sample A) मॉडल को नमूना B समझने में बहुत बेहतर बना सकता है, लेकिन केवल तभी जब नमूना A को पहले सीखा जाए। यदि आप उन्हें आपस में बदल देते हैं, तो सीखना कम कुशल हो जाता है। पेपर इसे "नॉन-एक्सचेंजेबिलिटी" कहता है—डेटा विनिमेय (interchangeable) नहीं है; क्रम सीखने का एक विशिष्ट मार्ग बनाता है।

2. समाधान: एक गतिशील मानचित्र (The Influence Graph)

सबसे अच्छा क्रम निर्धारित करने के लिए, D3 एक डायनेमिक इन्फ्लुएंस ग्राफ (Dynamic Influence Graph) बनाता है।

  • उपमा: कल्पना कीजिए कि हाइकर्स (डेटा नमूने) का एक समूह एक पहाड़ (सीखने का लक्ष्य) चढ़ने की कोशिश कर रहा है।
  • स्थिर मानचित्र (Static Maps): पुराने तरीकों में एक स्थिर मानचित्र का उपयोग किया जाता था जो कहता था, "हाइकर A मजबूत है, हाइकर B कमजोर है।"
  • D3 का गतिशील मानचित्र: D3 महसूस करता है कि जैसे-जैसे वे चढ़ते हैं, परिदृश्य बदल जाता है। यह पूछता है: "यदि हाइकर A अभी एक कदम लेता है, तो क्या इससे हाइकर B के लिए बाद में एक कदम लेना आसान हो जाएगा?"
  • "लुक-अहेड" (Look-Ahead): D3 एक छोटा सा कदम आगे का अनुकरण (simulate) करता है। यह गणना करता है: "यदि मैं मॉडल को अभी यह विशिष्ट डेटा सिखाता हूँ, तो यह अगले डेटा के लिए 'भ्रम' (loss) को कितना कम कर देगा?"
    • यदि डेटा A सिखाने से डेटा B बहुत आसान हो जाता है, तो D3 A से B की ओर एक मजबूत तीर खींचता है।
    • यदि डेटा A सिखाने से डेटा B कठिन हो जाता है, तो तीर दूसरी ओर इशारा करता है।

3. संघर्ष: "पत्थर-कागज-कैंची" (Rock-Paper-Scissors) लूप

कभी-कभी, डेटा एक भ्रमित करने वाला लूप बनाता है, जैसे कि पत्थर-कागज-कैंची का खेल:

  • डेटा A, डेटा B की मदद करता है।
  • डेटा B, डेटा C की मदद करता है।
  • लेकिन डेटा C वास्तव में डेटा A की मदद करता है।

यह एक "चक्र" (cycle) बनाता है जहाँ कोई स्पष्ट "पहला" कदम नहीं होता।

  • D3 सॉल्वर: इसमें फंसने के बजाय, D3 एक स्मार्ट रेफरी की तरह काम करता है। यह सभी तीरों को देखता है और पूछता है, "कौन सा नियम सबसे कमजोर है?" यह एक सुचारू, रैखिक पथ बनाने के लिए श्रृंखला के सबसे कमजोर लिंक को तोड़ने का निर्णय लेता है। यह सबसे मजबूत संबंधों को प्राथमिकता देता है और सीखने की प्रक्रिया को कुशलतापूर्वक आगे बढ़ाने के लिए सबसे कमजोर संबंधों का त्याग करता है।

4. दक्षता का नुस्खा: "स्केच" (The Sketch)

अरबों डेटा बिंदुओं के लिए इन संबंधों की गणना करना अविश्वसनीय रूप से भारी काम है, जैसे कि किला बनाने के लिए समुद्र तट पर रेत के हर एक कण का सटीक वजन मापने की कोशिश करना। इसमें बहुत समय लगेगा।

D3 ग्रेडिएंट कम्प्रेशन (Gradient Compression) नामक एक चतुर शॉर्टकट का उपयोग करता है:

  • उपमा: डेटा के हर एक कण को तौलने के बजाय, D3 डेटा का एक "स्केच" या "परछाई" लेता है। यह जटिल, उच्च-आयामी गणित को एक सरल, निम्न-आयामी स्थान में प्रोजेक्ट करता है।
  • परिणाम: यह भारी काम किए बिना संबंधों का एक बहुत अच्छा अनुमान प्राप्त कर लेता है। यह सिस्टम को कंप्यूटर को क्रैश किए बिना विशाल मॉडलों पर चलाने की अनुमति देता है।

5. परिणाम: एक बेहतर सीखने का मार्ग

लेखकों ने दो मुख्य चरणों में इसका परीक्षण किया:

  1. प्री-ट्रेनिंग (Pre-training): मॉडल को भाषा की बुनियादी बातें सिखाना।
  2. पोस्ट-ट्रेनिंग (Post-training/Fine-tuning): मॉडल को गणित या कोडिंग जैसे विशिष्ट कौशल सिखाना।

परिणाम:

  • स्मार्ट लर्निंग: "D3 पथ" का पालन करके, मॉडल तेजी से सीखे और उन्होंने रैंडमली डेटा को शफल करने या सरल नियमों का पालन करने वाले मॉडलों की तुलना में कम गलतियाँ कीं (कम "परप्लेक्सिटी")।
  • बेहतर तर्क (Reasoning): मॉडल गणित की समस्याओं (MATH dataset) को हल करने और कोड (HumanEval) लिखने जैसे जटिल कार्यों में काफी बेहतर थे।
  • दक्षता: क्रम निर्धारित करने के लिए आवश्यक अतिरिक्त गणित के बावजूद, सिस्टम व्यावहारिक रूप से चलाने के लिए पर्याप्त तेज़ था।

सारांश

D3 को एक AI मॉडल के लिए एक व्यक्तिगत टूर गाइड के रूप में समझें।

  • पुराने तरीके केवल छात्र के सामने किताबों का ढेर लगा देते थे और कहते थे, "इन्हें पढ़ लो।"
  • D3 छात्र की वर्तमान स्थिति को देखता है, यह जांचता है कि कौन सी किताब उन्हें अगली किताब समझने में सबसे अधिक मदद करेगी, और पूरी लाइब्रेरी को एक आदर्श, तार्किक क्रम में व्यवस्थित करता है। यह सुनिश्चित करता है कि छात्र ज्ञान को चरण-दर-चरण बनाए, जहाँ प्रत्येक चरण स्वाभाविक रूप से उन्हें अगले चरण के लिए तैयार करता है, जिससे एक स्मार्ट, अधिक सक्षम AI का निर्माण होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →