← नवीनतम पेपर
🤖 machine learning

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

यह अध्ययन प्रदर्शित करता है कि भाषाई रूप से प्रेरित पाठ्यक्रम LLM प्रीट्रेनिंग में मुख्य रूप से साझा लेटेंट लर्निंग चरणों की अवधि को बदलकर छोटे मॉडलों में प्रशिक्षण स्थिरता को बढ़ाते हैं और ग्रेडिएंट शोर को कम करते हैं, न कि नए चरण बनाकर, जबकि बड़े मॉडल पैमानों पर ये लाभ कम हो जाते हैं।

मूल लेखक: Mohamed Elgaar, Hadi Amiri

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamed Elgaar, Hadi Amiri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत छोटे बच्चे (एक छोटे कंप्यूटर मॉडल) को भाषा बोलना सिखाने की कोशिश कर रहे हैं। आपके पास किताबों का एक विशाल पुस्तकालय है (प्रशिक्षण डेटा) जिसमें नर्सरी राइम्स से लेकर जटिल कानूनी अनुबंधों और कंप्यूटर कोड तक सब कुछ शामिल है।

मुख्य सवाल जो यह शोध पत्र पूछता है, वह यह है: क्या इससे कोई फर्क पड़ता है कि आप उन किताबों को बच्चे को किस क्रम में थमाते हैं?

अधिकांश आधुनिक AI प्रशिक्षण पूरे पुस्तकालय को एक ब्लेंडर में डाल देता है, उसे बेतरतीब ढंग से मिला देता है, और मॉडल को एक बार में एक पन्ना खिलाता है। यह पेपर एक अलग विचार का परीक्षण करता जिसे करिकुलम लर्निंग (Curriculum Learning) कहा जाता है: किताबों को इस तरह व्यवस्थित करना ताकि बच्चा पहले "आसान" चीजें देखे और बाद में "कठिन" चीजें, ठीक वैसे ही जैसे एक मानव शिक्षक सरल शब्दों से शुरू होकर जटिल व्याकरण की ओर बढ़ता है।

यहाँ शोधकर्ताओं ने क्या पाया, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. सेटअप: "वन-पास" लाइब्रेरी

बड़े AI मॉडल की दुनिया में, हमें आमतौर पर लाइब्रेरी को केवल एक बार पढ़ने का मौका मिलता है। हमारे पास बाद में आसान किताबों को फिर से पढ़ने का समय नहीं होता। इसलिए, क्रम अत्यंत महत्वपूर्ण है क्योंकि बच्चा प्रत्येक पन्ने को ठीक एक बार ही देखता है।

शोधकर्ताओं ने एक निश्चित टेक्स्ट (जिसे "द पाइल" कहा जाता है) लिया और भाषा के नियमों के आधार पर तीन अलग-अलग "रीडिंग लिस्ट" बनाईं:

  • आयु-आधारित अधिग्रहण (Age-of-Acquisition): वे शब्द पढ़ना जो बच्चे जल्दी सीखते हैं (जैसे "कुत्ता" या "दौड़ना") और उन शब्दों को बाद में सीखना जो बाद में सीखे जाते हैं (जैसे "दर्शनशास्त्र" या "नौकरशाही")।
  • शब्द आवृत्ति (Word Frequency): सबसे आम शब्दों को पहले पढ़ना, फिर दुर्लभ शब्दों को।
  • क्रिया भिन्नता (Verb Variation): सरल, दोहराव वाले क्रियाओं वाले वाक्य पहले पढ़ना, फिर कई अलग-अलग प्रकार की क्रियाओं वाले वाक्य।

उन्होंने इन व्यवस्थित सूचियों की तुलना एक रैंडम शफल (Random Shuffle) (मानक विधि) से की।

2. मुख्य खोज: सीखने के "छिपे हुए चरण"

शोधकर्ता जानना चाहते थे कि क्या किताबों को व्यवस्थित करने से बच्चे के सीखने के तरीके में कोई बदलाव आया। क्या इसने सोचने का एक नया तरीका बनाया?

निष्कर्ष: नहीं। बच्चा सीखने के बिल्कुल समान चरणों से गुजरा, चाहे क्रम कुछ भी हो।

  • उपमा: कल्पना कीजिए कि आप एक पहाड़ चढ़ रहे हैं। चाहे आप घुमावदार रास्ता (करिकुलम) लें या सीधा, अराजक रास्ता (रैंडम), आप फिर भी "बेस कैंप," "पथरीली ढलान," और "शिखर" से गुजरेंगे। चरणों का क्रम इन चरणों के माध्यम से की गई यात्रा को नहीं बदलता।
  • क्या बदला: प्रत्येक चरण में बिताया गया समय और वहां जाते समय बच्चा किन विशिष्ट चट्टानों पर कदम रखता था। व्यवस्थित सूचियों ने बस इन चरणों के माध्यम से की गई यात्रा को अधिक सुचारू बना दिया।

3. "छोटा मॉडल" समस्या: ट्रैफिक जाम

पेपर ने पाया कि यह क्रम वाला तरीका छोटे मॉडलों (उन "छोटे बच्चों") के लिए सबसे अच्छा काम करता है।

  • समस्या (सॉफ्टमैक्स बॉटलनेक): छोटे मॉडलों की "मस्तिष्क क्षमता" सीमित होती है। जैसे-जैसे वे बड़े होते हैं (प्रशिक्षण के दौरान), उनका आउटपुट तंत्र "जाम" या "भर" सकता है। यह एक छोटी बाल्टी की तरह है जो समुद्र को रखने की कोशिश कर रही है; अंततः, यह भर जाती है, और मॉडल भ्रमित या अस्थिर होने लगता है।
  • रैंडम शफल की तबाही: जब मॉडल को रैंडम डेटा खिलाया गया, तो प्रशिक्षण के अंत में उसे "ट्रैफिक जाम" का सामना करना पड़ा। उसके सीखने में "शोर" (भ्रम) बहुत बढ़ गया, और उसकी आंतरिक संरचना कठोर और टूट गई (सिंगुलर एंट्रॉपी में उछाल)।
  • करिकुलम समाधान: जब मॉडल को एक व्यवस्थित क्रम में डेटा खिलाया गया (आसान से कठिन), तो उसने ट्रैफिक जाम से बचने में सफलता पाई। वह लंबे समय तक स्थिर रहा। उसने अधिक तथ्य नहीं सीखे, लेकिन उसने उन्हें बिना क्रैश हुए अधिक स्थिरता से सीखा।

महत्वपूर्ण विवरण: यह "ट्रैफिक जाम" केवल छोटे मॉडलों के साथ हुआ। बड़े मॉडल (बड़े दिमाग वाले "वयस्क") रैंडम अराजकता को संभालने के लिए पर्याप्त मजबूत थे।

4. "दिशा" मायने रखती है

शोधकर्ताओं ने यह परीक्षण किया कि क्या वास्तव में क्रम मायने रखता है, इसके लिए उन्होंने एक सूची को उल्टा कर दिया (पहले "कठिन" चीजें दिखाना, फिर "आसान" चीजें)।

  • परिणाम: यह एक आपदा थी। जिस मॉडल ने पहले कठिन चीजें देखीं, उसने वह सटीकता का लाभ खो दिया जो उसे प्राप्त होता यदि उसने पहले आसान चीजें देखी होतीं। यह साबित करता है कि छोटा शुरू करना और धीरे-धीरे आगे बढ़ना ही कुंजी है, न कि केवल शब्दों की एक विशिष्ट सूची होना।

5. "छिपा हुआ पहलू" (डोमेन मिक्सिंग)

यह पेपर अपनी एक सीमा के बारे में बहुत ईमानदार है। जब उन्होंने "शब्द आवृत्ति" के आधार पर किताबों को छाँटा, तो उन्होंने अनजाने में यह भी बदल दिया कि बच्चा पहले किस प्रकार की किताबें देख रहा था।

  • उपमा: यदि आप "कोड" शब्द कितनी बार आता है, इसके आधार पर किताबों को छाँटते हैं, तो आप अंत में सभी कविताएं और शुरुआत में सभी कंप्यूटर मैनुअल रख देंगे।
  • निष्कर्ष: शोधकर्ताओं ने जो लाभ देखा, वह केवल इसलिए नहीं था क्योंकि शब्द "आसान" थे, बल्कि इसलिए था क्योंकि मॉडल को विशिष्ट समय पर विषयों का एक विशिष्ट मिश्रण (जैसे कोड या समाचार) मिला। "करिकुलम" वास्तव में कठिनाई और विषय शेड्यूलिंग का मिश्रण था।

सारांश

  • क्या क्रम सीखने के चरणों को बदलता है? नहीं। मॉडल हमेशा समान व्यापक चरणों में सीखता है।
  • क्या क्रम मदद करता है? हाँ, लेकिन मुख्य रूप से छोटे मॉडलों के लिए।
  • कैसे? यह प्रशिक्षण प्रक्रिया को स्थिर रखता है और छोटे मॉडल को प्रशिक्षण के अंत में "जाम" होने या भ्रमित होने से रोकता है।
  • क्या यह बड़े मॉडलों के लिए काम करता है? नहीं, बहुत ज्यादा नहीं। बड़े मॉडल इतने मजबूत होते हैं कि किताबों का क्रम उन पर बड़ा अंतर नहीं डालता।
  • सीख: छोटे, क्षमता-सीमित मॉडलों के लिए, उन्हें "आसान से कठिन" सिखाना एक पहाड़ पर उनके लिए एक चिकना रास्ता देने जैसा है, जो उन्हें किनारे से फिसलने से रोकता है, भले ही पहाड़ खुद न बदला हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →