← नवीनतम पेपर
🤖 AI

Demystifying Data Organization for Enhanced LLM Training

यह शोध पत्र चार प्रमुख दिशा-निर्देशों को औपचारिक रूप देने और दो नवीन क्रम विधियों, STR और SAW को पेश करने के माध्यम से लार्ज लैंग्वेज मॉडल (LLM) प्रशिक्षण के लिए रणनीतिक डेटा संगठन के अल्प-अन्वेषित क्षेत्र को संबोधित करता है, जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ प्रशिक्षण स्थिरता और प्रदर्शन को बढ़ाने के लिए पूर्व-निर्धारित नमूना स्कोर का लाभ उठाते हैं।

मूल लेखक: Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत तेज़ छात्र को मास्टर शेफ बनने के लिए सिखाने की कोशिश कर रहे हैं। आपके पास 10,000 व्यंजनों (रेसिपी) का एक विशाल पुस्तकालय है।

अधिकांश शोधकर्ता इस बात पर ध्यान केंद्रित करते हैं कि पुस्तकालय में कौन से व्यंजन होने चाहिए (सबसे अच्छे व्यंजनों का चयन करना)। लेकिन यह शोध पत्र एक अलग सवाल पूछता है: छात्र को उन्हें किस क्रम में पढ़ना चाहिए?

लेखकों का तर्क है कि यदि आप छात्र को केवल व्यंजनों का एक रैंडम ढेर थमा देते हैं, या यहाँ तक कि "आसान" से "कठिन" के क्रम में व्यवस्थित ढेर भी दे देते हैं, तो वे भ्रमित हो सकते हैं, बुनियादी बातें भूल सकते हैं, या थककर हार मान सकते हैं। इसके बजाय, वे एक विशिष्ट "पढ़ने का शेड्यूल" प्रस्तावित करते हैं जो उन्हें तेजी से और बेहतर तरीके से सीखने में मदद करता है, जिसमें डेटा वही रहता है लेकिन उसे अलग तरह से व्यवस्थित किया जाता है।

यहाँ उनके विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

समस्या: "एक-पास" (One-Pass) की चुनौती

कल्पना कीजिए कि छात्र के पास पूरे पुस्तकालय को केवल एक बार (या शायद दो बार) पढ़ने का समय है। वास्तविक दुनिया में, बड़े AI मॉडल को प्रशिक्षित करना ऐसा ही है: वे डेटा की एक विशाल मात्रा देखते हैं लेकिन उन्हें केवल एक या दो "पास" ही मिलते हैं।

यदि आप उन्हें सबसे पहले सबसे कठिन व्यंजन देते हैं, तो वे घबरा जाएंगे। यदि आप उन्हें पहले सबसे आसान व्यंजन देते हैं और फिर अचानक सबसे कठिन की ओर बढ़ते हैं, तो वे बुनियादी बातें भूल सकते हैं। यदि आप उन्हें लगातार 100 आसान व्यंजन देते हैं, तो वे ऊब जाएंगे और ध्यान देना बंद कर देंगे।

समाधान: एक बेहतर शेड्यूल के लिए चार नियम

लेखकों ने डेटा को व्यवस्थित करने के लिए चार "स्वर्ण नियमों" की खोज की ताकि सीखना प्रभावी बना रहे। उन्हें नए नंबरों की गणना करने की आवश्यकता नहीं थी; उन्होंने केवल पहले से गणना किए गए स्कोर का उपयोग करके सर्वश्रेष्ठ व्यंजनों को चुना।

1. बाउंड्री शार्पनिंग (सीमा को पैना करना - "वार्म-अप और कूल-डाउन" का नियम)

  • विचार: छात्र को सहज महसूस कराने के लिए सरल, आसान व्यंजनों के साथ शुरुआत करें। उन्हें अपने शिखर प्रदर्शन तक पहुँचाने के लिए सबसे जटिल, उच्च-गुणवत्ता वाले व्यंजनों के साथ अंत करें।
  • उपमा: एक धावक के बारे में सोचें। आप मैराथन की शुरुआत पूरी गति से स्प्रिंट करके नहीं करते (आप क्रैश हो जाएंगे), और आप इसे धीरे चलकर समाप्त नहीं करते (आप अपनी गति खो देंगे)। आप वार्म-अप के लिए जॉगिंग से शुरुआत करते हैं और मजबूती से समाप्त करने के लिए एक जोरदार स्प्रिंट के साथ अंत करते हैं।

2. साइक्लिक शेड्यूलिंग (चक्रीय शेड्यूलिंग - "रिव्यू सेशन" का नियम)

  • विचार: केवल आसान से कठिन की ओर न बढ़ें और पीछे मुड़कर न देखें। उन्नत विषयों को पढ़ाते समय भी समय-समय पर कुछ आसान, बुनियादी व्यंजनों को शामिल करें।
  • उपमा: एक संगीत शिक्षक की कल्पना करें। यदि वे आपको केवल एक कठिन कॉन्सेर्टो (concerto) सिखाते हैं और आपको फिर कभी सरल स्केल बजाने नहीं देते, तो आप धनुष (bow) पकड़ने का तरीका भूल सकते हैं। यह नियम कहता है: "हर कुछ दिनों में, आइए एक सरल स्केल फिर से बजाएं ताकि यह सुनिश्चित हो सके कि आप बुनियादी बातें नहीं भूले हैं।"

3. करिकुलम कंटिन्यूटी (पाठ्यक्रम निरंतरता - "स्मूथ रैंप" का नियम)

  • विचार: एक बहुत ही आसान व्यंजन से अचानक एक बहुत कठिन व्यंजन पर न कूदें। कठिनाई अचानक नहीं, बल्कि एक ढलान की तरह धीरे-धीरे बदलनी चाहिए।
  • उपमा: यदि आप एक पहाड़ी पर गाड़ी चला रहे हैं, तो आप एक हल्की ढलान चाहते हैं। यदि सड़क अचानक एक खड़ी चट्टान में बदल जाती है, तो आपकी कार (AI) रुक जाएगी या दुर्घटनाग्रस्त हो जाएगी। यह नियम सुनिश्चित करता है कि आसान से कठिन डेटा के बीच का संक्रमण सुचारू हो ताकि सीखने की प्रक्रिया में "झटका" न लगे।

4. लोकल डायवर्सिटी (स्थानीय विविधता - "सलाद मिक्स" का नियम)

  • विचार: यहाँ तक कि व्यंजनों के एक छोटे समूह (एक "मिनी-बैच" जिसे छात्र एक बार में देखता है) के भीतर भी, उन्हें बिल्कुल एक जैसे 10 व्यंजन न दें। उन्हें मिलाएँ!
  • उपमा: यदि आप हर दिन दोपहर के भोजन में केवल चिकन खाते हैं, तो आप इससे बीमार हो जाएंगे और अन्य पोषक तत्वों को मिस कर देंगे। यदि आपके पास चिकन, गाजर, लेट्यूस और पनीर के साथ एक सलाद है, तो आपके पास एक संतुलित भोजन है। एक ही प्रशिक्षण सत्र में विभिन्न प्रकार के डेटा को मिलाने से AI विशिष्ट पैटर्न को याद करने के बजाय सामान्य नियम सीख पाता है।

नई विधियाँ: "स्टेयर" (सीढ़ी) और "सॉ" (आरी)

इन चार नियमों के आधार पर, लेखकों ने डेटा को व्यवस्थित करने के दो नए तरीके बनाए:

  • STR (स्टेयर ऑर्डरिंग - सीढ़ी क्रम): यह विधि "वार्म-अप," "रिव्यू," और "सलाड मिक्स" नियमों का पालन करती है। यह एक ऐसा शेड्यूल बनाता है जो कठिनाई में ऊपर जाता है लेकिन पिछले सिद्धांतों को दोहराने के लिए बीच-बीच में पीछे हटता है, जिससे सीखना स्थिर रहता है।
  • SAW (सॉ ऑर्डरिंग - आरी क्रम): यह "सुपर-चार्ज्ड" संस्करण है। यह "स्मूथ रैंप" नियम को भी जोड़ता है। केवल आगे-पीछे जाने के बजाय, यह एक चिकना, लहर जैसा पैटर्न (एक आरी के ब्लेड की तरह) बनाता है जो यह सुनिश्चित करता है कि कठिनाई कभी भी बहुत तेजी से न बदले।

परिणाम

लेखकों ने विभिन्न आकार के AI मॉडल (छोटे से बड़े) और विभिन्न कार्यों (जैसे गणित और कोडिंग) पर इन विधियों का परीक्षण किया।

  • परिणाम: इन नए शेड्यूल (STR और SAW) के साथ प्रशिक्षित किए गए मॉडल, रैंडम ऑर्डर या मानक "आसान-से-कठिन" ऑर्डर वाले मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं।
  • दक्षता: उन्हें नए डेटा स्कोर की गणना करने के लिए अतिरिक्त समय या पैसा खर्च करने की आवश्यकता नहीं थी। उन्होंने बस पहले से मौजूद डेटा स्कोर का उपयोग करके उन्हें पुनर्व्यवस्थित किया। यह ताश के एक डेक को, जो पहले से ही नंबरों के अनुसार क्रमबद्ध है, बस एक विशिष्ट पैटर्न में फेंटने जैसा है ताकि खेल जीता जा सके।

सारांश

यह शोध पत्र एक नया प्रकार का डेटा या एक नया AI मॉडल नहीं बनाता है। इसके बजाय, यह एक स्मार्ट लाइब्रेरियन की तरह कार्य करता है। यह दिखाता है कि यदि आप किताबों को शेल्फ पर एक विशिष्ट, विचारशील क्रम में व्यवस्थित करते हैं—पाठक को वार्म-अप कराते हुए, पुराने विषयों की समीक्षा करते हुए, संक्रमण को सुचारू बनाते हुए और विषयों को मिलाते हुए—तो पाठक (AI) बहुत तेजी से सीखता है और अधिक स्मार्ट बनता है, और वह भी बिना किसी अतिरिक्त संसाधन के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →