← नवीनतम पेपर
💬 NLP

Towards Next-Generation LLM Training: From the Data-Centric Perspective

यह शोध पत्र दो प्रमुख दिशाओं का प्रस्ताव करते हुए अगली पीढ़ी के एलएलएम (LLM) प्रशिक्षण की वकालत करता है: स्वचालित, सुदृढ़ डेटा तैयारी वर्कफ़्लो के लिए एजेंट-आधारित प्रणालियों का विकास, और प्रदर्शन को अनुकूलित करने के लिए गतिशील डेटा चयन, मिश्रण और पुन: भारण (reweighting) को सक्षम करने वाले एकीकृत प्रशिक्षण ढांचे का निर्माण।

मूल लेखक: Hao Liang, Zhengyang Zhao, Zhaoyang Han, Meiyi Qiang, Xiaochen Ma, Bohan Zeng, Qifeng Cai, Zhiyu Li, Linpeng Tang, Weinan E, Wentao Zhang

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Liang, Zhengyang Zhao, Zhaoyang Han, Meiyi Qiang, Xiaochen Ma, Bohan Zeng, Qifeng Cai, Zhiyu Li, Linpeng Tang, Weinan E, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत छोटे छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) को सारा मानव ज्ञान प्राप्त करने में माहिर बनने के लिए सिखाने की कोशिश कर रहे हैं।

अभी, इस छात्र को सिखाने का तरीका थोड़ा अराजक है। हम उनके सामने किताबों, पत्रिकाओं और इंटरनेट पोस्टों का एक विशाल, बिखरा हुआ ढेर रख देते हैं और कहते हैं, "सब कुछ पढ़ो, बेतरतीब क्रम में, और सीखो।" और हम इस ढेर को छाँटने के लिए कैंची और गोंद के साथ हफ्तों तक मैन्युअल रूप से काम करते हैं, ताकि अच्छे हिस्सों को काट सकें और कचरे को फेंक सकें। यह धीमा है, महंगा है, और अक्सर हम सबसे अच्छे सबक चूक जाते हैं।

यह शोध पत्र, जो पेकिंग यूनिवर्सिटी और अन्य शोधकर्ताओं द्वारा लिखा गया है, "क्लासरूम चलाने के एक नए तरीके" का सुझाव देता है। वे इसे एक "डेटा-सेंट्रिक" (Data-Centric) दृष्टिकोण कहते हैं, और वे हमारी वर्तमान समस्याओं को ठीक करने के लिए दो मुख्य अपग्रेड प्रस्तावित करते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "अराजक पुस्तकालय" और "स्थिर पाठ्यक्रम"

वर्तमान में, AI के लिए डेटा तैयार करना एक ऐसे लाइब्रेरियन की तरह है जो एक ऐसे पुस्तकालय को व्यवस्थित करने की कोशिश कर रहा है जहाँ किताबें फर्श पर बिखरी हुई हैं, अलग-अलग भाषाओं में लिखी गई हैं, और कुछ फटी हुई हैं।

  • अराजकता (The Mess): शोधकर्ता वर्तमान में इस डेटा को साफ करने के लिए "एड हॉक स्क्रिप्ट्स" (एक बार के लिए बनाए गए, कस्टम-मेड टूल्स) का उपयोग करते हैं। यह हर एक किताब के लिए अलग कैंची का उपयोग करने जैसा है। यह दोहराव वाला है, त्रुटियों की संभावना रखता है, और यदि कुछ गलत हो जाए तो इसे ठीक करना कठिन है।
  • स्थिर पाठ्यक्रम (The Static Syllabus): एक बार जब डेटा को साफ कर लिया जाता है, तो हम इसे एक विशाल, अपरिवर्तित बैच में AI को खिला देते हैं। यह छात्र को 10,000 पन्नों की एक पाठ्यपुस्तक देने और उसे बिना रुके पेज 1 से पेज 10,000 तक पढ़ने के लिए कहने जैसा है, चाहे वह ऊब रहा हो, भ्रमित हो, या वह सामग्री पहले से ही जानता हो। हम यह नहीं देखते कि छात्र कैसे सीख रहा है और उसके आधार पर पाठ योजना को समायोजित नहीं करते हैं।

2. समाधान A: "AI लाइब्रेरियन" (स्वचालित डेटा तैयारी प्रणाली)

लेखक मैन्युअल कैंची-और-गोंद वाले काम को बदलने के लिए एक स्मार्ट, स्वचालित लाइब्रेरियन (एक "एजेंट") बनाने का प्रस्ताव देते हैं।

  • यह कैसे काम करता है: डेटा को साफ करने के लिए जटिल कोड लिखने के बजाय, आप बस इस AI लाइब्रेरियन से बात करते हैं। आप कहते हैं, "मुझे गणित की समस्याओं के लिए एक डेटासेट चाहिए। अच्छे वाले ढूँढो, डुप्लिकेट्स को बाहर निकालो, भ्रमित करने वाले प्रश्नों को स्पष्ट बनाने के लिए उन्हें फिर से लिखो, और मुझे बताओ कि हमारे पास कितने पन्ने हैं।"
  • जादू (The Magic): लाइब्रेरियन आपकी रिक्वेस्ट को समझता है। वह स्वचालित रूप से सही टूल्स चुनता है (जैसे कि डुप्लिकेट हटाने के लिए "डीडुप्लिकेशन टूल" या व्याकरण ठीक करने के लिए "रीराइटिंग टूल"), उन्हें एक वर्कफ़्लो में जोड़ता है, और काम पूरा करता है।
  • लाभ: यह एक अराजक, मैन्युअल प्रक्रिया को एक सुचारू, दोहराने योग्य असेंबली लाइन में बदल देता है। यदि आपको बाद में नियम बदलने की आवश्यकता है, तो आप बस लाइब्रेरियन को बताते हैं, और वह प्रक्रिया को तुरंत फिर से चला देता है।

3. समाधान B: "डायनेमिक ट्यूटर" (एकीकृत डेटा-मॉडल इंटरेक्शन सिस्टम)

दूसरा अपग्रेड इस बारे में है कि AI छात्र वास्तव में डेटा से कैसे सीखता है। वर्तमान में, डेटा निष्क्रिय है। लेखक चाहते हैं कि डेटा सक्रिय (active) हो।

कल्पना कीजिए कि एक व्यक्तिगत ट्यूटर वास्तविक समय में छात्र को समस्या हल करते हुए देखता है।

  • चयन (सही किताबें चुनना): यदि छात्र जोड़ (addition) में बहुत अच्छा है लेकिन भिन्न (fractions) में बहुत खराब है, तो ट्यूटर उन्हें जोड़ की समस्या दिखाना बंद कर देता है और केवल भिन्न की समस्याओं पर ध्यान केंद्रित करता है। सिस्टम गतिशील रूप से उस क्षण के लिए सबसे उपयोगी डेटा चुनता है।
  • मिश्रण (आहार को संतुलित करना): यदि छात्र गणित से ऊब रहा है, तो ट्यूटर उन्हें व्यापक रूप से व्यस्त रखने और सीखने के लिए विज्ञान या इतिहास में शामिल करता है। सिस्टम डेटा के प्रकारों के "नुस्खे" (recipe) को ऑन-द-फ्लाई (तुरंत) समायोजित करता है।
  • रीवेटिंग (कठिन चीजों पर ध्यान केंद्रित करना): यदि छात्र किसी विशिष्ट अवधारणा के साथ संघर्ष करता है, तो ट्यूटर उस अवधारणा को अतिरिक्त ध्यान (उच्च "वेट") देता है, और उन आसान चीजों को सरसरी तौर पर देखता है जिन्हें वह पहले से ही जानता है।

परिणाम: एक स्थिर पुस्तक पढ़ने के बजाय, AI का अपने प्रशिक्षण डेटा के साथ एक गतिशील संवाद (dynamic conversation) होता है। डेटा AI की वर्तमान जरूरतों के अनुसार बदलता और अनुकूलित होता है।

4. बड़ी तस्वीर: निष्क्रिय से सक्रिय की ओर

इस शोध पत्र का मूल संदेश मानसिकता में बदलाव है:

  • पुराना तरीका: डेटा केवल एक निष्क्रिय सामग्री है, जैसे केक में आटा। आप इसे एक बार मिलाते हैं, बेक करते हैं, और बेहतर होने की उम्मीद करते हैं।
  • नया तरीका: डेटा सीखने की प्रक्रिया में एक सक्रिय भागीदार है। यह एक कोच की तरह है जो एथलीट के प्रदर्शन के आधार पर वास्तविक समय में प्रशिक्षण अभ्यास को समायोजित करता है।

यह क्यों मायने रखता है?

जैसे-जैसे AI मॉडल बड़े और स्मार्ट होते जा रहे हैं, हमारे पास इंटरनेट पर "अच्छे" डेटा की कमी होती जा रही है। हम उन्हें बस अधिक कच्चा डेटा डालना जारी नहीं रख सकते; यह अक्षम है।

  • AI लाइब्रेरियन का उपयोग करके, हम डेटा को साफ करने में लगने वाले समय और पैसे को बचाते हैं।
  • डायनेमिक ट्यूटर का उपयोग करके, हम AI को कम डेटा से अधिक सीखने में मदद करते हैं, जिससे "घटते प्रतिफल" (diminishing returns) से बचा जा सकता है जहाँ अधिक डेटा जोड़ने से कोई लाभ नहीं होता।

संक्षेप में, यह शोध पत्र AI के लिए एक स्मार्टर, अधिक कुशल स्कूल सिस्टम बनाने का ब्लूप्रिंट है, जहाँ पाठ्यक्रम स्वचालित रूप से उत्पन्न होता है और लगातार समायोजित किया जाता है ताकि यह सुनिश्चित हो सके कि छात्र सही चीज़ें सही समय पर सीख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →