← नवीनतम पेपर
💬 NLP

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

यह शोध पत्र InfoLaw को प्रस्तुत करता है, जो एक नवीन डेटा-जागरूक स्केलिंग फ्रेमवर्क है जो प्रीट्रेनिंग को सूचना संचय (information accumulation) के रूप में मॉडल करता है ताकि विभिन्न डेटा मिश्रणों, गुणवत्ता भार (quality weights) और पुनरावृत्ति स्तरों के बीच LLM प्रदर्शन का सटीक अनुमान लगाया जा सके, जिससे ओवरट्रेन या डेटा-सीमित शासन (regimes) में भी इष्टतम डेटा रेसिपी चयन सक्षम हो सके।

मूल लेखक: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "InfoLaw" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: क्या बहुत अधिक होना भी बुरा है?

कल्पना कीजिए कि आप एक छात्र (AI) को अच्छी तरह लिखना सिखाने की कोशिश कर रहे हैं। आपके पास किताबों का एक विशाल पुस्तकालय है, लेकिन उनमें से केवल कुछ ही वास्तव में उच्च गुणवत्ता वाले क्लासिक्स (उत्कृष्ट कृतियाँ) हैं। बाकी या तो औसत दर्जे की हैं या बस ठीक-ठाक हैं।

अतीत में, शोधकर्ताओं ने सोचा कि सबसे अच्छी रणनीति यह है कि आप छात्र को केवल उच्च-गुणवत्ता वाले क्लासिक्स ही दें। लेकिन इसमें एक पेंच है: छात्र के पूरे अध्ययन कार्यक्रम को भरने के लिए पर्याप्त क्लासिक्स उपलब्ध नहीं हैं। यदि आप छात्र को समय भरने के लिए उन्हीं 100 क्लासिक्स को बार-बार पढ़ने के लिए मजबूर करते हैं, तो वे अंततः ऊब जाते हैं, एक ही वाक्यांशों को दोहराने लगते हैं, और उनका प्रदर्शन वास्तव में खराब हो जाता है। इसे "दोहराव" (repetition) कहा जाता है।

दूसरी ओर, यदि आप समय भरने के लिए कुछ कम गुणवत्ता वाली किताबें मिला देते हैं, तो छात्र अधिक विविधता सीखता है, लेकिन वह कुछ बुरी आदतें भी सीख सकता है।

बड़ा सवाल यह है: हमें उच्च-गुणवत्ता वाली किताबों को कितनी बार दोहराना चाहिए, और हमें कम-गुणवत्ता वाली किताबों को कितना मिलाना चाहिए?

पुराना तरीका: एक टूटे हुए मानचित्र के साथ अनुमान लगाना

पहले, वैज्ञानिक यह अनुमान लगाने के लिए "स्केलिंग लॉज़" (Scaling Laws) का उपयोग करते थे कि एक AI कैसा प्रदर्शन करेगा। इन नियमों को एक ऐसे मानचित्र के रूप में सोचें जो कहता है, "यदि आप 10 घंटे पढ़ाई करते हैं, तो आपको 'B' ग्रेड मिलता है; यदि आप 100 घंटे पढ़ाई करते हैं, तो आपको 'A' ग्रेड मिलता है।"

हालाँकि, यह पेपर तर्क देता है कि जब आप एक ही उच्च-गुणवत्ता वाले डेटा को दोहराना शुरू करते हैं, तो यह पुराना मानचित्र विफल हो जाता है।

  • खामी: पुराना मानचित्र यह मानता है कि अधिक अध्ययन का समय हमेशा बेहतर ग्रेड की ओर ले जाता है। यह इस तथ्य को ध्यान में नहीं रखता कि एक ही किताब को 50 बार पढ़ने से पहली 5 बार के बाद कोई मदद नहीं मिलती।
  • परिणाम: जब शोधकर्ताओं ने एक विशाल AI के प्रदर्शन की भविष्यवाणी करने के लिए पुराने मानचित्र का उपयोग करने की कोशिश की, तो मानचित्र अत्यधिक आशावादी था। इसने भविष्यवाणी की कि AI को पूर्ण अंक मिलेंगे, लेकिन वास्तव में, AI भ्रमित हो गया और खराब प्रदर्शन किया क्योंकि वह दोहराव के चक्र में फंस गया था।

नया समाधान: "InfoLaw" (सूचना थर्मामीटर)

लेखक एक नया ढांचा पेश करते हैं जिसे InfoLaw कहा जाता है। केवल यह गिनने के बजाय कि AI ने "कितने घंटे" पढ़ाई की (या उसने कितने टोकन देखे), InfoLaw यह मापता है कि AI ने वास्तव में "कितनी नई जानकारी" सीखी।

उन्होंने इसे इस प्रकार बनाया है:

  1. लाइब्रेरी बकेट (Library Buckets): उन्होंने अपने विशाल टेक्स्ट लाइब्रेरी को गुणवत्ता के आधार पर 6 बकेट (हिस्सों) में विभाजित किया ( "गोल्ड" से लेकर "जंक" तक)।
  2. मिक्सिंग रेसिपी (Mixing Recipe): उन्होंने प्रशिक्षण के लिए अलग-अलग "रेसिपी" बनाईं। कुछ रेसिपी में 80% गोल्ड बुक्स थीं (बहुत अधिक दोहराव के साथ), और अन्य गोल्ड और सिल्वर बुक्स का मिश्रण थीं (कम दोहराव के साथ)।
  3. खोज: उन्होंने पाया कि AI की लर्निंग एक विशिष्ट पैटर्न का पालन करती है:
    • क्वालिटी डेंसिटी (Quality Density): उच्च-गुणवत्ता वाली किताबें पहली बार पढ़ने पर एक बड़ा "इन्फॉर्मेशन बूस्ट" देती हैं।
    • घटता हुआ प्रतिफल (The Diminishing Returns): हर बार जब आप एक किताब को दोबारा पढ़ते हैं, तो वह बूस्ट छोटा होता जाता है, जैसे एक बैटरी खत्म हो रही हो। अंततः, उसे दोबारा पढ़ने से लगभग शून्य मूल्य जुड़ता है।
    • फॉर्मूला: उन्होंने एक गणितीय सूत्र बनाया जो यह गणना करता है कि AI ने किताबों की गुणवत्ता और उन्हें कितनी बार दोहराया गया, दोनों को मिलाकर कुल कितनी "सूचना" (Information) ग्रहण की।

जादुई परिणाम: एक सीधी रेखा

इस पेपर का सबसे प्रभावशाली हिस्सा वह है जो हुआ जब उन्होंने केवल "समय बिताने" के बजाय इस नए "सूचना" मीट्रिक का उपयोग करके अपने परिणामों को प्लॉट किया।

  • पहले: जब उन्होंने समय के आधार पर परिणामों को प्लॉट किया, तो डेटा पॉइंट्स इधर-उधर बिखरे हुए थे। उच्च दोहराव वाली रेसिपी एक रेसिपी से बिल्कुल अलग दिखती थी।
  • बाद में: जब उन्होंने "सूचना" (Information) के आधार पर परिणामों को प्लॉट किया, तो वे सभी बिखरे हुए बिंदु एक ही एकल, पूर्ण सीधी रेखा में सिमट गए।

इसका मतलब यह है कि आप चाहे किसी भी "रेसिपी" का उपयोग करें (उच्च गुणवत्ता के साथ दोहराव, या मिश्रित गुणवत्ता), यदि आप जानते हैं कि AI ने कुल कितनी "सूचना" प्राप्त की है, तो आप सटीक रूप से भविष्यवाणी कर सकते हैं कि वह कैसा प्रदर्शन करेगा।

हम इससे क्या कर सकते हैं?

चूंकि उनके पास यह पूर्ण सीधी रेखा (InfoLaw) है, इसलिए अब वे विशाल मॉडल को प्रशिक्षित करने में लाखों डॉलर खर्च किए बिना दो बहुत उपयोगी काम कर सकते हैं:

  1. भविष्यवाणी करना: वे एक छोटे, सस्ते मॉडल (जैसे 250-मिलियन-पैरामीटर वाला मॉडल) को एक विशिष्ट रेसिपी के साथ प्रशिक्षित कर सकते हैं। InfoLaw का उपयोग करके, वे सटीक रूप से भविष्यवाणी कर सकते हैं कि एक विशाल 7-बिलियन-पैरामीटर वाला मॉडल उसी रेसिपी के साथ कैसा प्रदर्शन करेगा।
  2. परफेक्ट रेसिपी खोजना: वे फॉर्मूले का उपयोग करके "इष्टतम मिश्रण" (optimal mix) की गणना कर सकते हैं। उन्होंने पाया कि:
    • छोटे मॉडल (या छोटा बजट) उच्चतम गुणवत्ता वाले डेटा पर ध्यान केंद्रित करने चाहिए, भले ही इसका मतलब उसे थोड़ा दोहराना ही क्यों न हो।
    • बड़े मॉडल (या बड़ा बजट) विविधता से अधिक लाभान्वित होते हैं। उन्हें दोहराव के "बोरियत" से बचने के लिए कम-गुणवत्ता वाले डेटा को अधिक मिलाना चाहिए।

सारांश उपमा (Analogy)

AI को प्रशिक्षित करना एक स्टू (Stew/सूप) बनाने जैसा है।

  • पुरानी विधि: आप केवल यह मापते हैं कि बर्तन कितनी देर तक उबलता रहा। आप मानते हैं कि 1 घंटा उबलने से हमेशा 10 घंटे उबलने से बेहतर होता है। लेकिन अगर आप बार-बार वही 3 आलू डालते रहेंगे, तो स्टू अजीब और नमकीन हो जाएगा (दोहराव नुकसान पहुँचाता है)।
  • InfoLaw: यह विधि सामग्रियों से निकाले गए वास्तविक "स्वाद" (Flavor) को मापती है। यह जानता है कि उबालने का पहला घंटा आलू का 90% स्वाद निकालता है, लेकिन 10वां घंटा लगभग कुछ भी नहीं निकालता।
  • लाभ: अब, एक विशाल बर्तन के लिए कितना नमक और कितने आलू डालने हैं, इसका अनुमान लगाने के बजाय, आप तुरंत "फ्लेवर फॉर्मूला" का उपयोग करके सही रेसिपी की गणना कर सकते हैं, जिससे आप सामग्री और समय बर्बाद करने से बच सकते हैं।

मुख्य निष्कर्ष: यह पेपर साबित करता है कि बेहतर AI को प्रशिक्षित करने के लिए, हमें केवल यह नहीं देखना चाहिए कि हम कितना डेटा उपयोग कर रहे हैं, बल्कि यह देखना चाहिए कि वह डेटा कितनी नई जानकारी प्रदान करता है, खासकर जब हमें उच्च-गुणवत्ता वाले डेटा को दोहराने के लिए मजबूर किया जाता है। यह हमें प्रदर्शन की सटीक भविष्यवाणी करने और किसी भी आकार के AI के लिए सर्वोत्तम डेटा मिश्रण चुनने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →