← नवीनतम पेपर
💬 NLP

How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

यह शोध पत्र एक व्यवस्थित अध्ययन प्रस्तुत करता है जो यह पहचानता है कि उच्च-गुणवत्ता वाले सिंथेटिक प्रीट्रेनिंग के लिए संरचित आउटपुट प्रारूप और स्रोत डेटा चयन महत्वपूर्ण हैं, जिससे **FinePhrase** का निर्माण हुआ है, जो एक लागत प्रभावी 486-बिलियन-टोकन वाला डेटासेट है जो मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि 1B पैरामीटर से बड़े जनरेटर मॉडल कोई अतिरिक्त लाभ नहीं देते हैं।

मूल लेखक: Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf

प्रकाशित 2026-04-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (एक लार्ज लैंग्वेज मॉडल) को दुनिया के सर्वश्रेष्ठ विशेषज्ञ बनने के लिए सिखाने की कोशिश कर रहे हैं। आपके पास किताबों का एक विशाल पुस्तकालय (इंटरनेट) है, लेकिन उनमें से कई बिखरी हुई हैं, जिनमें गलतियाँ हैं, या जो भ्रमित करने वाली बोलचाल की भाषा में लिखी गई हैं। आपको उन्हें साफ करना होगा और जानकारी को इस तरह से प्रस्तुत करना होगा जिससे छात्र सबसे तेजी से सीख सके।

लंबे समय तक, शोधकर्ताओं को लगा कि ऐसा करने का एकमात्र तरीका "परफेक्ट" किताबें खोजना है। लेकिन इंटरनेट पर उच्च-गुणवत्ता वाले टेक्स्ट खत्म हो रहे हैं। इसलिए, शोधकर्ताओं ने इस बिखरी हुई सामग्री को बेहतर संस्करणों में पुनर्लेखन (rewrite) करने के लिए AI का उपयोग करना शुरू किया। इसे सिंथेटिक डेटा (Synthetic Data) कहा जाता है।

हालाँकि, अब तक, किसी को नहीं पता था कि उन्हें सबसे अच्छी तरह से कैसे पुनर्लिखित किया जाए। क्या AI को एक सख्त शिक्षक की तरह व्यवहार करना चाहिए? एक बातूनी दोस्त की तरह? क्या उन्हें पुनर्लेखन के लिए एक सुपर-स्मार्ट (और महंगे) AI का उपयोग करना चाहिए, या एक छोटा, सस्ता AI काफी है?

Hugging Face टीम का पेपर "How Can We Synthesize High-Quality Pretraining Data?" एक विशाल कुकिंग कॉम्पिटिशन की तरह है जहाँ उन्होंने यह पता लगाने के लिए हर संभव रेसिपी का परीक्षण किया कि असली 'सीक्रेट सॉस' क्या है। उन्होंने यह जानने के लिए एक ट्रिलियन से अधिक टोकन (शब्द) उत्पन्न किए।

यहाँ उनके निष्कर्ष दिए गए हैं, जिन्हें सरल भाषा में समझाया गया है:

1. "फॉर्मेट" (प्रारूप) "शेफ" से अधिक महत्वपूर्ण है

उपमा: कल्पना कीजिए कि आप एक बच्चे को गणित सिखा रहे हैं।

  • विकल्प A: आप उन्हें टेक्स्ट का एक बिखरा हुआ पैराग्राफ देते हैं जिसमें एक गणित की समस्या शामिल है।
  • विकल्प B: आप उस टेक्स्ट को एक स्पष्ट, चरण-दर-चरण गणित की शब्द समस्या (math word problem) और उसके समाधान में बदल देते हैं।
  • विकल्प C: आप इसे एक FAQ (अक्सर पूछे जाने वाले प्रश्न) या एक तालिका (Table) में बदल देते हैं।

निष्कर्ष: शोधकर्ताओं ने पाया कि विकल्प B, C, और D (स्ट्रक्चर्ड फॉर्मेट) जादुई थे। जब उन्होंने AI को वेब टेक्स्ट को गणित की समस्याओं, FAQ, तालिकाओं या ट्यूटोरियल में बदलने के लिए मजबूर किया, तो छात्र ने कहीं अधिक तेजी से सीखा।

  • क्यों? यह लेगो ब्रिक्स (Lego bricks) के बिखरे हुए ढेर को एक स्पष्ट निर्देश पुस्तिका में बदलने जैसा है। संरचना मस्तिष्क (मॉडल) को केवल टेक्स्ट की एक दीवार पढ़ने की तुलना में तर्क को बेहतर ढंग से समझने में मदद करती है।
  • आश्चर्य: उन्हें लगा था कि उन्हें इन निर्देशों को लिखने के लिए एक "सुपर शेफ" (एक विशाल, महंगा AI मॉडल) की आवश्यकता होगी। वे गलत थे। एक छोटा, सस्ता "जूनियर शेफ" (एक 1.7 बिलियन पैरामीटर वाला मॉडल) ने "मास्टर शेफ" (एक 27 बिलियन पैरामीटर वाला मॉडल) के समान ही अच्छा काम किया। वास्तव में, बड़े शेफ कभी-कभी बहुत कठोर और दोहराव वाले हो जाते थे, जिससे वास्तव में सीखने में बाधा आती थी।

2. "असली" चीजों को फेंकें नहीं

उपमा: कल्पना कीजिए कि आप एक स्मूदी बना रहे हैं।

  • सिंथेटिक डेटा (Synthetic Data) एक हाई-टेक, फ्लेवर-एन्हांस्ड पाउडर की तरह है।
  • असली वेब डेटा (Real Web Data) ताजे, असली फलों की तरह है।

निष्कर्ष: यदि आप केवल पाउडर (सिंथेटिक डेटा) से स्मूदी बनाते हैं, तो इसका स्वाद अजीब होता है और छात्र भ्रमित हो जाता है कि वास्तविक लोग कैसे बात करते हैं। मॉडल अपनी "कॉमन सेंस" खोने लगता है।

  • समाधान: आपको इस पाउडर को असली फल के साथ मिलाना चाहिए। सबसे अच्छे परिणाम तब मिले जब पुनर्लिखित सिंथेटिक डेटा को मूल, उच्च-गुणवत्ता वाले वेब टेक्स्ट के साथ मिलाया गया। सिंथेटिक डेटा तर्क और तथ्यों को सिखाता है, जबकि वास्तविक डेटा मॉडल को स्वाभाविक रूप से बोलना और मानवीय बारीकियों को समझना सिखाता है।

3. "कच्चे माल" की गुणवत्ता उतनी महत्वपूर्ण नहीं है जितना आप सोचते हैं

उपमा: आपके पास थोड़े खराब सेबों (कम गुणवत्ता वाला वेब टेक्स्ट) का ढेर है और एकदम सही सेबों का ढेर है।

  • पुरानी धारणा: आपको एक बेहतरीन पाई बनाने के लिए एकदम परफेक्ट सेबों की आवश्यकता है।
  • नई खोज: यदि आपके पास एक बेहतरीन रेसिपी (स्ट्रक्चर्ड प्रॉम्प्ट्स) है और आप पाई को थोड़े से परफेक्ट एप्पल सॉस (हाई-क्वालिटी मिक्स-इन डेटा) के साथ मिलाते हैं, तो आप वास्तव में खराब सेबों का उपयोग कर सकते हैं और फिर भी एक स्वादिष्ट पाई बना सकते हैं!
  • क्यों? पुनर्लेखन की प्रक्रिया खराब डेटा को "अप-साइकिल" (up-cycles) करती है। यह बिखरी हुई जानकारी को लेती है और उसे एक साफ, तार्किक प्रारूप में ढाल देती है। जब तक आप इसे कुछ उच्च-गुणवत्ता वाले डेटा के साथ मिलाते हैं, तब तक मूल टेक्स्ट का स्रोत उतना मायने नहीं रखता।

4. "टेम्पलेट कोलैप्स" (Template Collapse) का जाल

उपमा: कल्पना कीजिए कि एक रोबोट शिक्षक बहुत अधिक 'परफेक्ट' है। हर बार जब वह किसी अवधारणा को समझाता है, तो वह बिल्कुल एक ही वाक्य संरचना, एक ही फॉन्ट और एक ही लहजे का उपयोग करता है।

  • समस्या: छात्र ऊब जाता है और सीखना बंद कर देता है क्योंकि सब कुछ एक जैसा महसूस होता है। इसे "टेम्पलेट कोलैप्स" कहा जाता है।
  • निष्कर्ष: शोधकर्ताओं ने पाया कि "जूनियर शेफ" (SmolLM2) वास्तव में बेहतर था क्योंकि वह थोड़ा बिखरा हुआ और विविध था। उसने नियमों का बहुत सख्ती से पालन नहीं किया। इस विविधता ने छात्र के मस्तिष्क को व्यस्त रखा। "मास्टर शेफ" (Qwen 3) बहुत अधिक परफेक्ट और दोहराव वाला था, जिसने वास्तव में प्रशिक्षण को कम प्रभावी बना दिया।

परिणाम: FINEPHRASE

इन खोजों का उपयोग करते हुए, टीम ने FINEPHRASE नामक एक नया डेटासेट बनाया।

  • इसमें 486 बिलियन टोकन का पुनर्लिखित वेब टेक्स्ट शामिल है।
  • इसे एक छोटे, सस्ते मॉडल का उपयोग करके बनाया गया था (जिससे उनका बहुत पैसा बचा)।
  • यह पिछले तरीकों की तुलना में 30 गुना सस्ता है।
  • प्रदर्शन: जब उन्होंने इस डेटा पर एक मॉडल को प्रशिक्षित किया, तो इसने सभी पिछले "सिंथेटिक" रिकॉर्ड्स को पीछे छोड़ दिया। इसने तथ्यों और तर्क को उम्मीद से बेहतर सीखा, जबकि अपनी प्राकृतिक भाषा के कौशल को भी बनाए रखा।

मुख्य निष्कर्ष (The Big Takeaway)

अगली पीढ़ी के AI को बनाने के लिए, आपको डेटा को फिर से लिखने के लिए सबसे बड़े सुपरकंप्यूटरों पर अरबों डॉलर खर्च करने की आवश्यकता नहीं है। इसके बजाय, आपको बेहतर रेसिपी की आवश्यकता है।

  • बिखरे हुए टेक्स्ट को स्पष्ट, स्ट्रक्चर्ड फॉर्मेट (जैसे गणित, तालिका और FAQ) में पुनर्लिखित (Rewrite) करें।
  • इस नए डेटा को वास्तविक, उच्च-गुणवत्ता वाले मानव टेक्स्ट के साथ मिलाएं (Mix)
  • पुनर्लेखन के लिए एक छोटे, कुशल AI का उपयोग करें, और उसे रोबोटिक होने के बजाय थोड़ा रचनात्मक होने दें।

यह "बड़ा ही बेहतर है" (bigger is better) से बदलकर "स्मार्ट स्ट्रक्चर ही बेहतर है" (smarter structure is better) की ओर एक बदलाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →