← नवीनतम पेपर
💬 NLP

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

यह शोध पत्र यह प्रदर्शित करता है कि जर्मन भाषा मॉडलिंग के लिए, फ़िल्टर किए गए डेटा के एक छोटे, उच्च-गुणवत्ता वाले उपसमुच्चय पर बार-बार प्रशिक्षण लेना, बड़े और विविध कॉर्पोरा पर सिंगल-पास प्रशिक्षण की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे काफी कम टोकन के साथ अत्याधुनिक प्रदर्शन सक्षम होता है।

मूल लेखक: Ansar Aynetdinov, Patrick Haller, Alan Akbik

प्रकाशित 2026-05-01
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ansar Aynetdinov, Patrick Haller, Alan Akbik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जर्मन बोलना सिखाने की कोशिश कर रहे हैं। आपके पास चुनने के लिए दो मुख्य रणनीतियाँ हैं, और यह शोध पत्र यह देखने के लिए एक बड़ा प्रयोग है कि कौन सी बेहतर काम करती है।

दुविधा: बुफे बनाम मास्टरक्लास

  • रणनीति A (बुफे): आप इंटरनेट से जर्मन टेक्स्ट का एक विशाल, अराजक बुफे इकट्ठा करते हैं। इसमें सब कुछ है: उच्च-गुणवत्ता वाली खबरें, उपयोगी ट्यूटोरियल, लेकिन साथ ही स्पैम, टूटे हुए वाक्य और दोहराव वाले विज्ञापन भी हैं। आप रोबोट को एक बार में सब कुछ थोड़ा-थोड़ा खाने देते हैं। विचार यह है: "विविधता अधिक होना बेहतर है।"
  • रणनीति B (मास्टरक्लास): आप एक सख्त संपादक की तरह व्यवहार करते हैं। आप स्पैम, टूटे हुए वाक्यों और फालतू चीजों को फेंक देते हैं। आप केवल "स्वर्ण" (gold) रखते हैं—स्पष्ट, तथ्य-समृद्ध, शैक्षिक दस्तावेज़। लेकिन क्योंकि आपने बहुत कुछ फेंक दिया है, इसलिए आपके पास एक पूर्ण भोजन के लिए पर्याप्त भोजन नहीं है। इसलिए, आप इस छोटे, उच्च-गुणवत्ता वाले प्लेट को रोबोट को परोसते हैं, और फिर आप इसे फिर से, फिर से, और फिर से परोसते हैं। आप रोबोट को वही सटीक भोजन कई बार खाने देते हैं।

प्रयोग

हुमबोल्ट-यूनिवर्सिटैट ज़ु बर्लिन (Humboldt-Universität zu Berlin) के शोधकर्ता जानना चाहते थे कि: क्या रोबोट को एक बार में एक विशाल बुफे खिलाना बेहतर है, या कई बार एक छोटा, उत्तम भोजन खिलाना बेहतर है?

उन्होंने एक "गुणवत्ता फ़िल्टर" (एक बहुत ही स्मार्ट छलनी की तरह) बनाया जो "स्वर्ण" जर्मन टेक्स्ट को "कचरे" से अलग करता है। उन्होंने सबसे अच्छे दस्तावेजों का एक छोटा, सुपर-डेंस ढेर बनाया (जिसे डेंस कोर (Dense Core) कहा गया)।

परिणाम: मात्रा से अधिक गुणवत्ता

शोध पत्र का दावा है कि रणनीति B (मास्टरक्लास) हर बार जीतती है।

यहाँ एक उपमा (analogy) दी गई है:
कल्पना कीजिए कि आप एक जटिल नृत्य सीखने की कोशिश कर रहे हैं।

  • बुफे दृष्टिकोण एक हजार अलग-अलग वीडियो देखने जैसा है जिनमें लोग नाच रहे हैं, लेकिन उनमें से आधे धुंधले हैं, संगीत कटा हुआ है, और कुछ लोग बस इधर-उधर घूम रहे हैं। आप बहुत सारे मूव्स देखते हैं, लेकिन आप वास्तव में कदम ठीक से नहीं सीख पाते क्योंकि सिग्नल कमजोर है।
  • मास्टरक्लास दृष्टिकोण एक मास्टर डांसर के एक आदर्श, क्रिस्टल-क्लियर वीडियो को देखने जैसा है। आप इसे एक बार देखते हैं, फिर आप इसे फिर से देखते हैं, फिर देखते हैं, फिर देखते हैं। आप उन सूक्ष्म विवरणों पर ध्यान देते हैं जो आपने पहली बार में छोड़ दिए थे। तीसरी या चौथी बार तक, आप उस व्यक्ति से बेहतर नृत्य जानते हैं जिसने एक हजार धुंधले वीडियो देखे थे।

मुख्य निष्कर्ष सरल शब्दों में:

  1. दोहराव जादू है: भले ही उन्होंने "परफेक्ट वीडियो" (उच्च-गुणवत्ता वाले डेटा) को 7 बार देखा हो, रोबोट और भी स्मार्ट होता गया। वह बोर या भ्रमित नहीं हुआ। वास्तव में, उसने दोहराव से उतना ही सीखा जितना कि उसने एक बार में विशाल और अव्यवस्थित डेटा को देखकर सीखा था।
  2. कम ही अधिक है: जिन रोबोटों को छोटे, उच्च-गुणवत्ता वाले ढेर (कई बार दोहराए गए) पर प्रशिक्षित किया गया था, वे उन रोबोटों की तुलना में जर्मन समझने और बोलने में बेहतर थे जिन्हें 10 से 360 गुना अधिक डेटा (जो कम फ़िल्टर किया गया था) पर प्रशिक्षित किया गया था।
  3. आदेशों का पालन करने में बेहतर: जब उनसे इन रोबोटों को सहायक के रूप में कार्य करने के लिए कहा गया (जैसे सवालों के जवाब देना या ईमेल लिखना), तो "मास्टरक्लास" डेटा पर प्रशिक्षित रोबोट बहुत अधिक सटीक और सहायक थे। "बुफे" डेटा पर प्रशिक्षित रोबोट गलतियाँ करने या अजीब जवाब देने की अधिक संभावना रखते थे।
  4. "अनुवाद" की समस्या: शोधकर्ताओं ने यह भी देखा कि मौजूदा जर्मन AI परीक्षण दोषपूर्ण थे क्योंकि वे व्याकरण को ठीक किए बिना अंग्रेजी से मशीन-अनुवादित थे। उन्होंने इन परीक्षणों को ठीक किया (जैसे एक टूटे हुए मानचित्र को साफ करना) ताकि यह सुनिश्चित हो सके कि वे रोबोटों का निष्पक्ष रूप से परीक्षण कर रहे हैं।

निष्कर्ष (The Bottom Line)

जर्मन जैसी भाषाओं के लिए (जिनमें डेटा बहुत है, लेकिन अंग्रेजी की तरह ट्रिलियन शब्द नहीं हैं), यह शोध पत्र तर्क देता है कि सब कुछ पकड़ने की कोशिश न करें। चयनात्मक बनें। शोर को बाहर निकालें, सबसे अच्छा हिस्सा रखें, और AI को उस बेहतरीन चीज़ का बार-बार अध्ययन करने दें। यह इस बारे में नहीं है कि आप रोबोट को कितना खिलाते हैं; यह इस बारे में है कि भोजन कितना अच्छा है और उसे कितनी बार उसे पचाने का मौका मिलता है।

उन्होंने अपने "रोबोट्स" (जिन्हें BOLDT कहा जाता है) और अपने साफ किए गए परीक्षणों को सभी के उपयोग के लिए जारी किया, जिससे यह साबित होता है कि आप एक विशाल बजट या ढेर सारे अव्यवस्थित डेटा की आवश्यकता के बिना एक बहुत ही स्मार्ट, छोटा जर्मन AI बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →