← नवीनतम पेपर
💬 NLP

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

यह शोध पत्र प्रदर्शित करता है कि सिंथेटिक रीराइटिंग (synthetic rewriting) पुर्तगाली निरंतर प्रीट्रेनिंग (Portuguese continued pretraining) के लिए एक स्केल-डिपेंडेंट क्वालिटी मल्टीप्लायर (scale-dependent quality multiplier) के रूप में कार्य करती है, जो उच्च-गुणवत्ता वाले स्रोत डेटा पर लागू होने पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाती है लेकिन कम-गुणवत्ता वाले डेटा के लिए न्यूनतम लाभ प्रदान करती है।

मूल लेखक: Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को सीमित मात्रा में पाठ्यपुस्तकों का उपयोग करके एक नई भाषा (पुर्तगाली) सिखाने की कोशिश कर रहे हैं। आपके पास दो मुख्य प्रश्न हैं:

  1. क्या यह मायने रखता है कि पाठ्यपुस्तकें अच्छी गुणवत्ता की हैं?
  2. क्या एक स्मार्ट ट्यूटर उन पाठ्यपुस्तकों को बेहतर बनाने के लिए उन्हें फिर से लिख सकता है, भले ही मूल पाठ अस्त-व्यस्त हों?

यह शोध पत्र, जिसका शीर्षक "सिंथेटिक रीराइटिंग ए क्वालिटी मल्टीप्लायर" (गुणवत्ता गुणक के रूप में सिंथेटिक पुनर्लेखन) है, इन प्रश्नों का उत्तर देता है और एक AI के साथ एक विशाल प्रयोग चलाकर यह बताता है। यहाँ बताया गया है कि उन्होंने क्या पाया, जिसे सरल भाषा में समझाया गया है।

सेटअप: लाइब्रेरी और ट्यूटर

शोधकर्ताओं ने पुर्तगाली टेक्स्ट की एक विशाल लाइब्रेरी से शुरुआत की जिसे ClassiCC-PT कहा जाता है। उन्होंने इस लाइब्रेरी को दो ढेरों में विभाजित किया:

  • "गोल्ड" (स्वर्ण) ढेर: उच्च-गुणवत्ता वाले दस्तावेज़ (जैसे पाठ्यपुस्तकें, वैज्ञानिक पेपर और शैक्षिक सामग्री)।
  • "रफ" (खुरदरा) ढेर: कम-गुणवत्ता वाले दस्तावेज़ (जैसे बिखरे हुए फोरम पोस्ट, स्पैम, या खराब तरीके से लिखे गए ब्लॉग)।

उन्होंने अपने "बेस करिकुलम" (आधार पाठ्यक्रम) के रूप में उपयोग करने के लिए प्रत्येक ढेर से टेक्स्ट की एक छोटी, समान मात्रा (10 बिलियन शब्द) ली।

फिर वे एक सुपर ट्यूटर (एक 7-बिलियन पैरामीटर वाला AI मॉडल) लेकर आए। ट्यूटर का काम दोनों ढेरों के प्रत्येक दस्तावेज़ को चार अलग-अलग शैलियों में फिर से लिखना था:

  • ईजी (आसान): एक बच्चे के लिए सरल बनाया गया।
  • मीडियम (मध्यम): स्वच्छ और विश्वकोश जैसा (जैसे विकिपीडिया)।
  • हार्ड (कठिन): तकनीकी और औपचारिक।
  • Q&A (प्रश्न-उत्तर): क्विज़ प्रारूप में बदला गया।

इस प्रक्रिया ने बहुत सारा नया सिंथेटिक डेटा (कुल लगभग 40 बिलियन शब्द) बनाया जिससे छात्रों को सीखने के लिए सामग्री मिल सके।

छात्र: दो अलग-अलग AI मॉडल

उन्होंने इस पाठ्यक्रम का परीक्षण दो अलग-अलग "छात्रों" (AI मॉडल) पर किया:

  1. छोटा छात्र (1.1 बिलियन पैरामीटर): एक छोटा, कम शक्तिशाली मस्तिष्क।
  2. बड़ा छात्र (7 बिलियन पैरामीटर): एक बड़ा, अधिक स्मार्ट मस्तिष्क।

उन्होंने इन छात्रों को पुनर्गठित डेटा का उपयोग करके पढ़ाया और फिर उनका परीक्षण एक विशाल पुर्तगाली परीक्षा पर किया जिसे PoETa V2 (44 विभिन्न कार्य जैसे गणित, तर्क और पाठ को समझना) कहा जाता है।

बड़ी खोज: पुनर्लेखन एक "क्वालिटी मल्टीप्लायर" है

इस शोध पत्र का सबसे महत्वपूर्ण सबक यहाँ है, एक सरल उपमा का उपयोग करते हुए:

कल्पbildिए कि आपके पास एक रेसिपी (नुस्खा) है।

  • उच्च-गुणवत्ता वाला डेटा एक मिशेलिन-स्टार शेफ द्वारा लिखी गई रेसिपी की तरह है।
  • निम्न-गुणवत्ता वाला डेटा एक नैपकिन पर लिखी गई अधूरी रेसिपी की तरह है जिसमें सामग्री गायब है।
  • पुनर्लेखन (Rewriting) एक खाद्य समीक्षक द्वारा रेसिपी को चखने और निर्देशों को अधिक स्पष्ट और सटीक बनाने के लिए फिर से लिखने जैसा है।

बड़े छात्र (7B) के साथ क्या हुआ?

  • शेफ की रेसिपी + समीक्षक का पुनर्लेखन: छात्र ने अविश्वसनीय रूप से अच्छा सीखा। पुनर्लेखन ने एक सुपर-चार्जर के रूप में कार्य किया, जिससे प्रदर्शन में उल्लेखनीय वृद्धि हुई। समीक्षक ने अच्छी रेसिपी को और भी बेहतर बना दिया।
  • नैपकिन रेसिपी + समीक्षक का पुनर्लेखन: छात्र में बहुत कम सुधार हुआ। भले ही समीक्षक ने नैपकिन रेसिपी को ठीक करने की कोशिश की, लेकिन गायब सामग्री (खराब स्रोत डेटा) के कारण अंतिम व्यंजन अभी भी औसत दर्जे का ही रहा। पुनर्लेखन मौलिक खामियों को ठीक नहीं कर सका।

निष्कर्ष: पुनर्लेखन कचरे को खजाना में नहीं बदलता है। इसके बजाय, यह एक मल्टीप्लायर (गुणक) के रूप में कार्य करता है। यदि आप सोने से शुरू करते हैं, तो पुनर्लेखन इसे प्लेटिनम में बदल देता है। यदि आप सीसे (लेड) से शुरू करते हैं, तो पुनर्लेखन केवल आपको थोड़ा अधिक चमकदार सीसा ही देता है।

ट्विस्ट: आकार मायने रखता है (छोटा छात्र)

जब उन्होंने छोटे छात्र (1.1B) का परीक्षण किया, तो नियम बदल गए।

  • छोटे छात्र को पुनर्लेखन की ज्यादा परवाह नहीं थी।
  • वास्तव में, छोटा छात्र मूल, बिखरी हुई नैपकिन रेसिपी के साथ उतना ही अच्छा प्रदर्शन करता था जितना कि वह पॉलिश किए गए पुनर्लिखित डेटा के साथ करता था।

क्यों?
सोचिए कि छोटा छात्र एक ऐसे बच्चे की तरह है जो कई अलग-अलग उदाहरणों को देखकर सबसे अच्छा सीखता है, भले ही वे बिखरे हुए हों। पुनर्लिखित डेटा बहुत अधिक "स्वच्छ" और "संरचित" था, जिसने वास्तव में इसकी विविधता को कम कर दिया। छोटे छात्र को पैटर्न सीखने के लिए इंटरनेट की कच्ची अराजकता की आवश्यकता थी, जबकि बड़े छात्र को गहरे सिद्धांतों को सीखने के लिए स्वच्छ, संरचित डेटा की आवश्यकता थी।

निर्णय

  1. AI पुनर्लेखन से खराब डेटा को ठीक करने की कोशिश न करें। यदि आपका स्रोत डेटा निम्न गुणवत्ता का है, तो पुनर्लेखन आपको नहीं बचा पाएगा। आपको पहले अच्छा डेटा चुनना (क्यूरेट करना) होगा।
  2. पुनर्लेखन अच्छे डेटा के लिए एक फोर्स मल्टीप्लायर है। यदि आपके पास पहले से ही उच्च-गुणवत्ता वाला पुर्तगाली टेक्स्ट है, तो उसे विभिन्न शैलियों में फिर से लिखने से आपका AI मॉडल काफी स्मार्ट बन जाता है।
  3. बड़े मॉडलों को स्वच्छ डेटा की आवश्यकता होती है। बड़े, स्मार्ट AI मॉडल इस "क्वालिटी मल्टीप्लायर" प्रभाव से सबसे अधिक लाभ उठाते हैं। छोटे मॉडल वास्तव में पॉलिश किए गए पुनर्लेखन के बजाय कच्चे, विविध डेटा को पसंद कर सकते हैं।

संक्षेप में: सिंथेटिक पुनर्लेखन एक हाई-एंड फोटो फिल्टर की तरह है। यह एक सुंदर फोटो को शानदार बना देता है, लेकिन यह एक धुंधली, अंधेरी फोटो को मास्टरपीस में नहीं बदल सकता। आपको अभी भी एक अच्छी तस्वीर से शुरुआत करनी होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →