← नवीनतम पेपर
💻 computer science

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

यह अध्ययन प्रदर्शित करता है कि सिंथेटिक रीराइटिंग (synthetic rewriting), पुर्तगाली निरंतर प्रीट्रेनिंग (Portuguese continued pretraining) में डेटा क्यूरेशन के विकल्प के बजाय एक गुणवत्ता गुणक (quality multiplier) के रूप में कार्य करती है, जो केवल उच्च-गुणवत्ता वाले स्रोत डेटा पर लागू होने पर और मुख्य रूप से बड़े मॉडल स्केल पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाती है।

मूल लेखक: Thales Sales Almeida, Rodrigo Nogueira, Helio Pedrini

प्रकाशित 2026-09-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thales Sales Almeida, Rodrigo Nogueira, Helio Pedrini

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

लार्ज लैंग्वेज मॉडल्स आज के कई सबसे उन्नत आर्टिफिशियल इंटेलिजेंस सिस्टम के इंजन हैं, जो मानवीय विचारों की नकल करने वाली प्रवाहपूर्ण शैली के साथ टेक्स्ट लिखने, प्रश्नों के उत्तर देने और समस्याओं को हल करने में सक्षम हैं। ये सिस्टम इंटरनेट से बड़ी मात्रा में टेक्स्ट पढ़कर सीखते हैं, जिससे वे शब्दों के उपयोग और विचारों के जुड़ाव के पैटर्न को आत्मसात कर लेते हैं। हालाँकि, यह सीखने की प्रक्रिया हर भाषा के लिए समान रूप से प्रभावी नहीं है। जबकि अंग्रेजी के पास प्रशिक्षण के लिए उच्च गुणवत्ता वाले टेक्स्ट का एक विशाल पुस्तकालय उपलब्ध है, पुर्तगाली जैसी कई अन्य भाषाओं के पास बहुत कम संसाधन हैं। इस अंतर को पाटने के लिए, शोधकर्ता अक्सर एक ऐसे मॉडल को लेते हैं जिसे मुख्य रूप से अंग्रेजी पर प्रशिक्षित किया गया है और फिर उसे लक्षित भाषा में टेक्स्ट की छोटी मात्रा का उपयोग करके आगे पढ़ाते हैं। क्षेत्र में एक बढ़ता हुआ प्रश्न यह है कि क्या हम आर्टिफिशियल इंटेलिजेंस का उपयोग करके इस सीमित डेटा को और अधिक शक्तिशाली बना सकते हैं? विचार यह है कि यदि कोई कंप्यूटर एक अव्यवस्थित या सरल वाक्य को लेकर उसे अधिक स्पष्ट, संरचित या विस्तृत बनाने के लिए फिर से लिख सकता है, तो मॉडल बेहतर संस्करण से बेहतर सीख सकता है। लेकिन एक महत्वपूर्ण अनिश्चितता बनी हुई है: क्या यह रीराइटिंग (पुनर्लेखन) तकनीक खराब गुणवत्ता वाले टेक्स्ट पर समान रूप से काम करती है, या यह केवल उस टेक्स्ट के मूल्य को बढ़ाती है जो पहले से ही अच्छा था?

ब्राजील के कैम्पिनास विश्वविद्यालय के शोधकर्ताओं की एक टीम ने पुर्तगाली भाषा के मॉडल्स के साथ एक नियंत्रित प्रयोग करके इस प्रश्न का उत्तर देने का प्रयास किया। उन्होंने पुर्तगाली दस्तावेजों के एक विशाल संग्रह से शुरुआत की जिन्हें पहले ही गुणवत्ता के आधार पर ग्रेड दिया जा चुका था, जो लेखन की गुणवत्ता और सूचना की उपयोगिता के आधार पर निम्न से उच्च तक थे। इस संग्रह से, उन्होंने डेटा के तीन अलग-अलग समूह बनाए: एक समूह जिसमें केवल उच्चतम गुणवत्ता वाले दस्तावेज़ थे, दूसरा जिसमें सबसे निम्न-गुणवत्ता वाले दस्तावेज़ थे, और तीसरा समूह जो सब कुछ का एक यादृच्छिक मिश्रण था। प्रत्येक समूह के लिए, उन्होंने एक अलग आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करके टेक्स्ट को चार अलग-अलग शैलियों में फिर से लिखा, जैसे कि आसान पढ़ने के लिए एक सरल संस्करण, एक औपचारिक विश्वकोश शैली, एक तकनीकी संस्करण, और एक प्रश्न-उत्तर प्रारूप। इस प्रक्रिया ने एक बड़ी मात्रा में नया, सिंथेटिक (कृत्रिम) टेक्स्ट तैयार किया। इसके बाद उन्होंने इन पुनर्गठित डेटासेट्स पर दो अलग-अलग कंप्यूटर मॉडल—एक छोटा और एक बड़ा—को प्रशिक्षित किया ताकि यह देखा जा सके कि मूल गुणवत्ता और रीराइटिंग का संयोजन अंतिम परिणामों को कैसे प्रभावित करता है।

निष्कर्षों ने एक स्पष्ट और आश्चर्यजनक पैटर्न का खुलासा किया जो खराब डेटा को ठीक करने की उम्मीद को चुनौती देता है। जब शोधकर्ताओं ने बड़े मॉडल का उपयोग किया, तो रीराइटिंग तकनीक ने खामियों को ठीक करने के बजाय गुणवत्ता के मल्टीप्लायर (गुणक) के रूपă में कार्य किया। उच्च-गुणवत्ता वाले दस्तावेजों पर प्रशिक्षित मॉडल, मूल, बिना संशोधित उच्च-गुणवत्ता वाले टेक्स्ट पर प्रशिक्षित उसी मॉडल की तुलना में काफी बेहतर प्रदर्शन करता था। हालाँकि, जब उन्होंने निम्न-गुणवत्ता वाले दस्तावेजों पर वही रीराइटिंग प्रक्रिया लागू की, तो सुधार नगण्य था। पुनर्गठित निम्न-गुणवत्ता वाला टेक्स्ट उच्च-गुणवत्ता वाले पुनर्गठित टेक्स्ट के बराबर नहीं पहुँच सका; इसके बजाय, उनके बीच का अंतर बना रहा। यह सुझाव देता है कि रीराइटिंग प्रक्रिया तब सबसे प्रभावी होती है जब वह पहले से ही उत्कृष्ट सामग्री को लेती है और उसे और भी बेहतर बनाती है, बजाय इसके कि वह खराब सामग्री को बचाने की कोशिश करे। दस्तावेजों का यादृच्छिक मिश्रण बिल्कुल बीच में रहा, जो दर्शाता है कि रीराइटिंग का लाभ मूल टेक्स्ट की गुणवत्ता में सुधार के साथ लगातार बढ़ता जाता है।

हालाँकि, यह प्रभाव इस बात पर बहुत अधिक निर्भर था कि प्रशिक्षित किया जाने वाला मॉडल कितना बड़ा है। जब शोधकर्ताओं ने एक बहुत छोटे मॉडल के साथ प्रयोग को दोहराया, तो उच्च और निम्न गुणवत्ता के बीच का स्पष्ट अंतर समाप्त हो गया। इस छोटे परिवेश में, पुनर्गठित उच्च-गुणवत्ता वाला टेक्स्ट लगातार निम्न-गुणवत्ता वाले मूल टेक्स्ट से बेहतर प्रदर्शन नहीं कर सका। छोटा मॉडल पुनर्गठित टेक्स्ट द्वारा पेश किए गए जटिल संरचनात्मक परिवर्तनों का पूरी तरह से उपयोग करने में असमर्थ लग रहा था, या शायद इसने अनएडिटेड (असंपादित) डेटा की कच्ची विविधता से बेहतर सीखा। यह इंगित करता है कि सिंथेटिक रीराइटिंग की शक्ति एक सार्वभौमिक नियम नहीं है बल्कि यह आर्टिफिशियल इंटेलिजेंस सिस्टम के आकार के साथ बदलती है। छोटे मॉडल्स के लिए, पुनर्गठित टेक्स्ट की अतिरिक्त जटिलता लाभ प्रदान नहीं कर सकती है, जबकि बड़े, अधिक सक्षम मॉडल्स के लिए, उच्च-गुणवत्ता वाले डेटा को रीराइट करना प्रदर्शन बढ़ाने का एक शक्तिशाली उपकरण बन जाता है।

अध्ययन ने विशिष्ट प्रकार के कार्यों को भी देखा, जैसे परीक्षा के प्रश्नों के उत्तर देना या सोशल मीडिया पोस्ट को समझना, यह देखने के लिए कि रीराइटिंग ने सबसे अधिक मदद कहाँ की। सुधार उन क्षेत्रों में सबसे नाटकीय थे जिनमें संरचित ज्ञान और सांस्कृतिक समझ की आवश्यकता होती है, जैसे परीक्षा के प्रश्न पूछना या जटिल परिदृश्यों के माध्यम से तर्क करना। इन क्षेत्रों में, पुनर्गठित उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित मॉडल अन्य सभी से बहुत आगे निकल गया। दिलचस्प बात यह है कि सामान्य ज्ञान से जुड़े कार्यों के लिए, रीराइटिंग ने कभी-कभी चीजों को थोड़ा खराब कर दिया, जिससे पता चलता है कि यह प्रक्रिया कभी-कभी शोर (नॉइज़) पैदा कर सकती है या तथ्यों को विकृत कर सकती है। सोशल मीडिया कार्यों के लिए, मूल निम्न-गुणवत्ता वाला डेटा अपने आप में आश्चर्यजनक रूप से अच्छा प्रदर्शन करता था, संभवतः इसलिए क्योंकि सोशल मीडिया टेक्स्ट की अव्यवस्थित, अनौपचारिक प्रकृति स्वाभाविक रूप से उस अनएडिटेड वेब डेटा के समान है जिस पर मॉडल्स को मूल रूप से प्रशिक्षित किया गया था।

अंततः, यह शोध प्रदर्शित करता है कि हालांकि सिंथेटिक रीराइटिंग एक शक्तिशाली तकनीक है, लेकिन यह कोई जादुई छड़ी नहीं है जो खराब डेटा को सोने में बदल सके। इसके बजाय, यह एक गुणवत्ता मल्टीप्लायर के रूप में कार्य करती है, जो अच्छे डेटा की ताकत को बढ़ाती है और खराब डेटा की कमजोरियों को लगभग अपरिवर्तित छोड़ देती है। यह अंतर्दृष्टि उन डेवलपर्स के लिए महत्वपूर्ण है जो अंग्रेजी की तुलना में कम संसाधनों वाली भाषाओं के साथ काम कर रहे हैं। यह सुझाव देता है कि सबसे प्रभावी रणनीति पहले उपलब्ध सर्वोत्तम टेक्स्ट का सावधानीपूर्वक चयन करना है और फिर उसे बेहतर बनाने के लिए रीराइटिंग का उपयोग करना है, बजाय इसके कि गुणवत्ता की कमी की भरपाई के लिए रीराइटिंग पर भरोसा किया जाए। परिणाम यह भी रेखांकित करते हैं कि मॉडल का आकार मायने रखता; जो एक बड़े, परिष्कृत सिस्टम के लिए काम करता है, वह छोटे सिस्टम के लिए काम नहीं करेगा। डेटा गुणवत्ता और रीराइटिंग कैसे परस्पर क्रिया करते हैं, इसे स्पष्ट करके, यह कार्य पुर्तगाली और संभावित रूप से, समान संसाधन बाधाओं का सामना कर रही अन्य भाषाओं के लिए बेहतर आर्टिफिशियल इंटेलिजेंस सिस्टम बनाने का एक स्पष्ट मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →