← नवीनतम पेपर
💬 NLP

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

अल्ट्राएक्स (UltraX) एक फंक्शन-कॉलिंग फ्रेमवर्क है जो इंसर्शन (insertion), डिलीशन (deletion) और मॉडिफिकेशन (modification) क्षमताओं के साथ एडेप्टिव प्रोग्राममैटिक एडिटिंग को पेश करके बड़े पैमाने पर प्री-ट्रेनिंग डेटा रिफाइनमेंट को बढ़ाता है, जिससे मौजूदा नियम-आधारित और एलएलएम-आधारित (LLM-based) दृष्टिकोणों की दक्षता और विश्वसनीयता की सीमाओं को पार करते हुए बेहतर डेटा दक्षता और मॉडल प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को मानव भाषा बोलना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, इसका असली मंत्र केवल अधिक डेटा था। आप रोबोट के सामने किताबों, वेबसाइटों और लेखों का एक पहाड़ रख देते थे, इस उम्मीद में कि वह केवल भारी मात्रा के माध्यम से सब कुछ सीख लेगा। लेकिन अब, हम एक दीवार से टकरा गए हैं। हमने इंटरनेट से लगभग हर उपयोगी टेक्स्ट को खुरच कर निकाल लिया है। "अधिक ही बेहतर है" वाला नियम अब फीका पड़ने लगा है, जैसे बैटरी कम हो रही हो।

तो, हम क्या करें? हम ढेर लगाना छोड़ देते हैं और सफाई करना शुरू करते हैं।

यहाँ UltraX आता है, जो एक नया टूल है जिसे रोबोट की ट्रेनिंग बुक्स के लिए एक सूक्ष्म, सुपर-फास्ट संपादक (editor) के रूप में काम करने के लिए डिज़ाइन किया गया है। लेकिन इसमें एक ट्विस्ट है: यह केवल खराब वाक्यों को हटाने या पूरे पैराग्राफ को फिर से लिखने (जो धीमा और जोखिम भरा है) के बजाय, फंक्शन कॉलिंग (function calling) नामक एक चतुर तकनीक का उपयोग करता है।

"लेगो मास्टर" बनाम "ध्वस्तीकरण दल" (The "Lego Master" vs. The "Demolition Crew")

डेटा को साफ करने के पुराने तरीकों को एक ध्वस्तीकरण दल (demolition crew) की तरह सोचें।

  • नियम-आधारित तरीके (Rule-based methods) हथौड़े और चेकलिस्ट वाले श्रमिकों की तरह हैं। वे किसी भी ऐसी चीज़ को तोड़ देते हैं जो विज्ञापन या अजीब प्रतीक दिखती है। लेकिन वे अनाड़ी हैं; कभी-कभी वे एक सुंदर मूर्ति (मूल्यवान जानकारी) को भी गिरा देते हैं क्योंकि वह ईंटों के ढेर जैसी दिख रही होती है।
  • बड़े AI संपादक (Big AI editors) उन कलाकारों की तरह हैं जो कहानी को एकदम सही बनाने के लिए उसे पूरी तरह से फिर से लिखते हैं। लेकिन वे धीमे, महंगे हैं, और कभी-कभी वे कहानी को इतना बदल देते हैं कि उसका कोई अर्थ ही नहीं रह जाता।

UltraX अलग है। यह विशिष्ट उपकरणों के सेट के साथ एक लेगो मास्टर (Lego master) की तरह है। पूरी किताब को फिर से लिखने के बजाय, यह रोबोट को निर्देशों की एक छोटी सूची देता है:

  1. कचरे की इस विशिष्ट लाइन को हटाएं (Delete) (जैसे कि कोई विज्ञापन)।
  2. इस अजीब टाइपो (typo) को सही शब्द से बदलें (Swap)
  3. जानकारी के उस छूटे हुए हिस्से को डालें (Insert) जो गंदगी में खो गया था।

पेपर स्पष्ट रूप से इस विचार के खिलाफ तर्क देता है कि आपको टेक्स्ट को ठीक करने के लिए उसे पूरी तरह से फिर से लिखने की आवश्यकता है। यह दिखाता है कि केवल चीजों को हटा देना (जैसा कि अन्य टूल्स करते हैं) पर्याप्त नहीं है क्योंकि आप गलती से अच्छी चीज़ों को भी फेंक सकते हैं। यह यह भी तर्क देता है कि इन विशाल पैमाने पर डेटा को जेनरेट करने की कोशिश करना बहुत धीमा और अविश्वसनीय है। UltraX साबित करता है कि सटीक, सर्जिकल संपादन (surgical edits) ही कुंजी हैं।

यह कैसे काम करता है: "रेसिपी" और "शेफ"

यह प्रक्रिया दो मुख्य अंकों में होती है:

अंक 1: प्रशिक्षण (शेफ को सिखाना)
सबसे पहले, शोधकर्ताओं को अपने छोटे "रिफाइनर" मॉडल को एक अच्छा संपादक बनने के लिए सिखाने की आवश्यकता थी। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने एक "स्मार्ट शेफ" (एक शक्तिशाली AI) का उपयोग करके अव्यवस्थित वेब पेजों के एकदम साफ और शुद्ध संस्करण लिखे। फिर, उन्होंने उन साफ संस्करणों को निर्देशों की एक रेसिपी (जैसे "लाइन 5 हटाएं," "शब्द 12 ठीक करें") में बदलने के लिए एक विशेष मैपिंग तकनीक का उपयोग किया। उन्होंने भ्रमित करने वाली रेसिपी को फ़िल्टर किया और अपने छोटे मॉडल को इन निर्देशों का पूरी तरह से पालन करना सिखाया।

अंक 2: सफाई (स्केल-अप)
अब, वे इस प्रशिक्षित "रिफाइनर" को अरबों वेब पेजों पर आज़माते हैं। यह टेक्स्ट का एक हिस्सा पढ़ता है, उसे ठीक करने के लिए आवश्यक निर्देशों की सटीक सूची (लेगो मूव्स) की भविष्यवाणी करता है, और फिर एक कंप्यूटर प्रोग्राम उन निर्देशों को तुरंत लागू करता है। क्योंकि मॉडल को पूरी नई कहानी लिखने के बजाय केवल कमांड की एक छोटी सूची (जैसे "लाइन 3 हटाएं") आउटपुट करनी होती है, इसलिए यह अविश्वसनीय रूप से तेज़ है और थकता नहीं है।

परिणाम: तेज़, स्मार्ट और अधिक कुशल

शोधकर्ताओं ने एक 1-बिलियन पैरामीटर वाले रोबोट को अलग-अलग प्रकार के साफ किए गए डेटा का उपयोग करके शुरू से प्रशिक्षित करके इसका परीक्षण किया। यहाँ उन्हें क्या मिला:

  • बेहतर स्कोर: 10 अलग-अलग कौशलों (जैसे विज्ञान के सवालों के जवाब देना या चुटकुले समझना) के परीक्षण पर, UltraX डेटा के साथ प्रशिक्षित रोबोट ने कच्चे डेटा या अन्य तरीकों से साफ किए गए डेटा से प्रशिक्षित रोबोटों की तुलना में उच्च स्कोर किया। वास्तव में, UltraX ने उनके द्वारा आजमाए गए सभी पांचों प्रकार के इंटरनेट डेटा पर शीर्ष प्रदर्शन किया।
  • "2%" का उछाल: कई डेटासेट्स पर, UltraX ने 2% से अधिक का सापेक्ष सुधार दिया। AI की दुनिया में, यह एक बहुत बड़ी छलांग है।
  • कम में अधिक करना: यह सबसे शानदार हिस्सा है। UltraX-प्रशिक्षित रोबोट ने दूसरों की तुलना में कम प्रशिक्षण टोकन (कम शब्द) का उपयोग करके समान उच्च प्रदर्शन स्तर प्राप्त किया। यह सुझाव देता है कि UltraX डेटा को उपयोगी जानकारी के साथ "सघन" (dense) बनाता है, जिससे रोबट तेज़ी से सीखता है।

उन्होंने क्या नहीं किया (और वे किस बारे में अनिश्चित हैं)

यह जानना महत्वपूर्ण है कि इस कहानी की सीमाएँ क्या हैं। पेपर यह दावा नहीं करता है कि यह सब कुछ हमेशा के लिए हल कर देता है।

  • उन्होंने केवल अंग्रेजी वेब डेटा पर इसका परीक्षण किया। वे स्वीकार करते हैं कि उन्होंने अभी चीनी या अन्य भाषाओं पर इसे नहीं आजमाया है, जहाँ "शोर" (noise) पूरी तरह से अलग हो सकता है।
  • उन्होंने एक 1-बिलियन-पैरामीटर मॉडल को प्रशिक्षित किया। उन्होंने अभी तक यह साबित नहीं किया है कि क्या यह आने वाले विशाल, ट्रिलियन-पैरामीटर वाले मॉडलों पर भी इसी तरह काम करेगा।
  • वे सुझाव देते हैं कि लाभ शोर को हटाने और अच्छी जानकारी को बनाए रखने के बीच संतुलन से आते हैं, लेकिन वे हर प्रकार की इंटरनेट गड़बड़ी के लिए सटीक फॉर्मूला होने का दावा नहीं करते हैं।

निचोड़ (The Bottom Line)

UltraX सुझाव देता है कि AI को सिखाने का भविष्य अधिक डेटा खोजने के बारे में नहीं है, बल्कि हमारे पास मौजूद डेटा के साथ अधिक स्मार्ट होने के बारे में है। एक सटीक, निर्देश-आधारित दृष्टिकोण का उपयोग करके जो टेक्स्ट के विशिष्ट हिस्सों को हटा सकता है, ठीक कर सकता है और डाल सकता है, यह रोबोट की लाइब्रेरी को पुराने तरीकों की तुलना में तेज़ और बेहतर तरीके से साफ करता है। यह "सब कुछ दीवार पर फेंकने" से बदलकर "सर्जिकल तरीके से कचरा निकालने" की ओर एक बदलाव है, और परिणाम दिखाते हैं कि थोड़ी सी स्मार्ट सफाई बहुत काम आती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →