← नवीनतम पेपर
💬 NLP

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

यह शोध पत्र कॉमन कॉर्पस (Common Corpus) को प्रस्तुत करता है, जो विविध भाषाओं और डोमेन में लगभग दो ट्रिलियन टोकन की गैर-कॉपीराइट या ओपन-लाइसेंस वाली सामग्री से बना एलएलएम (LLM) प्री-ट्रेनिंग के लिए सबसे बड़ा खुला डेटासेट है, जिसे छोटे भाषा मॉडलों के प्रशिक्षण के माध्यम से प्रमाणित किया गया है जो समान आकार के मौजूदा मॉडलों के तुलनीय प्रदर्शन करते हैं।

मूल लेखक: Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza, Mattia Nee, Eliot Krzystof Jones, Irène Girard, David Mach, Anastasia Stasenko, Ivan P. Yamshchikov

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett, Carlos Rosas Hinostroza, Mattia Nee, Eliot Krzystof Jones, Irène Girard, David Mach, Anastasia Stasenko, Ivan P. Yamshchikov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को इंसान की तरह बोलना, सोचना और लिखना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको उसे किताबों, लेखों, कोड और बातचीत का एक विशाल पुस्तकालय खिलाना होगा। इसे ही हम लार्ज लैंग्वेज मॉडल (LLM) का "प्री-ट्रेनिंग" (pre-training) कहते हैं।

वर्षों से, इस लाइब्रेरी को बनाने का मानक तरीका यह था कि एक विशाल डिजिटल वैक्यूम क्लीनर (एक "वेब क्रॉलर") को पूरे इंटरनेट पर भेज दिया जाए, जो जो कुछ भी मिले उसे खींच ले। लेकिन यहाँ एक समस्या है: उसमें से बहुत सारी चीजें इस्तेमाल करने के लिए मुफ्त नहीं हैं। वे कॉपीराइटेड हैं, कंपनियों के स्वामित्व में हैं, या उनमें व्यक्तिगत रहस्य छिपे हैं। उनका उपयोग करना वैसा ही है जैसे अपने पड़ोसी के बगीचे से ईंटें चुराकर घर बनाना। यह काम तो करता है, लेकिन आपको मुकदमा झेलना पड़ सकता है, और बाद में आपका घर गिराया भी जा सकता है।

यहाँ आता है कॉमन कॉर्पस (Common Corpus)

"सार्वजनिक पार्क" बनाम "निजी मॉल"

इंटरनेट को एक विशाल शहर के रूप में सोचें।

  • पुराना तरीका: अधिकांश AI कंपनियों ने अपने मॉडल को "निजी मॉल" (कॉपीराइटेड समाचार, किताबें और कोड) से ईंटें उठाकर बनाया। उन्होंने तर्क दिया, "हम केवल निर्माण करना सीखने के लिए ईंटों को देख रहे हैं, मॉल चोरी नहीं कर रहे हैं!" लेकिन मॉल के मालिक (जैसे द न्यूयॉर्क टाइम्स) अब कह रहे हैं, "हमारी ईंटों को देखना बंद करो!" और वे दरवाजे बंद कर रहे हैं।
  • कॉमन कॉर्पस का तरीका: यह पेपर एक विशाल, बिल्कुल नए सार्वजनिक पार्क का परिचय देता है। इस पार्क की हर एक ईंट पर एक साइन लगा है जो कहता है, "लेने के लिए मुफ्त, उपयोग के लिए मुफ्त, निर्माण के लिए मुफ्त।" कोई मुकदमा नहीं, कोई छिपी हुई फीस नहीं, कोई कानूनी अस्पष्टता नहीं।

इस पार्क के अंदर क्या है?

लेखकों ने इस पार्क में केवल रैंडम कचरा नहीं डाला। उन्होंने 2 ट्रिलियन "टोकन" (इन्हें शब्दों और विचारों को बनाने वाले छोटे पहेली के टुकड़ों के रूप में सोचें) का एक संग्रह तैयार किया। यहाँ बताया गया है कि यह पार्क क्या विशेष बनाता है:

  1. यह एक वैश्विक गाँव है: अधिकांश AI लाइब्रेरी मुख्य रूप से अंग्रेजी में होती हैं। कॉमन कॉर्पस एक संयुक्त राष्ट्र की बैठक की तरह है। इसमें फ्रेंच, जर्मन, स्पेनिश और यहाँ तक कि उन दुर्लभ भाषाओं के भी बड़े हिस्से हैं जिन्हें अन्य AI मॉडल शायद ही जानते हों। यह केवल एक आवाज नहीं है; यह कई लोगों का एक समूह (choir) है।
  2. इसमें एक टाइम मशीन है: यह डेटा सदियों पीछे तक जाता है। इसमें 1700 के दशक के पुराने समाचार पत्र, प्राचीन पुस्तकें और आधुनिक वित्तीय रिपोर्ट शामिल हैं। यह AI को इतिहास और समय के साथ भाषा कैसे बदलती है, यह समझने में मदद करता है, न कि केवल यह कि लोग अभी ट्विटर पर क्या ट्वीट कर रहे हैं।
  3. यह एक कोड लाइब्रेरी है: इसमें कंप्यूटर कोड (जैसे पायथन और जावा) का एक बड़ा हिस्सा है। यह AI को केवल कविता लिखने के बजाय तार्किक रूप से सोचने और गणित की समस्याओं को हल करने के बारे में सिखाता है।
  4. यह "साफ" डेटा है: क्योंकि डेटा पुराना या ओपन-लाइसेंस वाला है, इसलिए यह कभी-कभी अव्यवस्थित दिख सकता है (जैसे धुंधले टेक्स्ट वाली स्कैन की गई किताब)। लेखकारों ने टाइपो को ठीक करने, खराब स्कैन को साफ करने और व्यक्तिगत रहस्यों (जैसे फोन नंबर) को हटाने के लिए विशेष "डिजिटल सफाईकर्मी" (AI टूल्स) बनाए हैं, इससे पहले कि रोबोट उसे देखे।

क्या यह काम आया?

लेखकों ने केवल इस "सार्वजनिक पार्क" के डेटा का उपयोग करके दो छोटे रोबोट (AI मॉडल) बनाए।

  • परिणाम: इन छोटे रोबोटों ने अन्य रोबोटों के समान या कभी-कभी उनसे बेहतर प्रदर्शन किया जिन्हें "चुराई गई ईंटों" से फीड किया गया था।
  • सबक: आपको स्मार्ट AI बनाने के लिए कानून तोड़ने की आवश्यकता नहीं है। यदि आप उच्च गुणवत्ता वाले, कानूनी, खुले डेटा का उपयोग करते हैं, तो आप शक्तिशाली उपकरण बना सकते हैं।

यह क्यों महत्वपूर्ण है?

कल्पना कीजिए कि यदि आपको हर बार एक नया ऐप बनाने के लिए इस बात की चिंता करनी पड़े कि कोई वकील आकर आपको बंद कर देगा क्योंकि आपने एक कॉपीराइट की गई छवि का उपयोग किया है। AI के साथ अभी यही हो रहा है।

कॉमन कॉर्पस दुनिया को एक विशाल, कानूनी, ओपन-सोर्स टूलबॉक्स सौंपने जैसा है। यह शोधकर्ताओं, छात्रों और छोटी कंपनियों को बिना किसी डर के अपना खुद का AI बनाने की अनुमति देता है। यह सुनिश्चित करता है कि AI का भविष्य केवल उन कुछ बड़ी कंपनियों द्वारा नियंत्रित न हो जिनके पास सारा डेटा है, बल्कि यह सभी के लिए एक साझा संसाधन बने।

संक्षेप में: लेखकों ने AI को सिखाने के लिए दुनिया का सबसे बड़ा, सबसे स्वच्छ और सबसे कानूनी पुस्तकालय बनाया है। उन्होंने साबित कर दिया है कि आप केवल "मुफ्त" सामग्रियों का उपयोग करके एक सुपर-स्मार्ट रोबोट बना सकते हैं, जिससे एक ऐसे भविष्य का द्वार खुलता है जहाँ AI खुला, सुरक्षित और सभी का है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →