← नवीनतम पेपर
💻 computer science

Era-Aware Language Modeling: Training a Decoder-Only Transformer on a Balanced Gutenberg Corpus

यह शोध पत्र GutenbergLM को प्रस्तुत करता है, जो कि युग-सशर्त टोकन (era-conditioning tokens) के साथ एक कालानुक्रमिक रूप से संतुलित प्रोजेक्ट गुटेनबर्ग कॉर्पस पर शून्य से प्रशिक्षित 109.5M-पैरामीटर वाला एक डिकोडर-ओनली ट्रांसफार्मर है, जो यह प्रदर्शित करता है कि स्पष्ट कालानुक्रमिक स्तरीकरण (temporal stratification) मॉडल को प्रारंभिक, मध्य और आधुनिक साहित्यिक युगों के अनुरूप विशिष्ट, काल-उपयुक्त लेखन शैलियों को उत्पन्न करने में सक्षम बनाता है।

मूल लेखक: V K R SUBHASH CH, PAVAN TEJ P G

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: V K R SUBHASH CH, PAVAN TEJ P G

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट है जो लाखों किताबें पढ़कर लिखना सीखता है। आमतौर पर, जब हम इन रोबोट्स को सिखाते हैं, तो हम उन्हें पूरा इंटरनेट खिला देते हैं। समस्या क्या है? इंटरनेट का अधिकांश हिस्सा पिछले 20 वर्षों में लिखी गई चीजों से बना है। यह ऐसा है जैसे आप किसी इतिहास के छात्र को केवल आज की खबरों के बारे में सिखा रहे हों; वे समसामयिक घटनाओं में बहुत अच्छे हो सकते हैं, लेकिन वे यह नहीं समझ पाएंगे कि 1700 या 1800 के दशक में लोग कैसे बोलते थे।

यह शोध पत्र एक नए प्रोजेक्ट का परिचय देता जिसे GutenbergLM कहा जाता है। इसे एक "समय-यात्रा लेखन कक्षा" (time-travel writing class) के रूप में सोचें जो एक छोटे, कुशल रोबोट के लिए बनाई गई है। इंटरनेट की अव्यवस्था के बजाय, शोधकर्ताओं ने इस रोबोट को प्रोजेक्ट गुटेनबर्ग (मुफ्त, पुरानी किताबों का एक विशाल संग्रह) की एक सावधानीपूर्वक चुनी गई लाइब्रेरी खिलाई।

उन्होंने इसे कैसे किया, इसे सरल चरणों में यहाँ दिया गया है:

1. एक आदर्श लाइब्रेरी बनाना (द कॉर्पस)

शोधकर्ताओं ने केवल यादृच्छिक (random) किताबें नहीं लीं। वे चाहते थे कि रोबोट तीन अलग-अलग "समय अवधियों" को समान रूप से सीखे:

  • प्रारंभिक युग (The Early Era): 1800 से पहले लिखी गई पुस्तकें।
  • मध्य युग (The Middle Era): 1801 और 1900 के बीच लिखी गई पुस्तकें।
  • आधुनिक युग (The Modern Era): 1900 के बाद लिखी गई पुस्तकें।

आमतौर पर, पुस्तकालयों में 1800 के दशक की किताबों की संख्या 1700 के दशक की तुलना में बहुत अधिक होती है। इसे ठीक करने के लिए, शोधकर्ताओं ने एक सख्त लाइब्रेरियन की तरह काम किया। उन्होंने प्रत्येक युग में पुस्तकों की गणना की और प्रत्येक समूह से बिल्कुल समान संख्या में पुस्तकें चुनीं (प्रत्येक युग के लिए लगभग 5,300 पुस्तकें)। इसने यह सुनिश्चित किया कि रोबोट किसी एक समय अवधि की ओर पक्षपाती न हो जाए। उन्होंने किताबों को साफ भी किया, डुप्लिकेट प्रतियों और मानक "प्रोजेक्ट गुटेनबर्ग" कानूनी हेडर को हटा दिया ताकि रोबोट केवल कहानियों को सीख सके।

2. रोबोट को बोलना सिखाना (टोकेनाइजेशन)

कंप्यूटर के पढ़ने से पहले, उसे शब्दों को "टोकन" नामक छोटे टुकड़ों में तोड़ना होता है। शोधकर्ताओं ने 32,000 शब्दों वाला एक विशेष शब्दकोश (एक टोकेनाइज़र) बनाया।

  • सीक्रेट सॉस: उन्होंने शब्दकोश में तीन विशेष "जादुई शब्द" (या नियंत्रण टोकन) जोड़े: <ERA_EARLY>, <ERA_MIDDLE>, और <ERA_MODERN>
  • यह कैसे काम करता है: इसे रेडियो के डायल की तरह समझें। जब रोबोट <ERA_EARLY> डायल देखता है, तो वह जानता है कि 1700 के दशक के व्यक्ति की तरह बोलने के लिए अपनी "आवाज़" बदलनी है। जब वह <ERA_MODERN> देखता है, तो वह आधुनिक आवाज़ में बदल जाता है।

3. रोबोट का मस्तिष्क (द आर्किटेक्चर)

रोबोट खुद एक "डिकोडर-ओनली ट्रांसफार्मर" है, जो एक फैंसी तरीका है यह कहने का कि यह एक आधुनिक AI मस्तिष्क है जिसे वाक्य में अगले शब्द की भविष्यवाणी करने के लिए डिज़ाइन किया गया है।

  • यह अपेक्षाकृत छोटा है (लगभग 109 मिलियन पैरामीटर), जो इसे कुशल बनाता है।
  • यह तेजी से सीखने और संदर्भ (context) को बेहतर ढंग से याद रखने के लिए आधुनिक ट्रिक्स का उपयोग करता है, जैसे रोटरी पोजीशन एम्बेडिंग्स (जो इसे शब्दों के क्रम को समझने में मदद करती हैं) और SwiGLU (एक प्रकार की ब्रेन सेल जो जानकारी को कुशलतापूर्वक प्रोसेस करती है)।
  • इसे एक सिंगल ग्राफिक्स कार्ड (एक NVIDIA A10G) पर लगभग 13 घंटों के लिए प्रशिक्षित किया गया था।

4. परिणाम: क्या यह काम करता है?

प्रशिक्षण के बाद, शोधकर्ताओं ने रोबोट का परीक्षण किया। यहाँ उन्हें क्या पता चला:

  • इसने लिखना सीखा: रोबोट ने उच्च सटीकता के साथ वाक्य में अगले शब्द की भविष्यवाणी करना सफलतापूर्वक सीख लिया (एक "परप्लेक्सिटी" स्कोर लगभग 24, जो एक छोटे मॉडल के लिए काफी अच्छा है)।
  • "रेडियो डायल" काम करता है: जब उन्होंने रोबोट को <ERA_EARLY> टैग के साथ एक कहानी शुरू करने के लिए कहा, तो इसने ऐसी भाषा उत्पन्न की जो पुरानी शैली की थी, जिसमें "thence" और "unto" जैसे शब्दों और पुराने तारीखों का संदर्भ था। जब उन्होंने <ERA_MODERN> टैग का उपयोग किया, तो टेक्स्ट एक समकालीन उपन्यास जैसा लगा, जिसमें "क्लबों" और "प्लेटफॉर्मों" जैसी चीजों का उल्लेख था।
  • कोई धोखाधड़ी नहीं: रोबोट ने केवल किताबों को रटा नहीं; इसने प्रत्येक युग की शैली को सीखा। यह उस समय की प्रामाणिक लगने वाली नई वाक्य रचनाएँ बना सकता था, बिना यह बताए कि कहानी वास्तव में किस बारे में है।

यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि आज के अधिकांश AI मॉडल "समय-अंधे" (time-blind) हैं क्योंकि उन्हें अव्यवस्थित, आधुनिक इंटरनेट डेटा पर प्रशिक्षित किया जाता है। यह प्रोजेक्ट साबित करता है कि यदि आप समय अवधि के आधार पर अपने प्रशिक्षण डेटा को सावधानीपूर्वक संतुलित करते हैं, तो आप एक छोटे AI को केवल एक स्विच बदलकर विभिन्न ऐतिहासिक लेखन शैलियों को समझने और उनकी नकल करने के लिए सिखा सकते हैं।

संक्षेप में: शोधकर्ताओं ने एक समय-यात्रा करने वाले लेखन शिक्षक का निर्माण किया। उन्होंने इसे पुरानी और नई किताबों का एक पूरी तरह से संतुलित आहार दिया, इसे "इरा बटन्स" (era buttons) का एक विशेष सेट दिया, और दिखाया कि अब यह रोबोट एक ही मस्तिष्क से अपनी लेखन शैली बदलकर 1700 के दशक, 1800 के दशक, या आज के दौर का लगने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →