Pretraining Language Models on Historical Text
यह शोध पत्र TypewriterLM का परिचय देता है, जो विशेष रूप से 1913 से पूर्व के अंग्रेजी ग्रंथों पर प्रशिक्षित एक 7.24B भाषा मॉडल है, साथ ही इसके साथ जुड़े 54B-टोकन वाले TypewriterCorpus, शाब्दिक रूप से आधारित (lexically grounded) पोस्ट-ट्रेनिंग डेटासेट और 'History-Event' बेंचमार्क को ऐतिहासिक भाषा मॉडलों के लिए डेटा गुणवत्ता, टेम्पोरल लीकेज (temporal leakage) और मूल्यांकन की चुनौतियों को संबोधित करने हेतु प्रस्तुत किया गया है।