Era-Aware Language Modeling: Training a Decoder-Only Transformer on a Balanced Gutenberg Corpus
Dieses Paper stellt GutenbergLM vor, einen 109,5-Millionen-Parameter starken Decoder-only-Transformer, der von Grund auf mit einem zeitlich ausgewogenen Project-Gutenberg-Korpus unter Verwendung von Ära-konditionierenden Token trainiert wurde, was zeigt, dass eine explizite zeitliche Stratifizierung es dem Modell ermöglicht, distinkte, epochenspezifische Schreibstile über die frühen, mittleren und modernen literarischen Ären hinweg zu generieren.