← Ultimi articoli
💬 NLP

Pretraining Language Models on Historical Text

Questo articolo introduce TypewriterLM, un modello linguistico da 7,24B addestrato esclusivamente su testi in inglese precedenti al 1913, insieme al relativo TypewriterCorpus da 54B di token, ai dataset di post-training a fondamento lessicale e al benchmark History-Event per affrontare le sfide relative alla qualità dei dati, alla fuga temporale e alla valutazione per i modelli linguistici storici.

Autori originali: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

Pubblicato 2026-06-03
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un viaggiatore del tempo come parlare e pensare esattamente come qualcuno che vive nel 1912. Se gli dessi un moderno libro di testo o lo lasciassi navigare su internet, imparerebbe accidentalmente cose come gli aeroplani, internet e le teorie della relatività di Einstein. Potrebbe quindi dirti con sicurezza che i "computer" sono le grandi macchine nel tuo seminterrato, senza rendersi conto che nel 1912 un "computer" era in realtà una persona che faceva calcoli a mano.

Questo è il problema che gli autori di questo articolo stanno risolvendo. Hanno costruito un'IA speciale, chiamata TYPEWRITERLM, che gli è severamente vietato conoscere qualsiasi cosa sia accaduta dopo il 1913.

Ecco come l'hanno fatto, spiegato attraverso semplici analogie:

1. La biblioteca "Capsula del Tempo" (I Dati)

Per addestrare questa IA, i ricercatori non potevano usare l'internet moderno. Invece, hanno costruito una massiccia biblioteca digitale chiamata TYPEWRITERCORPUS.

  • La Fonte: Hanno raccolto 54 miliardi di parole da vecchi libri, registri parlamentari, articoli scientifici e trascrizioni giudiziarie degli anni dal 1700 al 1913.
  • La Pulizia: I vecchi libri scansionati dai computer spesso presentano dei "glitch" (come le parole "Digitalizzato da Google" o numeri di pagina moderni). Il team ha agito come bibliotecari severi, eliminando ogni singolo artefatto moderno, URL o nota anacronistica per garantire che la biblioteca fosse puramente storica.
  • Il Risultato: Un enorme ammasso di testo che rappresenta il mondo esattamente com'era prima della Prima Guerra Mondiale.

2. La regola del "Bibliotecario Severo" (Instruction Tuning)

Di solito, quando insegniamo a un'IA a seguire delle istruzioni, usiamo esempi moderni o chiediamo a un'IA moderna super-intelligente di scrivere le risposte. Ma questo rovinerebbe l'accuratezza storica del "viaggiatore del tempo".

Così, i ricercatori hanno inventato un nuovo metodo chiamato Lexically Grounded Instruction Tuning.

  • L'Analogia: Immagina di giocare a un gioco in cui devi rispondere alle domande usando solo le parole trovate in un determinato vecchio libro. Non puoi inventare nuove parole o usare lo slang moderno.
  • Il Processo: Hanno creato due nuovi dataset (HISTORY-LIMA e HISTORY-SELFINSTRUCT). Per ogni domanda posta all'IA, la risposta viene costruita direttamente dal testo dei documenti dell'era 1913. Se la parola "aeroplano" non è presente nel testo sorgente, l'IA non è autorizzata a usarla. Questo assicura che l'IA non faccia "trapelare" accidentalmente conoscenze moderne nelle sue risposte.

3. Il "Test a Sorpresa" (Valutazione)

Come fai a sapere se l'IA non conosce davvero il futuro? Lo testi con un "Test a Sorpresa" chiamato HISTORY-EVENT.

  • Il Test: Hanno mostrato all'IA delle descrizioni di eventi storici.
    • Evento A: Accaduto nel 1850 (Prima del limite temporale).
    • Evento B: Accaduto nel 1950 (Dopo il limite temporale).
  • La Reazione: Hanno misurato quanto l'IA fosse "sorpresa" leggendo il testo.
    • Quando l'IA (TYPEWRITERLM) leggeva di eventi del 1950, era genuinamente confusa e sorpresa, come se non ne avesse mai sentito parlare.
    • Al contrario, un'IA moderna standard (come Llama) non era affatto sorpresa; conosceva i fatti perché li aveva letti durante il suo addestramento.
  • Il Controllo delle Fughe: Hanno anche controllato se l'IA conoscesse accidentalmente fatti che non avrebbe dovuto conoscere. Hanno scoperto che, sebbene l'IA fosse molto brava a rimanere nel passato, una piccolissima frazione di informazioni moderne è comunque "trapelata" (meno dell'1%), dimostando che mantenere una macchina del tempo perfettamente sigillata è incredibilmente difficile.

4. I Risultati

  • Il Viaggiatore del Tempo: L'IA risultante (TYPEWRITERLM) è un modello da 7,24 miliardi di parametri che parla e ragiona come una persona del 1913.
  • Il Confronto: Quando testata su enigmi logici generali, si è dimostrata competitiva rispetto ad altre IA storiche, nonostante sia stata addestrata con molti meno dati rispetto ai modelli moderni.
  • La Lezione: L'articolo dimostra che è possibile costruire un'IA intelligente che sia "cieca" al futuro, a patto di essere estremamente meticolosi riguardo ai dati forniti e al modo in cui si insegna a rispondere alle domande.

In breve: Gli autori hanno costruito una macchina del tempo digitale. L'hanno nutrita solo con vecchi libri, le hanno insegnato a rispondere alle domande usando solo le parole contenute in quei libri, e hanno dimostrato che l'IA non sa davvero cosa accadrà dopo il 1913. Questo permette agli storici e ai ricercatori di studiare il passato senza che l'IA "spoileri" accidentalmente la trama con conoscenze moderne.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →