← Derniers articles
💬 NLP

Pretraining Language Models on Historical Text

Ce document présente TypewriterLM, un modèle de langage de 7,24 milliards de paramètres entraîné exclusivement sur des textes anglais antérieurs à 1913, ainsi que son corpus associé de 54 milliards de jetons, le TypewriterCorpus, ses jeux de données de post-entraînement ancrés lexicalement, et le benchmark History-Event afin de relever les défis liés à la qualité des données, à la fuite temporelle et à l'évaluation pour les modèles de langage historiques.

Auteurs originaux : Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

Publié 2026-06-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un voyageur temporel à parler et à penser exactement comme quelqu'un vivant en 1912. Si vous lui donniez un manuel moderne ou si vous le laissiez naviguer sur Internet, il apprendrait accidentellement l'existence des avions, d'Internet et des théories de la relativité d'Einstein. Il pourrait alors vous affirmer avec assurance que les « ordinateurs » sont les grandes machines dans votre sous-sol, sans réaliser qu'en 1912, un « ordinateur » était en réalité une personne effectuant des calculs à la main.

C'est le problème que les auteurs de ce document tentent de résoudre. Ils ont construit une IA spéciale, appelée TYPEWRITERLM, qui lui est strictement interdit de savoir quoi que ce soit de ce qui s'est passé après 1913.

Voici comment ils ont procédé, expliqué à travers des analogies simples :

1. La bibliothèque « Capsule Temporelle » (Les Données)

Pour entraîner cette IA, les chercheurs ne pouvaient pas utiliser l'Internet moderne. À la place, ils ont construit une immense bibliothèque numérique appelée TYPEWRITERCORPUS.

  • La Source : Ils ont rassemblé 54 milliards de mots provenant de vieux livres, de registres parlementaires, de publications scientifiques et de transcriptions judiciaires des années 1700 à 1913.
  • Le Nettoyage : Les vieux livres numérisés par ordinateur présentent souvent des « bugs » (comme les mentions « Numérisé par Google » ou des numéros de pages modernes). L'équipe a agi comme des bibliothécaires stricts, purgeant chaque artefact moderne, URL ou note anachronique pour garantir que la bibliothèque soit purement historique.
  • Le Résultat : Un amas massif de texte qui représente le monde exactement tel qu'il était avant la Première Guerre mondiale.

2. La règle du « Bibliothécaire Strict » (Ajustement des Instructions)

Habituellement, lorsque nous apprenons à une IA à suivre des instructions, nous utilisons des exemples modernes ou nous demandons à une IA moderne très intelligente de rédiger les réponses. Mais cela ruinerait la « précision d'époque » du voyageur temporel.

Ainsi, les chercheurs ont inventé une nouvelle méthode appelée Lexically Grounded Instruction Tuning (Ajustement d'instructions ancré lexicalement).

  • L'Analogie : Imaginez que vous jouez à un jeu où vous devez répondre à des questions en utilisant uniquement les mots trouvés dans un livre ancien spécifique. Vous ne pouvez pas inventer de nouveaux mots ni utiliser d'argot moderne.
  • Le Processus : Ils ont créé deux nouveaux ensembles de données (HISTORY-LIMA et HISTORY-SELFINSTRUCT). Pour chaque question posée à l'IA, la réponse est construite directement à partir du texte des documents de l'époque de 1913. Si le mot « avion » ne figure pas dans le texte source, l'IA n'est pas autorisée à l'utiliser. Cela garantit que l'IA ne laisse pas accidentellement « fuiter » des connaissances modernes dans ses réponses.

3. Le « Test de Surprise » (Évaluation)

Comment savoir si l'IA ne connaît vraiment pas le futur ? On la teste avec un « Test de Surprise » appelé HISTORY-EVENT.

  • Le Test : Ils ont présenté à l'IA des descriptions d'événements historiques.
    • Événement A : S'est produit en 1850 (Avant la date limite).
    • Événement B : S'est produit en 1950 (Après la date limite).
  • La Réaction : Ils ont mesuré à quel point l'IA était « surprise » en lisant le texte.
    • Lorsque l'IA (TYPEWRITERLM) lisait des descriptions d'événements de 1950, elle était véritablement confuse et surprise, comme si elle n'en avait jamais entendu parler.
    • En revanche, une IA moderne standard (comme Llama) n'était pas du tout surprise ; elle connaissait les faits car elle les avait lus lors de son entraînement.
  • Le Contrôle de Fuite : Ils ont également vérifié si l'IA connaissait accidentellement des faits qu'elle ne devrait pas connaître. Ils ont constaté que, bien que l'IA soit très douée pour rester dans le passé, une infime fraction d'informations modernes a quand même « fuité » (moins de 1 %), prouvant qu'il est extrêmement difficile de sceller parfaitement une machine à remonter le temps.

4. Les Résultats

  • Le Voyageur Temporel : L'IA résultante (TYPEWRITERLM) est un modèle de 7,24 milliards de paramètres qui parle et raisonne comme une personne de 1913.
  • La Comparaison : Lorsqu'elle est testée sur des énigmes de logique générale, elle se montre compétitive face à d'autres IA historiques, même si elle a été entraînée sur beaucoup moins de données que les modèles modernes.
  • La Leçon : Ce document prouve que l'on peut construire une IA intelligente qui est « aveugle » au futur, à condition d'être extrêmement prudent quant aux données que l'on lui fournit et à la manière de lui enseigner la façon de répondre aux questions.

En bref : Les auteurs ont construit une machine à remonter le temps numérique. Ils l'ont nourrie uniquement de vieux livres, lui ont appris à répondre aux questions en utilisant seulement les mots trouvés dans ces livres, et ont prouvé qu'elle ne sait réellement rien de ce qui se passe après 1913. Cela permet aux historiens et aux chercheurs d'étudier le passé sans que l'IA ne vienne accidentellement « gâcher » l'intrigue avec des connaissances modernes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →