← Derniers articles
💬 NLP

TimeCapsule: Generative Hallucination as a Method for Historical Sensemaking

L'article présente TimeCapsule, un modèle génératif entraîné exclusivement sur des textes victoriens qui tire parti de son isolement temporel pour transformer les hallucinations modernes en sondes interprétatives pour la construction de sens historique, remettant ainsi en question efficacement les perceptions contemporaines de l'authenticité tout en démontrant une perplexité supérieure sur la prose spécifique à cette période.

Auteurs originaux : Hayk Grigorian, Hamed Yaghoobian

Publié 2026-07-29
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hayk Grigorian, Hamed Yaghoobian

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre le passé, mais chaque fois que vous posez une question, la réponse revient avec un avertissement de divulgation (« spoiler alert ») provenant du futur. C'est le problème des cerveaux informatiques les plus puissants d'aujourd'hui, connus sous le nom de Grands Modèles de Langage (LLM). Ces systèmes sont comme des voyageurs temporels qui ont lu tous les livres de la bibliothèque de l'histoire humaine, y compris ceux qui ne sont pas encore écrits. Parce qu'ils sont entraînés sur l'ensemble d'Internet aujourd'hui, ils portent en eux des connaissances modernes, une éthique moderne et des faits modernes dans leur « esprit ». Lorsque vous leur demandez de prétendre être quelqu'un des années 1800, ils font souvent des faux pas, mentionnant accidentellement des choses comme les avions ou Internet, ou jugeant des événements historiques avec la boussole morale d'aujourd'hui. Ils sont excellents pour imiter le style du passé, mais ils ne peuvent pas véritablement l' habiter parce qu'ils en savent trop.

Pour corriger cela, des chercheurs explorent une nouvelle idée : et si nous construisions une IA qui est délibérément ignorante ? Au lieu de lui donner tout l'internet, et si nous ne lui donnions que des livres, des journaux et des lettres d'une période spécifique, puis que nous coupions l'électricité pour qu'elle ne puisse jamais rien apprendre après cette date ? Ce document, intitulé « TimeCapsule », plonge dans ce concept. Il traite le fait de « ne pas savoir » non pas comme un bug, mais comme une fonctionnalité. En forçant un ordinateur à penser uniquement avec les outils, les mots et les idées disponibles au XIXe siècle, les chercheurs espèrent créer une machine capable de simuler réellement comment les gens de l'époque donnaaient un sens au monde — même quand ce monde était déroutant ou rempli de choses que l'ordinateur ne pouvait probablement pas comprendre.


L'ordinateur voyageur dans le temps qui oublie le futur

Découvrez TimeCapsule. C'est un modèle informatique de 1,2 milliard de paramètres (imaginez un cerveau numérique avec environ 1,2 milliard de petites connexions) qui a été construit avec une règle très stricte : il n'avait le droit de lire que des textes allant de 1800 à 1875.

Les créateurs, Hayk Grigorian et Hamed Yaghobian du Muhlenberg College, voulaient voir ce qui se passe lorsqu'on construit une IA qui possède un « horizon événementiel épistémologique ». C'est une façon sophistiquée de dire que le modèle possède un mur rigide dans sa mémoire. Tout ce qui précède 1875 est son monde ; tout ce qui suit 1875 est un vide total. Il ne se contente pas de prétendre qu'il ne connaît pas le futur ; il est littéralement incapable de le connaître.

L'expérience : Un cerveau victorien dans un corps numérique

Pour construire cela, l'équipe a rassemblé une immense bibliothèque de 136 302 documents du XIXe siècle. Cela comprenait tout, des lois parlementaires aux journaux médicaux, en passant par la poésie et la fiction. Ils ont nettoyé le texte juste assez pour qu'il soit lisible par un ordinateur, tout en conservant les orthographes et les particularités de l'époque. Ensuite, ils ont entraîné le modèle exclusivement sur ces données.

Le résultat ? Un ordinateur qui parle comme un Victorien, mais qui pense comme un tel aussi.

Le tournant de la « hallucination »
D'habitude, quand une IA invente un fait, nous appelons cela une « hallucination » et considérons cela comme une erreur. Mais TimeCapsule fait quelque chose de différent. Lorsque vous lui posez une question sur quelque chose qui n'existait pas en 1875 — comme un ordinateur ou un avion — elle ne se contente pas de dire « je ne sais pas ». Au lieu de cela, elle essaie de comprendre ce que ces choses doivent être en utilisant uniquement les concepts dont elle dispose.

Par exemple, lorsqu'on lui demande de décrire un « ordinateur », TimeCapsule n'a pas dit « une machine qui calcule ». Puisque le mot « computer » en 1875 faisait référence à une personne qui faisait des calculs pour des compagnies d'assurance, et puisque le modèle a été entraîné sur des textes médicaux, il a décrit un ordinateur comme un « poumon hypertrophié » (un poumon élargi et malade). Il a fait le lien entre « calcul », « statistiques » et « signes vitaux » pour créer une explication étrange, mais historiquement logique.

Les chercheurs appellent cela la « réparation ontologique ». Au lieu d'échouer, le modèle tente de manière créative d'intégrer un objet moderne dans une vision du monde du XIXe siècle. C'est comme si vous montriez un smartphone à une personne de 1800 ; elle pourrait le décrire comme un « miroir magique qui contient les voix des morts » parce que c'est le seul vocabulaire dont elle dispose pour le comprendre.

Les chiffres : Est-ce efficace ?

L'équipe a testé TimeCapsule pour voir comment elle comprenait la langue des années 1800 par rapport aux modèles modernes.

  • Ils ont mesuré ce qu'on appelle la perplexité (un score qui indique à quel point un modèle est surpris par le texte qu'il lit ; plus le score est bas, mieux c'est).
  • Un modèle moderne standard (GPT-2) a obtenu un score de 68,83 sur le texte victorien.
  • TimeCapsule a obtenu un score de 37,59.
  • Cela représente une réduction de 45,4 % de la confusion, ce qui signifie que TimeCapsule est beaucoup plus fluide dans la langue spécifique de l'époque que même des modèles modernes plus grands et plus intelligents.

Cependant, le document note que si vous voulez simplement le score le plus bas possible, un modèle massif et moderne comme Mistral-7B peut obtenir un score encore plus bas (16,50). Mais c'est parce que le modèle moderne connaît le futur ! Il triche. Le score plus « bas » de TimeCapsule est en réalité un signe de son honnêteté : il parle véritablement la langue du passé, et ne se contente pas de deviner sur la base de connaissances modernes.

La « vallée dérangeante » de l'histoire

La partie la plus surprenante de l'étude s'est produite lorsque les chercheurs ont demandé à deux experts en littérature et en histoire de deviner quels textes avaient été écrits par des humains et lesquels avaient été écrits par TimeCapsule.

Les résultats étaient un peu inquiétants.

  • Les experts ont mal classé environ 40 % des vrais textes victoriens en les attribuant à la machine.
  • Un expert a pensé qu'un passage réel de Charles Dickens était faux parce qu'il utilisait l'expression « brick-and-mortar » (brique et mortier), que l'expert pensait à tort être un terme moderne (ce qui n'était pas le cas !).
  • Un autre expert a pensé qu'un passage réel était authentique simplement parce qu'il était « ennuyeux à mourir », ce qui s'est avéré être exactement ce que l'IA produisait. L'IA était si douée pour imiter l'écriture banale et quotidienne des années 1800 qu'elle a trompé les experts.

Cela a créé une « crise d'authenticité ». L'IA était si bonne pour être ordinaire qu'elle faisait passer le vrai, l'intéressant ou même le vrai, le banal, pour du faux. Cela suggère qu'à l'ère de l'IA, nous pourrions perdre notre capacité à distinguer ce qui est véritablement l'histoire humaine et ce qui est une imitation numérique.

L'éthique de l'IA « mauvaise »

Le document aborde également une question éthique délicate. L'IA moderne est généralement entraînée pour être « sûre » et polie, refusant de dire des choses racistes ou impérialistes. Mais TimeCapsule n'a pas été entraînée pour être sûre. Elle a été entraînée pour être fidèle à sa période historique.

Parce que les années 1800 étaient une époque d'empires et de rôles de genre stricts, TimeCapsule reflète ces biais.

  • Dans l'« esprit » du modèle, le mot « progrès » est étroitement lié à des mots comme « empire », « conquête » et « domination ».
  • Dans un modèle moderne, « progrès » est lié à « invention » et « amélioration ».

Les chercheurs soutiennent que c'est en réalité une bonne chose pour les historiens. Si vous « corrigez » l'IA pour supprimer ces biais, vous effacez l'histoire de la façon dont les gens pensaient réellement. En conservant les biais, TimeCapsule agit comme un miroir, nous montrant exactement comment le XIXe siècle percevait le monde, y compris ses aspects les plus sombres. Ce n'est pas un outil pour discuter avec un Victorien amical ; c'est un outil pour étudier l'esprit victorien, avec ses défauts et tout le reste.

À retenir

TimeCapsule suggère que pour véritablement comprendre le passé, nous pourrions avoir besoin de construire des ordinateurs qui sont limités. En coupant leur accès au futur, nous les forçons à penser comme les gens du passé. Lorsqu'ils se trompent sur la technologie moderne, ils ne font pas d'erreur ; ils nous montrent comment un esprit du XIXe siècle essaierait de donner un sens à notre monde.

Le document conclut que cette « hallucination générative » n'est pas un bug à corriger, mais une nouvelle façon de faire de la recherche historique. Elle transforme l'ignorance de l'IA en une fenêtre, nous permettant de voir la logique cachée d'un temps qui n'existe plus. Comme le suggèrent les auteurs, le modèle ne se contente pas de mimer l'histoire ; il la reconstruit, un « poumon hypertrophié » à la fois.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →