← Derniers articles
💬 NLP

Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature

Cet article introduit « Loci Similes », un ensemble de données de référence composé de 545 parallèles vérifiés par des experts entre auteurs latins de l'Antiquité tardive et classiques, conçu pour pallier la rareté des ressources standardisées pour l'entraînement et l'évaluation des grands modèles de langage sur la détection des intertextualités.

Auteurs originaux : Julian Schelb, Michael Wittweiler, Marie Revellio, Barbara Feichtinger, Andreas Spitz

Publié 2026-07-14
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Julian Schelb, Michael Wittweiler, Marie Revellio, Barbara Feichtinger, Andreas Spitz

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un mystère dans une immense bibliothèque antique. Le mystère ? Découvrir quelles vieilles histoires ont été secrètement copiées, modifiées ou évoquées par des auteurs plus tardifs. Dans le monde de la littérature latine, cela s'appelle l'« intertextualité ». Pendant des siècles, les chercheurs ont dû lire des milliers de parchemins poussiéreux à la main, s'appuyant sur leur mémoire pour repérer quand un écrivain comme Jérôme (un moine chrétien) empruntait secrètement une expression géniale à Virgile (un poète païen).

Mais voici le problème : les écrivains ne se contentaient pas de faire un copier-coller. Ils changeaient l'ordre des mots, échangeaient des synonymes ou cachaient la référence si bien qu'un simple outil de « recherche par mot » passerait à côté. C'est comme essayer de trouver une chanson spécifique dans une playlist en fredonnant seulement quelques notes, mais où le chanteur aurait légèrement changé le tempo et les paroles.

Entrez en scène Loci Similes, un nouvel outil numérique créé par une équipe de spécialistes en informatique et d'experts en latin pour aider à résoudre ce problème. Considérez cela comme une « fiche de révision » massive et super organisée pour la bibliothèque.

La grande bibliothèque et la fiche de révision

L'équipe a construit un ensemble de données contenant environ 176 000 petits fragments de texte. Ils les ont divisés en deux tas :

  1. Le tas « Requête » : Des textes écrits plus tard (par des auteurs comme Jérôme, Lactance et Valerius Flaccus).
  2. Le tas « Source » : Des textes écrits plus tôt (des classiques comme Cicéron, Virgile, Ovide et Horace).

Pour s'assurer que leurs outils informatiques apprenaient réellement, ils ont créé une fiche de révision de « vérité terrain ». Cette fiche contient 1 490 connexions spécifiques que des experts humains ont vérifiées comme étant réelles. C'est comme avoir un corrigé où les experts ont dit : « Oui, cette phrase dans le livre de Jérôme est définitivement un clin d'œil à cette phrase dans le livre de Virgile. »

La grande course des ordinateurs

Les chercheurs ont posé la question suivante : Les ordinateurs peuvent-ils trouver ces connexions cachées mieux que les anciens outils de recherche ?

Ils ont organisé une course avec trois types de modèles informatiques :

  1. Le « Compteur de mots » (Modèles lexicaux) : Ils cherchent des mots exacts ou des racines de mots. Ils sont comme un bibliothécaire qui vérifie uniquement si les mêmes mots apparaissent dans les deux livres.
  2. Le « Penseur profond » (Modèles neuronaux denses) : Ils utilisent une IA avancée pour comprendre le sens d'une phrase, même si les mots sont différents. Ils sont comme un détective qui comprend l'« ambiance » d'une histoire.
  3. L'« Équipe en deux étapes » (Récupération et Reclassement) : Cette équipe utilise d'abord le « Compteur de mots » pour extraire une liste de suspects, puis utilise le « Penseur profond » pour vérifier ces derniers.

Ce qu'ils ont découvert (Le coup de théâtre)

C'est ici que l'histoire devient intéressante, car les résultats n'étaient pas ceux attendus par tout le monde.

1. Le « Penseur profond » n'a pas gagné le premier tour.
On pourrait penser que l'IA sophistiquée qui comprend le sens serait la meilleure pour trouver les références cachées. Mais l'article suggère que pour le latin, l'ancien « Compteur de mots » (plus précisément une méthode appelée BM25 utilisant des lemmes, qui sont les formes dictionnaires des mots) a en fait fait un meilleur travail lors de la première étape.

  • Pourquoi ? Le latin est une langue avec des terminaisons de mots folles qui changent selon la grammaire. L'IA sophistiquée se laisse parfois confondre par ces changements, tandis que le « Compteur de mots » est efficace pour les supprimer afin de trouver le mot central.
  • Le résultat : Le « Compteur de mots » a trouvé environ 78 % des copies directes, mot pour mot (références verbatim), lorsqu'il examinait les 100 meilleurs candidats. Les modèles d'IA sophistiqués étaient proches, mais ne l'ont pas battu.

2. Le « Penseur profond » est nécessaire pour les choses difficiles.
Si le « Compteur de mots » était excellent pour trouver les copies exactes, il a échoué lamentablement à trouver les allusions (des indices subtils où le sens est similaire mais les mots sont totalement différents).

  • Le problème : Si Jérôme a écrit une phrase qui ressemblait à celle de Virgile mais utilisait des mots totalement différents, le « Compteur de mots » ne voyait aucune connexion.
  • La solution : Le « Penseur profond » (plus précisément un modèle appelé XLM-R Large) était bien meilleur pour repérer ces connexions subtiles à faible chevauchement. Il pouvait dire : « Hé, même si les mots sont différents, ces deux phrases parlent du même sentiment effrayant. »

3. La stratégie gagnante : L'Équipe en deux étapes.
L'article suggère que la meilleure façon de résoudre le mystère n'est pas de choisir un seul détective, mais d'utiliser une équipe.

  • Étape 1 : Utiliser le « Compteur de mots » pour scanner toute la bibliothèque et extraire les 100 suspects les plus probables pour chaque requête.
  • Étape 2 : Remettre cette liste restreinte au « Penseur profond » pour décider s'il s'agit de vraies références ou de simples coïncidences.
  • Le résultat : Cette approche par équipe a réussi à récupérer 63 % des véritables références cachées tout en réduisant la liste de ce qu'un chercheur humain devrait lire de 97 %. C'est comme transformer un tas de mille aiguilles en un petit panier de 1 900 aiguilles, rendant la tâche beaucoup plus facile.

Ce que l'article écarte

Les auteurs sont très clairs sur ce qui ne fonctionne pas bien :

  • Utiliser l'IA sophistiquée seule ne suffit pas. Si vous comptez uniquement sur le « Penseur profond » sans un bon premier filtre, vous manquez trop de connexions.
  • Utiliser simplement la correspondance de mots ne suffit pas non plus. Si vous ne cherchez que des mots exacts, vous manquez les références subtiles et ingénieuses qui constituent la partie la plus intéressante de la recherche.
  • Ce n'est pas un problème « résolu ». L'article stipule explicitement que trouver ces liens subtils reste « difficile ». L'IA est bonne, mais elle fait encore des erreurs, surtout lorsque la connexion est très courte ou que les mots sont très différents.

L'essentiel à retenir

L'article suggère que bien que l'IA soit un outil puissant pour l'étude de la littérature antique, elle n'est pas une baguette magique qui résout tout instantanément. La meilleure approche actuelle est une approche hybride : utiliser des outils simples et rapides pour restreindre la recherche, puis utiliser des outils d'apprentissage profond et intelligents pour prendre la décision finale.

Les auteurs admettent que leur ensemble de données n'est pas parfait (il ne contient pas chaque connexion qui ait pu exister) et que définir ce qui constitue une « référence » peut être délicat, même pour les humains. Mais avec 1 490 exemples vérifiés par des experts et un nouveau benchmark appelé Loci Similes, ils ont offert aux futurs chercheurs un point de départ solide pour construire des outils encore meilleurs. Le mystère de la bibliothèque antique est toujours en cours de résolution, mais nous avons désormais une bien meilleure lampe de poche.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →