An Information-Theoretic Approach to Identifying Formulaic Clusters in Textual Data
Cet article présente un algorithme de la théorie de l'information utilisant des distributions d'auto-information pondérées pour identifier des clusters formulaires et des couches stylistiques dans des données textuelles de haute dimension, démontrant son efficacité pour analyser quantitativement les motifs compositionnels au sein de la Bible hébraïque multi-auteurs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un détective essayant de résoudre un mystère au sein d'une immense bibliothèque antique. Cette bibliothèque n'est pas seulement remplie d'histoires aléatoires ; c'est une collection de textes qui ont été écrits, édités et copiés par des centaines de personnes différentes sur des milliers d'années. Certaines parties ont été écrites par un auteur unique avec une voix singulière, tandis que d'autres sont assemblées à partir de sources différentes, comme un patchwork. Le défi est le suivant : comment déterminer à quel tailleur appartient chaque morceau sans interroger les tailleurs ? Vous ne pouvez pas simplement regarder les mots, car certains écrivains peuvent utiliser les mêmes mots pour des raisons différentes. Vous avez besoin d'un moyen de mesurer le « rythme » ou la « prédictibilité » de l'écriture.
C'est ici qu'intervient une branche de la science appelée la Théorie de l'Information. Considérez cela comme un moyen de mesurer à quel point vous êtes surpris lorsque vous lisez le mot suivant dans une phrase. Si vous lisez une histoire où tout peut arriver, vous êtes constamment surpris ; le contenu informationnel est élevé, et l'écriture semble « lâche » ou « créative ». Mais si vous lisez une recette ou un contrat juridique, vous savez exactement quel mot vient ensuite. « Ajoutez une tasse de... » est presque toujours suivi de « farine ». Cette prédictibilité signifie que le contenu informationnel est faible car le motif est rigide et répétitif. Dans cet article, les auteurs utilisent ce concept de « surprise » (ou de manque de surprise) pour trouver des motifs cachés dans les textes anciens. Ils veulent voir s'ils peuvent identifier automatiquement les sections de type « recette » d'un livre par rapport aux sections de type « histoire », simplement en mesurant la prédictibilité de leurs mots.
Le nouvel outil du détective
Les auteurs, Gideon Yoffe, Yair Segev et Barak Sober, ont construit une nouvelle loupe numérique. Ils l'appellent une approche informationnelle non supervisée. Décortiquons cela : « non supervisée » signifie que l'ordinateur n'a pas besoin d'un enseignant pour lui dire ce qu'il doit chercher ; il le découvre par lui-même. « Informationnelle » signifie qu'elle utilise les mathématiques pour mesurer la prédictibilité.
Leur idée principale est simple mais puissante : le texte formulaire est prévisible. Lorsqu'un écrivain utilise une structure rigide, comme une liste d'ancêtres ou un ensemble de lois religieuses, il répète les mêmes phrases encore et encore. Parce que ces phrases apparaissent si souvent, elles deviennent très prévisibles. Dans le langage de la théorie de l'information, les choses prévisibles ont une faible auto-information (faible surprise). Une narration imprévisible et créative a une auto-information élevée (haute surprise).
L'équipe a développé un algorithme qui parcourt un texte, à la recherche de segments d'écriture qui sont inhabituellement prévisibles. Il ne se contente pas de deviner ; il calcule un score pour chaque partie du texte basé sur le degré de « surprise » qu'un modèle de probabilité éprouverait face aux mots qu'il voit. Si une section est pleine de phrases répétitives et formulaires, le modèle n'est pas du tout surpris, et le score reste bas. Si la section est un récit sauvage et créatif, le score augmente. En regroupant les sections à score bas, l'algorithme peut isoler les « clusters formulaires » — les parties du texte qui semblent avoir été écrites par une main différente ou pour un objectif différent.
Tester l'outil sur des textes anciens
Pour voir si leur nouvel outil fonctionne réellement, les auteurs l'ont testé sur la Bible hébraïque, spécifiquement les trois premiers livres : la Genèse, l'Exode et le Lévitique. Ces livres sont célèbres parmi les érudits pour être « composites », ce qui signifie qu'ils sont considérés comme étant composés de différentes sources entrelacées. L'une des questions les plus débattues est de savoir comment séparer la source Sacerdotale (P) — connue pour être très structurée, légaliste et répétitive — des autres parties narratives du texte.
Les chercheurs n'ont pas seulement regardé les mots ; ils ont regardé la structure des mots. Ils ont décomposé le texte en petits morceaux (comme des phrases ou des versets) et ont compté la fréquence d'apparition de certains motifs. Ils ont ensuite lancé leur algorithme pour voir s'il pouvait naturellement séparer le texte en deux groupes : un groupe hautement répétitif (faible surprise) et un groupe plus varié (haute surprise).
Voici ce qu'ils ont trouvé :
- Dans la Genèse : Ils ont examiné la différence entre les longues et ennuyeuses listes de généalogies et les récits passionnants d'Abraham et d'Isaac. L'algorithme a identifié avec succès les généalogies comme le cluster formulaire hautement prévisible. Cela est logique, car les listes de famille suivent un schéma strict et répétitif, tandis que les histoires sont plus fluides.
- Dans l'Exode : Ils ont testé la séparation entre les sections Sacerdotales (P) (qui contiennent des lois sur la construction du Tabernacle et des rituels religieux) et les sections narratives non sacerdotales. L'algorithme a séparé de manière fiable ces deux couches, rejoignant ce que les érudits traditionnels croient depuis longtemps. Les parties Sacerdotales apparaissent comme la zone de « faible surprise » car elles sont pleines d'instructions répétitives.
- Dans le Lévitique : C'était le test le plus délicat. Le Lévitique est rempli de lois, mais les érudits débattent de la présence de deux couches distinctes : la source Sacerdotale (P) et un code de sainteté (H) plus tardif. Les deux sont répétitifs, mais présentent des différences subtiles. Les auteurs ont découvert que leur méthode pouvait les distinguer, mais seulement lorsqu'ils examinaient le texte à travers le bon « prisme ». Selon la taille des segments de texte analysés, l'algorithme mettait parfois en évidence les règles Sacerdotales comme étant les plus répétitives, et d'autres fois le Code de Sainteté. Cela suggère que les deux sont formulaire, mais qu'ils suivent des types de motifs différents qui apparaissent à différentes échelles.
À quel point sont-ils sûrs d'eux ?
Les auteurs prennent soin de ne pas prétendre avoir résolu le mystère de la Bible une fois pour toutes. Au lieu de cela, ils montrent que leur méthode suggère un moyen de quantifier ces différences.
Ils ont d'abord testé leur algorithme sur des données fictives générées par ordinateur pour s'assurer qu'il pouvait trouver des motifs dans un environnement contrôlé. Dans ces simulations, leur méthode a souvent mieux réussi que les outils de clustering standards (comme le k-means ou les modèles de mélange gaussien), surtout lorsque les données étaient éparses et de haute dimension (ce qui est précisément le cas des textes anciens).
Lorsqu'ils ont appliqué leur méthode à la Bible réelle, les résultats ont été prometteurs mais nuancés. Dans le livre de l'Exode, leur méthode concordait avec les classifications des experts dans 68 % des différents réglages de paramètres testés, contre seulement 30 % pour la méthode k-means standard. Dans la Genèse, elle concordait dans 40 % des cas contre 14,6 % pour le k-means. Dans le Lévitique, elle concordait dans 45,5 % des cas contre 29,8 % pour le k-means.
Ces chiffres suggèrent que l'approche informationnelle est un outil puissant pour trouver ces couches cachées, mais qu'elle n'est pas une baguette magique qui fonctionne parfaitement à chaque fois. Le fait que les résultats changent selon la façon dont on découpe le texte (la taille des groupes de mots et la fenêtre de versets) nous indique que la nature « formulaire » de ces textes est complexe. Ce n'est pas une chose unique ; c'est un mélange de motifs qui apparaissent à différentes échelles.
Pourquoi cela importe
Cet article ne donne pas seulement un nouveau moyen de trier des livres ; il offre une nouvelle façon de les écouter. En utilisant les mathématiques pour mesurer la « surprise », les auteurs fournissent un moyen objectif de voir où le rythme d'un texte change. Si une histoire devient soudainement très prévisible, cela peut être le signe qu'un autre auteur a pris la plume, ou que le texte a été copié à partir d'un modèle.
Les auteurs concluent que cette méthode est particulièrement utile pour les textes qui ont été édités et superposés au fil du temps, comme la Bible hébraïque. Elle permet aux chercheurs de voir l'« échafaudage structurel » d'un texte sans avoir besoin de deviner à l'avance quels mots sont importants. Bien que la méthode ne prouve pas exactement qui a écrit quoi, elle fournit un cadre quantitatif qui soutient de nombreuses théories traditionnelles sur la manière dont ces livres anciens ont été assemblés. Elle transforme l'art de l'analyse littéraire en une science des motifs, nous montrant que même dans les histoires les plus complexes, les empreintes de la structure et de la répétition peuvent être trouvées si l'on sait comment mesurer la surprise.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.