Characterizing Narrative Content in Web-scale LLM Pretraining Data
Cet article introduit un nouveau cadre et un ensemble de données, NarraDolma, pour caractériser la structure narrative fine des données de pré-entraînement des LLM à l'échelle du web, révélant que les qualités narratives sont présentes de manière mesurable mais inégalement réparties entre les sources et les sujets d'une manière que les pratiques de curation actuelles négligent.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous préparez un gâteau géant pour une fête immense. La recette demande de la « farine », mais vous ne savez pas quel type de farine vous avez. Est-ce une farine à gâteau fine et soyeuse ? Une farine de blé entier grossière ? Est-elle mélangée avec du sable ?
Pendant longtemps, les scientifiques qui construisaient des « Large Language Models » (LLM) — les cerveaux d'IA super intelligents derrière des outils comme les chatbots — ont mélangé leur « farine » (le texte internet sur lequel ils s'entraînent) sans vraiment connaître les ingrédients spécifiques. Ils savaient que certaines parties étaient « toxiques » ou « concernaient les mathématiques », mais ils en savaient peu sur les histoires contenues dans le mélange.
Ce document est comme une équipe de scientifiques de l'agroalimentaire qui a décidé de passer un microscope sur ce tas de farine géant. Ils voulaient répondre à la question : Quelle quantité de narration se trouve réellement là-dedans, et à quoi cela ressemble-t-il ?
Voici la décomposition de leur enquête :
1. Le livre de recettes (Le cadre)
Les chercheurs ne se sont pas contentés de demander : « Est-ce une histoire ? » (Oui/Non). Au lieu de cela, ils ont créé un profil de saveur détaillé basé sur la façon dont les humains racontent des histoires. Ils ont décomposé la « narration » en trois ingrédients principaux :
- L'Acteur (Agentivité) : Qui agit ? Voyons-nous le monde à travers ses yeux ? Ressentons-nous ses émotions ou entendons-nous ses pensées ? (Considérez cela comme le « cœur » de l'histoire).
- La Scène (Cadre) : Où et quand cela se passe-t-il ? Est-ce un « quelque part » vague, ou une pièce poussiéreuse spécifique dans le Paris des années 1920 ? (Considérez cela comme l'« arrière-plan »).
- L'Intrigue (Événements) : Que se passe-t-il réellement ? Y a-t-il des changements ? Y a-t-il une chaîne de cause à effet, ou juste une liste de choses ? (Considérez cela comme l'« action »).
Ils ont transformé ces éléments en 11 « curseurs » ou leviers spécifiques qui peuvent être évalués de 1 à 5.
2. La dégustation (Les données)
Ils ont pris une immense bibliothèque de textes internet appelée DOLMA (qui est gigantesque — 3 billions de mots, soit une bibliothèque qui vous prendrait une vie entière à lire).
- Étape 1 : Ils ne pouvaient pas tout lire. Ils ont donc construit un assistant robotique (un modèle appelé NARRABERT) pour les aider.
- Étape 2 : D'abord, ils ont engagé des experts humains pour lire 400 extraits aléatoires et les évaluer sur ces 11 curseurs. C'était le « standard d'or ».
- Étape 3 : Ils ont ensuite appris au robot assistant à imiter les humains.
- Étape 4 : Le robot a parcouru 3 millions d'extraits et les a tous évalués. Ils ont créé une nouvelle carte appelée NARRADOLMA.
3. Les découvertes surprenantes
Lorsqu'ils ont examiné la carte, ils ont découvert trois choses majeures :
A. Les histoires ne sont pas simplement « présentes » ou « absentes ».
Ce n'est pas comme un interrupteur où un texte est soit une histoire, soit n'en est pas une. C'est plutôt comme un variateur de lumière. Certains textes sont très faibles (faits ennuyeux), d'autres sont brillants (romans dramatiques), et la plupart se situent entre les deux. Les chercheurs ont découvert que la « narration » dans l'internet est un paysage continu et multidimensionnel, et non une simple catégorie.
B. La « farine » est inégalement mélangée.
Si vous pensez que « Reddit » est rempli d'histoires et que « Wikipédia » est rempli de faits, vous avez raison, mais c'est plus complexe.
- Reddit et les Livres sont comme un étagère d'épices remplie de « sentiments intérieurs » et de « pensées de personnages ». Ils sont élevés sur les curseurs de l'« Acteur ».
- Wikipédia et les Actualités sont comme une carte. Ils sont élevés en « Événements » et en « Temps/Lieu », mais bas en « Sentiments ».
- Les blogs de Voyage et de Cuisine sont comme une peinture. Ils sont élevés en « détails sensoriels » (odeurs, vues) mais bas en « Conflit ».
C. On ne peut pas simplement « ajouter plus d'histoires » en ajoutant plus de livres.
Les chercheurs ont découvert que même au sein d'une seule source (comme Reddit), la « narration » varie énormément. Certains posts Reddit sont de la pure drame ; d'autres sont de simples questions techniques.
- La métaphore : Imaginez que vous vouliez rendre votre gâteau plus « moelleux ». Vous pourriez penser : « Je vais juste ajouter plus de farine à gâteau ! » Mais si ce sac de farine contient en fait un mélange de farine à gâteau, de sable et de gravier, simplement ajouter plus du sac ne garantit pas un gâteau plus moelleux. Vous devez savoir quelle partie spécifique du sac est la bonne farine.
4. Pourquoi cela importe
Le document conclut que les personnes qui construisent des modèles d'IA ont traité leurs sources de données (comme « Reddit » ou « Actualités ») comme si elles étaient toutes du même type de conteur. Elles ne le sont pas.
Si une IA est principalement entraînée sur les « Actualités » (événements élevés, sentiments bas), elle pourrait devenir douée pour rapporter des faits mais mauvaise pour comprendre les émotions humaines. Si elle est principalement entraînée sur « Reddit » (sentiments élevés, structure basse), elle pourrait devenir douée pour l'empathie mais mauvaise pour la logique de cause à effet.
L'essentiel :
Ce document n'a pas inventé une nouvelle IA ou réparé une IA défectueuse. Au lieu de cela, il a construit un ruban à mesurer pour les histoires d'internet. Il nous a montré que la partie « histoire » de nos données est désordonnée, variée et inégalement répartie. Avant de pouvoir apprendre à une IA à mieux raconter des histoires, nous devons d'abord comprendre exactement quel type d'histoires se trouve actuellement dans le mélange.
Les chercheurs ont publié leur ruban à mesurer (le modèle) et leur carte (le jeu de données) pour que quiconque puisse les utiliser, afin que nous puissions tous commencer à mieux cuisiner nos gâteaux à l'avenir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.