LLM generation novelty through the lens of semantic similarity
Cet article propose un cadre de recherche sémantique à trois étapes et évolutif pour mesurer la nouveauté de la génération des LLM par rapport aux corpus complets de pré-entraînement, révélant que les modèles utilisent des données sur des séquences plus longues qu'on ne le pensait auparavant, présentent des motifs de nouveauté spécifiques à certains domaines et augmentent la nouveauté grâce à l'ajustement d'instructions.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un détective essayant de déterminer si un élève reproduit le contenu d'un examen. Si l'élève copie une phrase mot pour mot du manuel, la reproduction est évidente. Mais que se passe-t-il s'il lit tout le chapitre, comprend le concept, puis écrit une phrase totalement nouvelle qui signifie exactement la même chose ? Est-ce de la reproduction ou un véritable apprentissage ? C'est la grande question à laquelle sont confrontés les scientifiques qui étudient l'intelligence artificielle (IA). Ces modèles d'IA, souvent appelés Grands Modèles de Langage (LLM), sont comme des étudiants surpuissants qui ont lu presque tout l'internet. Ils peuvent écrire des histoires, résoudre des problèmes mathématiques et discuter avec nous. Mais parfois, ils ne font que répéter ce qu'ils ont lu auparavant, et d'autres fois, ils semblent inventer quelque chose de nouveau. La partie délicate consiste à faire la différence entre « copier » et « créer » lorsque l'IA est si douée pour cacher ses sources. Les scientifiques veulent savoir : l'IA est-elle réellement en train de réfléchir et de généraliser, ou n'est-elle qu'un perroquet sophistiqué répétant des motifs mémorisés ?
Cet article présente une nouvelle méthode ingénieuse pour résoudre ce mystère. Au lieu de simplement chercher des correspondances de mots exactes (comme un correcteur orthographique), les auteurs ont construit un système qui examine le sens derrière les mots. Ils appellent cela la « similitude sémantique ». Pensez-y comme à la comparaison de deux peintures. Si vous ne regardez que les coups de pinceau spécifiques, deux peintures peuvent paraître totalement différentes. Mais si vous regardez l'image globale, vous pourriez réaliser qu'elles représentent toutes deux le même coucher de soleil. Les chercheurs ont utilisé cette idée pour scanner les immenses bibliothèques de données sur lesquelles l'IA a été entraînée. Ils ne se sont pas contentés de demander : « L'IA a-t-elle copié cette phrase ? » Ils ont demandé : « L'IA a-t-elle copié l'idée de cette phrase, même si elle a utilisé des mots différents ? »
Pour tester cela, l'équipe a utilisé une famille de modèles d'IA appelée SmolLM. Ils ont mis en place une enquête en trois étapes. Premièrement, ils ont utilisé un outil de recherche rapide pour trouver les idées les plus similaires dans la bibliothèque d'entraînement. Deuxièmement, ils ont réévalué ces résultats pour s'assurer qu'ils regardaient le bon type de similitude, et non de simples correspondances courtes et faciles. Enfin, et c'est la partie la plus importante, ils ont comparé les réponses de l'IA aux réponses écrites par de vrais humains. Cela a servi d'outil de « calibration », semblable à un chef qui goûte un plat par rapport à une recette standard pour voir si l'assaisonnement est juste. En faisant cela, ils pouvaient mesurer à quel point la production de l'IA était réellement « novatrice » (nouvelle et différente), qu'elle ait l'air sophistiquée ou simple.
Les résultats ont été surprenants et changent notre perception de ces modèles d'IA. Premièrement, ils ont découvert que les modèles d'IA puisent dans leurs données d'entraînement sur des segments de texte beaucoup plus longs que ce que l'on pensait auparavant. Il ne s'agit pas seulement de copier une phrase unique ; ils tissent ensemble des idées provenant de longs paragraphes. Deuxièmement, le type de tâche importe énormément. Lorsque l'IA est sollicitée pour faire quelque chose de très strict, comme résoudre un problème mathématique, elle a tendance à être moins novatrice car il n'y a qu'une seule bonne façon de donner la réponse. Mais lorsqu'on lui demande d'écrire une histoire ou de répondre à une question complexe, elle devient beaucoup plus créative et moins semblable à un imitateur.
La découverte la plus intéressante concernait peut-être l'« ajustement par instructions » (instruction tuning). Il s'agit de l'apprentissage par lequel on enseigne à une IA à suivre des commandes spécifiques, comme « agis comme un assistant utile ». Les chercheurs ont découvert que cet entraînement ne change pas seulement le style de l'IA ; cela la rend en fait plus novatrice. Les modèles ajustés par instructions ont commencé à utiliser des formulations et des structures différentes qui étaient moins similaires à leurs données d'entraînement d'origine. C'est comme si le fait d'apprendre à l'IA à suivre des instructions lui avait donné la confiance nécessaire pour arrêter de répéter le manuel et commencer à écrire sa propre histoire.
Les auteurs ont également découvert que les modèles d'IA plus petits étaient souvent plus « novateurs » que les géants. Les modèles plus gros semblaient rester plus proches de leurs données d'entraînement, presque comme s'ils avaient plus peur de s'éloigner de ce qu'ils avaient mémorisé. Bien que l'étude ne prouve pas que ces modèles « pensent » au sens humain du terme, elle suggère fortement que l'ajustement par instructions les aide à dépasser la simple mémorisation. Les chercheurs ont rendu tous leurs outils et données publics afin que d'autres puissent vérifier leur travail, espérant que cette nouvelle façon de mesurer la « nouveauté » aidera à comprendre exactement ce que ces cerveaux numériques apprennent et quand ils créent véritablement quelque chose de nouveau.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.