← Derniers articles
🤖 machine learning

Inferring the Size of Large Language Models From Popular Text Memorization

Cet article présente une méthode en boîte noire qui infère des bornes inférieures conservatrices sur les nombres de paramètres des grands modèles de langage en analysant leur précision de mémorisation de textes populaires, permettant ainsi de classer les tailles des modèles et de révéler des stratégies industrielles d'échelle cachées, même pour les systèmes à poids fermés.

Auteurs originaux : Ivica Nikolic

Publié 2026-05-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ivica Nikolic

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous entriez dans une pièce où plusieurs personnes récitent des histoires célèbres comme Alice au pays des merveilles ou la Bible. Vous ne pouvez pas les voir, vous ne pouvez pas leur demander la taille de leur cerveau, et vous ne pouvez pas jeter un coup d'œil à leurs notes. Vous ne pouvez qu'écouter ce qu'ils disent ensuite lorsque vous les interrompez au milieu d'une phrase.

C'est exactement le problème auquel les chercheurs sont confrontés avec les modèles d'IA modernes (Grands Modèles de Langage). Les grandes entreprises technologiques construisent ces IA puissantes mais gardent leurs « plans » secrets. Elles ne vous diront pas combien de « neurones » (paramètres) l'IA possède, ce qui est la méthode standard pour mesurer l'intelligence ou le coût d'un modèle.

Ce papier présente une méthode de détective « boîte noire » astucieuse pour deviner la taille de ces cerveaux d'IA secrets simplement en écoutant la qualité avec laquelle ils terminent les phrases.

L'idée centrale : Le « test de mémoire »

Les chercheurs ont réalisé que presque chaque grande IA est entraînée sur le même tas massif de textes internet. Cela signifie qu'elles ont toutes lu les mêmes livres populaires, textes religieux et documents célèbres.

Pensez-y comme à un concours de mémoire. Si vous demandez à une personne de terminer une phrase tirée d'un livre qu'elle a mémorisé, une personne avec un cerveau plus grand (plus de paramètres) obtiendra généralement la bonne réponse plus souvent qu'une personne avec un cerveau plus petit.

Les chercheurs ont testé cela en :

  1. Sélectionnant 37 textes célèbres du domaine public (comme Hamlet, la Bible et la Constitution américaine).
  2. Les découpant en milliers de petits fragments.
  3. Demandant à différents modèles d'IA de prédire le tout prochain mot dans ces fragments.

Ils ont découvert un motif clair : Plus l'IA est grande, mieux elle devine le mot suivant dans ces histoires célèbres. Même si d'autres facteurs (comme la façon dont l'IA a été enseignée) comptent, la taille du cerveau était le principal moteur du succès.

Les deux outils de détective

Pour transformer ces « scores de mémoire » en une estimation de taille, l'équipe a construit deux outils différents :

1. La « loi d'échelle » (La carte)
Imaginez que vous avez un groupe de personnes connues (des IA open-source) dont vous connaissez la taille du cerveau. Vous tracez leurs scores de mémoire par rapport à leurs tailles connues et dessinez une courbe lisse reliant les points. Cela ressemble à une échelle : à mesure que le score augmente, la taille augmente de manière exponentielle.

  • Comment cela fonctionne : Lorsqu'une IA secrète passe le test, vous voyez où elle se situe sur l'échelle. Si elle obtient un score comparable à un modèle de 100 milliards de paramètres, vous estimez qu'elle est à peu près de cette taille.
  • Le hic : Comme l'IA secrète pourrait être construite différemment (comme un modèle « Mixture of Experts » où seule une partie du cerveau est active à la fois), les chercheurs ont décidé d'être très prudents. Ils ne devinent pas la taille exacte ; ils devinent un plancher minimum. Ils disent : « Cette IA fait au moins cette taille. »

2. Le test « face à face » (La course)
Parfois, vous n'avez pas besoin d'un nombre exact ; vous avez juste besoin de savoir qui est le plus grand.

  • Comment cela fonctionne : Les chercheurs mettent deux IA secrètes en compétition lors du même test de mémoire. Ils utilisent une « course » statistique pour voir si une IA est systématiquement meilleure pour terminer les phrases que l'autre.
  • Le résultat : Si l'IA A bat l'IA B dans la course, ils peuvent affirmer avec confiance : « L'IA A est définitivement plus grande que l'IA B », même sans connaître les chiffres exacts.

Ce qu'ils ont découvert

L'équipe a testé sa méthode sur 19 modèles open-source (où ils connaissaient les réponses) et a eu raison dans 95 % des cas. Ensuite, ils ont tourné leur attention vers les modèles « secrets » d'entreprises comme OpenAI, Google, Anthropic et Alibaba.

Voici ce que le travail de « détective » a révélé sur les stratégies cachées de l'industrie :

  • La stratégie du « gros cerveau » (Google et Anthropic) : Ces entreprises semblent construire des modèles avec des nombres de paramètres massifs. Par exemple, leurs modèles haut de gamme ont montré des signes de centaines de milliards de paramètres, suggérant qu'ils deviennent de plus en plus grands à chaque nouvelle génération.
  • La stratégie de « l'efficacité » (OpenAI et Alibaba) : De manière surprenante, les chercheurs ont constaté que les nouveaux modèles d'OpenAI (comme GPT-4o et les variantes GPT-5) ne semblaient pas devenir significativement plus grands en termes de nombre brut de paramètres par rapport à leurs versions plus anciennes. Ils semblent atteindre un « plafond de taille ». Au lieu d'agrandir le cerveau, ils semblent rendre le cerveau existant plus intelligent grâce à un meilleur entraînement ou à des algorithmes plus intelligents.
  • La vérification de la hiérarchie : La méthode a correctement identifié le classement interne des produits. Par exemple, elle a correctement deviné que le modèle « Opus » d'Anthropic est plus grand que son modèle « Sonnet », qui est plus grand que son modèle « Haiku », sans qu'on lui ait indiqué cet ordre à l'avance.

Les limites (Les petites caractères)

Le papier est très honnête sur ce qu'il ne peut pas faire :

  • C'est une borne inférieure : La méthode est conçue pour être sûre. Elle vous dira que l'IA fait au moins la taille X, mais la taille réelle pourrait être beaucoup plus grande. C'est comme dire : « Cette boîte pèse au moins 10 livres », alors qu'elle pourrait en réalité peser 50.
  • Le problème du « MoE » : Certaines IA modernes utilisent une architecture « Mixture of Experts ». Imaginez une bibliothèque où seuls quelques bibliothécaires spécifiques sont appelés pour répondre à une question, plutôt que tout le personnel. Comme les chercheurs ne peuvent pas voir combien de bibliothécaires il y a au total par rapport à combien sont actifs, ils ne peuvent pas obtenir un décompte total exact pour ces modèles, seulement un minimum conservateur.
  • Pas de triche : La méthode suppose que l'IA n'essaie pas de les tromper. Si une entreprise programme intentionnellement son IA pour oublier les livres célèbres afin de cacher sa taille, cette méthode échouerait.

La conclusion

Ce papier prouve que vous n'avez pas besoin des plans secrets d'une entreprise pour avoir une bonne idée de la taille de son IA. En testant simplement la qualité avec laquelle une IA se souvient d'histoires célèbres, vous pouvez déduire une « taille minimale » fiable et découvrir si une entreprise fait grandir ses modèles en les rendant plus grands ou en les rendant plus intelligents. Cela transforme la « boîte noire » de l'IA en quelque chose que nous pouvons entrevoir, même si nous ne pouvons pas tout voir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →