← Derniers articles
💻 computer science

Scaling Laws for Behavioral Foundation Models over User Event Sequences

Cet article établit des lois d'échelle pour les modèles de fondation comportementaux entraînés sur des séquences d'événements utilisateurs, révélant qu'un petit encodeur basé sur des caractéristiques est systématiquement optimal en termes de calcul, que les stratégies d'entraînement optimales changent selon le budget et les métriques d'évaluation, et que les contraintes d'échantillonnage négatif passent finalement des limites de FLOPs à des limites de mémoire.

Auteurs originaux : Rickard Brüel Gabrielsson

Publié 2026-06-05
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rickard Brüel Gabrielsson

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigiez un moteur de recommandation massif et à haute vitesse pour une boutique en ligne géante. Chaque fois qu'un client clique, achète ou recherche, cela laisse une empreinte numérique. Votre objectif est de construire une IA qui prédit ce qu'un client fera ensuite en se basant sur son historique.

Ce document est comme un immense « livre de recettes » scientifique pour construire cette IA. Les auteurs ont mené environ 600 expériences différentes, modifiant le cerveau de l'IA de toutes les manières possibles, pour déterminer la façon la plus efficace de dépenser leur puissance de calcul (ce qui coûte très cher en argent et en électricité).

Voici la décomposition de leurs découvertes, en utilisant des analogies simples :

1. Le cerveau en deux parties : Le Bibliothécaire et le Conteur

La plupart de ces modèles d'IA ont deux parties distinctes travaillant ensemble :

  • Le Bibliothécaire (l'Embedder) : Cette partie examine un article spécifique (comme une paire de chaussures ou une transaction) et détermine ce qu'il est. Il lit le texte, le prix, la couleur et la catégorie.
  • Le Conteur (le Transformer) : Cette partie observe la séquence des événements. Il se souvient que vous avez regardé des chaussures, puis un chapeau, puis une veste, et essaie de dever ce que vous achèterez ensuite.

La Grande Découverte : Les auteurs ont découvert que le « Bibliothécaire » doit être minuscule.

  • L'Analogie : Imaginez que vous embauchiez une équipe pour écrire un roman. Vous avez un budget limité. Vous pourriez penser qu'il vous faut une énorme équipe de chercheurs (le Bibliothécaire) pour chercher des faits pour chaque mot. Mais les auteurs ont découvert que vous n'avez besoin que d'une petite équipe de chercheurs (environ 2 % de votre personnel total).
  • Pourquoi ? Le « Bibliothécaire » voit les mêmes articles populaires (comme des « Nike sneakers ») des milliers de fois. Il s'ennuie et les apprend rapidement. Le « Conteur », en revanche, voit des combinaisons uniques d'événements qui ne se répètent que rarement. Le Conteur a besoin du gros cerveau ; le Bibliothécaire n'a besoin que d'un cerveau petit et efficace.

2. Le dilemme de la « Taille de Lot » (Batch Size) : Combien d'élèves dans une classe ?

Lors de l'entraînement de l'IA, vous ne lui montrez pas un exemple à la fois, mais un « lot » (batch) d'exemples.

  • L'Analogie : Pensez à un enseignant enseignant à une classe. Si la classe est trop petite (taille de lot de 64), l'enseignant est distrait par les particularités individuelles. Si la classe est immense (taille de lot de 2048), l'enseignant peut être submergé ou la leçon devient trop générique.
  • La Découverte : Le « point idéal » dépend de ce que vous mesurez.
    • Si vous vous souciez de la précision (avons-nous eu la bonne réponse ?), le point idéal est une classe de taille moyenne (environ 570 élèves).
    • Si vous vous souciez du classement (le premier résultat est-il le meilleur ?), le point idéal est une classe plus petite (environ 200–275 élèves).
    • À retenir : Vous ne pouvez pas simplement choisir une taille de lot pour tout. La « meilleure » taille change en fonction de ce que vous essayez d'optimiser.

3. L'arbitrage Données vs Modèle : Gros Cerveau ou Grande Bibliothèque ?

Vous avez un budget de calcul fixe (Compute Budget). Achetez-vous une IA super intelligente (plus de paramètres) et nourrissez-la avec moins de données ? Ou une IA légèrement moins intelligente et nourrissez-la avec une bibliothèque massive de données ?

  • La Découverte :
    • À petits budgets : Vous devriez nourrir l'IA avec des quantités massives de données. L'IA est comme une éponge ; elle doit absorber autant d'informations que possible car elle n'est pas encore assez intelligente pour généraliser par elle-même.
    • À très gros budgets : À mesure que vous devenez plus riche (plus de puissance de calcul), l'équilibre change. Vous commencez à avoir besoin d'une IA plus intelligente et de moins de données, pour finalement atteindre un point où le ratio ressemble à celui utilisé pour entraîner les grands modèles de langage (comme ceux qui écrivent du texte).
    • La Tendance : Cela commence par une stratégie « axée sur les données » et évolue lentement vers une stratégie « équilibrée » à mesure que vous disposez d'ordinateurs plus puissants.

4. L'échantillonnage « Négatif » : Combien de mauvaises réponses montrer ?

Lorsque l'IA apprend, elle ne voit pas seulement la bonne réponse ; elle voit aussi des « distracteurs » (mauvaises réponses) pour apprendre ce qu'elle ne doit pas choisir.

  • L'Analogie : Imaginez un examen à choix multiples. Si vous ne montrez à l'étudiant que 3 mauvaises réponses, il pourrait avoir de la chance. Si vous lui montrez 1 000 000 de mauvaises réponses, il apprendra parfaitement le schéma.
  • La Découverte :
    • Petits budgets : Vous avez besoin d'un nombre modéré de mauvaises réponses (des centaines de milliers).
    • Gros budgets : Vous voulez autant de mauvaises réponses que possible. En fait, aux budgets les plus élevés testés, la limite n'était plus la puissance de calcul, mais la mémoire. Le système voulait montrer 2 millions de mauvaises réponses, mais l'ordinateur manquait d'espace pour les stocker.
    • Le Piège : Le « meilleur » nombre de mauvaises réponses dépend de si vous mesurez la précision simple ou le classement complexe. Ils ne sont pas d'accord sur ce chiffre.

5. La leçon la plus importante : L'objectif change

L'avertissement le plus critique du document concerne les métriques (comment vous mesurez le succès).

  • L'Analogie : Imaginez que vous entraînez une voiture de course. Si vous mesurez le succès par la « vitesse de pointe », vous réglez le moteur d'une certaine façon. Si vous mesurez le succès par l'« efficacité énergétique », vous le réglez de manière totalement différente.
  • La Découverte : Dans ces modèles comportementaux, la métrique que vous choisissez change la recette.
    • Si vous entraînez l'IA pour minimiser la « perte » (erreur mathématique), vous obtenez un ensemble de paramètres.
    • Si vous l'entraînez pour maximiser le « classement » (mettre le meilleur article en premier), vous obtenez un autre ensemble de paramètres.
    • Point crucial : L'IA qui est la meilleure pour minimiser les erreurs mathématiques n'est pas toujours l'IA qui est la meilleure pour classer correctement les articles. Vous devez décider exactement ce que vous voulez optimiser avant de commencer à construire le modèle, car la recette « optimale » change en fonction de ce choix.

Résumé

Pour construire le « Modèle de Fondation Comportemental » le plus efficace (une IA qui comprend les actions humaines) :

  1. Gardez la partie « compréhension de l'article » (Embedder) très petite (environ 2 % de la taille totale).
  2. Utilisez une taille de lot moyenne, mais ajustez-la en fonction de si vous vous souciez de la précision ou du classement.
  3. Commencez avec de très grandes quantités de données, mais à mesure que vos ordinateurs deviennent plus puissants, passez vers un modèle plus intelligent.
  4. Utilisez autant d'exemples de « mauvaises réponses » que la mémoire de votre ordinateur peut en contenir.
  5. Le plus important : Décidez exactement à quoi ressemble le « succès » (la métrique) avant de commencer, car cette décision dicte toute l'architecture de votre IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →