← Derniers articles
📊 statistics

LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency

Cet article établit un cadre d'inférence semi-paramétrique pour la complétion de tenseurs de faible rang dans l'évaluation des LLM, dérivant des bornes d'efficacité et introduisant une méthode de blanchiment de score pour permettre une estimation asymptotiquement normale et quantifiée de l'incertitude des capacités des modèles à partir de comparaisons par paires bruitées et éparses.

Auteurs originaux : Jiachun Li, David Simchi-Levi, Will Wei Sun

Publié 2026-09-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jiachun Li, David Simchi-Levi, Will Wei Sun

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de l'intelligence artificielle en pleine évolution, un nouveau type de défi statistique est apparu. À mesure que les grands modèles de langage deviennent plus performants, la question n'est plus seulement de savoir comment les construire, mais de savoir exactement à quel point ils sont bons. Pour y répondre, les plateformes se sont tournées vers une méthode qui imite la façon dont les humains apprennent : demander à des personnes de comparer deux réponses côte à côte et de voter pour la meilleure. Ce processus génère un flux massif de données, mais ces données sont désordonnées. Certains modèles sont comparés des milliers de fois, tandis que d'autres sont rarement vus. Certaines questions sont posées constamment, tandis que d'autres sont ignorées. Le résultat est un classement qui ressemble à un classement clair, mais qui est en réalité construit sur une fondation d'informations inégales, bruitées et incomplètes. Sans un moyen de mesurer l'incertitude de ces classements, il est difficile de savoir si un modèle s'est réellement amélioré ou si le résultat n'est qu'un coup de chance des données.

Des chercheurs du MIT et de l'Université Purdue ont abordé ce problème en traitant l'évaluation de ces modèles d'IA comme un puzzle de pièces manquantes. Ils ont réalisé que la capacité d'un modèle n'est pas un chiffre unique, mais un profil complexe qui change selon la tâche, la langue ou l'utilisateur. Pour donner un sens à cela, ils ont imaginé la performance de chaque modèle dans chaque scénario possible comme une vaste grille multidimensionnelle de scores cachés. La plupart de ces scores ne sont jamais directement observés car nous ne pouvons pas demander à un humain de comparer chaque modèle avec tous les autres dans chaque situation. Au lieu de cela, nous ne voyons que le résultat de confrontations spécifiques et aléatoires. Les chercheurs ont développé un nouveau cadre mathématique pour combler ces scores manquants, non pas par simple supposition, mais en calculant les valeurs les plus probables tout en mesurant rigoureusement le degré de confiance de ces suppositions.

Le cœur de leur travail traite d'une difficulté spécifique que les méthodes précédentes avaient omise : la nature inégale des données. Dans un monde parfait, chaque comparaison serait également informative, mais en réalité, un affrontement entre deux modèles très similaires fournit beaucoup d'informations utiles, tandis qu'un affrontement entre un modèle de haut niveau et un modèle faible ne nous apprend presque rien. De plus, la manière dont les données sont collectées est souvent biaisée en faveur des modèles populaires ou des sujets tendance. Les chercheurs ont découvert que les outils statistiques standards échouent dans cet environnement car ils supposent que les données sont uniformes. Ils ont découvert que la machinerie mathématique utilisée pour estimer ces scores devient instable lorsque l'information est disproportionnée, menant à des classements peu fiables et à des intervalles de confiance trompeurs.

Pour résoudre cela, l'équipe a introduit une technique qu'elle appelle le « blanchiment de score » (score whitening). Imaginez cela comme l'ajustement du volume d'une radio afin que chaque station, qu'elle émette clairement ou avec de la statique, contribue de la même manière au son final. En rescalant mathématiquement chaque comparaison en fonction de la quantité d'information qu'elle porte réellement, ils ont transformé les données chaotiques et inégales en un flux équilibré. Cela leur a permis de construire un nouveau type d'estimateur capable de gérer le désordre du monde réel de l'évaluation de l'IA. Ils ont prouvé que cette méthode permet la création d'intervalles de confiance qui sont à la fois précis et efficaces, c'est-à-dire aussi serrés que possible sans sacrifier la fiabilité.

Leurs conclusions montrent qu'en tenant compte de la structure de bas rang (low-rank structure) des données — signifiant que la performance d'un modèle est pilotée par quelques facteurs sous-jacents comme la capacité de raisonnement ou la compétence en codage plutôt que par du bruit aléatoire — il est possible de prêter de la force entre différentes tâches et modèles. Cet emprunt d'informations est crucial lorsque les données sont rares. Les chercheurs ont démontré que leur approche fonctionne non seulement pour des questions simples, comme « est-ce que le Modèle A est meilleur que le Modèle B ? », mais aussi pour des questions complexes et non linéaires, telles que « quelle est la probabilité que le Modèle A gagne dans une catégorie spécifique ? ».

Dans des expériences utilisant des données synthétiques et des données réelles de la plateforme populaire Arena, la nouvelle méthode a prouvé sa valeur. Comparé aux approches existantes qui traitent chaque tâche séparément ou ignorent l'échantillonnage inégal, le nouvel estimateur a produit des classements avec des marges d'erreur nettement plus étroites. Il a réussi à calibrer ses niveaux de confiance, ce qui signifie que lorsqu'il affirmait avoir 95 % de chances d'avoir raison, il avait raison environ 95 % du temps. L'étude confirme que bien que les données issues des préférences humaines soient intrinsèquement bruitées et biaisées, il est possible d'en extraire une image claire et statistiquement solide de la performance des modèles. Cela fournit un moyen rigoureux pour les développeurs et les utilisateurs de comprendre non seulement qui gagne, mais aussi à quel point nous sommes certains de la victoire, transformant une collection de votes bruités en une mesure fiable de la capacité de l'intelligence artificielle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →