← Derniers articles
🤖 machine learning

The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

Cet article démontre, à travers un audit longitudinal de quatre lignées de publications de LLM en open-source, que les scores de fiabilité dérivent de manière significative entre les points de contrôle successifs, soutenant ainsi que de telles mesures doivent être traitées comme des artefacts datés et spécifiques à chaque point de contrôle plutôt que comme des attributs statiques transmis sans nouvelle mesure.

Auteurs originaux : Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

Publié 2026-07-07
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous achetiez une voiture d'une marque de confiance, comme « Mistral » ou « Qwen ». Le vendeur vous remet une brochure (une « Fiche de modèle » ou Model Card) qui indique : « Cette voiture est sûre à 90 % et honnête à 95 % », sur la base de tests effectués l'année dernière.

Maintenant, imaginez que six mois plus tard, la même marque publie une version légèrement mise à jour de cette même voiture. Ils n'ont pas changé le nom, mais ils ont peut-être modifié le moteur, mis à jour le logiciel ou même changé les pneus.

La grande question posée par ce document est la suivante : Pouvez-vous toujours faire confiance à l'ancienne brochure ? Le score de « 95 % de sécurité » de l'ancienne version s'applique-t-il automatiquement à la nouvelle ?

Les auteurs disent : Non. Absolument pas.

Voici la décomposition de leurs conclusions en utilisant des analogies simples :

1. Le problème de la « cible mouvante »

Les chercheurs ont examiné quatre grandes familles d'IA en open-source (Yi, Qwen, Mistral et Gemma). Pour chaque famille, ils ont vérifié trois versions consécutives (Génération 1, 2 et 3).

Pensez à ces modèles d'IA comme à des chefs en cuisine.

  • La Génération 1 est la première recette du chef.
  • La Génération 2, c'est le même chef, mais il a peut-être changé le mélange d'épices, le temps de cuisson ou le type de poêle qu'il utilise.
  • La Génération 3, c'est encore le chef, mais peut-être avec un nouvel assistant ou un four différent.

Même si le nom du chef sur le menu n'a pas changé, la nourriture qu'il sert, elle, change. Le document a constaté que la « fiabilité » de l'IA varie considérablement entre ces versions. C'est comme si la note de « 95 % de délicieux » d'un chef le mois dernier tombait à 85 % ou bondissait à 98 % simplement parce qu'il a légèrement modifié sa recette.

2. La « dérive » est réelle et importante

L'équipe a mesuré à quel point la performance de l'IA a « dérivé » (bougé) entre les versions.

  • Ils ont constaté que le décalage moyen était de 8,00 points de pourcentage.
  • Pour mettre cela en perspective, ils ont comparé ce décalage à ce que l'on attendrait si l'IA se contentait de lancer une pièce de monnaie de manière aléatoire. Le décalage réel était 3,6 fois plus grand que le bruit aléatoire.

L'analogie : Imaginez que vous essayiez de toucher le centre d'une cible au lancer de fléchettes. Si la cible elle-même bouge sauvagement à chaque fois que vous lancez une fléchette (même si vous lancez depuis le même endroit), votre score d'hier ne vous dit rien sur votre score d'aujourd'hui. Le document prouve que la « cible » (le comportement de l'IA) bouge beaucoup plus que nous ne le pensions.

3. Le « certificat » est expiré

Actuellement, les entreprises apposent souvent un score de confiance sur une fiche de modèle et supposent qu'il reste valide pour toute la « lignée de sortie ».

  • Le verdict du document : Un score de confiance n'est pas un certificat permanent comme un permis de conduire. C'est plutôt comme un bulletin météo.
  • Si vous lisez un bulletin météo disant « Il fait beau » mardi dernier, ce rapport est inutile pour décider de votre tenue aujourd'hui. Vous avez besoin d'un nouveau rapport pour les conditions d'aujourd'hui.

Les auteurs soutiennent que chaque fois qu'une nouvelle version d'une IA est publiée, les anciens scores de confiance doivent être considérés comme expirés. Vous ne pouvez pas les reporter sur la nouvelle version sans procéder à de nouveaux tests.

4. La solution de la « Fiche de modèle longitudinale »

Puisque les scores changent autant, les auteurs proposent une nouvelle façon de les rapporter, qu'ils appellent une Fiche de modèle longitudinale (Longitudinal Model Card).

Voyez cela comme un journal de suivi de forme physique plutôt que comme une photo unique.

  • L'ancienne méthode : Une photo de vous aujourd'hui disant : « Je pèse 70 kg ». (Cela ne vous dit pas si vous avez pris ou perdu du poids depuis la semaine dernière).
  • La nouvelle méthode (Fiche longitudinale) : Un journal qui dit : « Le 1er janvier, je pesais 70 kg. Le 1er février, je pesais 72 kg. Le changement est de +2 kg ».

Cette nouvelle fiche comprendrait :

  • Le « instantané » spécifique (Checkpoint) : Exactement quelle version de l'IA a été testée.
  • La date : Quand le test a eu lieu.
  • La dérive : De combien le score a changé par rapport à la version précédente.

5. Ce que cela ne signifie PAS

Le document est très prudent quant à ce qu'il ne prétend pas :

  • Ce n'est pas une question de « meilleur » ou de « moins bon » : L'IA n'est pas devenue nécessairement « plus bête » ou « plus sûre ». Elle a simplement changé. Parfois le score est monté, parfois il est descendu. Le point est qu'il est imprévisible.
  • Ce n'est pas à propos de l'IA fermée : Cette étude n'a porté que sur les modèles open-source que n'importe qui peut télécharger. Elle ne dit rien sur les modèles fermés et secrets des grandes entreprises (comme ceux avec lesquels vous discutez sur un site web), car ils sont plus difficiles à tester.
  • Ce n'est pas une solution « magique » : Le document ne propose pas de moyen d'empêcher l'IA de changer. Il dit simplement : « Arrêtez de prétendre qu'elle ne change pas ».

L'essentiel à retenir

Si vous achetez, régulez ou utilisez une IA en open-source, ne supposez pas que le score de confiance sur la brochure s'applique à la nouvelle version. L'IA est une « cible mouvante ». Vous devez tester chaque nouvelle version pour savoir ce que vous obtenez réellement. L'ancien score n'est qu'un artefact daté, pas une garantie.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →