← Derniers articles
🤖 AI

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

Ce papier soutient que les cadres d'évaluation actuels des LLM reposant sur des invites statiques sont trompeurs car l'optimisation des invites modifie considérablement le classement des modèles, rendant nécessaire une optimisation des invites par modèle pour identifier avec précision le meilleur modèle pour une tâche spécifique.

Auteurs originaux : Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

Publié 2026-05-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Le piège du « taille unique »

Imaginez que vous êtes un responsable de recrutement cherchant le meilleur chef pour votre restaurant. Vous avez cinq chefs différents (appelons-les Modèle A, B, C, D et E). Pour les tester, vous leur donnez à tous la même carte de recette exacte : « Préparez un ragoût. Utilisez du sel, du poivre et des oignons. »

Vous les observez cuisiner, goûtez le ragoût et les classez. Le Chef B gagne. Vous engagez le Chef B.

Le problème : Le Chef B est excellent pour suivre cette recette spécifique, mais peut-être que le Chef D est en réalité un génie qui a juste besoin que la recette soit écrite légèrement différemment pour briller. Peut-être que le Chef D a besoin que l'instruction dise : « Faites mijoter les oignons d'abord, puis ajoutez le sel » pour donner le meilleur de lui-même.

Ce papier soutient que les méthodes actuelles de test des modèles d'IA (Grands Modèles de Langage) ressemblent à ce responsable de recrutement. Ils donnent à chaque IA exactement la même invite statique (la carte de recette) et les classent en fonction de qui s'en sort le mieux avec cette carte spécifique.

Les auteurs affirment que cela est trompeur. Dans le monde réel, si vous engagez une IA, vous ne lui donneriez pas juste une invite générique ; vous ajusteriez les instructions pour obtenir les meilleures performances de cette IA spécifique. Ce papier appelle ce processus l'Optimisation des Prompts (PO).

L'expérience : Ajustez la recette, changez le gagnant

Les chercheurs ont pris cinq modèles d'IA populaires et les ont testés sur diverses tâches (comme résoudre des problèmes de mathématiques, répondre à des questions d'affaires ou extraire des données).

  1. Round 1 (L'ancienne méthode) : Ils ont donné à chaque modèle la même invite de « base ». Ils les ont classés.
  2. Round 2 (La nouvelle méthode) : Ils ont utilisé un outil automatisé pour « régler » l'invite pour chaque modèle individuellement. Ils ont demandé à l'IA : « Comment pouvons-nous réécrire les instructions pour que vous les compreniez le mieux ? » puis ont relancé les tests.

Le résultat : Le classement a complètement changé.

  • Dans certains cas, le modèle arrivé dernier au Round 1 a bondi à la première place au Round 2.
  • Le modèle qui était « le meilleur » dans l'ancien test n'était pas nécessairement le meilleur lorsqu'on lui donnait des instructions adaptées à son cerveau spécifique.

L'analogie : C'est comme tester des coureurs sur une piste.

  • Ancienne méthode : Vous faites courir tout le monde avec de lourdes bottes. Le Coureur A gagne car il est habitué aux lourdes bottes.
  • Nouvelle méthode : Vous donnez au Coureur A des baskets légères et au Coureur B des semelles orthopédiques sur mesure. Soudain, le Coureur B gagne.
  • Conclusion : Si vous ne les aviez testés qu'avec des bottes lourdes, vous auriez engagé le mauvais coureur pour un marathon.

Points clés de l'étude

1. Le modèle « meilleur » dépend de l'invite
Le papier a découvert que le « gagnant » d'une compétition change selon la façon dont les instructions sont rédigées. Si vous voulez choisir la meilleure IA pour un travail spécifique, vous devez d'abord optimiser les instructions pour cette IA spécifique. Si vous ne le faites pas, vous risquez de choisir un modèle qui est en réalité médiocre pour vos besoins.

2. Différents modèles réagissent différemment
Tout comme les humains, différentes IA ont des « personnalités » ou des sensibilités différentes.

  • Certains modèles (comme le Modèle B dans l'étude) étaient très sensibles aux changements d'invite. Un petit ajustement les faisait performer beaucoup mieux.
  • D'autres modèles étaient déjà si bons à une tâche spécifique (comme le routage simple) que l'ajustement de l'invite ne les aidait pas beaucoup, ou parfois même les confondait.

3. Le « Critique » peut se tromper
Les chercheurs ont utilisé une IA « critique » (GPT-4o) pour aider à réécrire les invites pour les autres modèles. Habituellement, cela fonctionnait très bien. Cependant, parfois le critique devenait trop malin ou les instructions devenaient trop complexes, ce qui faisait échouer le modèle.

  • Exemple : Dans un cas, l'invite optimisée demandait à l'IA de « réfléchir étape par étape » à tel point qu'elle a commencé à répondre aux questions d'exemple dans l'invite au lieu de la question de test réelle. C'était comme un élève qui lit les réponses du test pratique à voix haute au lieu de passer l'examen.

Ce que cela signifie pour vous (le praticien)

Si vous êtes une entreprise essayant de choisir une IA pour faire un travail (comme répondre aux e-mails clients ou analyser des documents), ne vous contentez pas de lancer un benchmark standard.

Le papier conclut que pour trouver le vrai meilleur modèle pour votre tâche spécifique, vous devez :

  1. Prendre votre tâche.
  2. Essayer différents modèles.
  3. Optimiser l'invite pour chaque modèle individuellement pour voir ce dont ils sont réellement capables.
  4. Ensuite, choisir le gagnant.

Si vous sautez l'étape 3 et utilisez simplement une invite générique, vous prenez probablement une mauvaise décision d'embauche basée sur un test trompeur.

Résumé

Le papier est un avertissement : Ne jugez pas un poisson par sa capacité à grimper à un arbre, et ne jugez pas une IA par sa capacité à suivre une invite générique. Pour savoir qui est vraiment le meilleur, vous devez parler leur langue. Si vous n'optimisez pas l'invite pour chaque modèle, vos résultats d'évaluation sont probablement faux, et vous pourriez vous retrouver avec le mauvais outil pour le travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →