Stop Comparing LLM Agents Without Disclosing the Harness
Ce document de position soutient que, pour les tâches à horizon long, le dispositif d'exécution de l'agent est souvent un déterminant plus fort de la performance que le modèle de langage sous-jacent, et exhorte la communauté à adopter des protocoles d'évaluation conscients du dispositif afin d'éviter l'attribution systématique des gains d'infrastructure à des améliorations du modèle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée centrale : Ce n'est pas seulement le moteur, c'est la voiture
Imaginez que vous essayez de déterminer quel moteur de voiture est le meilleur. Vous installez un moteur Ferrari dans une berline rouillée et délabrée, avec des pneus à plat et un volant qui ne fonctionne pas. Ensuite, vous installez un moteur légèrement moins puissant dans une voiture de course neuve et haute technologie, équipée de pneus parfaits et d'un système de navigation GPS.
Si la deuxième voiture gagne la course, est-ce parce que son moteur était meilleur ? Non. Elle a gagné parce que la voiture (le châssis, les pneus, la navigation) était meilleure.
Ce document soutient que nous commettons actuellement exactement la même erreur avec l'IA.
Lorsque nous testons des « agents » d'IA (des programmes d'IA capables d'effectuer des tâches comme écrire du code ou corriger des bugs logiciels), nous nous contentons généralement d'un seul score pour déclarer : « Wow, le Modèle A est meilleur que le Modèle B. » Les auteurs affirment que cela est trompeur. Ils soutiennent que pour des tâches complexes et de longue durée, le score dépend beaucoup plus du « harnais » (l'infrastructure logicielle entourant l'IA) que du modèle d'IA lui-même.
Le « Harnais » : Le corps et le système nerveux de l'IA
Le document désigne cette infrastructure sous le nom de « harnais ». Imaginez le modèle d'IA (le « cerveau ») comme un pilote. Le harnais est le cockpit, le système de pilote automatique, le jauge de carburant et la radio de communication.
- Le Modèle (Le Cerveau) : C'est simplement la partie qui pense et génère du texte. Il est « en boucle ouverte », ce qui signifie qu'il émet simplement une réponse et attend la prochaine instruction. Il ne sait pas s'il a fait une erreur tant que quelqu'un ne le lui dit pas.
- Le Harnais (Le Contrôleur) : C'est la couche logicielle qui :
- Décide quelles informations montrer à l'IA (Contexte).
- Vérifie si la réponse de l'IA a du sens (Vérification).
- Demande à l'IA de réessayer si elle échoue (Logique de réessai).
- Empêche l'IA de se perdre dans une trop grande quantité d'informations (Gestion de la mémoire).
Le document affirme que pour des tâches longues et difficiles, le harnais est la « contrainte liante ». Cela signifie que le harnais est le goulot d'étranglement. Si le harnais est mauvais, même l'IA la plus intelligente échouera. Si le harnais est excellent, une IA légèrement moins intelligente peut réussir.
La « Thèse de la Contrainte Liante »
Les auteurs proposent une théorie appelée la Thèse de la Contrainte Liante. En termes simples, elle dit :
« Lorsque nous comparons des modèles d'IA de premier plan sur des tâches difficiles et longues, la différence de leurs scores est causée davantage par la manière dont le harnais est construit que par le modèle utilisé. »
Ils ont constaté que modifier le harnais pouvait faire varier un score de 15 points de pourcentage, tandis que changer le modèle ne déplaçait généralement le score que de 2 à 4 points.
L'Analogie : Imaginez deux coureurs. L'un est un sprinteur olympique (Modèle A), et l'autre est un amateur très en forme (Modèle B).
- Si vous mettez le sprinteur olympique dans des bottes boueuses et lui donnez un lourd sac à dos (Mauvais Harnais), il pourrait perdre contre l'amateur courant avec des chaussures parfaites (Bon Harnais).
- Le document affirme que les classements actuels sont comme une course où tout le monde porte des chaussures différentes, mais où nous ne rapportons que le vainqueur, en ignorant les chaussures.
Pourquoi les classements actuels sont « incomplets »
Actuellement, les benchmarks (comme SWE-bench ou Terminal-Bench) agissent comme s'ils ne testaient que le « cerveau » seul. Mais en réalité, ils testent le Cerveau + Le Harnais.
Puisque les chercheurs publient rarement exactement comment ils ont construit leur harnais (la « recette » du cockpit), nous ne pouvons pas dire si un modèle est réellement plus intelligent ou si l'équipe a simplement construit un meilleur harnais autour de lui.
Les Preuves du Document :
- Exemples réels : Ils ont montré que le même modèle d'IA (Claude Opus) obtenait un score de 45,9 % avec un harnais et de 55,4 % avec un autre. C'est un bond énorme simplement en changeant l'enveloppe logicielle, pas le modèle.
- Expérience contrôlée : Ils ont pris trois modèles de premier plan différents et les ont fait passer à travers trois harnais différents (Minimal, Amélioré et Complet).
- Résultat : Changer le harnais modifiait les scores beaucoup plus que changer le modèle.
- La Surprise : Parfois, un modèle « pire » avec un harnais « meilleur » battait un modèle « meilleur » avec un harnais « pire ». Le classement s'inversait !
La Solution : « Divulgation » et « Décomposition de la Variance »
Le document ne dit pas que nous devrions arrêter d'utiliser des modèles. Il dit que nous devons arrêter de faire semblant que le harnais n'existe pas. Ils proposent une nouvelle façon d'évaluer l'IA :
- La « Carte Harnais » : Tout comme les étiquettes alimentaires listent les ingrédients, chaque soumission de benchmark d'IA devrait lister sa « Carte Harnais ». Cette carte détaille exactement comment le contexte est construit, comment les erreurs sont gérées et comment l'IA est vérifiée.
- Décomposition de la Variance : Au lieu de donner simplement un score, les chercheurs devraient rapporter :
- Quelle part de la différence de score est due au Modèle ?
- Quelle part est due au Harnais ?
- Quelle part est due à l'Interaction entre les deux ?
L'Essentiel
Si vous êtes un chercheur, un investisseur ou un utilisateur regardant les classements d'IA, le document vous avertit : Ne faites pas confiance aux classements aveuglément.
Jusqu'à ce que nous voyions la « Carte Harnais », un classement est comme juger une course sans savoir qui conduisait quelle voiture. Le « gagnant » pourrait simplement avoir eu une meilleure voiture, pas un meilleur pilote. Pour vraiment comprendre les progrès de l'IA, nous devons arrêter de comparer uniquement les cerveaux et commencer à comparer l'ensemble du système — le cerveau et le corps dans lequel il vit.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.