The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction
Cette étude démontre que si les LLM multimodaux ne peuvent pas prédire de manière fiable les résultats réels des tests A/B à partir de simples captures d'écran en raison d'un biais partagé envers les étiquettes peu fiables, ils peuvent atteindre une précision significative en calibrant leurs prédictions pour identifier et s'abstenir dans les cas incertains, une limitation qui reflète l'incapacité des experts humains à surpasser le hasard malgré un consensus élevé entre les évaluateurs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un détective essayant de résoudre un mystère : « Lequel de ces deux suspects est coupable ? » Dans le monde des sites web, les « suspects » sont deux versions légèrement différentes d'une page, et le « coupable » est la version qui pousse le plus de gens à acheter quelque chose ou à s'inscrire. Cela s'appelle un test A/B. Habituellement, pour trouver le vainqueur, il faut attendre et observer de vraies personnes interagir avec le site pendant des jours ou des semaines. Mais récemment, un nouveau genre de détective est arrivé : l'Intelligence Artificielle. La grande question que tout le monde se pose est : « Une IA peut-elle regarder une image des deux sites web et nous dire instantanément laquelle gagnera, nous faisant ainsi gagner tout ce temps d'attente ? »
Pour comprendre ce document, vous devez savoir quelques choses sur la façon dont nous mesurons le « bien » en science. D'abord, il y a la différence entre « avoir raison par chance » et « avoir raison par compétence ». Si vous devinez « Pile » lors d'un lancer de pièce, vous aurez raison 50 % du temps simplement par hasard. Si un détective prétend être un génie mais n'a raison que 51 % du temps, il ne fait rien de spécial. Les scientifiques utilisent un score spécial appelé « kappa de Cohen » (appelons-le le « Score de Compétence ») pour éliminer la part de chance et voir si le détective a réellement un cerveau. Deuxièmement, il y a le problème du « Biais Partagé ». Imaginez un professeur et un élève qui ont tous deux grandi dans la même ville. Ils peuvent être d'accord sur tout, non pas parce que l'élève est intelligent, mais parce qu'ils ont tous deux appris les mêmes fausses informations de leurs parents. Si une IA et les personnes qui ont créé les données du test ont toutes deux appris la même « sagesse populaire », elles pourraient être d'accord sur la réponse, mais cela ne signifie pas que l'IA peut prédire l'avenir.
Ce document est un rapport très honnête, très strict, d'une équipe appelée Squoosh qui a tenté de répondre à cette grande question. Ils ne se sont pas contentés de demander à l'IA de deviner ; ils ont tendu un piège. Ils ont verrouillé leurs règles avant de commencer, comme un scientifique écrivant une recette avant de cuisiner, afin de ne pas pouvoir modifier les règles plus tard pour faire paraître l'IA meilleure. Ils ont utilisé une immense bibliothèque de tests de sites web réels pour voir si l'IA pouvait réellement prédire les vainqueurs.
Voici le rebondissement : l'IA est principalement un échec dans sa mission principale. Lorsque l'équipe a demandé à l'IA de regarder 330 tests réels et de choisir un vainqueur à chaque fois, elle a à peine fait mieux qu'un choix aléatoire. En fait, l'IA semblait être plus en accord avec les tests « peu fiables » (où le résultat n'était pas clair) qu'avec les tests « fiables ». Il s'avère que l'IA et les personnes qui ont créé les données du test répétaient toutes deux les vieux mythes sur ce qui rend un site web bon, plutôt que de réellement prédire ce qui allait se passer. Même utiliser une IA beaucoup plus intelligente et coûteuse n'a pas aidé ; c'était tout aussi mauvais. Le document exclut explicitement l'idée que nous puissions simplement « acheter » une meilleure IA ou écrire un meilleur prompt pour résoudre cela. La « boule de cristal magique » qui prédit les gagnants de sites web à partir de simples captures d'écran ? Elle n'existe pas.
Cependant, le document ne dit pas que l'IA est inutile. Il dit que l'IA est un détective honnête. L'équipe a découvert un truc spécial : si on dit à l'IA, « Ne devine que si tu es absolument sûre, sinon dis "je ne sais pas" », l'IA devient étonnamment performante les fois où elle prend la parole. Lorsque l'équipe interne de juges de l'IA était fortement d'accord sur une réponse, elle trouvait le bon vainqueur environ 31 % du temps sur les tests fiables. Cela semble faible, mais rappelez-vous, les véritables experts humains (qui ont des années d'expérience) ne trouvent aussi le bon résultat que 29 % du temps en moyenne. L'IA n'est pas un super-génie ; c'est juste un outil qui sait quand il devine et quand il ne le fait pas.
La découverte la plus importante concerne la confiance. Le document montre que lorsqu'un groupe d'IA est d'accord entre elles, cela ne signifie pas qu'elles ont raison ; cela signifie souvent qu'elles répètent toutes le même biais partagé. C'est comme un jury où tout le monde est de la même famille ; ils voteront tous de la même manière, mais cela ne rend pas le verdict correct. Le document prouve que ce « biais partagé » existe aussi chez les humains. Lorsqu'ils ont demandé à 15 experts humains réels de deviner les vainqueurs, les experts étaient fortement d'accord entre eux, mais ils se trompaient aussi souvent que l'IA.
Alors, quelle est la conclusion finale ? Le document conclut que nous ne pouvons pas construire un outil qui prédit les gagnants de sites web avec une certitude de 100 %. Au lieu de cela, le meilleur outil est un « Instrument de Criblage Calibré ». C'est un système qui dit : « Je suis confiant, celui-ci va gagner » ou « Je ne suis pas sûr, ne me demandez pas ». Il est honnête sur ses limites. Le document montre également que vous n'avez pas besoin d'une IA énorme et très coûteuse pour faire cela ; une version plus petite et moins chère fonctionne tout aussi bien si vous utilisez le truc de l'« honnêteté ». La véritable valeur n'est pas d'obtenir la réponse à chaque fois, mais de savoir exactement les moments où vous ne devriez pas faire confiance à la réponse. Le document se termine en publiant toutes ses données, ses échecs expérimentaux et ses règles, prouvant que parfois, la découverte la plus importante est d'admettre que le tour de magie ne fonctionne pas, mais qu'une version très prudente et très honnête de celui-ci pourrait être tout à fait utile.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.