Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation
Cet article démontre que le « verrouillage de preuve » (evidence locking) — un flux de travail où les juges LLM extraient et conservent des preuves dans un appel distinct avant de rendre un verdict final — dégrade considérablement la performance d'évaluation en réduisant l'alignement avec les préférences humaines et en augmentant l'incohérence liée à l'ordre des réponses par rapport au jugement structuré en un seul appel.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un détective tentant de résoudre un mystère, mais qu'au lieu d'examiner la scène de crime vous-même, vous soyez contraint de lire un rapport de police écrit par quelqu'un d'autre. Vous devez décider qui est le coupable en vous basant entièrement sur ce résumé écrit. C'est le monde des « Juges IA ». Dans le domaine de l'intelligence artificielle, nous demandons souvent à des modèles informatiques intelligents d'agir comme des arbitres, décidant laquelle de deux réponses est la meilleure. Habitéralement, ces juges IA examinent les réponses originales et la question d'un seul coup, prenant une décision rapide. Mais récemment, une nouvelle idée est devenue populaire : « Faisons d'abord écrire ses raisons à l'IA ! » L'espoir était que si l'IA devait expliquer son raisonnement et rassembler des preuves avant de choisir un vainqueur, elle serait plus juste, plus logique et plus difficile à tromper. C'est comme demander à un élève de montrer son calcul dans un test de mathématiques avant de lui donner sa note. Mais et si ce « travail » écrit n'était pas réellement suffisant pour résoudre le problème ? Et si l'acte de figer cette note écrite et de jeter les réponses originales rendait l'IA réellement moins bonne dans son travail ?
Ce document, intitulé « Evidence Lock Before Commitment » (Verrouillage des preuves avant l'engagement), explore précisément cette question. Le chercheur, Divyansh Singh de l'Université de Floride, voulait tester un flux de travail spécifique que beaucoup de gens commençaient à utiliser. Il s'est demandé : Si nous forçons une IA à noter ses preuves en une étape, à sauvegarder cette note, puis à ne donner que cette note à une seconde étape pour prendre la décision finale (sans lui permettre de revoir les réponses originales), prend-elle toujours de bonnes décisions ? Il a testé cela avec deux modèles d'IA très intelligents, Claude Sonnet 4.5 et GPT-5, à travers 24 000 scénarios de jugement différents.
Les résultats ont été un véritable choc. Le chercheur a découvert que cette méthode de « Verrouillage des preuves » rendait en fait les juges IA moins performants. Lorsque l'IA était forcée de se fier uniquement à ses notes figées, elle était en accord avec les préférences humaines 4 à 6 points de pourcentage moins souvent que lorsqu'elle pouvait simplement regarder les réponses originales. Elle devenait également beaucoup plus confuse par l'ordre de présentation des réponses, devenant plus incohérente de 8 à 10 points de pourcentage. Curieusement, le simple fait de demander à l'IA de rédiger des preuves pendant qu'elle regardait encore les réponses originales (une méthode de « appel unique structuré ») fonctionnait très bien. Le problème n'était pas l'écriture ; le problème était le « verrouillage ». En figeant les preuves et en coupant l'accès à la source, l'IA perdait sa capacité à voir l'ensemble du tableau. Le document suggère que si la conservation d'un registre écrit est excellente pour l'audit et la vérification ultérieure du travail, elle ne devrait pas remplacer le matériel source lors de la prise de décision finale. L'« interface figée » dégrade la qualité du verdict, prouvant que parfois, vous avez réellement besoin de voir la scène de crime vous-même, et non de simplement lire le rapport.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.