← Derniers articles
📊 statistics

Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review

Cette réplique répond aux commentaires concernant l'expérience de classement ICML 2023 en structurant sa réponse autour de quatre thèmes clés : le cadrage de l'évaluation par les pairs comme estimation statistique, l'atténuation des enjeux d'équité et stratégiques dans le mécanisme isotone, l'intégration de signaux complémentaires tels que les classements des évaluateurs, et la proposition d'un cadre centré sur l'humain pour l'ère de l'IA générative.

Auteurs originaux : Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

Publié 2026-05-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez le monde de la recherche informatique de premier plan (spécifiquement l'Intelligence Artificielle) comme un immense festival de musique chaotique. Chaque année, des milliers de groupes (les chercheurs) veulent jouer sur la scène principale (voir leurs articles publiés). Mais il n'y a que quelques centaines de juges (les réviseurs) pour les écouter, et le festival grandit si vite que les juges sont noyés sous les candidatures.

Les auteurs de cet article, une équipe de statisticiens et d'informaticiens, soutiennent que nous devons cesser de traiter ce festival comme un simple concours de popularité et commencer à le traiter comme un puzzle statistique. Voici une décomposition de leurs idées en utilisant des analogies du quotidien :

1. Le Problème : Trop de billets, pas assez de juges

Le festival explose. En 2026, ils ont reçu plus de 26 000 chansons à juger. Les juges sont fatigués et ne peuvent pas écouter chaque chanson parfaitement. Parfois, un juge passe une mauvaise journée, parfois il ne « comprend » tout simplement pas un genre spécifique, et parfois la musique est tout simplement trop bonne ou trop mauvaise pour qu'il puisse juger équitablement.

Les auteurs disent : « Nous ne pouvons pas simplement laisser le public décider (comme en comptant les « likes » sur les réseaux sociaux) car le public n'est pas assez expert. Nous avons besoin d'un meilleur moyen de déterminer quelles chansons sont réellement les meilleures. »

2. La Solution : La « Playlist de l'Auteur » (Le Mécanisme Isotonique)

Les auteurs proposent une astuce ingénieuse appelée le Mécanisme Isotonique.

L'Analogie : Imaginez que vous êtes un juge dans un concours de cuisine. Vous devez noter 100 plats. Vous pourriez être un peu sévère avec les plats épicés ou un peu trop indulgent avec les desserts. Vos scores sont « bruyants » (un peu désordonnés).
Maintenant, imaginez que le chef (l'auteur) qui a préparé le plat est juste là. Il connaît mieux que quiconque sa propre cuisine. Il sait exactement comment ses 10 plats se comparent les uns aux autres.

  • L'Ancienne Méthode : Le chef dit simplement : « Mon plat est un 9 sur 10. » (C'est facile de mentir ; tout le monde veut un 10).
  • La Nouvelle Méthode : On demande au chef de classer ses propres 10 plats du meilleur au pire. « Le plat A est meilleur que le plat B, qui est meilleur que le plat C. »

Pourquoi cela fonctionne : Il est très difficile de mentir sur un classement de son propre travail sans se faire prendre. Si vous dites que votre « Plat C » est le meilleur, mais que votre « Plat A » est en réalité terrible, les mathématiques peuvent repérer le mensonge. En demandant aux auteurs de classer leurs propres soumissions, le système peut « nettoyer » les scores désordonnés des juges. C'est comme utiliser la propre connaissance du chef pour corriger la mauvaise audition du juge.

3. Aborder la Préoccupation « Injustice »

Certaines personnes s'inquiétaient : « Et si un chef célèbre avec 50 plats obtenait un énorme avantage sur un nouveau chef avec seulement 2 plats ? Le système de classement fonctionne mieux pour celui qui a plus d'articles à classer. »

La Solution des Auteurs : Ils ont réalisé que si l'on laisse une seule personne tout classer, ce n'est pas équitable. Ils suggèrent donc une stratégie de « regroupement ».

  • L'Analogie : Au lieu de demander au chef célèbre de classer ses 50 plats dans une seule grande file, demandez-lui de les regrouper en petits « menus de dégustation » (par exemple : « Le Menu Soupe », « Le Menu Dessert »). Classez les soupes entre elles, et les desserts entre eux.
  • Le Résultat : Cela égalise les chances. Les mathématiques montrent que même avec ce regroupement, le système rend les scores beaucoup plus précis, mais cela empêche les chefs célèbres de dominer les résultats simplement parce qu'ils ont plus de soumissions.

4. Le Problème de la « Stratégie » : Les Chefs peuvent-ils tricher ?

Les auteurs admettent que si le classement décide réellement de qui joue sur la scène principale, les chefs pourraient essayer de manipuler le système.

  • Le Risque : Un chef pourrait classer un plat terrible comme « génial » juste pour qu'il soit accepté, ou classer son meilleur plat plus bas pour le « réserver » à l'année suivante.
  • Le Rêalisme : Les auteurs disent : « Nous ne pouvons pas empêcher toute triche, mais nous pouvons concevoir les règles pour rendre la triche plus difficile. » Ils suggèrent de commencer petit (utiliser les classements uniquement pour signaler quels articles ont besoin d'un deuxième regard, plutôt que de les accepter ou les rejeter immédiatement) afin que nous puissions apprendre comment les gens se comportent avant d'en faire un jeu à enjeux élevés.

5. L'Avenir : Humains + IA, et non IA contre Humains

L'article se termine par une vue d'ensemble. L'Intelligence Artificielle change la façon dont la recherche est écrite et révisée. L'IA peut écrire du code, vérifier des mathématiques et même rédiger des critiques.

La Position des Auteurs :

  • Ne remplacez pas les humains. L'IA est un outil, comme une calculatrice surpuissante. Elle peut organiser les données et trouver des modèles, mais elle ne devrait pas être le juge final.
  • L'« Homme dans la Boucle » : Pensez à l'IA comme au machiniste qui installe les lumières et organise les instruments. Le juge humain est celui qui décide si la musique est réellement bonne.
  • Pourquoi ? Parce que la science ne concerne pas seulement les données ; elle concerne la créativité, l'éthique et le « goût ». L'IA pourrait manquer l'âme subtile d'un article ou halluciner (inventer des choses). Les humains doivent rester aux commandes de la décision finale.

Résumé

L'article soutient que pour réparer le système submergé de jugement de la recherche en IA, nous devons le traiter comme un problème mathématique. En demandant aux auteurs de classer honnêtement leur propre travail, nous pouvons « débruiser » les scores des juges et trouver les meilleurs articles plus précisément. Cependant, nous devons faire attention à ne pas laisser le système être manipulé, et nous devons nous assurer que, bien que l'IA nous aide à organiser le chaos, les humains restent ceux qui tiennent le marteau.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →