Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
Cette étude évalue la capacité de sept grands modèles de langage à inférer des connaissances individuelles par domaine à partir de journaux de communication Slack en comparant leurs estimations en zéro-shot aux compétences auto-déclarées, révélant que, bien que Gemini 2.5 Flash ait atteint la plus grande précision, la performance d'inférence ne dépend que faiblement du volume de messages et met en lumière la nécessité d'approches respectueuses de la vie privée et conscientes de la structure.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous entriez dans un immense bureau animé. Vous avez un problème épineux, mais vous ne savez pas à qui vous adresser. Est-ce la personne dans le coin qui parle de programmation toute la journée ? Ou celle qui semble tout savoir sur la gestion de projet ? Habituellement, vous devriez vous promener, demander à quelques personnes et espérer trouver le bon expert. Ce « jeu de devinettes » gaspille du temps et de l'argent.
Cet article pose une question simple : Un IA peut-elle agir comme un stagiaire hyper-observateur qui lit l'historique des discussions de tout le monde et vous indique instantanément qui sait quoi ?
Voici le déroulement de leur expérience, expliqué simplement :
Le dispositif : Le « Détective des discussions »
Les chercheurs ont pris un énorme tas de messages de discussion réels provenant du compte Slack d'une entreprise (environ 27 000 messages de 43 personnes sur plusieurs années). Ils ont alimenté ces messages dans sept « super-cerveaux » différents (des modèles de langage de grande taille comme GPT, Claude et Gemini).
Imaginez ces modèles d'IA comme différents types de détectives :
- Certains sont rapides mais peut-être un peu superficiels (comme un scanner rapide).
- D'autres sont lents mais des penseurs profonds (comme un professeur analysant un livre).
- Certains sont des généralistes, tandis que d'autres sont des spécialistes.
Le travail de l'IA était de lire les discussions et de créer un « rapport de compétences » pour chaque personne. Par exemple, si quelqu'un parlait constamment de « Python » et de « Science des données », l'IA devinait : « Cette personne connaît Python ».
La réalité : L'« Auto-évaluation »
Pour vérifier si l'IA était réellement bonne dans son travail, les chercheurs ont demandé aux humains réels de se noter eux-mêmes. Ils ont créé un site web simple où chaque personne regardait la liste des compétences trouvées par l'IA et disait : « Oui, je connais cela », ou « Non, je ne connais pas cela ».
Ensuite, les chercheurs ont comparé la supposition de l'IA avec la réponse réelle de l'humain. C'est comme un professeur qui note la supposition d'un élève sur les réponses d'un examen par rapport à la vraie clé de correction.
Les résultats : Qui a gagné le concours ?
Les chercheurs ont testé sept modèles d'IA différents. Voici comment ils se sont classés :
- Le gagnant : Gemini 2.5 Flash était le meilleur devineur. Il s'est trompé d'environ 21 points sur une échelle de 0 à 100. (Si l'humain disait qu'il était expert à 80 %, l'IA devinait environ 59 % ou 101 %).
- Le dauphin : Gemini 2.5 Pro était juste derrière.
- Le peloton de milieu : Les modèles Claude (Haiku et Sonnet) étaient corrects, mais moins affûtés que les modèles Gemini.
- Les en difficulté : Les modèles GPT (y compris le très célèbre GPT-4o et GPT-5) ont obtenu les pires résultats. Ils s'écartaient d'environ 33 points en moyenne.
La grande conclusion : Même la meilleure IA n'était pas parfaite. Elle pouvait saisir l'idée générale de qui savait quoi, mais elle ne pouvait pas déterminer le niveau exact d'expertise avec une grande précision.
La surprise : Plus de texte ≠ Meilleures devinettes
Vous pourriez penser : « Si je donne à l'IA un million de messages au lieu de mille, elle deviendra plus intelligente, non ? »
Pas nécessairement. Les chercheurs ont constaté que simplement avoir plus d'historique de discussion ne rendait pas automatiquement les suppositions de l'IA plus précises.
- Pourquoi ? Parce que beaucoup de messages de discussion sont juste « D'accord », « Compris » ou « Déjeuner à 13 h ? ». Ceux-ci ne vous disent pas ce que quelqu'un sait.
- La limite : Une fois que l'IA avait un minimum de discussion avec laquelle travailler, ajouter davantage n'aide pas beaucoup. C'est comme essayer de deviner le film préféré de quelqu'un en lisant sa liste de courses ; peu importe la longueur de la liste, cela ne vous dira pas grand-chose sur ses goûts cinématographiques.
La conclusion finale
L'étude prouve que l'IA peut jeter un coup d'œil dans nos journaux de discussion et faire une estimation décente de nos compétences. C'est un outil utile pour obtenir une carte approximative de « qui sait quoi » dans une entreprise.
Cependant, ce n'est pas encore une boule de cristal magique. L'IA fait toujours des erreurs, et les célèbres modèles GPT n'ont même pas terminé en première place dans ce test spécifique. Les chercheurs ont également noté que pour que cela fonctionne dans la vie réelle, les entreprises devraient être très prudentes concernant la vie privée, car l'envoi de discussions d'entreprise privées à des serveurs d'IA externes est un sujet sensible.
En bref : L'IA s'améliore pour lire la pièce, mais elle doit encore apprendre à distinguer l'expertise réelle d'une personne de ses simples bavardages quotidiens.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.