← Derniers articles
💻 computer science

Detecting Evidence of LLM Contributions to Open Access Biomedical Literature: A Bibliometric Analysis

Cette analyse bibliométrique de près de 3 millions d'articles biomédicaux en accès libre révèle une augmentation significative après 2022 de la terminologie associée aux LLM, indiquant une adoption rapide des outils d'IA générative et soulignant le besoin urgent de transparence et de méthodes de détection pour préserver l'intégrité scientifique.

Auteurs originaux : Gabriel M. Peterson, Marilyn H. Oermann, Jacqueline K. Owens, Gary F. Templeton, Hannah Bailey, Heather Carter-Templeton

Publié 2026-09-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gabriel M. Peterson, Marilyn H. Oermann, Jacqueline K. Owens, Gary F. Templeton, Hannah Bailey, Heather Carter-Templeton

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Depuis des décennies, les chercheurs s'appuient sur des outils pour rendre leur écriture plus claire et leurs recherches plus efficaces. Les correcteurs orthographiques et les logiciels de grammaire sont depuis longtemps des aides standards, lissant les erreurs et suggérant de meilleurs choix de mots sans modifier la voix fondamentale de l'auteur. Ces dernières années, une nouvelle génération de ces outils est apparue, capable de générer des paragraphes entiers de texte qui sonnent de manière remarquablement humaine. Ces systèmes, connus sous le nom de modèles de langage étendus, sont entraînés sur de vastes quantités de matériel écrit et peuvent produire une prose cohérente et polie sur presque n'importe quel sujet. Bien qu'ils offrent la promesse d'accélérer le processus d'écriture, ils soulèvent également une question difficile pour la communauté scientifique : comment peut-on distinguer une phrase écrite par un chercheur humain d'une phrase conçue par une machine ? Cette distinction est cruciale car l'intégrité de la littérature scientifique dépend de l'authenticité des idées et de l'exactitude des faits présentés en son sein. Si une partie significative des nouvelles recherches est rédigée ou lourdement éditée par ces outils, la façon dont nous lisons, faisons confiance et bâtissons sur ce savoir pourrait devoir changer.

Une équipe de chercheurs s'est donné pour mission de répondre à cette question en examinant directement les mots eux-mêmes. Ils se sont concentrés sur la vaste collection d'articles de recherche médicale et biologique en libre accès disponible dans une base de données publique appelée PubMed Central. Cette collection contient des millions d'articles, offrant une fenêtre massive sur la manière dont les scientifiques du monde entier rédigent leurs travaux. L'équipe n'a pas tenté de deviner quels articles spécifiques ont été écrits par des machines, une tâche qui s'est avérée difficile tant pour les humains que pour les programmes informatiques. Au lieu de cela, ils ont cherché un autre type de signal. Ils ont examiné si certains mots et expressions, que des études précédentes avaient identifiés comme étant utilisés beaucoup plus fréquemment par l'intelligence artificielle que par les humains, étaient soudainement devenus beaucoup plus courants dans la littérature scientifique après la fin de l'année 2022, lorsque ces outils sont devenus largement accessibles au public.

Les chercheurs ont rassemblé près de trois millions d'articles publiés entre 2019 et 2024. Ils ont créé une liste de 190 mots et expressions spécifiques qui avaient été signalés dans des recherches antérieures comme étant caractéristiques d'un texte généré par machine. Cela incluait des adjectifs comme « méticuleux » et « complexe », des verbes comme « approfondir » et « souligner », ainsi que des expressions plus longues telles que « naviguer dans les complexités de » ou « il est important de noter ». Ils ont ensuite scanné chaque article de leur ensemble de données pour voir la fréquence d'apparition de ces termes. L'objectif était de voir si la fréquence de ces mots changeait au fil du temps, en recherchant spécifiquement un saut brusque dans l'utilisation après la sortie de ces nouveaux outils d'IA.

Les résultats ont montré un changement clair et spectaculaire dans le langage de la recherche biomédicale. Avant 2022, l'utilisation de ces termes spécifiques augmentait lentement et régulièrement, conformément aux changements normaux dans la façon dont les gens écrivent. Cependant, à partir de 2023 et se poursuivant en 2024, l'usage de beaucoup de ces mots a explosé. Par exemple, le mot « méticuleusement », qui apparaissait moins de mille fois dans l'ensemble de la base de données en 2019, est apparu plus de 16 000 fois en 2024. L'expression « il est important de noter » a connu une poussée similaire, passant de seulement 29 occurrences en 2019 à près de 800 en 2024. Les combinaisons de phrases plus longues et plus complexes étaient peut-être les plus révélatrices. La combinaison « approfondir les complexités de » était pratiquement inexistante dans la littérature avant 2023, pourtant, en 2024, elle apparaissait dans des dizaines d'articles. Les chercheurs ont noté que ce n'étaient pas seulement des mots isolés devenant populaires ; les combinaisons spécifiques de mots connues pour être des signatures de l'écriture par IA apparaissaient ensemble avec une fréquence croissante.

L'étude a également examiné comment ces mots étaient utilisés en combinaison les uns avec les autres. Ils ont découvert que des paires et des groupes de ces termes associés à l'IA apparaissaient ensemble dans les mêmes articles à des taux statistiquement improbables de se produire par hasard. Par exemple, les mots « intelligence artificielle » et « souligner » ont commencé à apparaître ensemble dans les mêmes articles beaucoup plus souvent qu'auparavant. Les chercheurs ont observé que ces schémas n'étaient pas une simple évolution lente du style de langage, qui se produirait graduellement sur de nombreuses années, mais plutôt un point d'inflexion soudain qui coïncidait exactement avec la sortie publique des outils d'IA générative. Bien que l'étude ne puisse pas prouver qu'un article spécifique a été écrit par une machine, l'ampleur même de ce changement linguistique suggère que ces outils sont utilisés de manière extensive par les auteurs dans tout le domaine.

Les auteurs de l'étude soulignent que cela ne signifie pas que la recherche elle-même est nécessairement erronée, ni que chaque article utilisant ces mots est inauthentique. Au lieu de cela, les conclusions pointent vers une adoption rapide et généralisée de nouvelles aides à l'écriture qui changent la texture de la communication scientifique. Les chercheurs soutiennent que, puisque ces outils peuvent parfois commettre des erreurs ou produire du contenu manquant de véritable compréhension, la communauté scientifique doit développer un meilleur moyen d'identifier quand ils sont utilisés. Ils suggèrent que, plutôt que d'essayer d'interdire ces outils, qui sont probablement là pour rester, les chercheurs, les éditeurs et les réviseurs devraient se concentrer sur la transparence. En reconnaissant quand et comment ces outils sont utilisés, le registre scientifique peut rester digne de confiance même alors que les méthodes de sa création continuent d'évoluer. L'étude conclut que le langage de la science est en train de changer, et que reconnaître ces nouveaux schémas est la première étape vers la compréhension de la manière dont l'intelligence artificielle façonne la façon dont nous partageons les connaissances.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →