More than half of recent astronomy papers are written with language-model assistance
Une analyse bayésienne hiérarchique de plus de 200 000 articles d'astronomie révèle que plus de la moitié des manuscrits récents d'astro-ph présentent des traces linguistiques d'assistance par modèle de langage, un chiffre dépassant largement les moins de 1 % des articles qui divulguent explicitement une telle utilisation.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde calme et riche en données de l'astronomie, les scientifiques passent leurs journées à traduire la lumière des étoiles et des galaxies lointaines en récits sur l'univers. Pendant des décennies, le langage écrit de ces découvertes a été un dialecte technique strict, dépouillé de tout faste et entièrement concentré sur la précision. Mais fin 2022, un nouvel outil est entré en scène : des programmes informatiques avancés capables de rédiger un texte fluide, semblable à celui d'un humain. Ces outils, connus sous le nom de modèles de langage, sont rapidement devenus populaires pour aider les chercheurs à rédiger des articles, à vérifier la grammaire et à organiser des idées complexes. La question qui s'est vite posée n'était pas de savoir si ces outils étaient utilisés, mais à quel point leur influence était devenue étendue. Si un ordinateur aidait à écrire un article scientifique, le texte serait-il différent ? Porterait-il une empreinte subtile, un ensemble spécifique de mots qu'un écrivain humain choisirait rarement mais qu'une machine privilégie ?
Une équipe de chercheurs de l'Université d'État de l'Ohio et de l'Institut Max Planck d'Astronomie s'est donné pour mission de trouver la réponse en examinant les mots réels de la littérature. Ils ont analysé le texte intégral de plus de 200 000 articles d'astronomie soumis entre 2015 et la mi-2026. Leur objectif était de compter combien de ces documents présentaient des signes d'assistance informatique. Ils se sont concentrés sur une liste spécifique de mots qui étaient devenus courants dans les textes générés par machine, tels que « delve » (approfondir), « underscore » (souligner), « intricate » (complexe) et « pivotal » (pivot/crucial). Ce ne sont pas des termes techniques comme « redshift » (décalage vers le rouge) ou « supernova » ; ce sont des choix stylistiques, des mots qui ajoutent un certain rythme à une phrase. Avant l'essor de ces outils informatiques, les astronomes utilisaient ces mots avec parcimonie. Les chercheurs voulaient savoir si l'apparition soudaine de ces mots dans les articles récents signifiait que les articles étaient écrits avec de l'aide.
Pour obtenir une image claire, l'équipe n'a pas seulement compté les mots ; elle a construit un modèle statistique sophistiqué pour séparer le signal du bruit. Ils savaient que le langage évolue avec le temps et que certains mots peuvent devenir populaires pour des raisons autres que l'utilisation de l'informatique. Pour tenir compte de cela, ils ont examiné comment ces mots étaient utilisés dans les articles écrits avant 2020, une époque précédant la disponibilité généralisée de ces outils. Cela leur a donné une base de référence pour la fréquence à laquelle un astronome humain utiliserait naturellement ces mots. Ils ont ensuite comparé cette base de référence aux articles écrits après 2022. Crucialement, ils ont également examiné le petit nombre d'articles où les auteurs admettaient explicitement avoir utilisé un modèle de langage. Ces articles admis ont servi de point de calibration, une référence connue pour aider l'équipe à comprendre ce qu'est réellement un article « assisté par ordinateur » dans les données.
Les résultats ont été frappants. En 2025, les chercheurs ont estimé que plus de la moitié de tous les nouveaux articles d'astronomie portaient une trace d'assistance par modèle de langage. Plus précisément, ils ont calculé que 54 % des articles présentaient un schéma de vocabulaire cohérent avec une aide informatique, avec une marge d'erreur qui maintenait ce chiffre confortablement au-dessus de 36 % même selon les hypothèses les plus conservatrices. Ce chiffre a augmenté rapidement ; en 2024, le chiffre était d'environ 20 % et, au cours de la première moitié de 2026, il avait grimpé à près de 87 %. Cela suggère que l'utilisation de ces outils est passée d'une expérience rare à une partie standard du processus d'écriture pour la majorité des astronomes.
Cependant, l'histoire est plus complexe qu'un simple décompte d'articles. Les chercheurs ont constaté que l'« empreinte digitale » de l'ordinateur devient de plus en plus difficile à voir. Au début de 2023, les articles qui utilisaient ces outils présentaient un excès très marqué de ces mots marqueurs spécifiques — environ 3,5 fois plus qu'un article écrit par un humain. En 2026, cet excès était tombé à seulement 1,5 fois la base de référence. Cela s'est produit parce que les auteurs ont commencé à s'adapter. À mesure que les mots spécifiques comme « delve » sont devenus célèbres comme signes d'utilisation de l'ordinateur, les rédacteurs ont cessé de les utiliser aussi intensément, ou les ont édités, rendant la main de l'ordinateur moins évidente. Les outils sont toujours utilisés, mais ils deviennent plus subtils, se fondant plus naturellement dans les styles d'écriture humains.
Peut-être la découverte la plus révélatrice est l'écart entre ce qui se passe et ce qui est dit. Alors que les chercheurs estiment que 54 % des articles en 2025 étaient assistés, seulement 0,81 % de ces articles contenaient une déclaration formelle affirmant qu'un ordinateur a été utilisé. En d'autres termes, pour chaque article où un auteur a admis avoir utilisé l'outil, il y avait environ 66 articles qui présentaient les mêmes traces linguistiques mais ne disaient rien à ce sujet. Les chercheurs ont vérifié soigneusement leurs méthodes de détection et ont constaté qu'ils ne manquaient pas beaucoup de déclarations ; le silence semble être réel. La plupart des auteurs qui se sont exprimés ont dit qu'ils utilisaient les outils pour la grammaire, la clarté ou l'édition de la langue, des tâches que de nombreuses revues autorisent déjà. Le manque de divulgation semble ne pas provenir d'une tentative de cacher une faute professionnelle, mais d'un désir d'éviter une stigmatisation, car la communauté scientifique ne s'est pas encore accordée sur la légitimité de l'utilisation de ces outils.
L'étude conclut que le paysage de l'écriture scientifique a fondamentalement changé. Les outils ne sont plus une nouveauté ; ils sont une force dominante dans la production des articles d'astronomie. Les chercheurs notent que ce changement n'est pas nécessairement un échec de l'intégrité, mais un changement de pratique auquel la communauté n'est pas encore parvenue. À mesure que les traces linguistiques de ces outils continuent de s'estomper et deviennent plus difficiles à détecter, la fenêtre pour mesurer leur impact se referme. Les auteurs suggèrent que l'étape la plus urgente n'est pas de bannir les outils ou de poursuivre un signal qui s'efface, mais d'établir une norme claire de divulgation. Si les auteurs déclaraient simplement lorsqu'ils utilisaient ces aides, le domaine pourrait progresser sans la confusion d'une assistance cachée, transformant une pratique qui est actuellement ignorée en une pratique ouvertement comprise.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.