← Derniers articles
💬 NLP

Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era

Cette étude préenregistrée analyse plus de 69 000 prépublications de medRxiv pour révéler une augmentation significative et progressive de l'usage du tiret cadratin au niveau de la population au sein des sections de discussion suite à l'avènement des grands modèles de langage, suggérant un changement stylistique distinct dans l'écriture scientifique au cours du début des années 2020.

Auteurs originaux : Przemysław Czuma

Publié 2026-06-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Przemysław Czuma

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un détective essayant de déterminer si une immense bibliothèque de notes médicales a été touchée par une nouvelle main invisible. Vous ne cherchez pas des empreintes digitales ou de l'ADN ; vous cherchez un signe de ponctuation minuscule et spécifique : le tiret cadratin (—).

Voici l'histoire de ce que le papier a trouvé, racontée simplement.

Le Mystère : Une « faute de frappe » qui n'en est pas une

Pendant des années, les scientifiques ont murmuré une rumeur : « Les grands modèles de langage » (comme ChatGPT) adorent utiliser le tiret cadratin. Les humains, en revanche, les trouvent généralement agaçants ou difficiles à taper, ils les utilisent donc avec parcimonie. C'est comme si un humain écrivait une phrase avec une virgule, alors qu'un robot l'écrirait avec un tiret dramatique pour paraître plus « professionnel ».

Mais jusqu'à présent, ce n'était qu'une rumeur. Personne n'avait réellement compté les tirets dans des milliers de véritables articles scientifiques pour voir si la rumeur était vraie.

L'Enquête : Compter les tirets dans une mer de texte

Le chercheur, Przemysław Czuma, a décidé de jouer au détective à grande échelle. Il n'a pas examiné des livres publiés (qui sont souvent « nettoyés » par des éditeurs et perdent leur ponctuation originale). Au lieu de cela, il a observé medRxiv, un serveur où les scientifiques publient leurs brouillons bruts, non édités (prépublications), avant qu'ils ne soient publiés.

  • La Cible : Il s'est concentré sur la section « Discussion » de ces articles. C'est la partie où les scientifiques racontent une histoire, expliquent leurs sentiments sur les résultats et tentent de persuader le lecteur. C'est la partie la plus « humaine » d'un article.
  • L'Outil : Il a utilisé un programme informatique pour scanner plus de 69 000 de ces brouillons, en cherchant spécifiquement le caractère du tiret cadratin (—).
  • La Chronologie : Il a divisé les données en deux époques :
    1. Avant ChatGPT (avant novembre 2022).
    2. Après ChatGPT (après novembre 2022).

Les Résultats : Un feu lent, pas une explosion

Les résultats ont été spectaculaires, mais cela ne s'est pas produit du jour au lendemain comme un interrupteur que l'on actionne.

  • Avant l'essor de l'IA : Seulement environ 4 % des articles comportaient ne serait-ce qu'un seul tiret cadratin dans leur section Discussion. C'était rare.
  • Après l'essor de l'IA : Ce chiffre est passé à 11,5 %.
  • La Tendance : Cela ne s'est pas produit immédiatement en 2023. Le chiffre est resté bas, puis a commencé à grimper en 2024, et en 2025, il a monté en flèche pour atteindre 20 %.

L'Analogie : Imaginez une fête calme où presque personne ne porte de chapeau rouge. Puis, une nouvelle mode commence. Au début, seule une petite partie des gens essaie. Ensuite, lentement, plus de gens rejoignent le mouvement. L'année suivante, presque une personne sur cinq à la fête porte un chapeau rouge. C'est ce qui est arrivé au tiret cadratin.

La Preuve : Écarter les autres suspects

Un bon détective vérifie s'il existe d'autres explications. Le chercheur a soumis les données à plusieurs tests de « détection de mensonges » pour s'assurer que l'augmentation des tirets cadratins n'était pas simplement une tendance aléatoire ou un changement dans la façon dont le site web formate le texte.

  1. Le test de la « section ennuyeuse » : Il a vérifié les sections « Remerciements » et « Disponibilité des données » (les parties standard et ennuyeuses d'un article). Si l'ensemble du site web avait changé son formatage, ces sections auraient également plus de tirets. Ce n'était pas le cas. L'augmentation ne concernait que les parties narratives.
  2. Le test de la « fausse date » : Il a regardé la période avant l'existence de ChatGPT et a prétendu qu'une date aléatoire était le « début ». Rien n'avait changé. Cela a prouvé que l'augmentation n'était pas seulement une dérive lente et naturelle au fil du temps.
  3. Le test du « choix des mots » : Il a également recherché des mots spécifiques que les modèles d'IA adorent utiliser (comme « delve », « groundbreaking » ou « leverage »). Ces mots ont augmenté exactement au même moment que les tirets.

Ce que cela signifie (et ce que cela ne signifie pas)

L'article est très prudent quant à ses affirmations.

  • Il MONTRE : Quelque chose de grand a changé dans la façon dont les articles scientifiques sont écrits entre 2022 et 2025. Le style d'écriture a évolué d'une manière qui correspond à l'essor des outils d'IA. Le tiret cadratin est un signal « au niveau de la population », comme remarquer que la taille moyenne d'une foule a augmenté, et non que chaque personne est devenue plus grande.
  • Il NE MONTRE PAS : Vous ne pouvez pas regarder un seul article avec un tiret et dire : « Ceci a été écrit par un robot. » Un humain peut simplement adorer les tirets. Vous ne pouvez pas non plus regarder un article sans tiret et dire : « C'est 100 % humain. »
  • La Conclusion : L'étude confirme que la « empreinte » de l'écriture par IA devient visible dans la littérature scientifique. Cela ne s'est pas produit instantanément ; cela s'est produit à mesure que les scientifiques commençaient lentement à faire confiance et à utiliser ces nouveaux outils pour polir et écrire leurs récits.

En bref : le tiret cadatin est la « fumée » qui suggère qu'un feu (l'usage de l'IA) a commencé dans la cuisine de l'écriture scientifique, même si nous ne pouvons pas pointer exactement quel réchaud a été utilisé pour chaque casserole individuelle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →