← Derniers articles
💬 NLP

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

Cet audit préenregistré révèle que quatre API bibliographiques biomédicales majeures présentent des pertes de fidélité significatives et non documentées au niveau du caractère — particulièrement en ce qui concerne la ponctuation typographique et les espaces blancs spéciaux — par rapport à la vérité terrain JATS XML de PubMed Central, posant des risques pour l'extraction de données textuelles, la construction de corpus et l'entraînement des LLM.

Auteurs originaux : Przemysław Czuma

Publié 2026-06-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Przemysław Czuma

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un bibliothécaire essayant de construire une immense et parfaite bibliothèque numérique de la recherche médicale. Vous avez quatre camions de livraison différents (APIs) qui vous apportent les résumés (abstracts) de ces articles. Vous supposez que lorsqu'un camion livre une boîte, le contenu à l'intérieur est exactement ce que l'auteur a écrit.

Ce document est un audit qui vérifie si ces camions livrent réellement le même contenu exact, ou s'ils remplacent discrètement certains articles à l'intérieur des boîtes avant de vous les remettre.

Voici le détail de ce que l'étude a découvert, en utilisant des analogies simples :

La configuration : Le test de la « Copie Parfaite »

Les chercheurs ont pris 4 000 articles médicaux d'une source maîtresse (PubMed Central) et ont demandé à quatre grands services de livraison — PubMed, Crossref, OpenAlex et Semantic Scholar — de leur envoyer les résumés. Ils ont ensuite comparé le texte livré caractère par caractère avec le fichier « étalon d'or » original.

Ils ne cherchaient pas des mots manquants ou des phrases entières. Ils cherchaient des détails minuscules, voire invisibles : une ponctuation spéciale (comme des tirets élégants ou des guillemets incurvés), des symboles scientifiques (comme des lettres grecques ou des signes plus/moins), et des types d'espaces particuliers.

La grande révélation : « Invisible pour les humains, visible pour les machines »

La découverte la plus importante est que les humains ne voient pas la différence, mais les ordinateurs, oui.

  • Le point de vue humain : Si vous lisez un article de PubMed et un article de Crossref, ils semblent identiques. Un tiret ressemble à un tiret. Un espace ressemble à un espace.
  • Le point de vue machine : Pour un programme informatique (comme une IA ou un moteur de recherche), un « tiret élégant » et un « tiret ordinaire » sont des choses totalement différentes. L'un est un code spécial, l'autre est un code de base. Si le camion de livraison les échange, l'ordinateur pense qu'il s'agit d'un mot entièrement différent.

Les deux principales « fuites »

L'étude a révélé que deux des quatre camions perdaient ou modifiaient systématiquement certains types d'éléments :

1. Le camion PubMed : La politique du « Texte Brut »

  • Ce qui s'est passé : PubMed prend le texte original et le « aplatit » de manière agressive. Si l'auteur a utilisé un guillemet incurvé élégant (') ou un tiret cadratin spécial (), PubMed le remplace par une version basique et banale (' ou -).
  • L'analogie : Imaginez que vous envoyez une lettre avec un sceau de cire. Le service de livraison (PubMed) fait fondre le sceau de cire et le remplace par un autocollant ordinaire. Pour le lecteur humain, la lettre dit toujours la même chose. Mais pour une machine qui compte les « sceaux de cire » comme un signal spécifique, le sceau a disparu.
  • Le résultat : Dans presque chaque résumé contenant ces caractères spéciaux, PubMed les a remplacés. Seulement 0,6 % du temps, le caractère spécial a survécu.

2. Le camion OpenAlex : Le problème de l'« Espace Invisible »

  • Ce qui s'est passé : OpenAlex stocke les résumés d'une manière qui ne conserve que les mots et leur ordre, jetant ainsi les espaces spécifiques entre eux. Si un auteur a utilisé un « espace insécable » (un espace spécial qui maintient deux mots collés ensemble), OpenAlex le transforme en un espace ordinaire.
  • L'analogie : Imaginez un puzzle où les pièces sont les mots. OpenAlex démonte le puzzle, met les mots dans un sac, puis les déverse à nouveau avec un espacement standard. Il ne se souvient pas que deux pièces spécifiques étaient censées être collées ensemble avec une colle spéciale.
  • Le résultat : 0 % des espaces spéciaux ont survécu. Ils ont tous été transformés en espaces ordinaires.

La bonne nouvelle : Les éléments « Sûrs »

Tout n'a pas été perdu. L'étude a constaté que les deux autres camions (Crossref et Semantic Scholar) étaient très prudents avec les éléments « importants ».

  • Symboles scientifiques et lettres grecques : Les quatre camions ont tous livré ces éléments parfaitement. Si un article mentionnait « Bêta » (β) ou « plus ou moins » (±), chaque camion a livré le symbole exact.
  • Pourquoi c'est important : Cela signifie que le sens de la science est préservé, mais que le style et la mise en forme ne le sont pas.

Le problème de la « Boîte Manquante » (Crossref)

Il y a eu un autre problème majeur trouvé, mais il ne s'agissait pas de modifier le texte ; il s'agissait de boîtes manquantes entièrement.

  • Le problème : Le camion Crossref n'a pas apporté de résumé pour environ 25 % des articles.
  • La cause : Ce n'est pas que Crossref a perdu le texte ; c'est que certains grands éditeurs (comme Elsevier et l'American Chemical Society) n'ont tout simplement pas donné les résumés à Crossref au départ.
  • L'analogie : C'est comme un service de livraison qui n'accepte des colis que provenant de certains quartiers. Si vous habitez dans un quartier qu'ils ne desservent pas, vous ne recevez aucun colis du tout.

Pourquoi devriez-vous vous en soucier ?

L'article soutient que cela importe car nous lisons de plus en plus des livres avec des machines, et pas seulement avec des humains.

  • IA et Recherche : Si une IA essaie de compter combien de fois les auteurs utilisent un certain « tiret élégant » pour détecter s'ils ont utilisé un outil de rédaction par IA, et que le camion de livraison (PubMed) a déjà remplacé ce tiret par un tiret ordinaire, l'IA aura un mauvais décompte. Elle pourrait penser que l'auteur n'a pas utilisé l'outil, alors qu'il l'a fait.
  • Recherche et Doublons : Si un ordinateur essaie de trouver des articles en double en comparant le texte exact, il pourrait passer à côté s'il y a une version avec un « tiret élégant » et une autre avec un « tiret ordinaire ». Ils nous semblent identiques, mais l'ordinateur voit deux choses différentes.

L'essentiel

Le texte que vous lisez dans un résumé médical dépend entièrement de le site web ou l'outil que vous utilisez pour l'obtenir.

  • Si vous utilisez PubMed, vous obtenez une version « nettoyée » où la ponctuation spéciale est aplatie.
  • Si vous utilisez OpenAlex, vous obtenez une version où l'espacement spécial est perdu.
  • Si vous utilisez Crossref, vous pourriez ne recevoir aucun résumé si l'éditeur ne l'a pas envoyé.
  • Si vous utilisez Semantic Scholar, vous obtenez généralement le texte tel quel.

L'article conclut que bien que ces changements soient invisibles pour l'œil humain, ce sont des erreurs systématiques majeures pour les machines qui effectuent désormais le gros du travail de lecture, d'analyse et d'organisation de la littérature scientifique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →