Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources
Cette étude examine quatre moteurs de recherche génératifs majeurs à l'aide de 712 requêtes réelles et révèle qu'environ 16 % de leurs sources citées sont générées par une intelligence artificielle, soulignant un risque important que les utilisateurs reçoivent des informations synthétiques non vérifiées présentées comme faisant autorité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous demandiez à un groupe de quatre bibliothécaires très intelligents et bien voyageurs (ChatGPT, Copilot, Gemini et Perplexity) de répondre à une question sur la politique, la santé ou l'environnement. Au lieu de vous donner simplement une réponse directe, ces bibliothécaires disent : « Voici la réponse, et voici les 10 livres que nous avons lus pour l'écrire. »
Ce document est un audit de ces « livres » (les sites web qu'ils citent) pour vérifier si l'un d'eux a été réellement écrit par un robot se faisant passer pour un humain.
Voici la répartition de ce que les chercheurs ont découvert, en utilisant des analogies simples :
1. Le Cadre : La « Bibliothèque » d'Internet
Les chercheurs ont traité ces moteurs de recherche par IA comme une nouvelle sorte de bibliothèque. Ils ont posé 712 questions réelles (sur des sujets tels que « Ce régime est-il sûr ? » ou « Quel est le dernier scandale politique ? ») à quatre moteurs d'IA différents.
Les moteurs ont répondu avec des explications et fourni une liste de liens (citations) pour prouver l'origine de leurs informations. Les chercheurs se sont ensuite rendus sur ces liens, ont lu le contenu et l'ont soumis à un test de « détecteur de mensonge » (un outil de détection d'IA appelé Pangram) pour déterminer si le texte avait été écrit par un humain ou généré par une autre IA.
2. La Grande Découverte : Le « Fantôme Robot » dans la Bibliothèque
La découverte principale est que environ 16 % des « livres » cités par ces bibliothécaires ont été réellement écrits par des robots.
- La Métaphore : Imaginez que vous alliez à la bibliothèque pour trouver un livre d'histoire. Vous en prenez un sur l'étagère, l'ouvrez et réalisez que l'auteur est une machine qui a écrit l'ensemble en une seconde. Vous ne le saviez pas lorsque vous l'avez pris en main.
- La Réalité : Dans cette étude, environ 1 source sur 6 citée par les moteurs d'IA était un contenu généré par une IA.
- Le Plus Grand Coupable : Le moteur d'IA Copilot était le plus susceptible de citer ces sources écrites par des robots (près de 3 citations sur 10 étaient générées par une IA). ChatGPT était le plus prudent, mais les citait tout de même environ 7 % du temps.
3. Le Problème de la « Longue Traîne » : La Foule contre les VIP
Les chercheurs ont remarqué un schéma étrange dans les sites web que les moteurs d'IA aimaient citer.
- Les VIP (La Tête) : Un petit groupe de sites web célèbres et de confiance (comme Wikipédia, des sites gouvernementaux comme
whitehouse.gov, et des grands médias) sont cités encore et encore. Ce sont les « VIP » de la bibliothèque. - La Longue Traîne : Cependant, la vaste majorité des citations provient d'une « longue traîne » de milliers de sites obscures et rarement visités. La plupart de ces sites obscurs ne sont cités qu'une ou deux fois.
- La Découverte : Le contenu « écrit par des robots » se cachait principalement dans cette Longue Traîne. Les sites VIP célèbres étaient majoritairement écrits par des humains, mais les sites obscurs, ces « one-hit wonders », étaient ceux remplis de texte généré par une IA.
- L'Analogie : C'est comme une fête où l'hôte (l'IA) continue de vous présenter les mêmes 5 personnes célèbres (Wikipédia, sites gouvernementaux), mais passe ensuite 80 % de son temps à vous présenter 1 000 inconnus au fond de la pièce, dont beaucoup sont en réalité des mannequins (contenu IA) se faisant passer pour des humains.
4. La Répartition par Sujet
Les chercheurs ont vérifié trois domaines spécifiques :
- Environnement : Ce sujet présentait le plus grand nombre de sources générées par une IA citées.
- Santé : Une part significative des sources de conseils en santé était également générée par une IA.
- Politique : Contenait également des sources IA, bien que légèrement moins que les deux autres.
5. Pourquoi Cela Compte (Selon le Document)
Le document soutient que cela est risqué car :
- Le Piège de la « Confiance » : Lorsqu'une IA vous donne une réponse et vous montre une liste de liens, vous supposez que ces liens sont des faits réels et vérifiés par des humains. Si les liens sont en réalité générés par une IA, l'IA cite essentiellement ses propres « hallucinations » ou textes robotiques de faible qualité comme preuve de sa propre réponse.
- L'Écart de Qualité : Bien que tout texte généré par une IA ne soit pas mauvais, le document note que le texte IA peut contenir des erreurs, des biais ou des faits inventés. Si un moteur de recherche par IA utilise des sources écrites par une IA pour construire sa réponse, cela crée une « maison de cartes » où les fondations sont fragiles.
- La « Boîte Noire » : Les moteurs ne vous disent pas : « Hé, cette source a été écrite par un bot. » Ils vous montrent simplement le lien.
Résumé
Le document conclut que ces nouveaux « Moteurs de Recherche Génératifs » agissent actuellement comme des bibliothécaires qui citent parfois, par erreur, des livres écrits par des robots, sans le dire au lecteur. Ils s'appuient fortement sur quelques sites web célèbres, mais ils tirent également une quantité massive d'informations d'une « longue traîne » de sites web obscurs, dont beaucoup sont remplis de contenu généré par une IA.
Les chercheurs affirment que c'est un signe d'alarme : si nous ne corrigeons pas la façon dont ces moteurs choisissent et vérifient leurs sources, les utilisateurs pourraient, à leur insu, faire confiance à des informations entièrement synthétiques.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.