← Derniers articles
🤖 AI

A Comprehensive Dataset for Human vs. AI Generated Image Detection

Cet article présente MS COCOAI, un ensemble de données complet comprenant 96 000 images réelles et synthétiques générées par cinq modèles d'IA de premier plan, conçu pour faire progresser la recherche dans la détection et l'identification de la source des médias générés par l'IA.

Auteurs originaux : Rajarshi Roy, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Ga
Publié 2026-05-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rajarshi Roy, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Gaytri Jena, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous entriez dans une immense galerie d'art. La moitié des tableaux sont de véritables photographies prises par des humains, et l'autre moitié sont des chefs-d'œuvre créés par une équipe de robots très talentueux, mais invisibles. Le problème ? Les robots deviennent si bons que vous ne pouvez plus faire la différence simplement en regardant.

Ce document traite de la création d'un camp d'entraînement et d'un test pour nous aider à repérer l'art créé par des robots. Voici le détail en termes simples :

1. Le Problème : La « Vallée de l'Étrange » des Images

Nous disposons d'outils d'IA puissants (comme Stable Diffusion, DALL-E 3 et MidJourney) capables de créer des images à partir de rien. Ils sont incroyables, mais ils sont aussi utilisés pour répandre des mensonges ou de fausses nouvelles. Comme ces images semblent si réelles, nos yeux (et même les anciens programmes informatiques) se font berner. Nous avons besoin d'un meilleur moyen de les démasquer.

2. La Solution : Le Jeu de Données « MS COCOAI »

Les auteurs ont construit une immense bibliothèque de 96 000 images pour entraîner les ordinateurs à devenir de meilleurs détectives. Considérez cette bibliothèque comme une expérience scientifique contrôlée.

  • Le Groupe « Réel » : Ils ont pris 16 000 photos réelles dans une base de données célèbre appelée MS COCO. Ce sont de véritables photos accompagnées de descriptions écrites par des humains (légendes).
  • Le Groupe « Faux » : Ils ont pris ces exactes mêmes descriptions écrites par des humains et les ont injectées dans cinq robots d'IA différents (Stable Diffusion 2.1, SDXL, SD 3, DALL-E 3 et MidJourney v6).
  • Le Tour de Magie : Parce que l'IA et le photographe humain ont utilisé la même description, les images résultantes sont des « jumeaux » en termes de contenu.
    • Analogie : Imaginez demander à un chef humain et à un chef robot de préparer un « gâteau au chocolat avec des fraises ». Si le robot fait un gâteau qui ressemble légèrement différent, nous savons que c'est la faute du robot, et non parce qu'on lui aurait demandé de faire une « pizza épicée » à la place. Cela aide les chercheurs à séparer le « biais de contenu » des « artefacts de l'IA ».

3. Le Test de Stress : « La Routine de Gymnastique »

Pour s'assurer que les détecteurs sont robustes, les auteurs ne se sont pas contentés de leur donner des images propres. Ils ont également appliqué quatre « figures » aux images générées par l'IA, comme un gymnaste ajoutant de la difficulté à une routine :

  1. Retournement : Miroir de l'image horizontalement.
  2. Assombrissement : Rendre l'image plus sombre.
  3. Statique : Ajouter du « neige » (bruit) de type télévision à l'image.
  4. Compression : Réduire la taille du fichier (comme lors de l'enregistrement d'une photo sur un téléphone) pour la flouter légèrement.

Cela garantit que si un détecteur fonctionne, il fonctionne même lorsque l'image a été altérée.

4. Les Deux Défis (Les Tests)

Le document établit deux jeux spécifiques pour que les ordinateurs jouent avec ce jeu de données :

  • Jeu A (Le Test « Réel ou Robot ? ») : Regardez une image et dites : « Est-ce fait par un humain ou par une IA ? »
    • Résultat : Un modèle informatique de base a eu raison environ 80 % du temps. C'est comme si un humain devinait correctement 4 fois sur 5. C'est faisable, mais pas parfait.
  • Jeu B (Le Test « Qui l'a fait ? ») : Regardez une image générée par l'IA et devinez quel des cinq robots l'a produite.
    • Résultat : L'ordinateur n'a eu raison qu'environ 45 % du temps. C'est à peine mieux qu'un hasard (comme lancer une pièce de monnaie).
    • Pourquoi est-ce difficile ? C'est comme essayer de faire la différence entre cinq faussaires professionnels différents qui tentent tous de copier le même style. Il est beaucoup plus difficile d'identifier l'artiste spécifique que de simplement repérer que l'art est faux.

5. Comment Ils Ont Tenté de Résoudre le Problème (La Référence)

Pour obtenir un point de départ, les auteurs n'ont pas utilisé une nouvelle IA sophistiquée. Ils ont utilisé un objectif de caméra standard (un modèle ResNet-50) mais ont examiné les images différemment : le Domaine Fréquentiel.

  • Analogie : Imaginez regarder un tableau non pas par ses couleurs, mais par les « vibrations » ou le son qu'il produirait s'il était un instrument de musique. Les images générées par l'IA ont souvent un étrange « bourdonnement » ou un motif spécifique dans leurs vibrations que les photos humaines n'ont pas. Ils ont appris à un ordinateur à écouter ce bourdonnement.

6. La Conclusion

Le document conclut que, bien que nous devenions meilleurs pour repérer qu'une image est fausse (Jeu A), nous sommes toujours terribles pour déterminer quel outil d'IA spécifique l'a produite (Jeu B).

Ils ont rendu publique cette immense bibliothèque de 96 000 images appariées (réelles vs IA) afin que d'autres chercheurs puissent essayer de créer de meilleurs détecteurs. Leur objectif est d'aider la société à retrouver confiance en ce qu'elle voit en ligne.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →