← Derniers articles
🤖 machine learning

Common Inpainted Objects In-N-Out of Context

Ce papier présente COinCO, un nouveau dataset généré par inpainting diffusion qui fournit des exemples d'objets incohérents avec leur contexte pour améliorer le raisonnement contextuel, la prédiction d'objets et la détection de falsifications en vision par ordinateur.

Auteurs originaux : Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

Publié 2026-04-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez une photo de votre salon. Tout semble normal : un canapé, une table, une lampe. Mais soudain, vous voyez un hippopotame assis sur le canapé. Votre cerveau claque immédiatement : « Attends, un hippopotame ici ? C'est bizarre ! »

C'est exactement ce que les chercheurs de l'Université de Géorgie ont voulu enseigner aux ordinateurs avec leur nouveau projet appelé COinCO.

Voici une explication simple de leur travail, imagée comme une grande cuisine culinaire.

1. Le Problème : La cuisine est trop "normale"

Jusqu'à présent, les ordinateurs apprenaient à voir le monde en regardant des millions de photos réelles (comme le célèbre jeu de données COCO). Mais il y a un gros problème : dans la vraie vie, on ne voit presque jamais d'hippopotames dans des salons, ni de poissons dans des fours à pizza.

Les ordinateurs, nourris uniquement de ces photos "normales", ne savent pas détecter les erreurs. Ils ne savent pas dire : « Hé, ce poisson dans le four, c'est faux ! » parce qu'ils n'ont jamais vu assez de cas où les choses sont à la mauvaise place. C'est comme essayer d'apprendre à un enfant à reconnaître un mensonge en ne lui montrant que des histoires vraies.

2. La Solution : Le Chef "Inpainting" (Le Magicien de la Photo)

Pour résoudre ce problème, les chercheurs ont créé une nouvelle "cuisine" appelée COinCO.

Au lieu de chercher des photos bizarres dans la nature, ils ont décidé de fabriquer des erreurs eux-mêmes. Ils ont pris des photos normales et utilisé un outil magique (un modèle d'intelligence artificielle appelé "diffusion") pour :

  1. Effacer un objet (par exemple, un chat).
  2. Le remplacer par un autre objet (par exemple, un éléphant).

Ils ont fait cela près de 98 000 fois.

  • Parfois, le remplacement est logique (remplacer un chat par un chien dans un salon) : c'est "In-Context" (dans le contexte).
  • Parfois, c'est absurde (remplacer un chat par un éléphant dans un salon) : c'est "Out-of-Context" (hors contexte).

C'est comme si un chef cuisinier prenait une recette parfaite et y ajoutait volontairement soit du sel (parfait), soit du dentifrice (absurde), pour apprendre aux autres à goûter la différence.

3. Le Dégustateur : Les "Géants" de l'Intelligence (LVLM)

Comment savoir si l'éléphant dans le salon est vraiment absurde ? Les chercheurs n'ont pas demandé à des humains de tout vérifier (ce serait trop long). Ils ont fait appel à des "Géants" de l'intelligence artificielle (des modèles de langage visuel très puissants, comme des experts culinaires surhumains).

Ces géants examinent chaque photo modifiée selon trois règles simples :

  1. La Place (Location) : Est-ce que l'objet est à l'endroit ? (Un poisson dans le ciel ? Non.)
  2. La Taille (Size) : Est-ce que l'objet a la bonne taille ? (Une fourmi géante sur une table ? Non.)
  3. La Compagnie (Co-occurrence) : Est-ce que ces objets vont bien ensemble ? (Un réfrigérateur dans une cage de lion ? Non.)

Si l'objet viole l'une de ces règles, il est marqué comme "Hors Contexte".

4. Les Trois Jeux que COinCO permet de jouer

Grâce à cette immense bibliothèque de photos modifiées, les chercheurs ont créé trois nouveaux jeux pour entraîner les ordinateurs :

  • Le Jeu du Détective (Classification) :
    L'ordinateur doit dire : « Est-ce que cet objet appartient ici ? » Au lieu d'utiliser le "Géant" (trop lent et gourmand), ils ont appris à de petits "apprentis" (des modèles plus légers) à raisonner comme le Géant. Maintenant, un petit ordinateur rapide peut dire : « Attention, ce cheval dans la salle de bain, c'est louche ! »

  • Le Jeu du Devin (Prédiction) :
    On montre à l'ordinateur une photo avec un trou (un objet effacé) et on lui demande : « Qu'est-ce qui devrait être ici ? » Si on voit une plage, l'ordinateur devinera "surf" ou "crabe", et non "réfrigérateur". C'est comme compléter une phrase manquante dans une histoire.

  • Le Jeu du Chasseur de Faux (Détection de Fake) :
    C'est le plus utile pour la sécurité. Aujourd'hui, on voit beaucoup de fausses images générées par l'IA. Les détecteurs actuels regardent les pixels pour trouver des erreurs techniques. COinCO ajoute une nouvelle arme : le bon sens.
    Si un détecteur voit un objet qui n'a pas sa place (un hippopotame dans un salon), il peut dire : « C'est faux ! » même si l'image est techniquement parfaite. Cela permet de repérer les faux sans même avoir besoin de réentraîner les détecteurs.

En Résumé

COinCO, c'est comme un laboratoire de "fausses réalités".
Les chercheurs ont créé des milliers de situations où les objets sont soit à leur place, soit complètement déplacés. En utilisant cela comme terrain d'entraînement, ils ont appris aux ordinateurs à développer un "sixième sens" pour comprendre le contexte.

Au lieu de juste voir des pixels, les ordinateurs apprennent maintenant à dire : « Ça, c'est logique. Et ça, c'est une blague. » Une compétence essentielle pour ne pas se faire avoir par les fausses images de demain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →