← Derniers articles
🤖 AI

Deep Multimodal Learning with Missing Modality: A Survey

Cette enquête constitue la première revue exhaustive des méthodes d'apprentissage profond pour l'apprentissage multimodal avec modalité manquante (MLMM), détaillant ses motivations, ses distinctions par rapport aux configurations standards, les techniques actuelles, les applications, les jeux de données et les défis futurs.

Auteurs originaux : Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

Publié 2026-02-05
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Le problème des « cinq sens »

Imaginez que vous essayez de comprendre un film. Habituellement, vous avez deux entrées principales : la vue (la vidéo) et le son (les dialogues et la musique). C'est ce qu'on appelle un système « multimodal » — il utilise plusieurs sens pour saisir toute l'histoire.

Cependant, dans le monde réel, les choses peuvent mal tourner. Peut-être que vos haut-parleurs tombent en panne (pas de son), ou que l'écran devient noir (pas de vidéo). Peut-être êtes-vous dans une forêt brumeuse où vous ne voyez rien, mais où vous entendez un bruissement. C'est le problème de la Modalité Manquante.

La plupart des modèles d'IA sont comme des étudiants qui ne savent étudier que lorsqu'ils ont à la fois leur manuel ET leurs notes audio. Si on leur retire l'un des deux, ils paniquent et échouent. Cet article de synthèse est un guide massif pour les chercheurs, expliquant comment enseigner à l'IA à rester calme et à bien performer même lorsqu'elle perd l'un de ses « sens ».

De quoi parle cet article ?

Cet article est une synthèse (survey). Voyez-le comme un bibliothécaire qui aurait lu chaque livre (354 articles !) écrit entre 2012 et 2025 sur ce sujet spécifique. Les auteurs, Renjie Wu et son équipe, ont organisé toutes ces différentes solutions en une carte claire pour que les chercheurs sachent ce qui fonctionne, ce qui ne fonctionne pas, et vers quoi se diriger.

Ils appellent ce domaine le MLMM (Multimodal Learning with Missing Modality - Apprentissage Multimodal avec Modalité Manquante).

Les deux stratégies principales : « Réparer les pièces » vs « Réparer le cerveau »

Les auteurs divisent toutes les solutions en deux grands camps, comme si l'on réparait une voiture cassée soit en réparant les pièces, soit en changeant la façon de conduire du chauffeur.

1. Traitement des données : « Réparer les pièces »

Cette approche tente de combler l'information manquante avant même que l'IA ne commence à réfléchir.

  • La méthode de la « Page Blanche » (Composition de modalités) : Imaginez que vous lisez un livre, mais qu'une page est déchirée. Vous pourriez simplement laisser un espace blanc vide (des zéros) ou griffonner des absurdités aléatoires (des valeurs aléatoires) sur cette page. L'IA apprend alors à ignorer l'espace vide et à se concentrer sur le reste. C'est simple, mais pas très intelligent.
  • La méthode du « Copier-Coller » (Récupération/Retrieval) : Si une page manque, vous regardez d'autres exemplaires du même livre dans la bibliothèque, vous trouvez la page correspondante et vous la collez. Cela fonctionne bien si les livres sont identiques, mais si les histoires sont légèrement différentes, vous risquez de coller la mauvaise scène.
  • La méthode de « l'Imagination » (Génération de modalités) : C'est l'approche la plus avancée. L'IA agit comme un écrivain créatif. Si l'audio est manquant, l'IA regarde la vidéo et imagine ce que devrait être le son, puis le crée. C'est comme un magicien sortant un lapin d'un chapeau. L'article note que, bien que ce soit impressionnant, l'IA peut parfois « halluciner » (inventer des choses qui ne sont pas vraies).

2. Conception de la stratégie : « Réparer le cerveau »

Au lieu d'essayer de réparer les données manquantes, cette approche modifie l'architecture de l'IA pour qu'elle puisse gérer l'absence de données naturellement.

  • La méthode du « Projecteur » (Attention) : Imaginez un professeur dans une salle de classe. Si un élève est absent, le professeur n'arrête pas la leçon ; il braque simplement son projecteur sur les élèves qui sont présents. Les mécanismes d'« attention » permettent à l'IA de se concentrer dynamiquement uniquement sur les données disponibles et d'ignorer les parties manquantes.
  • La méthode du « Tuteur » (Distillation) : Imaginez un étudiant brillant (l'Enseignant) qui possède tous les livres. Un étudiant moins brillant (l'Élève) n'en possède que la moitié. L'Enseignant explique les chapitres manquants à l'Élève. L'Élève apprend ainsi à comprendre toute l'histoire même sans le livre physique.
  • La méthode du « Travail d'équipe » (Combinaisons de modèles) : Au lieu d'une seule IA géante, vous avez une équipe de spécialistes. Si la vidéo est absente, vous interrogez l'« Expert Audio ». Si l'audio est absent, vous interrogez l'« Expert Vidéo ». Ils votent ensemble pour donner la réponse.
  • Le « Super-Cerveau » (Grands Modèles de Langage) : Récemment, les énormes modèles d'IA (comme ceux qui propulsent les chatbots) sont devenus si intelligents qu'ils peuvent comprendre le texte, l'image et le son à la fois. Ils sont si flexibles que si l'on retire une entrée, ils s'adaptent et continuent, presque comme un humain capable de raconter une histoire même s'il ne peut pas voir l'image.

Où cela est-il utilisé ? (Exemples du monde réel)

L'article énumère de nombreux domaines où cela est crucial :

  • Imagerie médicale : Un médecin peut avoir un scanner IRM mais pas de scanner CT pour un patient. L'IA doit diagnostiquer la maladie en utilisant uniquement l'IRM sans faire de suppositions sauvages.
  • Voitures autonomes : La caméra d'une voiture peut être éblouie par la neige, ou son radar peut tomber en panne. L'IA de la voiture doit continuer à conduire en toute sécurité en utilisant uniquement les capteurs qui fonctionnent encore.
  • Détection des émotions : Un appel vidéo peut avoir un mauvais son mais une image claire. L'IA devrait toujours être capable de dire si vous êtes heureux ou triste en regardant votre visage.
  • Robotique : Un robot explorant une grotte peut perdre son signal GPS. Il doit naviguer en utilisant uniquement ses caméras et ses capteurs de toucher.

Les problèmes que nous n'avons pas encore résolus

Même si nous avons ces astuces géniales, l'article souligne certains maux de tête majeurs :

  1. Le piège des « Fausses Données » : Quand l'IA « imagine » les données manquantes, elle invente parfois des détails erronés. Si une voiture autonome imagine une route là où il y a un précipice, c'est dangereux.
  2. L'IA « Paresseuse » : Parfois, même si l'IA essaie de combler la pièce manquante, elle finit par ignorer la nouvelle information et se repose uniquement sur le capteur qu'elle possède déjà, ce qui peut ne pas suffire.
  3. La « Bibliothèque Désordonnée » : Il n'existe pas de test standard unique. Un chercheur peut tester son IA avec 10 % de données manquantes, tandis qu'un autre teste avec 90 %. Il est difficile de comparer qui est réellement le meilleur.
  4. Trop lourd : Beaucoup de ces solutions nécessitent une puissance de calcul massive (comme un supercalculateur). Or, les appareils du monde réel (comme une montre connectée ou un drone) sont petits et ont des batteries faibles. Nous avons besoin de solutions « légères » qui fonctionnent sur de petites puces.

L'essentiel

Cet article est une feuille de route. Il nous dit que, bien que nous ayons fait de grands progrès pour apprendre à l'IA à faire face aux capteurs défectueux et aux données manquantes, nous devons encore trouver de meilleures façons de le faire sans inventer de fausses informations, sans nécessiter de supercalculateurs et sans nous laisser confondre par les situations désordonnées du monde réel. L'objectif est de construire une IA aussi robuste qu'un humain : capable de comprendre le monde même quand la vue est floue ou que le micro est cassé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →