← Últimos artigos
🤖 AI

Deep Multimodal Learning with Missing Modality: A Survey

Este levantamento fornece a primeira revisão abrangente de métodos de aprendizado profundo para Aprendizado Multimodal com Modalidade Ausente (MLMM), detalhando suas motivações, distinções de configurações padrão, técnicas atuais, aplicações, conjuntos de dados e desafios futuros.

Autores originais: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

Publicado 2026-02-05
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O Problema dos "Cinco Sentidos"

Imagine que você está tentando entender um filme. Normalmente, você tem duas entradas principais: visão (o vídeo) e som (o diálogo e a música). Isso é como um sistema "multimodal" — ele usa vários sentidos para entender a história completa.

No entanto, no mundo real, as coisas dão errado. Talvez seus alto-falantes quebrem (sem som), ou a tela fique preta (sem vídeo). Talvez você esteja em uma floresta com neblina onde não consegue ver, mas consegue ouvir um farfalhar. Este é o problema da Modalidade Ausente (Missing Modality).

A maioria dos modelos de IA é como estudantes que só sabem estudar quando têm o livro didático e as notas de áudio. Se você tirar um deles, eles entram em pânico e falham. Este artigo de revisão é um guia massivo para pesquisadores sobre como ensinar a IA a manter a calma e ter um bom desempenho mesmo quando perde um de seus "sentidos".

Sobre o que é este Artigo?

Este artigo é um survey (revisão). Pense nele como um bibliotecário que leu todos os livros (354 artigos!) escritos entre 2012 e 2025 sobre este tópico específico. Os autores, Renjie Wu e sua equipe, organizaram todas essas diferentes soluções em um mapa claro para que os pesquisadores saibam o que funciona, o que não funciona e para onde ir a seguir.

Eles chamam este campo de MLMM (Aprendizado Multimodal com Modalidade Ausente).

As Duas Estratégias Principais: "Consertar os Dados" vs. "Consertar o Cérebro"

Os autores dividem todas as soluções em dois grandes grupos, como consertar um carro quebrado ou reparando as peças ou mudando a forma como o motorista dirige.

1. Processamento de Dados: "Consertando as Peças"

Esta abordagem tenta preencher a informação ausente antes mesmo de a IA começar a pensar.

  • O Método da "Página em Branco" (Composição de Modalidade): Imagine que você está lendo um livro, mas uma página foi arrancada. Você poderia apenas deixar um espaço em branco (zeros) ou rabiscar bobagens aleatórias (valores aleatórios) naquela página. A IA aprende a ignorar o espaço em branco e focar no restante. É simples, mas não é muito inteligente.
  • O Método do "Copiar e Colar" (Recuperação): Se uma página está faltando, você procura outras cópias do mesmo livro na biblioteca, encontra a página correspondente e a cola ali. Isso funciona bem se os livros forem idênticos, mas se as histórias forem ligeiramente diferentes, você pode colar a cena errada.
  • O Método da "Imaginação" (Geração de Modalidade): Esta é a mais avançada. A IA age como um escritor criativo. Se o áudio estiver faltando, a IA olha para o vídeo e imagina como o som deveria ser, e então o cria. É como um mágico tirando um coelho de dentro de um chapéu. O artigo observa que, embora isso seja legal, às vezes pode "alucinar" (inventar coisas que não são verdadeiras).

2. Design de Estratégia: "Consertando o Cérebro"

Em vez de tentar consertar os dados ausentes, esta abordagem muda a arquitetia da IA para que ela possa lidar com dados ausentes naturalmente.

  • O Método do "Holofote" (Atenção): Imagine um professor em uma sala de aula. Se um aluno falta, o professor não interrompe a aula; ele apenas aponta seu holofote para os alunos que estão presentes. Os mecanismos de "Atenção" permitem que a IA foque dinamicamente apenas nos dados disponíveis e ignore as partes ausentes.
  • O Método do "Tutor" (Destilação): Imagine um aluno inteligente (o Professor) que tem todos os livros. Um aluno menos inteligente (o Aluno) tem apenas metade dos livros. O Professor explica os capítulos que faltam para o Aluno. O Aluno aprende a entender a história completa mesmo sem o livro físico.
  • O Método do "Trabalho em Equipe" (Combinação de Modelos): Em vez de uma única IA gigante, você tem uma equipe de especialistas. Se o vídeo estiver faltando, você pergunta ao "Especialista em Áudio". Se o áudio estiver faltando, você pergunta ao "Especialista em Vídeo". Eles votam na resposta juntos.
  • O "Super-Cérebro" (Grandes Modelos de Linguagem): Recentemente, modelos de IA gigantes (como os que alimentam os chatbots) tornaram-se tão inteligentes que podem entender texto, imagem e som ao mesmo tempo. Eles são tão flexíveis que, se você tirar uma entrada, eles simplesmente se adaptam e continuam, quase como um humano que ainda consegue contar uma história mesmo que não consiga ver a imagem.

Onde isso é usado? (Exemplos do Mundo Real)

O artigo lista muitos lugares onde isso é crítico:

  • Exames Médicos: Um médico pode ter uma ressonância magnética, mas não ter uma tomografia computadorizada para um paciente. A IA precisa diagnosticar a doença usando apenas a ressonância sem fazer suposições absurdas.
  • Carros Autônomos: A câmera de um carro pode ser cegada pela neve, ou o radar pode quebrar. A IA do carro precisa continuar dirigindo com segurança usando apenas os sensores que ainda estão funcionando.
  • Detecção de Emoções: Uma chamada de vídeo pode ter um áudio ruim, mas um vídeo claro. A IA ainda deve ser capaz de dizer se você está feliz ou triste olhando para o seu rosto.
  • Robótica: Um robô explorando uma caverna pode perder o sinal de GPS. Ele precisa navegar usando apenas suas câmeras e sensores de toque.

Os Problemas que Ainda Não Resolvemos

Apesar de termos esses truques legais, o artigo aponta algumas dores de cabeça importantes:

  1. A Armadilha dos "Dados Falsos": Quando a IA "imagina" dados ausentes, ela às vezes inventa detalhes que estão errados. Se um carro autônomo imaginar uma estrada onde há um precipício, isso é perigoso.
  2. A IA "Preguiçosa": Às vezes, mesmo que a IA tente preencher a peça que falta, ela acaba ignorando a nova informação e apenas confia no único sensor que ela tem, o que pode não ser suficiente.
  3. A "Biblioteca Bagunçada": Não existe um teste padrão único. Um pesquisador pode testar sua IA com 10% de dados ausentes, enquanto outro testa com 90%. É difícil comparar quem é realmente o melhor.
  4. Muito Pesado: Muitas dessas soluções exigem um poder computacional massivo (como um supercomputador). Mas os dispositivos do mundo real (como um smartwatch ou um drone) são pequenos e têm baterias fracas. Precisamos de soluções "leves" que funcionem em chips pequenos.

A Conclusão

Este artigo é um roteiro. Ele nos diz que, embora tenhamos feito grandes progressos em ensinar a IA a lidar com sensores quebrados e dados ausentes, ainda precisamos de melhores maneiras de fazer isso sem inventar coisas, sem precisar de supercomputadores e sem nos confundirmos com situações bagunçadas do mundo real. O objetivo é construir uma IA que seja tão robusta quanto um humano: capaz de entender o mundo mesmo quando a visão está embaçada ou o microfone está quebrado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →