← Últimos artigos
💻 computer science

Conservative Proxy Prompting for Reliable Frozen Vision–Language Models with Missing Modalities

Este artigo propõe o Conservative Proxy Prompting (CPP), um framework de eficiência de parâmetros que aumenta a confiabilidade de modelos de visão-linguagem congelados sob ausência de modalidades ao construir representações de proxy no espaço de características e regular conservadoramente sua contribuição para evitar sinais enganosos.

Autores originais: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

Publicado 2026-09-02
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, existe uma classe crescente de sistemas conhecidos como modelos de visão-linguagem. Estes são mentes digitais treinadas para compreender o mundo ao olhar para imagens e ler texto simultaneamente, aprendendo como imagens e palavras se relacionam entre si. Eles tornaram-se notavelmente habilidosos em tarefas como descrever uma foto ou responder perguntas sobre uma cena, em grande parte porque são treinados em coleções massivas de imagens e textos pareados. No entanto, estes sistemas são construídos sobre uma premissa frágil: a de que sempre receberão tanto a imagem quanto a descrição ao mesmo tempo. Na realidade caótica do mundo real, isso raramente é garantido. Sensores falham, dados perdem-se na transmissão e filtros de privacidade podem remover uma descrição, deixando o sistema apenas com metade da informação que ele espera. Quando um modelo treinado em pares completos é subitamente forçado a adivinhar com apenas uma peça do quebra-cabeça, sua confiança muitas vezes desmorona, e suas respostas tornam-se não confiáveis. O desafio para os pesquisadores não é apenas ajudar o modelo a adivinhar o que está faltando, mas ensiná-lo a saber a diferença entre o que ele realmente vê e o que ele está meramente inferindo.

Uma equipe de pesquisadores da Universidade Normal de Zhejiang e da Universidade Sun Yat-Sen desenvolveu um novo método para resolver este problema, chamado de Prompting de Proxy Conservador (Conservative Proxy Prompting). A abordagem deles reconhece uma verdade fundamental sobre a inteligência artificial: quando um modelo tem que adivinhar uma peça de informação faltante baseando-se no que pode ver, esse palpite é inerentemente incerto. Imagine uma pessoa tentando identificar um prato em um restaurante. Se ela puder ver a comida e ler o cardápio, ela está certa. Se o cardápio estiver faltando, ela pode olhar para a comida e adivinhar o nome, mas deve permanecer ligeiramente incerta de sua resposta. Métodos existentes frequentemente tentam reconstruir a informação faltante como se ela fosse real, tratando efetivamente um palpite com o mesmo peso de uma observação direta. Os pesquisadores argumentam que isso é perigoso porque o dado reconstruído é apenas uma estimativa, e tratar isso como fato pode enganar o sistema. Em vez disso, o novo framework deles trata esses palpites como evidências "proxy" — úteis, mas que exigem uma mão cautelosa.

O núcleo de sua solução envolve uma estratégia de dois passos que trabalha com os modelos de IA poderosos já existentes sem a necessidade de treiná-los do zero. Primeiro, o sistema utiliza uma técnica chamada aprendizagem de prompt (prompt learning) para suavemente direcionar a compreensão do modelo para a tarefa específica em questão, como identificar gêneros de filmes ou tipos de alimentos, usando apenas um número minúsculo de configurações ajustáveis. Isso permite que o modelo permaneça afiado e pronto para o trabalho específico sem precisar reformular todo o seu cérebro. Segundo, e mais importante, o sistema introduz um mecanismo para lidar com dados ausentes. Quando uma imagem está faltando, o sistema usa o texto para criar um esboço aproximado de como a imagem poderia ser. Quando o texto está faltando, o sistema usa a imagem para adivinhar as palavras. Mas aqui reside a diferença crucial: antes que essa informação adivinhada seja misturada com os dados reais, o sistema deliberadamente reduz sua influência. Ele aplica um filtro "conservador", reduzindo o peso do palpite para que ele apoie a decisão sem sobrepujar a evidência direta. Isso garante que, se o palpite estiver errado, ele não arraste a resposta final junto com ele.

Para testar essa ideia, os pesquisadores submeteram seu método a testes rigorosos em três conjuntos de dados muito diferentes do mundo real. Eles utilizaram uma coleção de pôsteres de filmes e resumos de enredo, um conjunto massivo de imagens de alimentos com receitas e um conjunto desafiador de memes da internet projetado para testar se um sistema consegue detectar discurso de ódio. Em cada caso, eles simularam falhas do mundo real removendo aleatoriamente a imagem ou o texto dos dados, às vezes removendo informações de até noventa por cento das amostras. Os resultados foram claros: o novo método superou consistentemente outras abordagens que tentavam simplesmente reconstruir os dados ausentes. Ao manter a influência dos palpites sob controle, o sistema manteou uma alta precisão mesmo quando lhe faltava a maior parte de sua informação. Provou-se que um modelo não precisa ser perfeito em adivinhar para ser confiável; ele só precisa saber o quanto confiar em seus próprios palpites.

O estudo também revelou que essa confiabilidade vem sem um custo pesado. O novo método exigiu apenas um número muito pequeno de parâmetros ajustáveis — aproximadamente entre 1,6 e 2,7 milhões — para alcançar esses resultados. Em comparação, outros métodos que tentavam alcançar uma robustez semelhante frequentemente exigiam quase três vezes mais configurações ajustáveis. Essa eficiência é significativa porque significa que o sistema pode ser adaptado a novas tarefas rapidamente e armazenado facilmente, sem a necessidade de um poder computacional massivo. Os pesquisadores descobriram que o número específico de configurações de "direcionamento" importava, mas não havia um único número mágico que funcionasse para todas as situações; uma quantidade moderada de ajuste era, geralmente, o ponto ideal. Além disso, o sistema mostrou que podia lidar com situações que nunca havia visto antes. Mesmo tendo sido treinado apenas com dados completos e sendo testado com dados ausentes, ele se adaptou bem, sugerindo que o princípio de ser cauteloso com os palpites é uma estratégia robusta que se generaliza além dos exemplos específicos de treinamento.

Em última análise, este trabalho desloca o foco de tentar recriar perfeitamente a informação faltante para gerenciar a incerteza dessa recreação. Os pesquisadores demonstraram que, em um mundo onde os dados são frequentemente incompletos, os sistemas de IA mais confiáveis não são necessariamente aqueles que tentam preencher cada lacuna, mas aqueles que compreendem os limites de seu próprio conhecimento. Ao tratar a informação inferida como uma voz útil, porém secundária, em vez de uma parceira igual à observação direta, o sistema torna-se mais estável e confiável. Esta abordagem oferece um caminho prático para o implante de sistemas inteligentes no mundo real, onde sensores quebram e dados se perdem, garantindo que essas ferramentas permaneçam úteis mesmo quando não estão vendo o quadro completo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →