← Últimos artigos
💻 computer science

Prompt-based Adaptation in Large-scale Vision Models: A Survey

Esta pesquisa apresenta a primeira revisão abrangente sobre Adaptação Baseada em Prompt (PA) em modelos de visão em grande escala, estabelecendo um quadro unificado que distingue Visual Prompting (VP) e Visual Prompt Tuning (VPT) com base na granularidade de injeção e no mecanismo de geração, além de analisar suas aplicações em diversos domínios e desafios futuros.

Autores originais: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

Publicado 2026-03-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um gênio da lâmpada extremamente poderoso, que já aprendeu a reconhecer quase tudo no mundo (cachorros, carros, paisagens, rostos) porque foi treinado com milhões de fotos. Esse é o nosso "Modelo de Visão Grande" (como os ViT ou Swin Transformer).

O problema é que, se você quiser usar esse gênio para uma tarefa muito específica e diferente — por exemplo, identificar tumores em raios-X médicos ou contar pássaros em fotos de satélite —, a abordagem antiga era reeducar o gênio inteiro. Era como pegar um professor universitário de física quântica e obrigá-lo a refazer a escola inteira do zero para aprender a cozinhar. Isso gasta muita energia, tempo e dinheiro, e às vezes o professor esquece o que sabia de física no processo.

Este artigo de pesquisa (uma "sobra" ou revisão) apresenta uma solução inteligente e leve chamada Adaptação Baseada em Prompts (PA). Em vez de reeducar o gênio, nós apenas damos a ele instruções rápidas e específicas para a tarefa atual.

O artigo divide essas instruções em duas categorias principais, que podemos entender com analogias do dia a dia:

1. Visual Prompting (VP) = "Colar um Post-it na Foto"

Pense no modelo como uma câmera de segurança que já sabe o que é um carro.

  • O que é: Você não mexe na câmera. Você apenas coloca algo na frente da lente ou na imagem antes dela entrar na câmera.
  • Analogia: É como se você estivesse usando uma câmera antiga e, para focar em algo específico, você desenha um círculo com um marcador na tela ou cola um post-it dizendo "Olhe aqui!".
  • Tipos:
    • Fixo: Você usa um marcador vermelho que já existe (como um ponto ou caixa que o usuário clica). Não precisa aprender nada novo.
    • Aprendido: Você cria um filtro ou uma sobreposição que o computador "aprende" a desenhar sozinho para ajudar a câmera a ver melhor.
    • Gerado: Um pequeno robô desenha um filtro personalizado para cada foto que entra, adaptando-se à luz ou ao clima.
  • Vantagem: Funciona mesmo se você não tiver acesso aos "cérebros" internos do modelo (caixa preta). É ótimo para quando você só tem o botão de "usar" e não pode mexer nas engrenagens.

2. Visual Prompt Tuning (VPT) = "Dar um Óculos de Realidade Aumentada ao Gênio"

Aqui, o modelo ainda é o mesmo, mas nós injetamos pequenas "notas mentais" dentro do processo de pensamento dele.

  • O que é: Em vez de mudar a foto de entrada, nós adicionamos pequenas "etiquetas" ou "tokens" (como palavras-chave invisíveis) dentro da sequência de dados que o modelo processa.
  • Analogia: Imagine que o gênio está lendo um livro. Em vez de reescrever o livro inteiro (o que é caro), nós colamos pequenos bilhetes coloridos entre as páginas. Esses bilhetes dizem: "Ei, nesta página, preste atenção nas cores azuis, não nas verdes". O livro continua o mesmo, mas a leitura muda de foco.
  • Tipos:
    • Aprendido: Os bilhetes são fixos e otimizados para a tarefa.
    • Gerado: Um pequeno assistente cria bilhetes diferentes para cada página que o gênio vai ler, dependendo do contexto.
  • Vantagem: É muito mais preciso para tarefas complexas que exigem mudar a forma como o modelo "entende" o mundo (como mudar de fotos de rua para fotos de raios-X).

Por que isso é revolucionário?

O artigo explica que essa abordagem é como trocar de lentes em vez de trocar de câmera.

  • Economia: Você não precisa gastar milhões de dólares em energia para re-treinar o modelo.
  • Velocidade: Adapta-se rapidamente a novas tarefas (como detectar novos tipos de defeitos em uma fábrica).
  • Segurança: Como o "cérebro" principal não muda, o conhecimento original não é corrompido.

Onde isso é usado no mundo real?

Os autores mostram que essa técnica está salvando o dia em várias áreas:

  • Medicina: Ajudando a detectar doenças em imagens médicas sem precisar de milhares de exemplos de cada doença.
  • Satélites e Agricultura: Identificando mudanças na floresta ou cultivos com poucos dados.
  • Robótica: Fazendo robôs entenderem o mundo 3D usando modelos que foram treinados apenas em fotos 2D.
  • Carros Autônomos: Ajudando os carros a "verem" melhor na chuva ou neblina, ajustando a percepção sem reprogramar todo o sistema de direção.

Os Desafios (O "Mas...")

Nem tudo são flores. O artigo alerta para alguns problemas:

  • Instabilidade: Às vezes, mudar levemente o "bilhete" ou o "post-it" pode fazer o modelo falhar completamente. É como um equilíbrio delicado.
  • Segurança: Se alguém mal-intencionado colocar um "bilhete" errado, pode enganar o modelo para ver coisas que não existem (como um sinal de pare que o carro ignora).
  • Tempo: Embora economize energia de treinamento, às vezes o processo de "ler os bilhetes" pode tornar a resposta um pouco mais lenta.

Conclusão

Em resumo, este artigo é um mapa para pesquisadores e engenheiros. Ele diz: "Pare de tentar reeducar o gênio inteiro. Em vez disso, aprenda a dar as instruções certas (Prompts) para ele fazer o trabalho específico que você precisa, de forma rápida, barata e eficiente."

É a diferença entre tentar ensinar um elefante a dançar ballet (re-treinamento total) e apenas colocar uma música específica e um pequeno guia de passos para ele seguir (Adaptação por Prompt).

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →