← Últimos artigos
🤖 machine learning

Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts

Este artigo propõe o *Visual Adaptive Prompt Tuning* (VAPT), um método que aumenta a expressividade de especialistas de *prompts* em modelos de visão, superando o desempenho de técnicas de ajuste de parâmetros eficientes e até de modelos totalmente ajustados (*fine-tuned*), com maior eficiência de parâmetros e de amostras.

Autores originais: Minh Le, Anh Nguyen, Huy Nguyen, Chau Nguyen, Anh Tran, Nhat Ho

Publicado 2026-02-12
📖 3 min de leitura☕ Leitura rápida

Autores originais: Minh Le, Anh Nguyen, Huy Nguyen, Chau Nguyen, Anh Tran, Nhat Ho

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um Chef de Cozinha super experiente (o modelo de IA pré-treinado, como o ViT). Ele sabe tudo sobre culinária básica: como cortar, como temperar e como usar o fogo.

No entanto, você quer que ele prepare um prato muito específico, como um "Sushi de Fusão Japonês-Brasileiro". O Chef sabe cozinhar, mas ele não tem o "toque" ou a "receita exata" para essa mistura nova.

O Problema: O "Post-it" Estático (VPT)

Até agora, a técnica usada para ensinar esse Chef era o VPT (Visual Prompt Tuning). Imagine que, em vez de dar um novo livro de receitas para o Chef, você apenas cola um Post-it na bancada dele com uma instrução genérica: "Use ingredientes exóticos".

O problema é que esse Post-it é estático. Não importa se o peixe que chegou hoje é um Salmão ou um Atum, o Post-it diz a mesma coisa. O Chef tenta seguir a instrução, mas como o Post-it não muda de acordo com o ingrediente que está na frente dele, o resultado nem sempre é perfeito. É uma instrução "burra" que não reage ao que está acontecendo na cozinha.

A Solução: O "Chef Assistente Inteligente" (VAPT)

Os pesquisadores criaram o VAPT (Visual Adaptive Prompt Tuning). Em vez de um Post-it colado na parede, imagine que agora o Chef tem um Assistente de Cozinha super atento.

Esse assistente não fica parado. Toda vez que um ingrediente novo chega na bancada, o assistente olha para ele, analisa a textura, a cor e o cheiro, e escreve uma instrução nova e personalizada na hora para o Chef.

  • Se o ingrediente é um peixe gorduroso, o assistente diz: "Chef, use menos óleo!"
  • Se o ingrediente é um limão muito ácido, o assistente diz: "Chef, adicione um pouco de açúcar para equilibrar!"

Essa instrução é adaptável (ou "adaptive"). Ela muda conforme a imagem (o ingrediente) que o modelo está vendo.

Como eles fizeram isso? (A "Mágica" Técnica)

Para não gastar muito dinheiro ou tempo (o que chamamos de "eficiência de parâmetros"), eles não deram um novo cérebuiltin para o Chef. Eles apenas criaram dois mecanismos simples:

  1. O Olhar Global (Token-wise Projectors): O assistente olha para a cozinha inteira para entender o contexto, e não apenas para um grão de sal isolado.
  2. O Filtro de Detalhes (Channel-wise Convolution): Ele consegue perceber a relação entre os ingredientes vizinhos (como o sal e a pimenta) para dar uma instrução mais precisa.

Por que isso é importante? (Os Resultados)

Os resultados foram impressionantes, como se o Chef tivesse passado de um cozinheiro bom para um mestre de alta gastronomia:

  • Mais Inteligente: Ele superou até mesmo quando tentavam treinar o Chef inteiro do zero (o que é muito caro e demorado).
  • Aprende com Pouco: Mesmo se você der apenas 1% dos ingredientes (poucos dados de treino), o VAPT consegue entender o que fazer, enquanto o método antigo (VPT) ficava completamente perdido.
  • Rápido e Barato: Ele faz tudo isso sem precisar de uma cozinha gigante ou de milhares de novos funcionários; ele apenas usa um assistente muito eficiente.

Em resumo: O VAPT transforma instruções de IA de "avisos fixos na parede" em "conselhos inteligentes que mudam conforme a situação", tornando a inteligência artificial muito mais precisa e capaz de aprender tarefas novas com muito menos esforço.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →