← Últimos artigos
💻 computer science

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP é um método totalmente apenas para frente e eficiente em consultas que otimiza prompts profundos tanto nos ramos de visão quanto de texto de modelos CLIP congelados usando aproximação estocástica de perturbação simultânea, superando abordagens de ordem zero existentes em múltiplos benchmarks ao alavancar reparametrização de baixo posto cross-modal, momentum de correção de gradiente e um cronograma de posto dinâmico.

Autores originais: Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

Publicado 2026-08-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô superinteligente que leu toda a internet e aprendeu a entender tanto imagens quanto palavras. É como um bibliotecário genial que consegue dizer instantaneamente do que se trata uma foto apenas olhando para ela, ou descrever uma cena usando frases perfeitas. Este robô é chamado de Modelo de Visão-Linguagem, e ele é incrivelmente poderoso. Mas aqui está o detalhe: geralmente, para ensinar ao robô um novo truque — como reconhecer um tipo específico de flor rara ou um exame médico estranho — você precisa deixá-lo "reconfigurar" seu próprio cérebro. Esse processo é pesado, como tentar reorganizar uma biblioteca enorme enquanto ela ainda está aberta ao público, e exige muita capacidade de computação e memória.

Às vezes, porém, você não pode fazer isso. Talvez o robô viva em um dispositivo minúsculo, movido a bateria, no seu bolso, ou talvez seja um serviço secreto com o qual você só pode conversar através de uma janela de chat que não permite ver como ele pensa. Nesses casos, você não pode reconfigurar o cérebro; você só pode sussurrar novas instruções para ele. Isso é chamado de "ajuste de prompt" (prompt tuning). Em vez de mudar o cérebro do robô, você dá a ele um conjunto especial de dicas ou "prompts" para ajudá-lo a resolver um novo quebra-cabeça. O problema é que encontrar as dicas perfeitas geralmente exige muita tentativa e erro, e se você não consegue ver os pensamentos internos do robô (gradientes), é como tentar encontrar uma agulha no palheiro enquanto está vendado. Você pode precisar de milhares de palpites apenas para acertar, o que é muito lento e caro para a vida real.

É aqui que entra um novo método chamado ZOMP. Pense no ZOMP como um detetive astuto que resolve o problema da "agulha vendada" mudando a forma como pesquisa. Em vez de adivinhar cada detalhe da dica de uma só vez, o ZOMP usa uma estratégia para adivinhar as partes mais importantes primeiro e, depois, preenche o restante lentamente.

Veja como funciona, usando algumas metáforas divertidas:

O Truque do "Projeto Compartilhado"
Normalmente, quando você tenta ensinar coisas novas ao robô, tem que escrever dicas separadas para os "olhos" (visão) e para a "voz" (texto). Se você tentar escrever dicas profundas e complexas para ambos ao mesmo tempo, o número de possibilidades torna-se tão grande que a busca vendada se perde. O ZOMM muda o jogo ao dizer: "Vamos usar um projeto compartilhado". Imagine que as dicas para os olhos e para a voz são construídas a partir do mesmo pequeno conjunto de peças de LEGO. Você só precisa descobrir como organizar essas poucas peças, e elas constroem automaticamente as dicas certas tanto para os olhos quanto para a voz ao mesmo tempo. Isso mantém o espaço de busca pequeno e gerenciável, mesmo que as dicas sejam profundas e complexas.

A Expansão de "Orçamento Indexado"
Mesmo com o projeto compartilhado, tentar organizar todas as peças de uma vez ainda é muito difícil quando você está vendado. O ZOMP usa um sistema de "orçamento". Imagine que você tem um número limitado de palpites (consultas) para encontrar a melhor dica. O ZOMP começa permitindo que ele brinque apenas com a primeira peça, a mais importante. Ele encontra a direção certa para essa única peça. Assim que tem certeza de que está no caminho certo, ele "desbloqueia" a próxima peça, depois a próxima, expandindo a busca lentamente apenas quando tem uma direção confiável. É como aprender a dirigir: você começa em um estacionamento vazio (um espaço de busca minúsculo), fica confortável e depois avança lentamente para as ruas do bairro e, finalmente, para a rodovia. Você não tenta dirigir na rodovia no seu primeiro dia.

A Memória de "Momento"
Como a busca é feita de olhos vendados, as pistas que o robô recebe são frequentemente ruidosas e instáveis, como tentar caminhar em um barco em águas agitadas. O ZOMP adiciona uma memória de "momento" (momentum). Pense nisso como um surfista que não apenas reage a cada onda, mas lembra a direção geral para onde o oceano está empurrando. Mesmo que uma onda o jogue para o lado, ele continua seguindo na direção certa porque lembra para onde estava indo. Isso ajuda o robô a ignorar o ruído e a manter-se no caminho que realmente funciona.

Os Resultados
Os pesquisadores testaram este método em 13 desafios diferentes, desde identificar flores até reconhecer veículos em imagens de satélite. Eles deram ao ZOMP e a outros métodos exatamente o mesmo número de palpites (5.000 consultas). Os resultados mostraram que o ZOMP consistentemente encontrou melhores dicas do que os outros métodos. Ele não foi apenas ligeiramente melhor; ele foi frequentemente significativamente mais preciso, especialmente em tarefas complicadas onde o robô costuma ter dificuldades.

O que é realmente legal é que o ZOMP não apenas melhorou na tarefa específica para a qual foi treinado. Ele também ficou melhor em lidar com situações novas e estranhas que nunca tinha visto antes (como reconhecer um esboço de um objeto em vez de uma foto). Isso sugere que, ao pesquisar de forma cuidadosa e eficiente, o ZOMP aprendeu uma maneira mais inteligente de usar o conhecimento existente do robô, em vez de apenas memorizar os exemplos de treinamento.

Em resumo, o ZOMP prova que você não precisa reconfigurar o cérebro do robô para torná-lo mais inteligente. Ao usar um projeto compartilhado, expandir a busca lentamente e manter uma memória constante da direção, você pode ensinar truques novos a uma IA poderosa mesmo quando só pode sussurrar para ela e tem um número limitado de tentativas. É uma maneira prática e eficiente de tirar o máximo proveito desses modelos gigantes sem precisar de um supercomputador no seu bolso.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →