← Últimos artigos
💬 NLP

Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers

Este artigo apresenta o OPTS, um framework de otimização de prompts que melhora o desempenho de otimizadores existentes como o EvoPrompt ao implementar mecanismos explícitos baseados em bandits (especificamente Thompson sampling) para selecionar e aplicar estratégias de design de prompt de forma eficaz, superando, assim, métodos que dependem de seleção implícita de estratégias.

Autores originais: Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa

Publicado 2026-06-18
📖 4 min de leitura☕ Leitura rápida

Autores originais: Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô muito inteligente, mas às vezes teimoso (um Modelo de Linguagem Grande ou LLM), a resolver um quebra-cabeça difícil. Você dá instruções ao robô, chamadas de "prompt". Se as instruções forem vagas, o robô fica confuso. Se forem perfeitas, o robô resolve o quebra-cabeça instantaneamente.

Por muito tempo, os humanos tentaram escrever essas instruções perfeitas manualmente, ou usaram programas de computador para ajustar automaticamente as instruções até que funcionassem melhor. Isso é chamado de Otimização de Prompt.

No entanto, há um problema: esses programas automáticos costumam criar instruções que são funcionais, mas carecem do "tempero secreto" que os especialistas humanos utilizam. Eles perdem truques comprovados como "pense passo a passo" ou "aja como um especialista".

O Problema: O Jogo de Adivinhação Ruim do Robô

Recentemente, uma ferramenta chamada APET tentou consertar isso. Ela deu ao robô um menu de "estratégias de design" (como um menu de técnicas culinárias: adicionar sal, picar finamente, cozinhar em fogo baixo). O robô deveria olhar para o menu e decidir quais truques usar para o quebra-cabeça específico.

Mas o artigo argumenta que pedir ao robô para fazer essa escolha é como pedir a um chef cansado para adivinhar qual tempero salvará uma sopa queimada. O robô frequentemente adivinha errado, escolhendo estratégias que na verdade tornam as instruções piores. É uma escolha implícita (o robô apenas "sente" que deve usar um truque), e ele não é muito bom nisso.

A Solução: OPTS (O Sommelier Inteligente)

Os autores deste artigo introduzem um novo método chamado OPTS (Optimizing Prompts with sTrategy Selection - Otimizando Prompts com Seleção de Estratégia).

Em vez de deixar o robô adivinhar, o OPTS atua como um sommelier inteligente (um especialista em vinhos) ou um gerente de cassino administrando um jogo de azar. Veja como funciona usando uma analogia simples:

Imagine que você tem uma fileira de máquinas caça-níqueis (os pesquisadores as chamam de "braços").

  • Máquina 1: Adiciona "Pense Passo a Passo" às instruções.
  • Máquina 2: Diz ao robô para "Ler a pergunta novamente".
  • Máquina 3: Diz ao robô para "Agir como um especialista em matemática".
  • Máquina K+1: Não faz nada (mantém as instruções exatamente como estão).

No método antigo (APET), o robô simplesmente puxaria uma alavanca aleatoriamente ou baseado em um palpite.

No novo método OPTS, o sistema usa uma estratégia matemática chamada Amostragem de Thompson (Thompson Sampling). Pense nisso como um jogador de azar inteligente que mantém uma planilha de pontuação:

  1. Ele testa uma máquina (uma estratégia).
  2. Se o rob na resolver o quebra-cabeça melhor, o sistema dá um "polegar para cima" para essa máquina e torna mais provável que ela seja escolhida na próxima vez.
  3. Se o robô falhar, o sistema dá um "polegar para baixo" para essa máquina e para de escolhê-la.
  4. Crucialmente, ele também mantém uma máquina de "Não Fazer Nada". Se todos os truques estiverem tornando as coisas piores, o sistema aprende a simplesmente deixar as instruções como estão.

O Que Eles Descobriram

Os pesquisadores testaram isso em dois robôs diferentes (LLMs) usando um conjunto de quebra-cabeças de lógica e raciocínio muito difíceis (chamados de BIG-Bench Hard).

  • O Resultado: Ao usar essa abordagem de "jogador inteligente" para escolher a estratégia certa, o sistema criou instruções muito melhores do que os próprios robôs conseguiriam fazer sozinhos.
  • O Campeão: O método de Amostragem de Thompson (o jogador inteligente) foi o vencedor claro. Ele melhorou o desempenho do otimizador de prompts em até 50% em algumas tarefas.
  • A Comparação: O método antigo (APET), onde o robô adivinhava, teve um desempenho na verdade pior do que apenas escolher estratégias aleatoriamente. Isso prova que o robô é ruim em adivinhar quais truques usar, mas é ótimo em seguir instruções se nós dissermos a ele qual truque usar.

A Conclusão

Este artigo não afirma ter resolvido todos os problemas de IA ou estar pronto para diagnósticos médicos ainda. Ele simplesmente mostra que, quando estamos tentando ensinar a IA a falar melhor, não devemos deixar a IA adivinhar qual método de ensino usar. Em vez disso, devemos usar um sistema inteligente e baseado em dados (como a Amostragem de Thompson) para escolher explicitamente os melhores truques de ensino, exatamente como um treinador escolhendo a jogada certa para uma situação específica de jogo.

O código para este "treinador inteligente" já está disponível para que outros possam usar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →