← Últimos artigos
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

O artigo introduz a Otimização de Política Vetorial (VPO), um algoritmo de aprendizado por reforço que treina modelos de linguagem para gerar soluções diversas ao aproveitar recompensas de valor vetorial, melhorando assim significativamente seu desempenho em procedimentos de busca no momento do teste em comparação com a otimização padrão de recompensa escalar.

Autores originais: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

Publicado 2026-05-22
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef treinando um novo aprendiz para cozinhar para um crítico de gastronomia muito exigente. O crítico não quer apenas "uma boa refeição"; ele tem um cardápio complexo de desejos específicos: talvez ele queira o bife malpassado, o molho apimentado, os vegetais crocantes e a apresentação artística.

O Jeito Antigo: O Chef "Tamanho Único"

No passado, ao treinar IA (como Modelos de Linguagem de Grande Escala), usávamos um método chamado Otimização de Recompensa Escalar (representado no artigo por GRPO).

Pense nisso como dizer ao aprendiz: "Seu objetivo é obter a pontuação mais alta possível baseada em um único número: 50% qualidade do bife + 50% qualidade do molho."

O aprendiz percebe rapidamente que, para obter a pontuação mais alta, deve parar de experimentar. Ele cozinhará exatamente a mesma combinação "perfeita" de bife-molho repetidamente. Ele se torna um mestre de uma única receita específica.

  • O Problema: Quando o crítico realmente aparece, ele pode dizer: "Na verdade, hoje quero o bife ao ponto e o molho doce." O aprendiz, tendo praticado apenas uma receita específica, não faz ideia do que fazer. Ele tem apenas uma resposta, e é a resposta errada para o humor específico de hoje.

O Jeito Novo: Otimização de Política Vetorial (VPO)

O artigo propõe um novo método de treinamento chamado Otimização de Política Vetorial (VPO).

Em vez de dar ao aprendiz uma pontuação única, o treinador diz: "Vou te dar uma lista de objetivos diferentes. Às vezes quero que você foque no bife, às vezes no molho, às vezes nos vegetais. Quero que você prepare um prato com diferentes pratos de uma só vez, onde cada prato seja uma obra-prima de uma combinação diferente."

O aprendiz aprende a criar um conjunto diversificado de soluções:

  1. Prato A: Bife perfeito, molho simples.
  2. Prato B: Bife suave, molho apimentado complexo.
  3. Prato C: Vegetais crocantes, montagem artística.

Eles não estão tentando encontrar o único prato melhor. Eles estão tentando cobrir todo o "mapa" de combinações deliciosas possíveis (o que o artigo chama de Fronteira de Pareto).

A "Busca no Momento do Teste" (O Crítico Chega)

É aqui que a mágica acontece. O artigo argumenta que, em sistemas de IA modernos, a IA não apenas dispara uma resposta e espera pelo melhor. Em vez disso, o sistema atua como um motor de busca no momento do uso (inferência).

Quando o crítico chega com seu pedido específico e único (por exemplo, "quero o bife malpassado mas o molho doce"), o sistema não pede à IA para cozinhar um novo prato do zero. Em vez disso, ele olha para o prato com pratos diversos que o aprendiz preparou durante o treinamento.

  • O Chef Antigo (GRPO): O crítico olha para o prato. Está cheio de 100 pratos idênticos "Bife-Molho #1". O crítico não consegue encontrar o que quer.
  • O Chef VPO: O crítico olha para o prato. Há um prato com bife malpassado e molho doce! O sistema escolhe esse.

Por Que Isso Importa

O artigo testou isso em quatro "cozinhas" diferentes (tarefas como resolver quebra-cabeças de lógica, navegar em labirintos e escrever código).

  1. Mais Candidatos = Melhores Resultados: À medida que o sistema era permitido a olhar para mais pratos (um maior "orçamento de busca"), o chef VPO continuava ficando cada vez melhor em encontrar a combinação perfeita. O desempenho do chef antigo atingiu um limite porque ele só tinha um tipo de prato para oferecer.
  2. Resolvendo o Impossível: Em um desafio de codificação muito difícil (LiveCodeBench), o chef antigo não conseguiu resolver o problema de forma alguma, não importa quantas vezes tentasse. O chef VPO, no entanto, tinha um conjunto diversificado de "tentativas" que, quando combinadas com uma ferramenta de busca, conseguiram desvendar o problema.
  3. A "Armadilha da Diversidade": O artigo observa que, se os objetivos forem todos basicamente os mesmos (por exemplo, "faça vermelho" e "faça azul", onde vermelho e azul são a mesma coisa), o VPO não ajuda. Ele brilha apenas quando os objetivos são verdadeiramente diferentes e exigem compensações.

A Conclusão

O artigo afirma que, se você planeja usar uma IA dentro de um sistema que busca entre muitas opções para encontrar a melhor, você não deve treinar a IA para ser um "especialista" em uma única resposta perfeita. Em vez disso, você deve treiná-la para ser um generalista que produz um portfólio diversificado de opções de alta qualidade.

Ao permitir que a IA explore diferentes "sabores" de soluções durante o treinamento, você oferece ao sistema de busca no momento do teste um cardápio muito mais rico para escolher, levando a resultados mais inteligentes e adaptáveis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →