← Últimos artigos
💻 computer science

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

Este artigo identifica que o GRPO em Modelos Visão-Linguagem sofre de colapso de diversidade ao convergir prematuramente para estratégias de raciocínio limitadas e propõe o MUPO, uma abordagem simples que incentiva o pensamento divergente para superar essa limitação e melhorar o desempenho em benchmarks.

Autores originais: Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

Publicado 2026-04-02
📖 3 min de leitura☕ Leitura rápida

Autores originais: Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça muito difícil. Existem dois tipos de "pessoas" (ou modelos de computador) tentando resolvê-lo:

  1. O Especialista Focado (o Modelo RL/GRPO): Ele é como um detetive muito sério que decide que a única maneira de resolver o caso é seguindo uma linha de raciocínio muito específica. Ele é muito bom nisso e, se a resposta estiver naquela linha, ele a encontra rapidamente. Mas, se a linha estiver errada, ele fica preso nela, insiste em continuar e nunca tenta outra abordagem.
  2. O Explorador Criativo (o Modelo Base): Ele é como uma criança curiosa que joga várias ideias diferentes no ar. Ele pode não ser tão profundo em nenhuma ideia específica de cada vez, mas ele tenta de tudo: contar de trás para frente, usar objetos vizinhos como referência, ou até chutar. Às vezes, ele acerta porque tentou algo que o "Especialista" nem pensou em tentar.

O Problema: "O Colapso da Diversidade"

Os pesquisadores descobriram algo curioso ao treinar computadores para serem "Especialistas" usando uma técnica chamada RL (Aprendizado por Reforço), especificamente o método GRPO.

No início, o computador tentava várias coisas (como o Explorador). Mas, conforme ele aprendia, ele começou a ficar obcecado por uma única estratégia que parecia funcionar bem. Ele abandonou todas as outras ideias. Isso é chamado de "Colapso da Diversidade".

Imagine que você está em um restaurante e, ao provar um prato, decide que apenas aquele prato é bom. Você para de experimentar qualquer outra coisa. Se aquele prato estiver estragado, você passa fome. O computador fez o mesmo: ele convergiu para uma única "estrada" e ignorou todas as outras "estradas" que poderiam levar à resposta certa.

A Solução: "MUPO" (O Maestro da Diversidade)

Para consertar isso, os autores criaram uma nova técnica chamada MUPO.

Pense no MUPO como um Maestro de Orquestra ou um Gerente de Equipe. Em vez de deixar o computador pensar sozinho e ficar obcecado por uma ideia, o MUPO divide a equipe em vários grupos pequenos.

  • O que ele faz: Ele diz: "Grupo A, vocês tentem resolver usando matemática pura. Grupo B, tentem contar visualmente. Grupo C, tentem eliminar as opções erradas."
  • A Recompensa: O MUPO recompensa não apenas quem acerta a resposta, mas também quem traz uma ideia diferente das outras. Se o Grupo A e o Grupo B pensarem de formas muito parecidas, eles não ganham pontos extras. Mas se o Grupo C trouxer uma ideia totalmente nova, ele é recompensado.
  • O Resultado: O computador aprende a ser profundo (como o Especialista) e a explorar várias ideias diferentes (como o Explorador) ao mesmo tempo.

Por que isso é importante?

No mundo real, nem todo problema tem uma única solução lógica. Às vezes, você precisa olhar de um ângulo diferente.

  • Antes (GRPO): O computador era como um carro que só sabia andar em uma única pista. Se a pista acabasse ou estivesse bloqueada, o carro parava.
  • Agora (MUPO): O computador é como um carro com rodas que podem girar em qualquer direção. Se uma estrada estiver fechada, ele rapidamente muda para outra e continua em frente.

Resumo em uma frase:

Os pesquisadores descobriram que os computadores inteligentes estavam ficando "teimosos" e focados demais em uma única ideia, e criaram um novo método para forçá-los a pensar de várias formas diferentes ao mesmo tempo, tornando-os muito mais inteligentes e capazes de resolver problemas difíceis que antes pareciam impossíveis.

É como se dissessem: "Não existe apenas um caminho para Roma; às vezes, você precisa explorar todas as estradas para chegar lá com sucesso!"

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →