← Últimos artigos
💻 computer science

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

O artigo introduz o CASHEW, um framework de tempo de inferência, e o CASHEW-RL, uma variante aprendida treinada com Otimização de Política de Sequência de Grupo, para estabilizar o raciocínio multimodal ao agregar iterativamente trajetórias candidatas e filtrar alucinações através de verificação visual, alcançando ganhos de desempenho significativos em 13 benchmarks de compreensão de imagem e vídeo.

Autores originais: Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça difícil, como descobrir exatamente o que uma xícara de água está fazendo em um vídeo de uma pintura. Se você perguntar a uma IA padrão (um Modelo de Linguagem-Visão) apenas uma vez, ela pode supor: "Talvez o artista esteja guardando o pincel ali?". Ela está confiante, mas está errada. Se você perguntar novamente, ela pode supor: "Talvez seja para descansar o pincel?". Ela ainda está supondo, e suas respostas continuam mudando. Este é o problema que o artigo chama de raciocínio instável.

Os autores deste artigo, da Arizona State University e da NewsBreak, criaram uma solução chamada CASHEW (e uma versão mais inteligente chamada CASHEW-RL) para corrigir isso. Veja como funciona, usando analogias simples:

1. O Problema: O "Pensador Solitário"

Os modelos de IA atuais são como uma única pessoa tentando resolver um quebra-cabeça em uma sala escura. Eles podem tropeçar nos próprios pés (cometer um erro) e continuar andando na direção errada porque não conseguem ver o quadro completo claramente. Eles frequentemente "alucinam", o que significa que inventam fatos que não existem, como dizer que uma xícara é para armazenamento quando, na verdade, é para limpeza.

2. A Solução: O "Grupo de Estudos" (CASHEW)

Em vez de deixar a IA pensar sozinha, o CASHEW transforma a IA em um grupo de estudos.

  • O Processo: Quando a IA recebe uma pergunta, ela não dá apenas uma resposta. Ela gera uma multidão de diferentes "caminhos de pensamento" (trajetórias). Imagine 8 estudantes diferentes em uma sala, cada um tentando resolver o quebra-cabeça por conta própria.
  • A Verificação de Realidade (Verificação Visual): Este é o ingrediente secreto. Antes de o grupo concordar com uma resposta, um "árbitro" (uma ferramenta de verificação visual) checa o trabalho deles contra a imagem ou o vídeo real. Se um estudante diz: "A xícara é para armazenamento", o árbitro olha para o vídeo e diz: "Não, eu não veço uma prateleira de armazenamento. Eu vejo o artista mergulhando o pincel para limpá-lo".
  • A Síntese: A IA então pega as melhores partes das ideias de todos os 8 estudantes, filtra as mentiras (alucinações) usando as notas do árbitro e combina tudo em uma resposta superprecisa e baseada em evidências.

É como pegar uma sessão de brainstorming bagunçada e transformá-la em um relatório polido e verificado pelos fatos.

3. O Upgrade: O "Especialista Internalizado" (CASHEW-RL)

A primeira versão (CASHEW) é ótima, mas exige que o computador execute o processo de "grupo de estudos" toda vez que responde a uma pergunta, o que pode ser lento.

Os autores também criaram o CASHEW-RL. Pense nisso como pegar esse grupo de estudos e ensinar a IA a se tornar a própria líder do grupo.

  • Eles treinaram a IA usando um sistema de recompensa especial (como a pontuação de um videogame) que dava pontos por:
    1. Acertar a resposta.
    2. Citar a evidência visual correta (como apontar para a xícara).
    3. Não perder tempo com perguntas fáceis (ser eficiente).
  • Após esse treinamento, a IA aprendeu a fazer o "pensamento em grupo" e a "verificação de fatos" por conta própria, dentro de seu próprio cérebro, de forma muito mais rápida e eficiente.

O Que Eles Descobriram?

O artigo testou isso em 13 benchmarks diferentes envolvendo imagens e vídeos. Os resultados foram como encontrar uma varinha mágica para o raciocínio da IA:

  • Grandes Saltos na Precisão: Em um teste de ciências chamado ScienceQA, a pontuação da IA saltou 26,2 pontos percentuais. Em um teste de raciocínio de vídeo chamado EgoSchema, saltou 9,1 pontos percentuais.
  • Menos Alucinação: A IA parou de inventar fatos. Ela começou a se manter fiel ao que realmente podia ver na imagem.
  • Melhor que a Concorrência: Quando comparado a outros métodos que tentam corrigir o raciocínio da IA (como apenas perguntar à IA a mesma pergunta 8 vezes e escolher a resposta mais comum), o CASHEW venceu todas as vezes.

Em Resumo

O artigo afirma que, ao forçar a IA a pensar em grupos, checar seu trabalho contra a evidência visual e aprender com seus erros, podemos torná-la muito mais confiável. Isso impede que a IA dê palpites confiantes e a coloca no caminho de um raciocínio cuidadoso e baseado em evidências.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →