← Últimos artigos
💬 NLP

LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

Este artigo apresenta o LookBack, um método livre de treinamento que melhora a pontuação de resposta de LVLMs ao aumentar a verossimilhança dos tokens com uma pontuação de retrocesso visual para detectar melhor alucinações e selecionar saídas fundamentadas, abordando as limitações das métricas de confiança existentes.

Autores originais: Beomsik Cho, Jinhyeong Kim, Dongseok Lee, Jaehyung Kim

Publicado 2026-08-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Beomsik Cho, Jinhyeong Kim, Dongseok Lee, Jaehyung Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está conversando com um robô superinteligente que tem tanto olhos quanto um cérebro. Este robô, chamado de Modelo de Linguagem e Visão de Grande Escala (ou LVLM, para abreviar), pode olhar para uma imagem e depois escrever uma história ou responder a uma pergunta sobre ela. É como ter um amigo que pode ver o mundo e descrevê-lo perfeitamente. Mas aqui está o problema: às vezes, esse robô fica confiante demais em sua própria voz. Ele pode descrever uma cena com uma gramática e um fluxo tão perfeitos que parece totalmente real, mesmo que esteja inventando coisas que não estão na imagem de forma alguma. Isso é chamado de "alucinação".

Para corrigir isso, os cientistas geralmente tentam escolher a melhor resposta de uma lista de muitos palpites que o robô faz. Eles frequentemente usam um truque simples: escolhem a resposta que soa mais confiante ou provável com base na própria matemática interna do robô. Pense nisso como um professor escolhendo a redação que soa mais fluente. Mas e se o robô for apenas um falador eloquente que está confiantemente errado? Este é o problema que este artigo aborda: como saber se o robô está realmente olhando para a foto ou se ele está apenas sonhando acordado enquanto parece inteligente?

Os pesquisadores por trás deste estudo, da Universidade Yonsei, perceberam que o "medidor de confiança" usual do robô está quebrado quando se trata de imagens. Eles descobriram que, mesmo que você retire a foto e apenas peça ao robô para adivinhar, ele ainda dá as mesmas pontuações de confiança altas para suas respostas. É como um aluno que consegue recitar uma redação de história perfeitamente de memória, mas se você perguntar sobre uma foto específica em seu livro didático, ele pode descrever confiantemente um dinossauro em uma sala de aula porque é apenas bom em adivinhar palavras, não em olhar para evidências.

Para resolver isso, a equipe inventou um novo método chamado LOOKBACK. Imagine que você está corrigindo a redação desse aluno novamente. Em vez de apenas verificar se as frases fluem bem, você pergunta: "Você realmente olhou para a foto quando escreveu esta palavra?" O LOOKBACK é uma ferramenta especial que verifica cada palavra que o robô escreve para ver se os "olhos" do robô (sua atenção interna) estavam realmente olhando para a imagem naquele exato momento.

Veja como funciona de um jeito divertido:

  1. A Verificação de Confiança: Primeiro, o LOOKBACK verifica o quão seguro o robô está sobre uma palavra, exatamente como os métodos antigos faziam.
  2. A Verificação de Retrospectiva (Lookback): Depois, ele pergunta: "Você olhou para a foto para dizer isso?" Se o robô disser "panda" e seus olhos internos estivessem encarando justamente um panda na imagem, essa palavra recebe um grande impulso. Se o robbô disser "panda", mas estava apenas adivinhando porque adora a palavra "panda", ele recebe uma penalidade.
  3. A Pontuação Final: A ferramenta combina essas duas verificações. Ela dá a pontuação mais alta para respostas que não são apenas fluentes e confiantes, mas que também provam que estavam realmente olhando para a evidência visual.

A equipe testou essa ideia em quatro desafios diferentes envolvendo imagens e perguntas, usando três cérebros de robôs inteligentes diferentes. Eles descobriram que o LOOKBACK foi muito melhor em escolher a resposta correta do que os métodos antigos. Na verdade, quando fizeram os robôs gerarem 25 palpites diferentes e usaram o LOOKBACK para escolher o vencedor, ele consistentemente escolheu a resposta certa com mais frequência do que qualquer outro método que tentaram.

O que é realmente legal é que o LOOKBACK não precisa aprender nada novo ou usar nenhum outro robô para ajudar. Ele apenas usa os sinais que o próprio robô principal já está enviando enquanto pensa. É como dar um espelho ao robô para que ele possa verificar seu próprio trabalho sem precisar de um professor parado sobre ele. O estudo sugere que, ao simplesmente pedir ao robô para "olhar para trás" na imagem enquanto fala, podemos impedir que ele minta confiantemente sobre o que vê, tornando esses amigos de IA muito mais confiáveis para tarefas do mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →