← Últimos artigos
💬 NLP

v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning

O artigo introduz o v1, uma extensão leve para modelos de linguagem multimodais que possibilita a referência visual ativa por meio de um mecanismo semântico de apontar e copiar, permitindo que o modelo recupere e re-ancore dinamicamente patches de imagem relevantes durante o raciocínio para superar as limitações da codificação visual estática.

Autores originais: Jiwan Chung, Junhyeok Kim, Siyeol Kim, Jaeyoung Lee, Min Soo Kim, Youngjae Yu

Publicado 2026-08-06
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Jiwan Chung, Junhyeok Kim, Siyeol Kim, Jaeyoung Lee, Min Soo Kim, Youngjae Yu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça difícil, mas as peças estão escondidas dentro de uma imagem gigante e complexa. No mundo da inteligência artificial, existem cérebros "multimodais" especiais que podem olhar para imagens e ler texto ao mesmo tempo. Normalmente, quando esses modelos de IA tentam resolver um problema matemático envolvendo um diagrama, eles dão apenas uma olhada rápida na imagem, memorizam a "vibe" geral e tentam resolver o resto do problema usando apenas palavras. É como olhar para um mapa por cinco segundos, fechar os olhos e depois tentar dirigir para uma nova cidade sem nunca mais olhar para o mapa. O problema é que, conforme as instruções de direção se tornam mais longas e complicadas, a IA começa a esquecer exatamente onde ficam as curvas ou como são os pontos de referência. Ela perde seu "aterramento" (grounding), o que significa que ela se afasta da evidência visual necessária para estar correta.

Este artigo apresenta uma nova maneira para esses cérebros de IA pensarem, chamada v1. Em vez de apenas dar uma olhada e depois adivinhar, o v1 ensina o modelo a apontar ativamente para as partes específicas da imagem que ele precisa lembrar, copiar essa informação e colá-la de volta em seu processo de pensamento sempre que ficar travado. É como ter um aluno superinteligente que, enquanto resolve um problema matemático longo, continua estendendo a mão para tocar o diagrama com o dedo, dizendo: "Espere, deixe-me verificar este ângulo novamente", e então traz esse detalhe visual específico de volta para suas notas para ajudar a terminar o cálculo. Os pesquisadores descobriram que esse truque simples de "apontar e copiar" ajuda a IA a manter o foco nas partes certas da imagem, levando a respostas muito melhores em testes matemáticos visuais difíceis.

O Problema: A Armadilha do "Um Olhar Só"

A maioria dos modelos de IA atuais que conseguem ver e ler são como estudantes que recebem a instrução de estudar um diagrama por uma fração de segundo e depois fechar os olhos. Eles codificam a imagem em sua memória uma única vez e depois tentam raciocinar através do problema usando apenas texto. Os pesquisadores notaram uma falha nessa abordagem: conforme o raciocínio se torna mais longo e complexo, o modelo começa a perder o foco. É como se os olhos do estudante ficassem vidrados; eles param de prestar atenção aos detalhes importantes na imagem. O artigo mostra que, à medida que a IA escreve mais etapas para resolver um problema, sua atenção à imagem real desaparece, e ela começa a cometer erros porque não está mais "olhando" para a evidência de que precisa.

A Solução: Apontar e Copiar

Para corrigir isso, a equipe criou o v1, uma atualização leve para esses modelos de IA. Pense no v1 como dar à IA um ponteiro mágico e uma fotocopiadora. Quando a IA está pensando em um problema e percebe que precisa verificar uma parte específica da imagem — como um ângulo em um triângulo ou uma barra em um gráfico — ela não apenas adivinha. Em vez disso, ela usa um mecanismo de "apontar" para selecionar exatamente aquele pedaço da imagem.

Depois de apontar, ela "copia" a informação visual daquele lugar e a cola diretamente de volta em seu fluxo de pensamento. Isso significa que a IA pode revisitar a evidência visual quantas vezes precisar, mantendo a imagem fresca em sua mente enquanto faz a matemática. Crucialmente, não se trata de gerar novas imagens ou desenhar novos quadros; trata-se de re acessar os dados originais da imagem com precisão cirúrgica. O modelo aprende a dizer: "Eu preciso olhar para a barra vermelha novamente", aponta para ela, copia seus dados e então continua seu raciocínio com esse contexto visual fresco.

Como Eles Ensinaram a IA

Você não pode simplesmente dizer a uma IA para "olhar com mais atenção"; ela precisa ser treinada sobre como fazer isso. Os pesquisadores construíram um conjunto de dados massivo chamado v1g, contendo 300.000 exemplos de problemas matemáticos onde as etapas de raciocínio estão explicitamente ligadas a partes específicas da imagem. Eles usaram um processo automatizado inteligente para criar esses dados:

  1. Eles pegaram caminhos de raciocínio existentes de outros modelos de IA.
  2. Usaram um modelo de linguagem poderoso para decompor esses caminhos, identificando onde a IA deveria ter olhado para a imagem.
  3. Adicionaram anotações de "aterramento" (grounding), que são como post-its digitais que dizem: "Quando você mencionar este ângulo, deve olhar para esta região específica da imagem".

Este conjunto de dados ensinou ao modelo v1 que, quando estiver travado ou precisar verificar um passo, ele deve estender a mão, apontar para o lugar certo e copiar a informação.

Os Resultados: Raciocínio Inteligente e Focado

A equipe testou o v1 em vários benchmarks matemáticos desafiadores, incluindo MathVista, MathVision e MathVerse. Esses testes são cheios de diagramas, gráficos e formas geométricas que exigem uma inspeção visual cuidadosa.

Os resultados foram impressionantes. Embora o v1 seja um modelo relativamente pequeno (7 bilhões de parâmetros), ele superou muitos modelos maiores e outros modelos especializados em raciocínio.

  • No benchmark MathVision, o modelo base sem o recurso de apontar obteve uma pontuação de 23,6.
  • Quando o recurso de apontar foi adicionado durante o treinamento, mas não usado durante o teste, a pontuação subiu ligeiramente para 25,3.
  • Mas quando o modelo foi permitido usar o recurso apontar e copiar durante o teste, a pontuação saltou para 34,5.

Isso mostra que a capacidade de revisitar ativamente a imagem é o fator chave para o sucesso. O modelo não apenas ficou melhor em matemática; ele ficou melhor em olhar enquanto faz matemática. Em um exemplo, enquanto outros modelos identificaram incorretamente a barra mais alta em um gráfico, o v1 apontou corretamente para a barra específica, copiou seus dados e calculou a porcentagem correta. Em outra tarefa envolvendo um quebra-cabeça de busca de caminho com hexágonos, o v1 apontou com sucesso para as formas corretas para verificar a rota, enquanto outros se perderam.

O Que Isso Significa

O artigo sugere que o futuro do raciocínio multimodal não é apenas sobre tornar os modelos maiores ou mais inteligentes na geração de texto. É sobre dar a eles a capacidade de acessar dinamicamente informações visuais quando precisarem. Ao permitir que o modelo "aponte e copie", os pesquisadores descobriram uma maneira de manter a evidência visual alinhada com as etapas de raciocínio, evitando que o modelo se desvie da verdade.

Os pesquisadores fazem questão de notar que isso não é uma varinha mágica que resolve todos os problemas. Às vezes, o modelo ainda aponta para a área errada, ou pode apontar vezes demais, ou pode ter dificuldade com conceitos muito abstratos que não se encaixam perfeitamente em uma caixa. No entanto, a descoberta central é clara: o referenciamento visual ativo ajuda. Ele transforma a IA de um estudante que olha para o mapa uma vez e espera pelo melhor, em um navegador que constantemente verifica o mapa, garantindo que cada curva esteja correta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →