← Últimos artigos
🤖 AI

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

O artigo MolmoPoint propõe um mecanismo de apontamento mais intuitivo e eficiente para modelos de linguagem e visão, que seleciona diretamente tokens visuais em vez de gerar coordenadas textuais, estabelecendo novos recordes de desempenho em benchmarks de apontamento em imagens, interfaces gráficas e vídeos.

Autores originais: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

Publicado 2026-03-31
📖 4 min de leitura☕ Leitura rápida

Autores originais: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô muito inteligente que consegue ver o mundo e conversar com você, como um assistente pessoal superpoderoso. Esse robô é o que chamamos de Modelo de Linguagem Visual (VLM).

O problema é que, até agora, quando você pedia para esse robô apontar para algo na tela (como "aponte para o botão de salvar" ou "onde está o gato?"), ele tinha que fazer uma conta de matemática complicada. Ele precisava gerar números de coordenadas (como "x=105, y=340"), o que era lento, gastava muita energia e, às vezes, ele errava a conta e apontava para o lugar errado.

A equipe do MolmoPoint criou uma solução genial e muito mais intuitiva. Vamos entender como funciona com algumas analogias simples:

1. O Velho Jeito: O Cartógrafo Cansado

Antes, o robô agia como um cartógrafo que nunca viu o mapa. Para dizer onde está algo, ele tinha que desenhar um mapa mental, calcular distâncias e escrever um endereço numérico longo.

  • O problema: Era como pedir para alguém descrever a localização de uma tesoura em uma mesa apenas dizendo "3 passos à direita e 2 para cima". Se a mesa mudasse de tamanho, a descrição ficava errada. Além disso, escrever esses números demorava muito.

2. O Novo Jeito (MolmoPoint): O Detetive com um Laser

O MolmoPoint mudou a regra do jogo. Em vez de calcular coordenadas, o robô agora usa tokens de apontamento (como se fossem botões mágicos).

Imagine que a imagem na tela é um quebra-cabeça gigante. O novo método funciona em três etapas, como um detetive refinando sua busca:

  1. O "PATCH" (O Macro): O robô olha para a imagem e diz: "Ah, o objeto está nessa área grande aqui!" (como apontar para uma página inteira de um livro).
  2. O "SUBPATCH" (O Micro): Dentro dessa área grande, ele diz: "Não, é mais específico, está nesse quadrado menor aqui!" (como apontar para um parágrafo específico).
  3. O "LOCATION" (O Ponto Final): Finalmente, ele diz: "E é exatamente neste pontinho aqui dentro do parágrafo!" (como apontar para uma única palavra).

A Mágica: Em vez de escrever números, o robô apenas "clica" nos pedaços da imagem que já existem na sua memória. É como se ele estivesse tocando na tela com o dedo, em vez de ditar as coordenadas do dedo para você.

3. Por que isso é tão bom?

  • Mais Rápido e Leve: Como ele não precisa calcular números longos, ele gasta menos "cérebro" (tokens) e responde mais rápido. É como enviar um emoji em vez de escrever um livro inteiro para dizer "estou feliz".
  • Não se confunde com o tamanho da tela: Se você mostrar uma foto em alta definição (4K) ou uma foto pequena, o robô continua acertando. O método antigo quebrava porque os números mudavam de tamanho; o novo método apenas "olha" para o pedaço da imagem, não importa o tamanho dela.
  • Parando na hora certa: O robô aprendeu a dizer "Acabei de apontar para tudo o que você pediu" (um token especial de "não há mais pontos"). Isso evita que ele fique apontando coisas aleatórias sem parar, como um cachorro perseguindo o próprio rabo.

4. Onde isso é usado?

Os pesquisadores treinaram três "irmãos" com essa habilidade:

  • MolmoPoint-8B: O irmão geral, bom para fotos de natureza, vídeos e objetos do dia a dia.
  • MolmoPoint-GUI-8B: O irmão especialista em computadores e celulares. Ele é incrível para ajudar a clicar em botões, menus e janelas de programas, entendendo interfaces complexas melhor do que qualquer outro modelo aberto.
  • MolmoPoint-Vid-8B: O irmão focado em vídeos, capaz de seguir objetos em movimento (como um jogador de futebol correndo) sem se perder.

5. O Resultado Final?

Com essa nova abordagem, o MolmoPoint bateu recordes mundiais em várias tarefas:

  • Acertou mais pontos em imagens do que os modelos anteriores.
  • Entendeu melhor como interagir com telas de computador (GUI).
  • Seguiu objetos em vídeos com muito mais precisão.

Em resumo: O MolmoPoint ensinou o robô a parar de fazer contas de matemática para apontar coisas e começar a usar a intuição visual, "tocando" diretamente na imagem. É como trocar um GPS complicado que só fala em coordenadas por um amigo que aponta com o dedo e diz: "Olhe ali!".

Isso torna a interação entre humanos e máquinas muito mais natural, rápida e precisa, abrindo portas para robôs que ajudam a usar computadores e para assistentes que entendem exatamente o que você está olhando.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →