← Últimos artigos
💻 computer science

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

Este artigo apresenta o Space Tokens, um framework leve e agnóstico à modalidade que melhora as capacidades de raciocínio espacial de modelos de visão-linguagem ao destilar geometria 3D e atributos de objetos em tokens latentes contínuos para processamento de cadeia de pensamento (chain-of-thought), alcançando desempenho de estado da arte em benchmarks espaciais sem exigir módulos adicionais em tempo de inferência.

Autores originais: Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

Publicado 2026-08-12
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a navegar em uma sala de estar bagunçada. Você mostra a ele uma foto de um sofá, uma mesa de centro e um gato. Um robô básico poderia dizer: "Eu vejo um sofá". Mas para conseguir pegar um brinquedo sem derrubar a mesa, o robô precisa saber muito mais: Qual o tamanho do sofá? Qual a distância dele da parede? O gato está sentado sobre a mesa ou embaixo dela? Esta é a diferença entre apenas ver e realmente compreender o espaço. No mundo da inteligência artificial, isso é chamado de "inteligência espacial". Por muito tempo, os computadores foram ótimos em reconhecer objetos, mas terríveis em entender como esses objetos se encaixam no espaço 3D. Para resolver isso, cientistas tentaram duas coisas principais: ou tornar o cérebro do computador (o modelo) enorme e caro, ou adicionar ferramentas especiais e pesadas apenas para medir distâncias. Ambos funcionam, mas são lentos e desajeitados.

Agora, uma equipe de pesquisadores criou um truque inteligente chamado "Space Tokens" (Tokens Espaciais). Pense em um modelo de IA padrão como um aluno fazendo uma prova. Normalmente, se o aluno precisa saber como medir uma sala, ele tem que levar um transferidor e uma fita métrica (ferramentas extras) ou memorizar uma enciclopédia massiva de geometria (um céreamente gigante). Este novo artigo sugere uma abordagem diferente: e se o aluno pudesse apenas pensar em medidas? Os pesquisadores descobriram uma maneira de ensinar a IA a criar "notas mentais" invisíveis dentro de seu próprio processo de pensamento. Essas notas, ou "tokens", agem como pequenos sussurros contínuos de geometria que a IA pode usar para raciocinar sobre tamanho, distância e forma sem precisar de ferramentas extras ou de um cérebro maior. É como dar à IA um senso de espaço integrado que ela pode usar enquanto fala, tornando-a mais inteligente em relação ao mundo físico sem diminuir sua velocidade.

O Problema: Cérebros Grandes vs. Ferramentas Pesadas

Imagine que você tem um amigo muito inteligente que é ótimo em descrever imagens. Você mostra a ele uma foto de uma cozinha, e ele consegue dizer: "Isso é uma geladeira, e aquilo é uma torradeira". Mas se você perguntar: "Consigo colocar uma caixa de pizza gigante entre a geladeira e a torradeira?", ele pode errar o palpite porque não consegue realmente "sentir" o espaço.

Para corrigir isso, os cientistas tentaram dois caminhos principais. O primeiro é o "escalonamento", que é como dizer ao amigo para ler todos os livros da biblioteca e memorizar todos os layouts possíveis de quartos. Isso funciona, mas exige um céreve massivo que leva uma eternidade para rodar. O segundo caminho são as "ferramentas especializadas", que é como dar ao amigo uma trena a laser e um scanner 3D para usar toda vez que ele olha para uma foto. Isso é preciso, mas é lento, caro, e o amigo não consegue usá-lo se estiver com pressa ou se as ferramentas não estiverem disponíveis.

Os autores deste artigo fizeram uma pergunta simples: Podemos ensinar o amigo a apenas "conhecer" o espaço em sua cabeça, sem precisar da biblioteca ou da trena a laser?

A Solução: Space Tokens

Os pesquisadores introduziram um método chamado Space Tokens. Em vez de adicionar novo hardware ou tornar o modelo de IA enorme, eles ensinaram a IA a gerar "tokens" especiais (que são apenas pequenos pedaços de dados) que representam o espaço 3D.

Pense nesses tokens como post-its invisíveis que a IA cola em seus próprios pensamentos.

  1. Notas de Nível de Cena: Algumas notas descrevem o quarto inteiro. Elas capturam a forma do chão, a posição das paredes e a profundidade do ambiente.
  2. Notas de Nível de Objeto: Outras notas descrevem itens específicos. Elas guardam informações sobre onde um objeto está, qual o seu tamanho e para qual direção ele está voltado.

A magia é que essas notas são "contínuas", o que significa que não são apenas rótulos simples como "grande" ou "pequeno". Elas são como coordenadas e medidas precisas que a IA pode usar para fazer cálculos em sua mente. A IA aprende a criar essas notas observando exemplos de um modelo "professor" (um sistema de reconstrução 3D muito inteligente) e depois praticando até conseguir fazer isso sozinha.

Como Eles Ensinaram a IA

O treinamento aconteceu em três estágios, como um videogame com três níveis:

  • Nível 1: Aprendendo a Linguagem do Espaço. A IA recebeu imagens e foi ensinada a gerar as "notas adesivas" (tokens) que correspondem à geometria 3D da cena. Ela aprendeu a alinhar seus pensamentos internos com as formas 3D precisas do mundo.
  • Nível 2: Pensando com as Notas. Uma vez que a IA soube como fazer as notas, ensinaram-na a usá-las para responder perguntas. Eles a forçaram a olhar para as notas e dizer: "Porque a geladeira está a 2 metros de distância, a caixa de pizza não caberá". Isso é chamado de raciocínio de "Cadeia de Pensamento" (Chain-of-Thought), mas agora os pensamentos incluem dados espaciais.
  • Nível 3: Melhorando com a Prática. Finalmente, eles usaram uma técnica chamada Aprendizado por Reforço. A IA tentava responder perguntas e, se acertasse o tamanho ou a distância, recebia uma "recompensa". Se errasse, aprendia com o erro. Isso ajudou a IA a ficar ainda mais afiada no uso de suas notas espaciais.

O Que Eles Descobriram

Os resultados foram impressionantes. Os pesquisadores testaram seu novo método em um benchmark chamado VSI-Bench, que é um teste rigoroso de compreensão espacial.

  • Quando aplicaram isso a um modelo chamado Qwen3-VL-8B, a pontuação subiu 4,3%.
  • Quando aplicaram a um modelo mais forte chamado SenseNova-SI-1.3, a pontuação subiu 1,3%.

Mas a verdadeira vitória foi em tarefas específicas. O novo método tornou-se o melhor do mundo em adivinhar o tamanho de objetos (acertando 79,2% das vezes) e o tamanho de cômodos (acertando 75,7% das vezes). Estas são tarefas que normalmente exigiriam ferramentas 3D pesadas, mas este método o fez apenas usando seus "post-its" internos.

Por Que Isso Importa

A parte mais emocionante é que a IA não precisou mudar seu cérebro ou carregar ferramentas extras. Ela apenas aprendeu a pensar de forma diferente. Os pesquisadores também mostraram que esses "post-its" são reais. Eles puderam decodificar esses tokens de volta em formas 3D e ver que a IA realmente havia aprendido a geometria da sala. Ela não estava apenas dando palpites; ela tinha uma compreensão genuína do espaço.

Isso sugere que não precisamos construir modelos de IA maiores, mais lentos ou mais caros para torná-los espacialmente inteligentes. Só precisamos ensiná-los a criar e usar essas notas espaciais internas. É uma maneira mais leve, rápida e flexível de dar às máquinas a capacidade de navegar em nosso mundo 3D, o que é um grande passo à frente para coisas como robôs que precisam se mover em nossas casas ou carros que precisam dirigir com segurança.

Em resumo, o artigo mostra que, ao dar à IA uma maneira de "pensar em 3D" usando simples tokens internos, podemos torná-la muito melhor em compreender o mundo físico sem torná-la mais pesada ou lenta. É uma pequena mudança na forma como a IA pensa que leva a um grande salto no que ela é capaz de fazer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →