← Últimos artigos
💬 NLP

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

O artigo apresenta o MultiModal Code-Switching (MMCS), um novo paradigma de pré-treinamento que intercala objetos visuais no texto para fornecer supervisão explícita ao nível do objeto, melhorando significativamente a eficiência de dados e as capacidades de ancoragem visual em comparação com os métodos tradicionais de alinhamento imagem-texto.

Autores originais: Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

Publicado 2026-08-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a entender o mundo. Você mostra a ele uma foto de uma mesa bagunçada e diz: "Há uma caneca de café, um laptop e um gato". No mundo da Inteligência Artificial, esses robôs são chamados de Modelos de Linguagem de Grande Escala Multimodais (MLLMs). Eles são como estudantes superinteligentes que conseguem ler texto e olhar para fotos ao mesmo tempo. Para aprender, eles geralmente estudam em pares: um lado mostra uma foto e o outro lado mostra um parágrafo longo descrevendo-a. O robô tenta adivinhar as palavras com base na imagem inteira.

Mas aqui está a parte complicada: uma única foto é uma mistura de muitas coisas. Se o robô vê uma foto com um gato, um cachorro e uma bola, e o texto diz "O gato está perseguindo o cachorro", o robô tem que descobrir qual parte da imagem borrada e misturada pertence ao "gato" e qual pertence ao "cachorro". É como tentar resolver um quebra-cabeça onde todas as peças estão coladas umas nas outras, formando uma grande massa. O robô tem que adivinhar as conexões, o que é lento, ineficiente e frequentemente leva à confusão. É como tentar aprender os nomes de seus amigos olhando para uma foto de grupo onde todos estão amontoados; você pode até adivinhar quem é quem, mas provavelmente erraria muito.

Este é exatamente o problema que os pesquisadores da Universidade de Nanjing abordaram em seu novo artigo. Eles perceberam que a maneira antiga de ensinar esses robôs — colar a foto inteira a uma frase inteira — era muito bagunçada. Então, eles inventaram um truque novo e inteligente chamado Troca de Código Multimodal (MMCS).

Pense no MMCS como um jogo de "preencha a lacuna", onde a lacuna não é uma palavra, mas uma pequena imagem ampliada. Em vez de escrever "O gato está no tapete", o robô recebe uma frase que se parece com isto: "O [imagem de um gato] está no [imagem de um tapete]".

No mundo real, a "troca de código" (code-switching) é quando uma pessoa que fala duas línguas (como inglês e espanês) mistura ambas na mesma frase, como dizer: "Eu fui à tienda para comprar leite". Os pesquisadores pegaram emprestada essa ideia. Eles tratam o objeto visual (a imagem do gato) como uma "língua" ou "código" diferente do texto. Ao substituir a palavra "gato" por um fragmento de imagem real do gato, eles forçam o robô a olhar para aquela pequena imagem específica e entender que é aquilo o que a palavra significa. Não há mais adivinhação. A conexão é explícita e direta.

A equipe construiu uma máquina massiva para criar esses exemplos especiais de treinamento. Eles pegaram milhares de imagens, escreveram descrições detalhadas para elas, encontraram os objetos específicos nas fotos (como o gato, o livro ou a lâmpada) e então substituíram as palavras das descrições por esses pequenos fragmentos de imagem. Eles criaram um conjunto de dados de 773.000 dessas amostras de "linguagem mista".

Os resultados foram surpreendentemente eficientes. Normalmente, para ensinar bem um robô, você precisa de centenas de milhares de pares padrão de imagem e texto. Mas com este novo método de "troca de código", o robô aprendeu tão bem usando apenas 50.000 amostras. Na verdade, um modelo treinado com apenas 50.000 dessas amostras especiais teve um desempenho tão bom quanto, ou até melhor do que, modelos treinados com 600.000 amostras padrão. É como se o robô tivesse passado de precisar de uma biblioteca inteira de livros didáticos para aprender a mesma quantidade de informação através de apenas alguns cartões de memória, porque os cartões eram muito mais claros.

O artigo também mostrou que esse método não ajudou apenas o robô a reconhecer objetos; tornou o robô melhor em entender exatamente onde as coisas estão em uma imagem e em descrevê-las com precisão. Quando os pesquisadores observaram como o "cérebro" do robô estava funcionando, viram que sua atenção tornou-se muito mais nítida. Em vez de olhar vagamente para a foto inteira, ele focava exatamente no lugar certo ao ler a palavra "gato".

Em resumo, os pesquisadores descobriram que, ao misturar imagens e palavras em uma frase — substituindo palavras por seus equivalentes visuais — eles podiam ensinar modelos de IA a entender o mundo de forma muito mais rápida e precisa. Eles provaram que você não precisa afogar um robô em dados se der a ele dados que sejam perfeitamente claros. O robô não precisa adivinhar qual parte da foto é o gato; o gato está bem ali na frase, encarando-o de volta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →