← Últimos artigos
💻 computer science

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

O CoLT é um novo framework que aprimora modelos de linguagem de grande escala multimodais ao substituir o verboso raciocínio baseado em Cadeia de Pensamento (Chain-of-Thought) textual por representações de pensamento latente eficientes em nível de etapa, alcançando acelerações significativas de inferência e desempenho superior através de uma estratégia de treinamento que utiliza um decodificador externo leve para supervisão bidirecional enquanto o remove durante a inferência.

Autores originais: Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

Publicado 2026-07-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema: O Robô "Falador"

Imagine que você tem um assistente robô brilhante que consegue olhar para uma imagem e resolver um problema de matemática. Para chegar à resposta correta, o robô precisa "pensar" primeiro.

Atualmente, a maioria dos robôs avançados utiliza um método chamado Chain-of-Thought (CoT) (Cadeia de Pensamento). Isso é como o robô conversando consigo mesmo em voz alta. Antes de dar a resposta final, ele escreve uma longa história passo a passo em texto: "Primeiro, vejo um triângulo. Depois, noto que a linha tem 5 polegadas de comprimento. Em seguida, aplico o teorema de Pitágoras..."

Embora isso funcione bem, tem dois grandes pontos negativos:

  1. É lento: O robô tem que digitar cada palavra do seu processo de pensamento. Se o processo de pensamento for longo, leva muito tempo e poder computacional.
  2. É rígido: Uma vez que o robô escreve uma palavra, ele fica preso àquela frase específica. Ele não consegue mudar de ideia ou explorar diferentes caminhos facilmente sem reescrever toda a história.

A Solução: CoLT (Chain of Latent Thoughts)

Os autores deste artigo propõem uma nova maneira de ensinar esses robôs a pensar, chamada CoLT.

Em vez de fazer o robô escrever uma longa história, o CoLT ensina o robô a pensar em sussurros silenciosos e invisíveis (chamados de "pensamentos latentes"). Imagine o robô tendo uma conversa interna complexa em um código secreto que só ele entende. Ele não escreve os passos; ele apenas mantém as ideias em sua "mente" (sua memória interna de computador) e pula direto para a resposta.

A Analogia:

  • Modo Antigo (Text CoT): Como um aluno resolvendo um problema de matemática escrevendo cada passo em uma folha de papel. É claro, mas leva muito tempo para escrever.
  • CoLT: Como um mestre de xadrez olhando para o tabuleiro. Eles não dizem as jogadas em voz alta; eles visualizam toda a estratégia em suas cabeças instantaneamente e então fazem a jogada.

O Desafio: O Problema do "Silêncio"

Os pesquisadores perceberam que, se você apenas disser a um robô para "pensar silenciosamente", ele pode ficar confuso. Sem a estrutura de escrever palavras, os pensamentos internos do robô podem se tornar um amontoado de termos sem sentido ou ruído. É como pedir a alguém para resolver um quebra-cabeça em sua mente sem nunca verificar se sua lógica faz sentido.

A Correção: O "Tradutor Secreto"

Para corrigir isso, os autores construíram um sistema de treinamento especial com três "treinadores" (sinais de supervisão) para ensinar o robô a pensar corretamente em silênço:

  1. O Treinador de Ida (O Tradutor): Este treinador olha para o pensamento silencioso do robô e tenta traduzi-lo de volta para o inglês. Se o pensamento do robô for bom, o treinador consegue escrever facilmente o próximo passo da história. Se o treinador não conseguir traduzir, o robô sabe que precisa pensar de forma mais clara.
  2. O Treinador de Volta (A Âncora): Este treinador olha para a história em inglês e tenta transformá-la de volta no pensamento silencioso do robô. Isso garante que os pensamentos silenciosos do robô estejam realmente conectados a ideias reais e lógicas, não apenas números aleatórios.
  3. O Treinador Interno (O Fluxo): Este treinador verifica se os pensamentos do robô fluem logicamente de um passo para o outro. Ele garante que o robô não pule aleatoriamente do ponto A para o ponto Z sem uma ponte.

A Melhor Parte: Esses treinadores são usados apenas enquanto o robô está aprendendo. Assim que o robô é treinado, os treinadores são descartados. Quando o robô realmente resolve um problema para você, ele usa seus pensamentos silenciosos diretamente. Sem tradução extra, sem passos extras.

Os Resultados: Rápido e Inteligente

O artigo testou este novo método em oito tarefas desafiadoras diferentes, como leitura de gráficos, resolução de questões científicas e compreensão de diagramas.

  • Velocidade: Como o robô pula a escrita de milhares de palavras e usa apenas 3 "passos silenciosos", ele é 10 vezes mais rápido no total e 22 vezes mais rápido na etapa de pensamento em comparação ao antigo método baseado em texto.
  • Precisão: Surpreendentemente, o robô não ficou apenas mais rápido; ele ficou mais inteligente. Ele superou outros métodos que tentaram usar o "pensamento silencioso" e até venceu métodos que exigiam imagens extras caras para ajudar no aprendizado.
  • Robustez: Quando a entrada era bagunçada (como uma imagem borrada ou uma pergunta com erros de digitação), o método de pensamento silencioso foi muito mais estável do que o método baseado em texto. É como se um sussurro fosse menos afetado pelo ruído de fundo do que um grito alto.

Resumo

CoLT é uma nova maneira de ensinar a IA a pensar. Em vez de forçar a IA a escrever uma história longa e lenta para resolver um problema, ela ensina a IA a manter uma conversa estruturada e lógica em sua própria "mente". Ao usar ferramentas de treinamento especiais para garantir que esses pensamentos silenciosos façam sentido, a IA torna-se tanto muito mais rápida quanto mais precisa na resolução de quebra-cabeças visuais complexos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →