← Últimos artigos
💬 NLP

Latent Reasoning in TRMs is Secretly a Policy Improvement Operator

Este artigo demonstra que o raciocínio recursivo latente em modelos pequenos funciona como um operador de melhoria de política, permitindo a aplicação de esquemas de aprendizado por reforço e treinamento por difusão para eliminar etapas de computação ineficazes e reduzir significativamente as passagens de ida (forward passes) enquanto mantém o desempenho.

Autores originais: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

Publicado 2026-06-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Por que "Pensar" Às Vez é Apenas Perda de Tempo

Imagine que você está tentando resolver um quebra-cabeça difícil. Você tem um assistente pequeno e inteligente (o modelo de IA) que tenta resolvê-lo.

Nos últimos anos, pesquisadores tentaram tornar esse assistente mais inteligente dizendo a ele para "pensar em loops". Em vez de dar uma resposta, o assistente olharia para seu próprio palpite anterior, pensaria sobre ele por um momento e, então, faria um novo palpite, ligeiramente melhor. Ele faria isso repetidamente, esperando que, no 10º ou 20º palpite, tivesse a solução perfeita.

Isso é chamado de Raciocínio Latente. A teoria era: "Se deixarmos o modelo retornar sobre si mesmo, é como dar a ele um cérebro muito mais profundo sem realmente aumentar o tamanho do cérebro."

O Problema: Os autores deste artigo encontraram uma falha nessa lógica. Embora o modelo estivesse em loop, muitos desses loops não estavam fazendo nada de útil. Era como um aluno encarando um problema de matemática, escrevendo a mesma resposta errada, apagando-a e escrevendo-a novamente, repetidamente, esperando que ela se tornasse correta magicamente. O artigo chama isso de "computação morta" (dead compute) — desperdiçar energia em etapas que não melhoram de fato a resposta.

A Descoberta: É Secretamente uma Máquina de "Melhoria de Política"

Os autores fizeram uma grande pergunta: O que está realmente acontecendo dentro do cérebro do modelo durante esses loops?

Eles descobriram que o modelo não está apenas "pensando mais profundamente". Ele está secretamente agindo como um agente de aprendizado por reforço (um tipo de IA que aprende por tentativa e erro).

Aqui está a analogia:

  • O Jeito Antigo: O modelo adivinha, depois adivinha novamente, esperando que o segundo palpite seja melhor. É como jogar dardos de olhos vendados e esperar que o segundo arremesso chegue mais perto do alvo.
  • A Nova Percepção: Os autores perceberam que o modelo está, na verdade, realizando uma "Melhoria de Política" (Policy Improvement). Esta é uma forma sofisticada de dizer: "Pegue seu palpite atual, observe a diferença entre seu palpite e a verdade, e use essa diferença para empurrar seu próximo palpite para mais perto do alvo."

O artigo prova que toda vez que o modelo entra em loop, ele deveria estar calculando uma "vantagem" específica (uma pontuação de quanto o novo palpite é melhor em relação ao antigo). Se não estiver fazendo isso, ele está apenas patinando no lugar.

A Solução: Supervisão de Melhoria Profunda (DIS)

Como o modelo estava se perdendo em "computação morta", os autores inventaram um novo método de treinamento chamado Supervisão de Melhoria Profunda (DIS - Deep Improvement Supervision).

A Analogia: O Caminho das "Migalhas de Pão"
Imagine que você está tentando caminhar de sua casa até um tesouro escondido.

  • Método Antigo (TRM): Dizem a você: "Continue andando em círculos até encontrar o tesouro". Você pode andar 100 círculos, mas apenas 5 deles realmente o aproximaram do tesouro. O resto foram passos desperdiçados.
  • Novo Método (DIS): O professor lhe dá um mapa com migalhas de pão.
    1. Passo 1: Caminhe até a primeira migalha (um palpite ligeiramente melhor).
    2. Passo 2: Caminhe até a segunda migalha (um palpite ainda melhor).
      ...e assim por diante, até alcançar o tesouro.

Os autores criam essas "migalhas de pão" pegando a resposta correta e "corrompendo-a" lentamente (tornando-a ligeiramente errada) para criar um caminho de objetivos intermediários. Eles então treinam o modelo para atingir cada uma dessas migalhas perfeitamente.

Por que isso funciona:
Em vez de esperar que o modelo descubra como melhorar por conta própria, os professores forçam o modelo a aprender que cada etapa deve ser uma melhoria. Isso transforma a "computação morta" em "melhoria ativa".

Os Resultados: Mais Rápido, Menor e Melhor

Os autores testaram este novo método (DIS) no Tiny Recursive Model (TRM), que é um modelo de IA muito pequeno.

  1. Menos Trabalho, Mesmo Resultado: Eles descobriram que, com o DIS, o modelo não precisava de tantos loops. Eles reduziram o número de "etapas de pensamento" em 18 vezes (de 336 etapas para apenas 18) obtendo o mesmo resultado ou melhor.
  2. Vencendo os Gigantes: Eles testaram isso no benchmark ARC-AGI (um teste muito difícil de inteligência geral, como um teste de QI moderno para IA).
    • O modelo minúsculo deles (com apenas 0,8 milhão de parâmetros) obteve 24%.
    • Isso é enorme porque a maioria dos outros modelos de código aberto precisa de bilhões de parâmetros para chegar perto dessa pontuação.
    • Eles superaram significativamente o modelo TRM original, provando que o "ingrediente secreto" não era o tamanho do modelo, mas o método de treinamento.

Resumo em Uma Sentença

O artigo revela que os modelos de IA recursivos estavam secretamente tentando melhorar seus palpites como um aprendiz de reforço, mas estavam falhando porque não lhes foi ensinado como melhorar; ao fornecer um caminho de treinamento passo a passo de "migalhas de pão", os autores tornaram os modelos 18 vezes mais eficientes e significativamente mais inteligentes, tudo isso usando uma fração mínima do poder computacional.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →