← Últimos artigos
💬 NLP

Hierarchical Latent Prediction for Language Models

Este artigo introduz o Hierarchical Latent Prediction (HiLP), um novo objetivo auxiliar que utiliza latentes abstratos de nível superior para mitigar o acúmulo de erro em rollouts de espaço latente, melhorando, assim, o raciocínio de longo horizonte, o desempenho de codificação e a eficiência de decodificação especulativa em modelos de linguagem.

Autores originais: Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

Publicado 2026-08-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a escrever uma história. A maneira padrão de fazer isso é chamada de "Previsão do Próximo Token" (Next-Token Prediction). É como um jogo de "Mad Libs" onde o robô olha para a última palavra que você escreveu e adivinha a próxima. Se você disser "O gato sentou no", o robô adivinha "tapete". Então, você fornece a ele "O gato sentou no tapete", e ele adivinha "macio". Esse método construiu robôs incrivelmente inteligentes, mas tem uma falha. Como o robô olha apenas um passo à frente, ele pode se perder em histórias longas. Se ele cometer um erro minúsculo no início, esse erro vai crescendo conforme ele continua adivinhando, como uma bola de neve rolando montanha abaixo. Isso é chamado de "viés de exposição" (exposure bias).

Para corrigir isso, cientistas tentaram ensinar o robô a olhar alguns passos à frente ou a adivinhar a "vibe" das próximas palavras em vez de apenas a próxima letra. Mas esses métodos costumam ter seus próprios problemas: ou não conseguem enxergar longe o suficiente no futuro, ou ficam confusos com seus próprios erros quando tentam planejar muito longe à frente. A grande questão é: Podemos ensinar o robô a entender a estrutura da história em múltiplos níveis ao mesmo tempo — como conhecer o enredo de um capítulo enquanto também conhece a próxima frase — sem tornar o robô muito lento ou complicado de usar?

É exatamente isso que os pesquisadores da Microsoft Research e da Universidade do Texas em Austin abordaram em seu novo artigo, "Hierarchical Latent Prediction for Language Models". Eles introduziram um novo e inteligente método de treinamento chamado HiLP (Hierarchical Latent Prediction). Pense no cérebro do robô como tendo duas camadas de pensamento. A primeira camada é a visão "ao nível da rua", que foca na próxima palavra imediata, exatamente como o método antigo. A segunda camada é a visão "de helicóptero", que olha para um bloco de palavras de uma só vez para entender o quadro geral, como um parágrafo ou uma cena.

Em seus experimentos, os pesquisadores ensinaram o robô a usar essa "visão de helicóptero" como uma ferramenta de treinamento secreta. Eles criaram uma camada "abstrata" especial que resume as últimas palavras em um único conceito de alto nível. Então, pediram ao robô para prever onde esse conceito de alto nível estaria alguns passos no futuro. Isso forçou o robô a aprender como a história deve fluir ao longo de uma distância maior, não apenas de palavra para palavra. Crucialmente, essa "visão de helicóptero" é usada apenas durante o treinamento. Assim que o robô termina de aprender, os pesquisadores descartam as camadas extras. Quando o robô estiver escrevendo uma história para você, ele usará apenas a visão simples e rápida "ao nível da rua". Isso significa que o robô fica mais inteligente no planejamento de longo prazo sem se tornar mais lento ou pesado para rodar.

Os resultados sugerem que essa abordagem funciona bem. Quando testaram o novo robô em tarefas de codificação e quebra-cabeças de raciocínio de múltiplos passos, ele teve um desempenho melhor do que métodos anteriores que tentavam olhar à frente. Por exemplo, em um benchmark de codificação chamado HumanEval, o novo método alcançou uma pontuação de 11,33, superando o método padrão (que pontuou 8,77) e outras tentativas recentes como o NextLat (que pontuou 10,58). Os pesquisadores também descobriram que este método tornou a "decodificação especulativa" (speculative decoding) mais eficiente. Esta é uma técnica onde o robô adivinha várias palavras de uma vez para acelerar o processo; com o HiLP, os palpites do robô foram mais precisos, o que significa que ele perdeu menos tempo se corrigindo.

O artigo argumenta que, embora olhar apenas um passo à frente seja bom para detalhes locais, falha em capturar a estrutura de longo prazo da linguagem. Ao adicionar essa "visão de helicóptero" hierárquica durante o treinamento, o robô aprende a manter seus objetivos de longo prazo em mente, reduzindo o "efeito bola de neve" dos erros. Os autores sugerem que este método oferece uma maneira de obter os benefícios do planejamento de longo horizonte sem as trocas usuais de velocidade ou complexidade, embora notem que a distância específica de "olhar à frente" que usaram foi uma configuração manual, e trabalhos futuros poderiam torná-la mais flexível. Em última análise, o HiLP mostra que ensinar um modelo de linguagem a ver a floresta e as árvores durante a prática pode ajudá-lo a escrever histórias melhores, mesmo que ele use apenas as árvores na hora de apresentar o desempenho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →