← Últimos artigos
🤖 machine learning

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

Este artigo apresenta o "Program-of-Layers" (PoLar), uma estrutura livre de treinamento que pula ou repete camadas pré-treinadas dinamicamente para criar caminhos de execução customizados para cada entrada, demonstrando que tal inferência flexível melhora significativamente a precisão e a eficiência em relação ao processamento padrão de LLM de profundidade fixa.

Autores originais: Ziyue Li, Yang Li, Tianyi Zhou

Publicado 2026-06-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ziyue Li, Yang Li, Tianyi Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef robô muito inteligente e pré-treinado (o Grande Modelo de Linguagem, ou LLM), que é famoso por resolver problemas complexos. Este chef possui um livro de receitas rigoroso com um número fixo de etapas (camadas) que ele sempre segue, não importa o prato que esteja preparando.

Se o chef for solicitado a "ferver um ovo", ele ainda passará por todas as etapas de sua receita mestre de 100 passos, desde picar vegetais até temperar a sopa, mesmo que o ovo precise apenas de uma panela com água. Se ele for solicitado a "construir um castelo de açúcar", ele ainda seguirá os mesmos 100 passos, mesmo que fique preso no meio do caminho e precise repensar sua abordagem.

O Problema:
O artigo argumenta que essa receita de "tamanho único" é ineficiente. Às vezes, o chef perde tempo fazendo etapas desnecessárias e, às vezes, ele falha porque não teve tempo suficiente para refletir sobre um problema difícil.

A Descoberta (O Momento "Aha!"):
Os pesquisadores perguntaram: E se o chef pudesse reescrever sua própria receita sobre a hora?

Eles descobriram que, para quase todos os problemas, não existe apenas uma maneira "correta" de usar as habilidades do chef. Existem muitos "programas" (sequências de passos) diferentes que poderiam funcionar.

  • Pular: Para problemas fáceis (como ferver um ovo), o chef poderia pular os primeiros 50 passos e fazer apenas os últimos 10.
  • Repetir (Looping): Para problemas difíceis (como construir um castelo de açúcar), o chef poderia ficar preso em uma etapa específica, repeti-la algumas vezes para refinar o resultado e então seguir em frente.

Os pesquisadores usaram um "mecanismo de busca" (chamado Monte-Carlo Tree Search) para encontrar essas receitas melhores e ocultas. Eles descobriram que:

  1. Mais curto é frequentemente melhor: Muitos problemas podem ser resolvidos corretamente com menos etapas do que a receita padrão.
  2. Repetir ajuda: Para problemas difíceis, repetir um bloco específico de etapas (looping) frequentemente corrige erros que a receita padrão comete.
  3. Misturar é a chave: As melhores receitas geralmente envolvem uma mistura de pular algumas partes e repetir outras.

A Solução: POLAR
O problema de encontrar essas receitas perfeitas é que buscar por elas leva muito tempo. Você não pode pedir ao chef para "tentar 1.000 receitas diferentes" para cada pergunta; isso levaria uma eternidade.

Por isso, a equipe construiu um "Preditor de Receitas" (POLAR) minúsculo e leve.

  • Como funciona: Antes de o chef começar a cozinhar, este Preditor olha para a pergunta e adivinha instantaneamente a melhor receita personalizada. Ele diz: "Pule os passos 1–10, faça os passos 11–20 normalmente, repita os passos 21–25 duas vezes, depois pule o restante".
  • A Magia: O chef principal (o grande LLM) não muda nada. Ele continua congelado e pré-treinado. O Preditor apenas diz a ele como usar suas habilidades existentes para aquele momento específico.

Os Resultados:
Quando testaram isso em problemas matemáticos:

  • A precisão aumentou: O chef resolveu mais problemas corretamente, inclusive corrigindo erros que a receita padrão cometeu.
  • A velocidade aumentou: Em problemas fáceis, o chef terminou mais rápido porque pulou etapas desnecessárias.
  • Funciona em coisas novas: Mesmo quando testaram o chef em problemas matemáticos que ele nunca tinha visto antes, o Preditor ainda sabia como ajustar a receita para obter bons resultados.

Em Resumo:
Em vez de forçar um modelo inteligente a seguir um caminho rígido e fixo para cada tarefa, este artigo nos ensina como dar ao modelo um "controle remoto". Esse controle remoto permite que pulemos partes chatas ou apertemos o botão "repetir" em partes complicadas, tornando o modelo mais inteligente, rápido e eficiente sem precisar retreiná-lo ou mudar seu cérebro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →