← Últimos artigos
🤖 machine learning

How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models

Este artigo estabelece uma lei de escalonamento que quantifica o custo de validação de modelos de linguagem com recursão em profundidade, revelando que cada iteração adicional equivale a aproximadamente 0,46 de um bloco único não recorrente, o que implica que a recursão aumenta o custo computacional de treinamento sem oferecer ganhos de capacidade proporcionais.

Autores originais: Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis

Publicado 2026-04-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

🔄 O Grande Experimento: "Repetir ou Criar Novo?"

Imagine que você está construindo uma equipe de especialistas para resolver um problema complexo. Você tem duas opções de orçamento (computação) para gastar:

  1. Opção A (Modelo Padrão): Contratar 4 especialistas diferentes (4 blocos únicos), cada um com sua própria experiência e conhecimento, trabalhando em sequência.
  2. Opção B (Modelo "Loopado"): Contratar apenas 1 especialista e pedir que ele faça o trabalho 4 vezes (repetindo o ciclo 4 vezes), usando o mesmo conhecimento que já tem.

A grande pergunta que os pesquisadores do TUM (Alemanha) e Imperial College (Reino Unido) fizeram foi: Se eu gastar o mesmo dinheiro (mesma quantidade de cálculos), a Opção B (repetir 1 pessoa 4 vezes) é tão boa quanto a Opção A (ter 4 pessoas diferentes)?

🧠 A Descoberta Principal: O "Fator de Repetição"

A resposta do artigo é: Não, não é a mesma coisa.

Eles descobriram que repetir um bloco de inteligência artificial várias vezes não é como ter blocos novos e únicos. É como se a "repetição" tivesse um desconto de eficiência.

Eles criaram uma fórmula mágica e descobriram um número chamado ϕ\phi (Fi), que vale 0,46.

  • Se fosse 1,0: Repetir 4 vezes seria igual a ter 4 pessoas novas. (O sonho de todo mundo, mas não é verdade).
  • Se fosse 0,0: Repetir 4 vezes não ajudaria em nada, seria como ficar olhando para a parede 4 vezes.
  • O que é 0,46? Significa que, ao repetir um bloco 4 vezes, você ganha apenas 1,86 vezes a capacidade de um bloco novo.

A Analogia da Fábrica de Pães:
Imagine que você tem uma massa de pão.

  • Modelo Padrão: Você tem 4 fornos diferentes. Cada forno assa um pão novo.
  • Modelo Loopado: Você tem 1 forno. Você coloca a massa, assa, tira, coloca de novo, assa, tira, e repete 4 vezes.
  • O Resultado: O pão que sai do forno repetido 4 vezes é bom, mas não é tão "especial" quanto ter 4 fornos diferentes trabalhando ao mesmo tempo. O forno repetido perde um pouco de "sabor" (capacidade de aprendizado) a cada volta.

📉 O Custo Escondido: "O Preço da Economia"

O artigo mostra que, embora o modelo "loopado" tenha menos parâmetros (menos "cérebro" único), ele gasta a mesma quantidade de energia (cálculos) para processar cada palavra.

  • Exemplo Prático: Um modelo loopado com 410 milhões de parâmetros (que repete 4 vezes) se comporta como um modelo normal de 580 milhões de parâmetros.
  • O Problema: Mas, para treinar esse modelo loopado, você gasta a mesma energia que gastaria para treinar um modelo gigante de 1 bilhão de parâmetros.

Resumo: Você economiza em "espaço de memória" (tem menos parâmetros únicos), mas paga caro em "tempo de treino" e não atinge a mesma inteligência que teria se tivesse comprado os parâmetros extras.

🎯 Onde isso funciona e onde falha?

Os pesquisadores testaram o modelo em várias tarefas, como se fosse um aluno de escola:

  1. Memorização de Fatos (Conhecimento Paramétrico): O modelo loopado perde. Se você precisa que a IA lembre de fatos específicos (como "quem foi o primeiro presidente dos EUA"), ter 4 pessoas diferentes é muito melhor do que repetir 1 pessoa 4 vezes. A "memória" fica diluída.
  2. Leitura e Símbolos (Tarefas Abertas): Aqui, o modelo loopado empata ou perde pouco. Se você der o texto na frente dele (livro aberto), ele consegue entender bem, mesmo sendo repetido.
  3. Raciocínio Complexo (Matemática e Lógica): Os pesquisadores esperavam que o modelo loopado fosse um gênio aqui (já que teoricamente ele "pensa mais" ao repetir). Mas não foi o caso. Com o orçamento de computação que eles usaram, o modelo repetido não conseguiu mostrar vantagem em raciocínio. O "gabarito" de raciocínio ainda é muito difícil para modelos pequenos.

💡 O Que Isso Significa para o Futuro?

O artigo conclui que, por enquanto, repetir blocos não é uma solução mágica para criar modelos superinteligentes de graça.

  • O Valor de uma repetição: Cada vez que você repete o bloco, você ganha menos do que se tivesse adicionado um bloco novo.
  • O Desafio: Para que o modelo loopado valha a pena, os cientistas precisam encontrar maneiras de fazer a "repetição" ser mais eficiente (aumentar o número 0,46 para algo maior, talvez até acima de 1,0 no futuro).

Em resumo: Se você quer construir um cérebro de IA, ter mais "células" únicas (parâmetros) ainda é melhor do que fazer uma célula única trabalhar exaustivamente em loop. A repetição ajuda, mas não é um atalho perfeito para a inteligência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →