← Últimos artigos
💬 NLP

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

O artigo apresenta o InfoLaw, um novo framework de escalonamento consciente dos dados que modela o pré-treinamento como acúmulo de informações para prever com precisão o desempenho de LLMs em diversas misturas de dados, pesos de qualidade e níveis de repetição, permitindo assim a seleção ótima de receitas de dados mesmo em regimes de supertreinamento ou com dados limitados.

Autores originais: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

Publicado 2026-05-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: Demais de uma Boa Coisa?

Imagine que você está tentando ensinar um estudante (a IA) a escrever bem. Você tem uma biblioteca massiva de livros, mas apenas alguns deles são verdadeiros clássicos de alta qualidade. O resto é mediano ou apenas aceitável.

No passado, os pesquisadores achavam que a melhor estratégia era apenas dar ao estudante os clássicos de alta qualidade. Mas há uma pegadinha: não há clássicos suficientes para preencher todo o cronograma de estudos do estudante. Se você forçar o estudante a ler os mesmos 100 clássicos repetidamente para preencher o tempo, ele eventualmente fica entediado, começa a repetir as mesmas frases e seu desempenho na verdade piora. Isso é chamado de "repetição".

Por outro lado, se você misturar alguns livros de qualidade inferior para preencher o tempo, o estudante aprende mais variedade, mas pode pegar alguns maus hábitos.

A grande pergunta é: Quanto dos livros de alta qualidade devemos repetir e quanto dos livros de qualidade inferior devemos misturar?

O Jeito Antigo: Adivinhando com um Mapa Quebrado

Anteriormente, os cientistas usavam "Leis de Escala" para prever o desempenho de uma IA. Pense nessas leis como um mapa que diz: "Se você estudar por 10 horas, você tira uma nota B; se estudar por 100 horas, você tira uma nota A".

No entanto, o artigo argumenta que esse mapa antigo quebra quando você começa a repetir os mesmos dados de alta qualidade.

  • O Defeito: O mapa antigo assume que mais tempo de estudo sempre equivale a notas melhores. Ele não leva em conta o fato de que ler o mesmo livro 50 vezes para de ajudar depois das primeiras 5 vezes.
  • O Resultado: Quando os pesquisadores tentaram usar o mapa antigo para prever como uma IA gigante se sairia, o mapa era excessivamente otimista. Ele previa que a IA tiraria notas perfeitas, mas, na realidade, a IA ficava confusa e se saía mal porque estava presa em um loop de repetição.

A Nova Solução: "InfoLaw" (O Termômetro de Informação)

Os autores introduzem um novo framework chamado InfoLaw. Em vez de apenas contar "quantas horas" a IA estudou (ou quantos tokens ela viu), o InfoLaw mede "quanta nova informação" a IA realmente aprendeu.

Veja como eles construíram isso:

  1. Os Baldes da Biblioteca: Eles organizaram sua biblioteca massiva de texto em 6 baldes baseados na qualidade (de "Ouro" a "Lixo").
  2. A Receita de Mistura: Eles criaram diferentes "receitas" para treinamento. Algumas receitas eram 80% livros de Ouro (com muita repetição), e outras eram uma mistura de livros de Ouro e Prata (menos repetição).
  3. A Descoberta: Eles descobriram que o aprendizado da IA segue um padrão específico:
    • Densidade de Qualidade: Livros de alta qualidade dão um enorme "impulso de informação" na primeira vez que você os lê.
    • Retornos Decrescentes: Cada vez que você lê um livro novamente, o impulso fica menor e menor, como uma bateria descarregando. Eventualmente, lê-lo novamente adiciona quase zero valor.
    • A Fórmula: Eles criaram uma fórmula matemática que calcula a "Informação" total que a IA absorveu, combinando a qualidade dos livros e quantas vezes eles foram repetidos.

O Resultado Mágico: Uma Linha Reta

A parte mais impressionante do artigo é o que aconteceu quando eles plotaram seus resultados usando essa nova métrica de "Informação" em vez de apenas "Tempo Gasto".

  • Antes: Quando plotaram os resultados baseados no tempo, os pontos de dados estavam espalhados por toda parte. Uma receita com alta repetição parecia totalmente diferente de uma receita com baixa repetição.
  • Depois: Quando plotaram os resultados baseados em Informação, todos os pontos espalhados colapsaram em uma única linha reta perfeita.

Isso significa que não importa qual "receita" você use (alta qualidade com repetição, ou qualidade mista), se você souber a "Informação" total que a IA absorveu, você pode prever perfeitamente o quão bem ela se sairá.

O Que Podemos Fazer Com Isso?

Como eles têm essa linha reta perfeita (o InfoLaw), agora podem fazer duas coisas muito úteis sem precisar gastar milhões de dólares treinando modelos gigantes primeiro:

  1. Prever o Futuro: Eles podem treinar um modelo pequeno e barato (como um modelo de 250 milhões de parâmetros) com uma receita específica. Usando o InfoLaw, podem prever com precisão exatamente como um modelo massivo de 7 bilhões de parâmetros se sairia com essa mesma receita.
  2. Encontrar a Receita Perfeita: Eles podem usar a fórmula para calcular a "mistura ótima". Eles descobriram que:
    • Modelos pequenos (ou orçamentos pequenos) devem focar pesadamente nos dados de mais alta qualidade, mesmo que isso signifique repeti-los um pouco.
    • Modelos grandes (ou orçamentos grandes) se beneficiam mais da variedade. Eles devem misturar mais dados de qualidade inferior para evitar o "tédio" da repetição.

Analogia de Resumo

Pense em treinar uma IA como cozinhar um ensopado.

  • Método Antigo: Você apenas mede quanto tempo a panela ferve. Você assume que 10 horas são sempre melhores que 1 hora. Mas se você continuar adicionando as mesmas 3 batatas repetidamente, o ensopado fica estranho e salgado (a repetição prejudica).
  • InfoLaw: Este método mede o sabor real extraído dos ingredientes. Ele sabe que a primeira hora de cozimento extrai 90% do sabor da batata, mas a 10ª hora extrai quase nada.
  • O Benefício: Agora, em vez de adivinhar quanto sal e quantas batatas adicionar para uma panela gigante de ensopado, você pode usar a "Fórmula de Sabor" para calcular a receita perfeita instantaneamente, economizando ingredientes e tempo.

A Conclusão: O artigo prova que, para treinar IAs melhores, não devemos olhar apenas para a quantidade de dados que usamos, mas para quanta nova informação esses dados fornecem, especialmente quando somos forçados a repetir dados de alta qualidade. Isso nos permite prever o desempenho com precisão e escolher a melhor mistura de dados para qualquer tamanho de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →