← Últimos artigos
💬 NLP

HRM-Text: Efficient Pretraining Beyond Scaling

O artigo apresenta o HRM-Text, um modelo de 1 bilhão de parâmetros que alcança desempenho competitivo com modelos significativamente maiores ao combinar uma arquitetura recorrente hierárquica, técnicas de treinamento especializadas e pré-treinamento apenas com instruções para reduzir drasticamente os requisitos de computação e dados para a pesquisa de modelos de linguagem fundamentais.

Autores originais: Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o estado atual da Inteligência Artificial como uma fábrica massiva e de alta velocidade. Para construir uma máquina "inteligente", essas fábricas despejam trilhões de páginas de texto bruto (como toda a internet) em um liquidificador, usando bilhões de dólares em eletricidade para processar tudo. O resultado é um modelo inteligente, mas o processo é tão caro e consumidor de energia que apenas algumas empresas gigantes podem pagar para operar a fábrica.

O artigo que você compartilhou, HRM-Text, propõe uma maneira completamente diferente de construir essas máquinas. Em vez de uma fábrica massiva e de força bruta, eles construíram uma oficina pequena e altamente eficiente que aprende como um cérebro humano.

Aqui está a explicação de como eles fizeram isso, usando analogias simples:

1. A Analogia do Cérebro: O "Pensador Lento" e o "Executor Rápido"

A maioria dos modelos de IA hoje é como uma única pessoa tentando fazer tudo ao mesmo tempo: ler, pensar e escrever, tudo em uma única corrida gigante e caótica.

Os autores observaram como os cérebros humanos funcionam. Eles notaram que nossos cérebros têm um loop frontoparietal: um sistema que separa o pensamento estratégico lento (planejando o quadro geral) do pensamento de execução rápida (fazendo o trabalho real).

  • O Jeito Antigo: Uma IA padrão é como um velocista tentando correr uma maratona sem parar. Ela fica cansada e confusa.
  • O Jeito HRM-Text: Eles construíram um modelo com duas camadas:
    • O Módulo "H" (O General): Esta é a camada lenta e estratégica. Ela leva um momento para entender o quadro geral e definir a direção.
    • O Módulo "L" (O Especialista): Esta é a camada rápida e de execução. Ela lida rapidamente com os detalhes e refina a resposta com base no plano do General.
    • O Resultado: Ao separar o "planejamento" da "execução", o modelo não se perde nos detalhes. Ele aprende mais rápido e com mais eficiência.

2. O Método de Treinamento: Pare de Ler a Pergunta, Comece a Responder

Os modelos de IA atuais são treinados lendo um livro e tentando prever a próxima palavra para cada palavra única no livro, incluindo as próprias perguntas. É como um estudante estudando para uma prova tentando memorizar as perguntas do professor palavra por palavra, em vez de aprender a resolver os problemas.

O HRM-Text muda as regras:

  • O Objetivo "Conclusão de Tarefa": Em vez de tentar prever a frase inteira, o modelo só é penalizado se errar a resposta. Ele ignora a parte da pergunta durante o treinamento.
  • O Truque "PrefixLM": Imagine um estudante lendo uma pergunta. Com a IA padrão, o estudante só pode olhar para as palavras que já escreveu. Com o HRM-Text, o estudante tem permissão para ler a pergunta inteira primeiro (olhando para trás e para frente) antes de escrever a resposta. Isso ajuda a entender o contexto muito melhor sem precisar memorizar o texto da pergunta em si.

3. Os Estabilizadores "Mágicos"

Treinar um modelo que "pensa" em loops (recorrência) é notoriamente difícil; é como tentar equilibrar uma pilha de pratos enquanto o chão treme. O artigo introduz dois "estabilizadores" para impedir que a pilha caia:

  • MagicNorm: Pense nisso como um amortecedor. Ele garante que, à medida que o modelo "pensa" através de muitos passos, os números dentro do computador não fiquem nem muito grandes nem muito pequenos, o que geralmente faz o aprendizado falhar.
  • Atribuição de Crédito Profunda com Aquecimento: Imagine ensinar uma criança a andar. Você não pede que ela corra uma maratona no primeiro dia. Você começa com passos curtos e, à medida que ela fica mais forte, permite que ela dê passos mais longos. O HRM-Text começa olhando apenas alguns passos para trás para aprender com os erros e, gradualmente, olha mais para trás à medida que fica mais inteligente. Isso impede que o modelo fique confuso com sua própria história muito cedo.

O Resultado: Uma Vitória "Davi contra Golias"

O artigo afirma que, com esses truques, eles construíram um modelo de 1 bilhão de parâmetros (uma IA relativamente pequena) que foi treinada com apenas 40 bilhões de tokens (uma quantidade ínfima de dados em comparação com os trilhões usados por gigantes como Google ou Meta).

  • O Custo: Eles gastaram cerca de $1.500 e usaram 16 placas gráficas por menos de dois dias.
  • A Comparação: Apesar de ser minúscula e barata, este modelo performou tão bem quanto (e às vezes melhor do que) modelos massivos que custam centenas de milhares de dólares e levaram meses para serem treinados.
  • A Eficiência: Para obter os mesmos resultados, os modelos padrão precisaram de 100 a 900 vezes mais dados e 96 a 432 vezes mais poder de computação.

O Quadro Geral

Os autores não estão dizendo que esta é a IA perfeita final. Eles estão dizendo: "Prove que é possível."

Eles mostraram que você não precisa de um orçamento de um bilhão de dólares para construir uma IA inteligente. Ao projetar a arquitetura para pensar como um cérebro (planejamento lento + execução rápida) e treiná-la para focar apenas em resolver problemas (ignorando o texto da pergunta), você pode democratizar a pesquisa em IA. Isso significa que pequenos laboratórios, universidades e até indivíduos agora podem treinar seus próprios modelos fundamentais do zero, quebrando o monopólio que apenas as empresas mais ricas atualmente detêm.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →