← Últimos artigos
💬 NLP

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

Este artigo introduz o Hidden Decoding, um novo método de escalonamento que aprimora Grandes Modelos de Linguagem ao expandir a computação de tokens ao longo da dimensão do comprimento da sequência por meio de fatoração de fluxo, permitendo ganhos significativos de desempenho em escalas de fronteira sem modificar a espinha dorsal fixa do Transformer ou incorrer em custos de treinamento proibitivos.

Autores originais: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Sh
Publicado 2026-07-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um cérebro de robô superinteligente (um Grande Modelo de Linguagem) que já é bastante incrível. Normalmente, para torná-lo ainda mais inteligente, os cientistas tentam aumentar o tamanho do cérebro — adicionando mais camadas, mais neurônios, mais de tudo. Mas isso é como tentar construir um arranha-céu em cima de um arranha-céu: custa uma fortuna, leva uma eternidade e, às vezes, a equipe de construção (os computadores de treinamento) simplesmente não consegue lidar com o tamanho.

A equipe de IA do WeChat fez uma pergunta diferente: E se mantivermos o céreamente exatamente do mesmo tamanho, mas dermos a ele mais tempo para pensar sobre cada palavra?

O Problema do "Looping"

Alguns pesquisadores tentaram resolver isso fazendo o robô "repetir" seu pensamento. Imagine um estudante lendo uma frase, depois lendo a mesma frase novamente, e novamente, usando as mesmas células cerebrais repetidas vezes para obter uma resposta melhor. Isso é chamado de um modelo "em loop" ou "recorrente".

Mas aqui está o problema: quando você tenta treinar os maiores robôs (aqueles com centenas de bilhões de parâmetros), essa ideia de looping quebra a linha de montagem. Os computadores que treinam esses modelos trabalham em um pipeline, onde cada parte do cérebro faz seu trabalho uma vez e passa o bastão. Se você fizer o robô parar e reler a mesma frase, a linha inteira trava, e os computadores caros ficam ociosos. É como uma esteira de fábrica que fica parando para deixar um trabalhador refazer o mesmo parafuso; a fábrica para completamente.

A Solução: "Decodificação Oculta" (A Linha de Montagem Secreta)

A equipe do WeChat criou um truque inteligente chamado Decodificação Oculta (Hidden Decoding). Em vez de fazer o robô ler a mesma palavra repetidamente em um loop, eles fazem o robô ler a palavra múltiplas vezes ao mesmo tempo, mas em faixas paralelas e secretas.

Pense nisso como uma equipe de corrida de carros. Em vez de um carro dar três voltas na pista para conseguir o melhor tempo de volta, eles enviam quatro carros idênticos (fluxos/streams) pela pista simultaneamente.

  1. A Configuração: Quando o robô vê uma palavra (como "maçã"), ele não apenas a transforma em um código. Ele a transforma em quatro códigos diferentes, cada um indo para sua própria faixa secreta.
  2. O Trabalho Secreto: Essas quatro faixas passam pelas camadas do cérebro. As três primeiras faixas são "ocultas". Elas fazem todo o trabalho pesado, o pensamento e o raciocínio, mas não podem falar a resposta ainda. Elas são como a equipe de brainstorm em uma sala nos fundos.
  3. A Palavra Final: Apenas a quarta faixa (o fluxo final) tem permissão para gritar a próxima palavra. O cérebro só é avaliado por esta resposta final.
  4. A Memória: Crucialmente, o cérebro lembra o que as três primeiras faixas pensaram. Ele guarda suas notas (chamadas de "caches de Chave-Valor") para que a próxima palavra possa ler as notas de brainstorm da palavra anterior.

Desta forma, o robô recebe quatro vezes o poder de pensamento para cada palavra, mas não precisa construir um cérebro maior nem interromper a linha de montagem. Ele apenas processa uma sequência de dados mais longa de uma só vez.

Tornando-o Acessível: O Truque da "Estrutura de Fluxo"

Você pode pensar: "Espere, se eu tiver quatro faixas conversando entre si, a matemática não ficará loucamente complicada?". Se cada faixa tentasse falar com todas as outras em cada etapa, o custo explodiria (ele subiria 16 vezes!).

Para corrigir isso, a equipe usou um método chamado Atenção Estruturada por Fluxo (Stream-Factorized Attention).

  • Na maior parte do tempo: As faixas permanecem em suas próprias bolhas. A Faixa 1 fala com a Faixa 1, a Faixa 2 com a Faixa 2. Elas não incomodam umas às outras.
  • Às vezes: Apenas algumas camadas específicas permitem que as faixas troquem notas e misturem suas ideias.

Isso mantém o custo baixo. Em vez de o custo saltar 16 vezes, ele sobe apenas cerca de 4,4 a 5,1 vezes (o que é próximo do aumento de 4x nas faixas). Isso torna possível treinar esses modelos supergrandes sem quebrar o banco.

Funcionou?

A equipe testou isso em dois modelos massivos: um com 80 bilhões de parâmetros e um gigante com 617 bilhões. Eles não mudaram o tamanho do cérebro; eles apenas ativaram o "modo de 4 faixas".

  • Os Resultados: Os modelos ficaram mais inteligentes. Em testes difíceis de matemática e ciência, o modelo de 617 bilhões melhorou sua pontuação no teste "GPQA Diamond" de 89,1 para 91,2. No teste de física "PHYBench", foi de 75,3 para 76,3.
  • A Tendência: Eles também testaram com 2 faixas, 4 faixas e 8 faixas. À medida que adicionavam mais faixas, as pontuações continuavam subindo. Isso sugere que adicionar mais "faixas de pensamento" é uma forma real de tornar os modelos mais inteligentes sem reconstruí-los.

O Que Eles Descartaram

A equipe foi cuidadosa para verificar se isso era apenas uma coincidência. Eles tentaram outras formas de usar as faixas extras:

  • Forçar cada faixa a adivinhar: Se eles fizessem as três primeiras faixas tentarem prever a resposta também (em vez de apenas a última), o modelo na verdade ficava pior.
  • Misturar as respostas: Se eles apenas fizessem a média dos pensamentos de todas as quatro faixas, isso também não funcionava tão bem quanto deixar a última faixa decidir.
  • Compartilhar as notas: Se eles fizessem as faixas compartilharem as mesmas notas de memória em vez de manterem as suas próprias, o modelo ficava ligeiramente menos preciso.

Isso prova que o ingrediente secreto é deixar as primeiras faixas realizarem um pensamento silencioso e privado e manter suas notas separadas, para que a última faixa possa usar essa sabedoria profunda e acumulada para fazer a melhor suposição.

A Conclusão

A Decodificação Oculta mostra que você nem sempre precisa de um cérebro maior para ser mais inteligente. Às vezes, você só precisa dar ao cérebro mais tempo para pensar em paralelo. Ao transformar uma única palavra em uma linha de montagem secreta de pensamentos, a equipe do WeChat encontrou uma maneira de aumentar a inteligência de modelos de escala de fronteira sem o custo massivo de construir um novo, maior. É uma maneira prática e de engenharia para extrair mais inteligência dos modelos que já possuímos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →