← Últimos artigos
🤖 AI

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

Este artigo propõe a "Lei de Densificação do Comportamento do Usuário", um padrão de escalonamento quantitativo que vincula o tamanho dos dados à capacidade mínima de tokenização suficiente, e introduz o ALGN, um método de tokenização adaptativa que supera os gargalos de dados em escala de bilhões e supera as linhas de base existentes no aprendizado de representação de usuário.

Autores originais: Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

Publicado 2026-08-25
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo digital, cada clique, compra e pesquisa deixa um rastro. Para as empresas que constroem as plataformas que usamos diariamente, esses rastros não são apenas registros; são a matéria-prima para entender quem somos. Ao analisar a história longa e sinuosa das ações de uma pessoa, os sistemas de inteligência artificial tentam construir um resumo único e poderoso das preferências e hábitos desse indivíduo. Esse resumo, frequentemente chamado de representação do usuário, atua como uma impressão digital digital que ajuda a decidir quais notícias mostrar, quais produtos recomendar ou quais anúncios exibir. Durante anos, a crença predominante entre os engenheiros era simples: para tornar essas impressões digitais mais precisas, bastava simplesmente precisar de mais dados. A lógica parecia sólida — alimentem o sistema com mais usuários, histórias mais longas de suas vidas e cérebros computacionais maiores para processar tudo isso, e os resultados naturalmente melhorariam.

No entanto, um novo estudo desafia essa suposição de que "mais é melhor". Pesquisadores do Ant Group e da Universidade de Zhejiang investigaram se essa estratégia de expansão infinita realmente funciona ao lidar com a escala massiva de dados do mundo real, como os bilhões de transações processadas pelo Alipay. Eles descobriram que existe um ponto em que adicionar mais informações brutas deixa de ajudar e começa a prejudicar. Assim como um quarto pode ficar tão entulhado de móveis que se torna impossível se movimentar, um sistema pode ficar tão inundado de dados repetitivos e de baixo valor que perde sua capacidade de enxergar o que realmente importa. A equipe descobriu que o gargalo não é o tamanho do modelo computacional, mas a qualidade e a densidade da informação que é alimentada nele. Eles propõem uma nova abordagem que foca em comprimir esse histórico massivo em um resumo compacto e de alto valor, permitindo que o sistema aprenda mais com menos.

Os pesquisadores começaram testando os limites da abordagem tradicional em um conjunto de dados contendo centenas de milhões de usuários. Eles aumentaram sistematicamente o número de usuários, a janela de tempo observada e o tamanho do próprio modelo computacional. Eles descobriram que o desempenho melhorou rapidamente no início, mas depois atingiu um muro rígido. Quando adicionavam mais usuários além de um certo ponto, ou observavam históricos mais longos do que cerca de sessenta dias, o sistema parava de aprender algo novo. Os dados extras eram majoritariamente apenas os mesmos velhos hábitos repetidos repetidamente, como uma pessoa comprando o mesmo café todas as manhãs durante uma década. Mesmo quando tornavam o modelo computacional significativamente maior, ele não conseguia se tornar mais inteligente; ele simplesmente memorizava esses detalhes repetitivos sem ganhar qualquer insight real sobre as verdadeiras preferências do usuário. Esse fenômeno, que os autores chamam de "parede de escala comportamental bruta", mostrou que simplesmente jogar mais dados no problema não era mais uma estratégia viável.

Para romper esse muro, a equipe introduziu um método de "densificação" dos dados. Em vez de alimentar o sistema com todo o histórico bagunçado de eventos brutos, eles primeiro traduziram esses eventos em um conjunto compacto de tokens digitais, de forma semelhante a como um livro pode ser resumido em algumas frases fundamentais sem perder o enredo. Eles usaram uma técnica que agrupa comportamentos semelhantes e elimina a redundância, mantendo apenas os sinais mais informativos. Quando treinaram seus modelos nessas versões comprimidas e tokenizadas dos históricos dos usuários, os resultados foram impressionantes. O sistema continuou a melhorar mesmo à medida que os dados cresciam, enquanto o sistema treinado com dados brutos já havia estagnado. Os dados comprimidos permitiram que o modelo visse a floresta em vez de se perder nas árvores, mantendo sua capacidade de aprender e se adaptar mesmo quando o volume de entrada era massivo.

O estudo foi além ao definir uma regra precisa de quanta compressão é necessária conforme os dados crescem. Eles descobriram que a quantidade de "espaço" necessário para armazenar o resumo de um usuário não precisa crescer em proporção direta ao volume de dados brutos. Em vez disso, segue um padrão previsível onde a capacidade necessária cresce lentamente conforme o volume de dados aumenta. Isso significa que, para um sistema que lida com um bilhão de usuários, você não precisa de um bilhão de vezes mais memória ou poder computacional; você só precisa de uma quantidade calculada e muito menor de tokens de alta qualidade. Essa descoberta, que eles denominam "Lei da Densificação Comportamental", fornece um guia matemático para que engenheiros saibam exatamente quanta compressão aplicar para qualquer quantidade de dados, garantindo que não desperdicem recursos em informações desnecessárias.

Finalmente, os pesquisadores desenvolveram uma nova ferramenta chamada Rede de Comprimento Adaptativo de Portão (Adaptive Length Gated Network) para colocar essa lei em prática. Métodos anteriores tratavam o histórico de cada usuário da mesma forma, atribuindo a mesma quantidade de espaço comprimido para todos, independentemente de quão complexa fosse sua vida de fato. A nova ferramenta é mais inteligente; ela observa cada usuário individualmente e decide quanto detalhe manter. Para um usuário com uma vida muito rotineira e previsível, ela atribui um resumo muito curto. Para um usuário com um conjunto de interesses e hábitos complexos e diversos, ela atribui um resumo mais longo e detalhado. Essa abordagem dinâmica garante que nenhum poder computacional seja desperdiçado em dados chatos e repetitivos, enquanto usuários complexos ainda recebem a atenção necessária. Em seus testes, este método adaptativo não apenas superou todos os sistemas anteriores em precisão, mas também utilizou significativamente menos capacidade computacional, provando que eficiência e desempenho podem andar de mãos dadas.

As implicações deste trabalho estendem-se muito além de um único aplicativo ou site. Elas sugerem uma mudança fundamental na forma como construímos sistemas inteligentes para o futuro. Em vez da corrida interminável para coletar mais dados e construir modelos maiores, o caminho à frente reside em aprender a extrair mais valor dos dados que já possuímos. Ao focar na densidade da informação, em vez do volume bruto, podemos construir sistemas que são não apenas mais precisos, mas também mais eficientes e sustentáveis. O estudo demonstra que, na era dos grandes dados, a ferramenta mais poderosa não é um balde maior, mas um filtro melhor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →