← Últimos artigos
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

O YouZhi é um LLM financeiro de alta concorrência construído sobre o ecossistema Huawei Ascend que utiliza uma estrutura de transição camada-adaptativa de GQA para MLA e treinamento especializado para reduzir significativamente o overhead de memória do KV-cache, alcançando assim melhorias substanciais tanto na precisão de benchmarks financeiros quanto na concorrência máxima de inferência em comparação com modelos base.

Autores originais: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Z
Publicado 2026-06-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um brilhante especialista financeiro, vamos chamá-lo de "YouZhi". Ele sabe tudo sobre dinheiro, ações e bancos. No entanto, há um problema: quando você tenta usá-lo para ajudar milhares de pessoas ao mesmo tempo (como durante um pico de acessos no mobile banking), ele fica sobrecarregado.

Por quê? Porque para lembrar o que está dizendo, ele precisa de um "bloco de notas" massivo (chamado KV Cache) em sua memória. Quanto maior a multidão, maior o bloco de notas, e eventualmente, o céreamente dele fica sem espaço. Isso o torna lento e caro de operar.

O artigo apresenta o YouZZhi-LLM, uma nova versão deste especialista projetada para lidar com multidões enormes sem perder sua memória ou sua inteligência. Veja como eles fizeram isso, explicado de forma simples:

1. O Truque da "Dobradura Inteligente" (Layer-Adaptive GQA-to-MLA)

Pense no cérebro do especialista como um edifício de vários andares com mais de 30 pavimentos (camadas).

  • O Jeito Antigo: Métodos anteriores tentavam encolher o bloco de notas dobrando cada andar exatamente da mesma maneira. Era como tentar dobrar um casaco de inverno pesado e um lenço de seda fino usando exatamente a mesma técnica. O resultado? O lenço de seda (as camadas iniciais delicadas do cérebro) ficou amassado e danificado, tornando o especialista esquecido.
  • O Jeito YouZhi: A equipe percebeu que diferentes andares precisam de tratamentos diferentes.
    • Andares Superiores (Camadas Profundas): Estes são robustos. Eles podem ser dobrados apertados (comprimidos) sem perder muita informação.
    • Andares Inferiores (Camadas Rasas): Estes são delicados. Eles precisam ser dobrados de forma muito suave ou nem sequer serem dobrados para manter os detalhes nítidos.
  • A Inovação: O YouZhi usa um sistema de "dobradura inteligente" que analisa cada andar individualmente e decide a forma perfeita de comprimi-lo. Isso encolhe o bloco de notas em 72% (tornando-o minúsculo), mas mantém a memória do especialista quase perfeita.

2. O Treinamento de "Reabilitação" (Post-Training Pipeline)

Quando você muda a forma como o cérebro é dobrado, o especialista fica um pouco confuso e perde parte de seu conhecimento geral. Para corrigir isso, a equipe o colocou em um acampamento de treinamento de duas etapas:

  • Etapa 1: Recuperação de Conhecimento Geral: Eles usaram o especialista original, não dobrado, como um "professor" para reensinar a versão dobrada a falar e pensar normalmente de novo. Isso é como um aluno estudando com um tutor para recuperar as lições perdidas.
  • Etapa 2: Especialização Financeira: Assim que o especialista voltou ao normal, deram a ele uma biblioteca massiva de livros financeiros, notícias e cenários bancários reais. Eles também o ensinaram a dizer "eu não sei" quando uma pergunta é impossível (para evitar inventar fatos falsos) e a seguir regras estritas de formatação (como escrever respostas em JSON ou Markdown).

3. Os Resultados: Mais Rápido, Mais Inteligente e Mais Barato

A equipe testou este novo sistema em chips de computador especializados da Huawei (NPUs Ascend). Veja o que aconteceu:

  • O "Superpoder": Como o bloco de notas é muito menor, o sistema pode lidar com 2,69 vezes mais pessoas ao mesmo tempo em comparação com a versão antiga.
  • Sem Perda de Inteligência: Apesar da compressão pesada, o modelo na verdade melhorou em tarefas financeiras. Por exemplo, a versão de 7 bilhões de parâmetros melhorou suas pontuações em testes financeiros em 12,3%, enquanto lidava com quase o triplo de tráfego.
  • Teste do Mundo Real: Em um aplicativo de mobile banking simulado, o modelo entendeu corretamente as intenções do usuário (como "quero um empréstimo") e preencheu detalhes (como "de $5.000") com mais de 97% de precisão, tão bem quanto os modelos muito mais pesados e não otimizados.

O Resumo Final

O YouZhi-LLM é como pegar um caminhão pesado e lento e transformá-lo em um carro esportivo elegante e veloz que pode carregar a mesma quantidade de carga. Ao descobrir exatamente onde comprimir a memória e depois retreinar o modelo para ser um especialista financeiro, eles criaram um sistema que é incrivelmente inteligente e capaz de atender milhares de usuários simultaneamente sem perder o fôlego.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →