← Últimos artículos
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhi es un LLM financiero de alta concurrencia construido sobre el ecosistema Huawei Ascend que utiliza un marco de transición de GQA a MLA adaptativo por capas y un entrenamiento especializado para reducir significativamente la sobrecarga de memoria del KV-cache, logrando así mejoras sustanciales tanto en la precisión de los benchmarks financieros como en la concurrencia máxima de inferencia en comparación con los modelos base.

Autores originales: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Z
Publicado 2026-06-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un brillante experto financiero, llamémoslo "YouZhi". Él lo sabe todo sobre dinero, acciones y banca. Sin embargo, hay un problema: cuando intentas usarlo para ayudar a miles de personas al mismo tiempo (como durante una racha de mucha actividad en la banca móvil), se siente abrumado.

¿Por qué? Porque para recordar lo que está diciendo, necesita un "bloc de notas" masivo (llamado KV Cache) en su memoria. Cuanto más grande es la multitud, más grande es el bloc de notas, y eventualmente, su cerebro se queda sin espacio. Esto lo hace lento y costoso de ejecutar.

El artículo presenta YouZhi-LLM, una nueva versión de este experto diseñada para manejar multitudes enormes sin perder su memoria o su inteligencia. Así es como lo hicieron, explicado de forma sencilla:

1. El truco del "Plegado Inteligente" (Layer-Adaptive GQA-to-MLA)

Piensa en el cerebro del experto como un edificio de varios pisos con más de 30 plantas (capas).

  • La forma antigua: Los métodos anteriores intentaban encoger el bloc de notas plegando cada piso exactamente de la misma manera. Era como intentar doblar un pesado abrigo de invierno y una fina bufanda de seda usando exactamente la misma técnica. ¿El resultado? La bufanda de seda (las capas iniciales delicadas del cerebro) se arrugó y se dañó, haciendo que el experto fuera olvidadizo.
  • El estilo YouZhi: El equipo se dio cuenta de que los diferentes pisos necesitan tratamientos diferentes.
    • Pisos superiores (Capas profundas): Son robustos. Pueden plegarse de forma apretada (comprimirse) sin perder mucha información.
    • Pisos inferiores (Capas superficiales): Son delicados. Necesitan ser plegados muy suavemente o no ser plegados en absoluto para mantener los detalles nítidos.
  • La innovación: YouZhi utiliza un sistema de "plegado inteligente" que observa cada piso individualmente y decide la forma perfecta de comprimirlo. Esto reduce el bloc de notas en un 72% (haciéndolo diminuto) pero mantiene la memoria del experto casi perfecta.

2. El entrenamiento de "Rehabilitación" (Post-Training Pipeline)

Cuando cambias la forma en que se pliega el cerebro, el experto se confunde un poco y pierde parte de su conocimiento general. Para solucionar esto, el equipo lo sometió a un campamento de entrenamiento de dos pasos:

  • Paso 1: Recuperación del conocimiento general: Utilizaron al experto original, sin plegar, como "maestro" para volver a enseñarle a la versión plegada cómo hablar y pensar normalmente otra vez. Esto es como un estudiante estudiando con un tutor para ponerse al día con las lecciones perdidas.
  • Paso 2: Especialización financiera: Una vez que el experto volvió a la normalidad, le dieron una enorme biblioteca de libros financieros, noticias y escenarios bancarios reales. También le enseñaron a decir "no lo sé" cuando una pregunta es imposible (para evitar inventar hechos falsos) y a seguir reglas estrictas de formato (como escribir respuestas en JSON o Markdown).

3. Los resultados: Más rápido, más inteligente y más barato

El equipo probó este nuevo sistema en los chips especializados de Huawei (NPUs Ascend). Esto fue lo que sucedió:

  • El "Superpoder": Debido a que el bloc de notas es mucho más pequeño, el sistema puede manejar 2.69 veces más personas al mismo tiempo en comparación con la versión anterior.
  • Sin pérdida de inteligencia: A pesar de la fuerte compresión, el modelo en realidad mejoró en tareas financieras. Por ejemplo, la versión de 7 mil millones de parámetros mejoró sus puntuaciones en pruebas financieras en un 12.3% mientras manejaba casi el triple de tráfico.
  • Prueba del mundo real: En una aplicación de banca móvil simulada, el modelo comprendió correctamente las intenciones del usuario (como "quiero un préstamo") y completó los detalles (como "por $5,000") con una precisión superior al 97%, tan bien como los modelos mucho más pesados y no optimizados.

La conclusión

YouZhi-LLM es como tomar un camión pesado y lento y convertirlo en un auto deportivo elegante y de alta velocidad que puede transportar la misma cantidad de carga. Al descubrir exactamente dónde comprimir la memoria y luego reentrenar al modelo para que sea un experto financiero, crearon un sistema que es increíblemente inteligente y capaz de servir a miles de usuarios simultáneamente sin despeinarse.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →