YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition
YouZhi est un LLM financier à haute concurrence construit sur l'écosystème Huawei Ascend qui utilise un cadre de transition adaptatif par couche de GQA vers MLA et un entraînement spécialisé pour réduire considérablement la surcharge de mémoire du cache KV, atteignant ainsi des améliorations substantielles tant de la précision des benchmarks financiers que de la concurrence d'inférence maximale par rapport aux modèles de base.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un brillant expert financier, appelons-le « YouZhi ». Il sait tout sur l'argent, les actions et la banque. Cependant, il y a un problème : lorsque vous essayez de l'utiliser pour aider des milliers de personnes exactement au même moment (comme lors d'un pic d'affluence sur une application bancaire mobile), il est submergé.
Pourquoi ? Parce que pour se souvenir de ce qu'il dit, il a besoin d'un immense « bloc-notes » (appelé KV Cache) dans sa mémoire. Plus la foule est grande, plus le bloc-notes est grand, et finit par manquer d'espace à son cerveau. Cela le rend lent et coûteux à exploiter.
Le document présente YouZhi-LLM, une nouvelle version de cet expert conçue pour gérer de grandes foules sans perdre sa mémoire ni son intelligence. Voici comment ils ont fait, expliqué simplement :
1. L'astuce du « Pliage Intelligent » (GQA-vers-MLA adaptatif par couche)
Imaginez le cerveau de l'expert comme un immeuble de plusieurs étages avec plus de 30 étages (couches).
- L'ancienne méthode : Les méthodes précédentes essayaient de réduire le bloc-notes en pliant chaque étage exactement de la même manière. C'était comme essayer de plier un gros manteau d'hiver et une fine écharpe de soie en utilisant la même technique. Le résultat ? L'écharpe de soie (les couches précoces et délicates du cerveau) se froissait et s'abîmait, rendant l'expert distrait.
- La méthode YouZhi : L'équipe a réalisé que différents étages nécessitent des traitements différents.
- Étages supérieurs (Couches profondes) : Ils sont robustes. Ils peuvent être pliés de manière serrée (compressés) sans perdre beaucoup d'informations.
- Étages inférieurs (Couches peu profondes) : Ils sont délicats. Ils doivent être pliés très doucement ou pas du tout pour garder les détails nets.
- L'innovation : YouZhi utilise un système de « pliage intelligent » qui examine chaque étage individuellement et décide de la meilleure façon de le compresser. Cela réduit le bloc-notes de 72 % (le rendant minuscule) tout en gardant la mémoire de l'expert presque parfaite.
2. L'entraînement de « Rééducation » (Pipeline Post-Entraînement)
Lorsque vous changez la façon dont le cerveau est plié, l'expert devient un peu confus et perd une partie de ses connaissances générales. Pour corriger cela, l'équipe l'a soumis à un camp d'entraînement en deux étapes :
- Étape 1 : Récupération des connaissances générales : Ils ont utilisé l'expert original, non plié, comme « professeur » pour réapprendre à la nouvelle version pliée comment parler et penser normalement. C'est comme un étudiant qui étudie avec un tuteur pour rattraper les leçons manquées.
- Étape 2 : Spécialisation financière : Une fois que l'expert était revenu à la normale, ils lui ont donné une immense bibliothèque de livres financiers, d'actualités et de scénarios bancaires réels. Ils lui ont également appris à dire « Je ne sais pas » lorsqu'une question est impossible (pour éviter d'inventer de faux faits) et à suivre des règles de formatage strictes (comme écrire des réponses en JSON ou en Markdown).
3. Les Résultats : Plus Rapide, Plus Intelligent et Moins Cher
L'équipe a testé ce nouveau système sur les puces informatiques spécialisées de Huawei (NPUs Ascend). Voici ce qui s'est passé :
- Le « Superpouvoir » : Parce que le bloc-notes est beaucoup plus petit, le système peut gérer 2,69 fois plus de personnes en même temps par rapport à l'ancienne version.
- Aucune perte d'intelligence : Malgré la forte compression, le modèle est en fait devenu meilleur dans les tâches financières. Par exemple, la version de 7 milliards de paramètres a amélioré ses scores aux tests financiers de 12,3 % tout en gérant presque trois fois plus de trafic.
- Test en conditions réelles : Dans une simulation d'application bancaire mobile, le modèle a correctement compris les intentions des utilisateurs (comme « Je veux un prêt ») et a rempli les détails (comme « pour 5 000 $ ») avec une précision de plus de 97 %, aussi bien que les modèles beaucoup plus lourds et non optimisés.
L'essentiel
YouZhi-LLM, c'est comme prendre un camion lourd et lent pour le transformer en une voiture de sport élégante et rapide capable de transporter la même quantité de cargaison. En comprenant exactement où compresser la mémoire et en réentraînant le modèle pour en faire un expert financier, ils ont créé un système qui est à la fois incroyablement intelligent et capable de servir des milliers d'utilisateurs simultanément sans sourciller.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.