← 최신 논문
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhi는 레이어 적응형 GQA-to-MLA 전환 프레임워크와 특화된 학습을 활용하여 KV-캐시 메모리 오버헤드를 획기적으로 줄임으로써, 기본 모델 대비 금융 벤치마크 정확도와 최대 추론 동시성 모두에서 상당한 개선을 달성한 Huawei Ascend 생태계 기반의 고동시성 금융 LLM입니다.

원저자: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Z
게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 "유지(YouZhi)"라고 불리는 천재적인 금융 전문가가 있다고 상상해 보세요. 그는 돈, 주식, 그리고 은행 업무에 관한 모든 것을 알고 있습니다. 하지만 문제가 하나 있습니다. 수천 명의 사람들을 동시에 상대하려고 하면(예를 들어, 모바일 뱅킹이 매우 붐비는 시간대처럼), 그는 과부하가 걸립니다.

왜 그럴까요? 그가 하는 말을 기억하기 위해서는 그의 기억 속에 거대한 "연습장"(KV 캐시라고 불림)이 필요하기 때문입니다. 군중이 커질수록 연습장도 커지며, 결국 그의 두뇌는 공간이 부족해집니다. 이로 인해 그는 느려지고 운영 비용도 많이 들게 됩니다.

이 논문은 이 전문가가 기억력을 잃거나 지능이 떨어지지 않으면서도 거대한 인파를 처리할 수 있도록 설계된 새로운 버전인 YouZhi-LLM을 소개합니다. 그 방법은 다음과 같이 쉽게 설명할 수 있습니다.

1. "스마트 폴딩(Smart Folding)" 기술 (계층 적응형 GQA-to-MLA)

전문가의 두뇌를 30층 이상의 층으로 이루어진 다층 건물이라고 생각해 보세요.

  • 기존 방식: 이전의 방법들은 모든 층을 똑같은 방식으로 접어서 연습장을 줄이려고 시했습니다. 이는 마치 무거운 겨울 코트와 얇은 실크 스카프를 똑같은 기술로 접으려는 것과 같았습니다. 결과는 어땠을까요? 실크 스카프(두뇌의 섬세한 초기 층들)는 구겨지고 손상되어, 전문가는 기억력이 떨어지게 되었습니다.
  • YouZhi의 방식: 팀은 각 층마다 서로 다른 처리가 필요하다는 것을 깨달았습니다.
    • 상층부 (깊은 층): 이 층들은 튼튼합니다. 정보를 많이 잃지 않고도 아주 촘촘하게 접을(압축할) 수 있습니다.
    • 하층부 (얕은 층): 이 층들은 섬세합니다. 디테일을 날카롭게 유지하려면 아주 부드럽게 접거나 아예 접지 말아야 합니다.
  • 혁신: YouZhi는 각 층을 개별적으로 살펴보고 각 층에 가장 완벽한 압축 방식을 결정하는 "스마트 폴딩" 시스템을 사용합니다. 이를 통해 연습장을 **72%**나 줄여 아주 작게 만들면서도, 전문가의 기억력은 거의 완벽하게 유지했습니다.

2. "재활" 훈련 (사후 학습 파이프라인)

두뇌를 접는 방식을 바꾸면 전문가는 약간 혼란을 느끼고 일반적인 지식을 잃을 수 있습니다. 이를 해결하기 위해 팀은 그를 2단계 훈련 캠프에 투입했습니다.

  • 1단계: 일반 지식 회복: 그들은 원래의 접히지 않은 전문가를 "선생님"으로 사용하여, 새로 접힌 버전이 다시 정상적으로 말하고 생각하는 법을 배우도록 재교육했습니다. 이는 마치 학생이 놓친 수업을 따라잡기 위해 튜터와 함께 공부하는 것과 같습니다.
  • 2단계: 금융 전문화: 전문가가 정상 궤도에 올라오자, 팀은 그에게 방대한 양의 금융 서적, 뉴스, 그리고 실제 뱅킹 시나리오를 제공했습니다. 또한, 불가능한 질문에 대해서는 "모른다"라고 말하는 법(가짜 사실을 지어내는 것을 방지하기 위해)과 엄격한 형식 규칙(예: 답변을 JSON이나 Markdown 형식으로 작성하는 법)을 따르는 법을 가르쳤습니다.

3. 결과: 더 빠르고, 더 똑똑하며, 더 저렴하게

팀은 화웨이(Huawei)의 특화된 컴퓨터 칩(Ascend NPU)에서 이 새로운 시스템을 테스트했습니다. 결과는 다음과 같습니다.

  • "초능력": 연습장이 훨씬 작아졌기 때문에, 이 시스템은 기존 버전보다 2.69배 더 많은 사람을 동시에 처리할 수 있습니다.
  • 지능 손실 없음: 강력한 압축에도 불구하고, 모델은 오히려 금융 작업에서 더 나은 성능을 보였습니다. 예를 들어, 70억 개의 파라미터를 가진 버전은 트래픽을 거의 3배 가까이 처리하면서도 금융 테스트 점수가 12.3% 향상되었습니다.
  • 실제 환경 테스트: 시뮬레이션된 모바일 뱅킹 앱에서, 이 모델은 사용자 의도(예: "대출을 받고 싶어요")를 이해하고 세부 사항(예: "5,000달러 규모로")을 채우는 데 있어 최적화되지 않은 훨씬 무거운 모델들과 대등하게 97% 이상의 정확도를 보여주었습니다.

핵심 요약

YouZhi-LLM은 무겁고 느리게 움직이는 트럭을, 동일한 양의 화물을 운반할 수 있으면서도 매끈하고 빠른 스포츠카로 바꾸는 것과 같습니다. 메모리를 정확히 어디서 압축할지 파악하고 모델을 금융 전문가로 재학습시킴으로써, 그들은 매우 똑똑하면서도 수천 명의 사용자를 동시에 서비스할 때도 전혀 힘들어하지 않는 시스템을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →