← 최신 논문
🤖 AI

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

이 논문은 일반화된 도트 프로덕트 어텐션(Generalized Dot-Product Attention) 및 계층적 시드 풀링(Hierarchical Seed Pooling)과 같은 저수준 최적화와 연산 스킵(Computation Skip)과 같은 고수준 혁신을 통해 낮은 스케일링 효율성 문제를 해결함으로써 예측 가능한 스케일링 법칙을 확립하고, 스케일링 효율을 두 배로 높여 Meta 광고에서 상당한 생산적 임팩트를 달성한 대규모 추천 시스템을 위한 통합 아키텍처인 Kunlun을 소개한다.

원저자: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Y
게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Yuzhen Huang, Chao Chen, Yue Dong, Yi Yang, Shuo Chang, Xiaorui Gan, Wenlin Chen, Santanu Kolay, Darren Liu, Jade Nie, Chunzhi Yang, Ellie Wen, Jiyan Yang, Huayu Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한, 초고속 디지털 마켓플레이스(Meta가 광고에 사용하는 것과 같은)를 운영하고 있다고 상상해 보십시오. 매초 수백만 명의 사람들이 스크롤을 내리고 있으며, 시스템은 각 사용자가 어떤 광고를 클릭할지 추측해야 합니다. 이 추측을 하기 위해 시스템은 두 가지 유형의 단서(Clues)를 사용하는 '두뇌'(머신러닝 모델)를 사용합니다:

  1. 스토리 (시퀀스/Sequence): 사용자가 최근에 무엇을 했는가 (예: "신발을 클릭하고, 모자를 클릭한 다음, 배낭을 클릭했다").
  2. 스냅샷 (컨텍스트/Context): 사용자가 지금 어떤 상태인가 (예: "비가 오고 있다", "그들은 뉴욕에 있다", "그들은 25세이다").

오랫동안, 이 '스토리'와 '스냅샷'을 모두 효율적으로 처리할 수 있는 '두뇌'를 구축하는 것은 마치 네모난 바퀴를 달고 레이스카를 운전하는 것과 같았습니다. 작동은 했지만, 매우 느렸고 엄청난 양의 연료(컴퓨팅 파워)를 낭비했습니다. 연구자들은 이 문제를 **"낮은 스케일링 효율성(poor scaling efficiency)"**이라고 부릅니다. 기본적으로, 시스템을 더 똑똑하게 만들기 위해 더 크게 만들려고 할 때, 추가되는 비용만큼 빠르게 똑똑해지지 않았다는 뜻입니다.

여기, Kunlun이 등장합니다. 다양한 봉우리들을 하나로 통합하는 산맥의 이름을 딴 Kunlun은 이러한 네모난 바퀴 문제를 해결하기 위해 설계된 새로운 아키텍처입니다. 논문은 Kunlun이 두 가지 수준, 즉 "부품(low-level)"과 "교통 관리(high-level)" 차원에서 시스템을 최적화함으로써 이 문제를 해결한다고 주장합니다.

Kunло한이 어떻게 작동하는지 일상적인 비유를 통해 설명하겠습니다:

1. 저수준(Low-Level) 수정 사항: 엔진 고치기

기존 시스템은 비효로적인 부품들을 가지고 있어, 데이터가 도착하기를 기다리는 동안 컴퓨터의 '엔진'(GPU)이 유휴 상태로 머물게 만들었습니다. Kunlun은 이를 고성능 부품으로 교체합니다:

  • GDPA (개인화된 번역가):
    • 문제점: 기존 시스템은 '스냅토리'를 '스냅샷'을 기반으로 번서할 때, 시간을 낭비하는 서투르고 단계적인 과정을 거쳤습니다.
    • 해결책: Kunlun은 GDPA(Generalized Dot-Product Attention)를 사용합니다. 이것은 단순히 단어 대 단어로 번역하는 것이 아니라, 문장 전체의 맥락을 즉각적으로 이해하는 번역가와 같습니다. 단계들을 하나로 융합하여 컴퓨터가 멈추거나 시작할 필요 없이 엔진이 훨씬 더 매끄럽게 돌아가도록 만듭니다.
  • HSP (요약가):
    • 문제점: 사용자들은 긴 기록(수천 번의 클릭)을 가지고 있습니다. 기존 시스템은 모든 클릭을 개별적으로 읽으려 했고, 이는 너무 과도했습니다.
    • 해결책: HSP(Hierarchical Seed Pooling)는 스마트한 편집자와 같습니다. 500페이지짜리 전기를 일일이 읽는 대신, 책을 읽고 10페이지짜리 요약본을 만든 뒤, 다시 1페이지짜리 초록을 만드는 방식입니다. 이는 긴 이력을 시스템이 과부하 없이 실제로 사용할 수 있는 압축적이고 강력한 요약본으로 응축합니다.
  • 슬라이딩 윈도우 어텐션 (지역적 집중):
    • 문제점: 기존 시스템은 사용자가 과거에 했던 아주 첫 번째 행동과 지금 하고 있는 행동을 비교하려고 시도했습니다. 하지만 보통은 작년에 무엇을 했는지보다 지난주에 무엇을 했는지가 훨씬 더 중요합니다.
    • 해결책: **슬라이딩 윈도우 어텐션(Sliding Window Attention)**은 시스템에 "전체 역사를 다 보지 말고, 최근 몇 페이지에만 집중하라"고 지시합니다. 이는 최근의 상호작용에 집중함으로써 예측의 정확도는 유지하면서도 막대한 컴퓨로 파워를 절약합니다.

2. 고수준(High-Level) 수정 사항: 스마트한 교통 제어

훌륭한 엔진을 가졌더라도, 잘못된 길로 가거나 모든 빨간불에 멈춰 선다면 연료를 낭비하게 됩니다. Kunlun은 자원이 배분되는 방식을 바꿉니다:

  • CompSkip (급행 차선):
    • 문제점: 기존 시스템은 필요하지 않은 경우에도 모든 단계에서 똑같이 무거운 작업을 수행하도록 강제했습니다.
    • 해결책: CompSkip은 스마트한 신호등 시스템과 같습니다. 이 시스템은 어떤 단계는 완전한 '자기 점검'(Self-Attention)이 필요하지 않고, 어떤 단계는 완전한 '요약'(HSP)이 필요하지 않다는 것을 알아차립니다. 교차하는 레이어(layer)에서 불필요한 단계들을 건너뜁니다. 자동차가 직진 중이라면 매 초마다 백미러를 확인할 필요가 없는 것과 같습니다. 이를 통해 엄청난 양의 에너지를 절약합니다.
  • 이벤트 레벨 개인화 (VIP 대우):
    • 문제점: 기존 시스템은 '클릭'(강한 신호)을 '노출'(단순히 광고를 봄)과 동일하게 취급했습니다. 즉, 가치가 낮은 이벤트에도 자원을 낭비했습니다.
    • 해결책: Kunlun은 중요한 이벤트에 VIP 대우를 해줍니다. 사용자가 무언가를 구매하려는 상황(고가치 이벤트)이라면, 시스템은 더 많은 컴퓨팅 파워와 더 깊은 분석을 할당합니다. 반면 단순한 브라우징 중이라면, 더 가볍고 빠른 방식을 사용합니다. 이는 마치 식당에서 VIP 고객에게는 풀 코스 요리를 제공하고, 그냥 지나가는 사람에게는 빠른 커피 한 잔을 제공하는 것과 같습니다.

결과: "스케일링 법칙 (The Scaling Law)"

논문은 이러한 수정 사항들을 결합함으로써, Kunlun이 업계가 어려움을 겪었던 목표인 **예측 가능한 스케일링 법칙(Predictable Scaling Laws)**을 달로 달성했다고 주장합니다.

과거에는 컴퓨팅 파워를 두 배로 늘린다고 해서 반드시 지능이 두 배가 되지는 않았습니다. 하지만 Kunlun에서는 그 관계가 예측 가능하고 효율적입니다.

  • 효율성 증대: 최신 슈퍼컴퓨터(NVIDIA B200 GPU)에서, Kunlun은 이전 방식보다 하드웨어를 두 배 더 효율적으로 사용합니다 (사용률이 17%에서 37%로 상승).
  • 실제 세계의 영향: 이것은 단순한 실험실 실험이 아닙니다. Meta는 주요 광고 모델에 Kunlun을 이미 배치했습니다. 그 결과는? 주요 비즈니스 지표에서 1.2%의 개선을 이뤄냈습니다. 매일 수십억 개의 결정이 내려지는 광고의 세계에서, 이 작은 퍼센티지는 엄청난 승리입니다.

요약하자면: Kunlun은 추천 시스템을 구축하는 더 똑똑하고, 더 가볍고, 더 조직적인 방법입니다. 네모난 바퀴 때문에 연료를 낭비하는 것을 멈추고, 불필요한 정차를 건너뛰며, 가장 중요한 단서에 VIP 대우를 제공함으로써, 시스템이 커질수록 훨씬 더 똑똑해질 수 있도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →