← 최신 논문
🤖 AI

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex는 파이썬 임베디드 프론트엔드와 효율적인 백엔드를 결합하여 희소 주의(sparse attention) 알고리즘의 신속한 프로토타이핑과 배포를 가능하게 하는 시스템으로, AI 에이전트가 풀 어텐션(full attention)보다 최대 3.46배 높은 처리량을 달하는 설계를 자동으로 발견하고 이러한 이점을 신흥 대규모 아키텍처로 확장할 수 있도록 합니다.

원저자: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 도서관(대규모 언어 모델, 즉 LLM)을 운영하고 있는 사서라고 상상해 보세요. 이 사서는 한 번에 한 단어씩 아주 긴 이야기를 써 내려가야 합니다.

사서가 새로운 단어를 쓸 때마다, 그들은 지금까지 쓴 모든 내용을 다시 훑어보며 새로운 단어가 적절한지 확인해야 합니다. 전통적인 도서관에서 사서는 모든 문장을 확인하기 위해 모든 책과 모든 선반을 일일이 돌아다녀야 합니다. 이야기가 길어질수록(수천 단어 이상), 이 "걷고 확인하는" 과정은 믿을 수 없을 정도로 느려지고 진을 빼놓습니다. 이것이 바로 **풀 어텐션(Full Attention)**의 문제입니다.

**스파스 어텐션(Sparse Attention)**은 사서에게 똑똑한 지름길을 제공하는 것과 같습니다: "마지막 5페이지와 처음의 가장 중요한 3개 챕터만 봐." 이렇게 하면 시간을 엄청나게 절약할 수 있습니다. 하지만 현재 이러한 지름길을 만드는 것은 엔지니어들에게 악몽과 같습니다. 마치 새로운 지름길 아이디어가 생길 때마다 매번 맞춤형 고속 열차 선로를 새로 깔아야 하는 것과 같습니다. 새로운 아이디어를 테스트하고 싶을 때마다 전체 선로를 처음부터 다시 구축해야 하며, 여기에는 몇 주가 걸립니다.

여기에 Vortex가 있습니다.

Vortex는 이러한 지름길들을 위한 "범용 열차 선로 건설자" 역할을 하는 새로운 시스템입니다. 다음은 쉬운 비유를 통한 작동 방식입니다.

1. 문제점: "페이지 단위"의 도서관

현대의 도서관은 책을 하나의 길고 연속적인 줄로 저장하지 않습니다. 공간을 절약하기 위해 책들을 흩어져 있는, 연속되지 않은 상자들(Paged Attention)에 나누어 저장합니다.

  • 기존 방식: 만약 컴퓨터에게 "특정하게 흩어진 상자들을 봐"라고 명령하려면, 각 상자를 찾아내고, 집어 들고, 순서대로 배치하기 위해 복잡하고 낮은 수준의 코드를 작성해야 했습니다. 이는 마치 로봇에게 해변에서 모래알 하나하나를 파내어 찾는 법을 가르치는 것과 같았습니다.
  • Vortex 방식: Vortex는 vTensor라는 새로운 사고방식을 도입합니다. 이는 사서에게 "마법의 지도"를 쥐여줍니다. 당신은 물리적으로 상자들이 어디에 있는지 알 필요가 없습니다. 그저 "가장 관련성이 높은 상자 5개를 가져와"라고 말하기만 하면, 마법의 지도가 흩어진 저장소에서 세부 사항을 처리하며 알아서 찾아냅니다.

2. 언어: vFlow (레시피 북)

Vortex에는 vFlow라는 프로그래밍 언어가 포함되어 있습니다.

  • 비유: 당신이 요리사라고 상상해 보세요. 컴퓨터에게 당근을 어떻게 썰어야 하는지 일일이 코드로 명령하는 대신, 그냥 레시피를 쓰는 것입니다: "당근을 가져와서, 썰고, 양파와 섞으세요."
  • 도움이 되는 점: 연구자들(심지어 AI 에이전트까지도)은 단 몇 줄의 코드로 새로운 유형의 지름길(스파스 어텐션 알고리즘)을 위한 "레시피"를 작성할 수 있습니다. 그들은 복잡한 하드웨어 세부 사항에 대한 전문가가 될 필요가 없습니다. 그저 무엇을 하고 싶은지만 설명하면, Vortex가 그것을 효율적으로 수행하는 방법을 결정합니다.

3. AI 에이전트: "자율적인 발명가"

이 부분이 가장 흥고한 부분입니다. 논문은 Vortex가 매우 사용하기 쉬워서 AI 에이전트(인간처럼 행동하도록 설계된 컴퓨터 프로그램)가 스스로 새로운 지름길을 발명할 수 있다는 것을 보여줍니다.

  • 실험: 연구진은 AI 에이전트에게 "사서의 속도를 높일 수 있는 20가지 새로운 방법을 발명하라"고 요청했습니다.
  • 결과: AI 에이전트들은 단순히 기존 아이디어를 복제하는 데 그치지 않고, 완전히 새롭고 다양한 레시피를 만들어냈습니다. 이 AI가 생성한 지름길 중 하나는 이야기의 정확도를 전혀 손실하지 않으면서도 표준 방식보다 사서를 3.46배 더 빠르게 만들었습니다.
  • 루프(Loop): AI는 18시간 동안 레시피를 시도하고, 실패하고, 다시 수정하는 과정을 반복했습니다. 결국 인간이 놓쳤을 수도 있는 속도와 정확성 사이의 완벽한 균형점을 찾아냈습니다.

4. 결과: 미래를 앞당기다

Vortex는 작은 모델만을 위한 것이 아닙니다. 세계에서 가장 크고 복잡한 도서관에서도 작동합니다.

  • 거대 모델: 팀은 2,290억 개의 파라미터를 가진 거대 모델(MiniMax-M2.7)을 NVIDIA B200 슈퍼컴퓨터 칩에서 테스트했습니다. 그곳에서도 Vortex의 지름길은 시스템을 1.37배 더 빠르게 만들었습니다.
  • 새로운 아키텍처: 또한 이들은 MLA(DeepSeek이나 GLM 같은 모델에서 사용됨)라는 새로운 유형의 도서관 설계에도 이를 적용했습니다. vFlow를 사용하여 커스텀 지름길을 설계했고, 4.7배의 속도 향상을 얻었습니다.

요약

Vortex번역가이자 건설팀이 하나로 합쳐진 존재라고 생각하십시오.

  1. 복잡하고 지저분한 하드웨어 규칙을 읽기 쉽고 단순한 레시피로 번역합니다.
  2. 인간과 AI 에이전트가 긴 텍스트를 읽기 위한 새로운 "지름길"을 빠르게 발명하고, 테스트하고, 배포할 수 있게 해줍니다.
  3. 수개월이 걸리던 엔지니어링 프로젝트를 단 몇 시간의 문제로 바꾸어 놓았으며, 이를 통해 지능을 희생하지 않고도 AI 모델을 더 빠르고 효율적으로 실행하는 방법을 찾을 수 있게 합니다.

논문은 실험을 용이하게 만듦으로써 Vortex가 이미 AI 에이전트가 현재 상용화된 그 어떤 것보다 훨씬 빠른 알고리즘을 발견하도록 도왔다고 주장하며, 새로운 하드웨어를 기다리지 않고도 AI를 더 빠르고 효율적으로 만들 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →