← 최신 논문
💬 NLP

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

CoSA는 커널 인지 프록시(Kernel-Aware Proxy)와 순서 기반 스킵 커널(Ordered-Skipping Kernel)을 결합하여 블록 선택 및 스킵을 동적으로 최적화함으로써, 긴 문맥을 가진 LLM의 정확도를 높게 유지하면서도 엄격한 계산 예산 하에서 상당한 추론 속도 향상과 지연 시간 감소를 달성하는 훈련이 필요 없는 2단계 희소 어텐션 프레임워크이다.

원저자: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단 하나의 질문에 답하기 위해 128,000페이지에 달하는 거대한 백과사전을 읽어야 한다고 상상해 보십시오. 인공지능의 세계에서 이 "백과사전"들은 거대 언어 모델(LLM)이라 불리며, 이 "읽는" 과정은 모델이 문맥을 이해하는 방식입니다. 문제는 이러한 모델들이 읽는 표준적인 방식이 마치 첫 단어부터 마지막 단어까지 책의 모든 페이지를 다 읽어야만 비로소 질문에 대해 생각하기 시작하는 사서와 같다는 점입니다. 책이 길어질수록, 이 "모두 읽기" 방식은 마치 벽돌이 가득 담긴 배낭을 메고 마라톤을 하는 것처럼 고통스러울 정도로 느려지고 비용이 많이 듭니다.

이를 해결하기 위해 과학자들은 사서에게 조금 더 선택적으로 읽는 법을 가르치려 노력해 왔는데, 이를 "희소 주의(sparse attention)"라고 합니다. 모든 페이지를 읽는 대신, 모델은 어떤 페이지가 중요한지 추측하고 나머지는 건너뛰려고 시도합니다. 보통 이는 두 단계로 이루어집니다. 먼저, 빠른 "대리인(proxy, 빠른 추측가)"이 책을 훑어보고 중요한 페이지들을 단순한 "예/아니오" 목록으로 표시합니다. 그다음, "커널(kernel, 실제 작업자)"이 그 목록을 따라가며 본격적인 작업을 수행합니다. 이는 괜찮은 시스템이지만 결함이 있습니다. 책이 거대해지고 시간을 아끼기 위해 어떤 페이지를 건너뛸지 매우 엄격하게 결정해야 할 때, 빠른 추측가는 실수를 하기 시작하며, 작업자는 그 잘못된 목록을 맹목적으로 따르게 됩니다. 그 결과, 모델은 속도는 빨라지지만 중요한 세부 사항을 잊어버리게 됩니다. 마치 사서가 어떤 부분이 지루하다고 생각해서 이야기의 절정 부분을 건너뛰어 버리는 것과 같습니다.

여기서 CoSA(Co-Designed Sparse Attention)라는 새로운 방법이 등장합니다. CoSA의 연구진은 기존의 "추측가"와 "작업자"가 서로 고립되어 작동하고 있었으며, 이로 인해 압박이 가해질 때 시스템이 무너진다는 사실을 깨달았습니다. 그들은 전체 과정을 재설계하여 두 존재가 하나의 팀으로서 함께 일하도록 만들기로 했습니다. 단순히 작업자에게 "예/아 아니오" 목록을 건네주는 대신, 새로운 "추측가"(커널 인식 대리인, KAP라고 불림)는 우선순위 목록을 전달합니다. 단순히 "이 페이지를 읽으시오"라고 말하는 것이 아니라, "이 페이지를 먼저 읽고, 그다음 이 페이지, 그다음 이 페이지 순으로 읽으시오"라고 말하는 것입니다.

여기에는 마법 같은 기술이 숨어 있습니다. 작업자(Ordered-Skipping Kernel, OSK라고 불림)는 이 우선순위 목록을 사용하여 페이지를 읽는 순서를 재배치합니다. 가장 중요한 페이지들을 먼저 읽음으로써, 작업자는 프로세스 초기에 무엇이 중요한지에 대한 "누적 점수"를 쌓아 올립니다. 가장 중요한 내용을 초기에 파악했기 때문에, 작업자는 혼란 없이 훨씬 더 많은 페이지를 자신 있게 건너뛸 수 있습니다. 이는 마치 당신이 추리 소설을 읽고 있는데, 탐정이 와서 "범인을 찾기 위해 처음 세 장을 먼저 읽으세요. 그다음엔 나머지 50장의 원예 팁 부분은 안심하고 건너뛰어도 됩니다"라고 말해주는 것과 같습니다.

논문은 이 팀워크 접근 방식이 판도를 바꾸는 게임 체인저임을 보여줍니다. 약 긴 소설 한 권 분량인 128,000 토큰의 문맥을 읽는 모델을 대상으로 테스트했을 때, CoSA는 "주의(attention)" 과정의 속도를 4.93배 높였고, 첫 단어를 생성하는 데 걸리는 시간을 2.53배 단축했습니다. 결정적으로, 모델이 이야기의 맥을 이해하거나 복잡한 추론 문제를 해결하는 능력을 잃지 않으면서도 이 성과를 달-성했습니다. 연구진은 대리인과 커널이 서로 대화하고 특정 작업 순서를 공유하게 함으로써, 모델의 지능을 유지하면서도 훨씬 더 공격적으로 작업을 건너뛸 수 있다는 것을 발견했습니다. 결국, AI의 세계에서는 어떤 페이지를 읽을지 아는 것만큼이나 언제 읽을지를 아는 것이 중요하다는 사실이 드러났습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →