← 최신 논문
🤖 machine learning

RIS-Kernel: A Model-Agnostic Architecture for Long-Context LLM Inference via Sparse Attention

RIS-Kernel은 추론 복잡도를 O(N^2)에서 O(N log N)으로 줄이는 모델 불가지론적 희소 어텐션 아키텍처를 도입하여, 확률적 샘플링을 통해 밀집형 베이스라인과 대등하거나 이를 상회하는 정확도를 달ert하면서도 일반적인 CPU 하드웨어에서 긴 문맥의 LLM 분석을 가능하게 합니다.

원저자: Anderson R. Santos

게시일 2026-07-27
📖 1 분 읽기☕ 가벼운 읽기

원저자: Anderson R. Santos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: RIS-Kernel

문제 정의

장문맥(long-context) 거대 언어 모델(LLM) 추론의 주요 병목 현상은 전체 셀프 어텐션(full self-attention)의 이차적 계산 및 메모리 복잡도(O(N2)O(N^2))입니다. 이러한 스케일링 문제는 실질적인 문서 분석 범위를 약 65,536 토큰으로 제한하며, 고가의 GPU 클러스터를 필요로 하여 전문 하드웨어가 없는 대부분의 연구 그룹이 심층적인 텍스트 분석에 접근하는 것을 어렵게 만듭니다. 또한, 네이티브 학습 한계를 넘어 문맥 창을 확장하면 위치 인코딩(positional encoding)의 퇴화가 발생하여, 계산 자원이 확보되더라도 검색 능력이 붕괴되는 현상이 나타납니다.

방법론: RIS-Kernel 아키텍처

본 논문은 수정되지 않은 언어 모델에 런타임 희소성(runtime sparsity)을 직접 주입하는 모델 불가지론적(model-agnostic) 추론 엔진인 RIS-Kernel(Reduced Interaction Sampling)을 소개합니다. 이 아키텍처는 모델 가중치를 변경하거나, 파인튜닝을 하거나, GPU 가속을 요구하지 않고도 셀프 어텐션 복잡도를 O(NlogN)O(N \log N)으로 줄입니다.

핵심 구성 요소

  1. 희소 확률적 기하학(Sparse Stochastic Geometry): RIS는 밀집된 어텐션 행렬을 확률적 샘플링을 통해 생성된 희소 마스크로 대체합니다. 이는 두 가지 별개의 모드로 작동합니다.
    • 확률적 모드(Stochastic Mode): 시퀀스를 균등한 풀(pool)로 취급하여, 피벗(pivot)당 전역 이웃(global neighbors)을 추출합니다. 커버리지는 밀도와 앙상블 시드(seed) 수에 따라 단조롭게 증가합니다.
    • 구조적 모드(Structural Mode): 시퀀스를 블록 단위로 분할하고, 각 블록을 하나의 클릭(clique)으로서 완전히 연결한 뒤 전역적인 중복 에지(redundant edges)를 추가합니다. 이 "블록-클릭" 기하학은 극단적인 희소성 상태에서도 국소적 커뮤니티 구조와 근접 앵커(proximal anchors)의 보존을 보장합니다.
  2. 하이브리드 앵커 및 사전 융합 통합 소프트맥스(PFUS): 확률적으로 복구된 토큰들에 대한 경쟁적 가중치의 희석을 방지하기 위해, RIS는 단일 사전 융합 소프트맥스를 사용합니다. 이는 한 번 계산된 모든 시드 인덱스의 합집합인 "확률적 앵커(Stochastic Anchor)"를 이후의 토큰들을 위한 "동적 로컬 윈도우(Dynamic Local Window)"와 병합합니다. 선택된 모든 토큰은 함께 정규화되어, 확률적으로 검색된 희귀 엔티티가 빈번한 토큰과 동일한 경쟁적 가중치를 갖도록 보장합니다.
  3. 동적 RoPE 스케일링: 시스템은 로드 시점에 설정 파라미터를 가로채서 회전 위치 임베딩(RoPE) 스케일링(Linear 또는 YaYaRN)을 동적으로 적용합니다. 이를 통해 모델 그래프를 수정하지 않고도 네이티브 학습 범위를 훨씬 초과하는 문맥 창을 처리할 수 있습니다.
  4. 메모리 제한 구현: 마스크 생성 중 O(N²) 불리언 행렬로 인한 메모리 부족(OOM) 오류를 방지하기 위해, RIS는 스트리밍 설계를 사용합니다. 시드 인덱스를 생성하고, 이를 마스터 마스크로 병합한 뒤, 개별 시드 데이터를 즉시 폐기함으로써 앙상블 크기에 관계없이 피크 메모리 사용량을 제한합니다.

주요 기여

  • 모델 불가지론적 추론: 이 아키텍처는 런타임 주입 방식으로 작동하며, 재학습 없이 Qwen2 및 TinyLlama와 같은 기존 모델과 호환됩니다.
  • 하드웨어 접근성: 본 시스템은 가속 기능이 없는 일반적인 CPU 하드웨어(16 GB ~ 128 GB RAM 범위)에서 검증되었으며, 이를 통해 GPU 클러스터 없이도 장문 문맥 추론이 가능하다는 것을 입증했습니다.
  • 정규화 효과: 본 논문은 희소 어텐션이 정규화 역할을 수행함을 확인했습니다. 낮은 밀도(예: 1%)와 높은 앙상블 수를 사용할 때, 시퀀스 수준의 노이즈를 제거함으로써 모델이 네이티브 밀집 어텐션 베이스라인보다 더 우수한 성능을 보이게 합니다.
  • 위치 인코딩 민감도: 본 연구는 검색 실패가 선형 보간(linear interpolation)에 의한 위치 인코딩 붕괴 때문인지, 아니면 희소 투영 자체 때문인지에 대한 경계를 명확히 구분하였으며, 외삽(extrapolation)을 위해 YaRN과 같은 방법론의 필요성을 강조합니다.

실험 결과

실험은 과학 논문 코퍼스를 사용하여 Qwen2-1.5B-InstructTinyLlama-1.1B를 대상으로 수행되었습니다.

1. 제어된 정밀도 (32k 토큰)

  • 베이스라인: 네이티브 밀집 어텐션은 **71.88%**의 정확도를 달성했습니다. 제로 컨텍스트(zero-context) 하한선은 **59.38%**였습니다.
  • RIS-Stochastic: 1% 밀도와 70~80개의 시드를 사용했을 때, 정확도는 **75.00%**에 도달하여 밀집 베이스라인을 상회했습니다. 5% 밀도와 10개의 시드를 사용했을 때는 베이스라인과 정확히 일치했습니다(71.88%).
  • RIS-Structural: 1% 밀도와 10개의 시드를 사용했을 때, **75%**의 컨텍스트 격차를 회복했습니다(68.75% 정확도). 이는 동일한 수준에 도달하기 위해 50개의 시드가 필요했던 Stochastic 모드보다 뛰어난 성능입니다.

2. 확장성 및 외삽 (64k 토큰)

  • 네이티브 한계: 밀집 어텐션은 표준 테스트베드에서 OOM 오류를 발생시켰습니다.
  • 선형 보간(Linear Interpolation): 심각한 위치 붕괴를 야기하여, 밀도와 관계없이 정확도가 무작위 추측 수준인 ~15–23%로 떨어졌습니다.
  • YaRN 스케일링: 위치 기하학을 보존했습니다.
    • RIS-Structural (1% 밀도, 60개 시드): **65.62%**의 정확도를 달성하여, 제로 컨텍스트 하한선(51.56%) 대비 14.06 퍼센트 포인트를 회복했습니다. 이 결과는 McNemar의 쌍체 검정(paired test)에서 유의미한 수준이었습니다 (p=0.078p = 0.078).
    • RIS-Stochastic (5% 밀도, 40개 시드): 선형 보간 하에서도 제로 컨텍스트 베이스라인을 상회하는 **59.4%**를 기록했으나, YaRN을 사용했을 때보다는 효과가 덜했습니다.
  • TinyLlama의 한계: TinyLlama(네이티브 2k 제한)에서 4배~16배 외삽 계수 시 정보 검색에 실패했습니다. 이는 RIS가 호스트 모델의 위치 인코딩 시스템이 최소한 부분적으로라도 기능하고 있어야 함을 확인시켜 줍니다.

3. 효율성 프런티어

1% 미만의 밀도(0.3%–0.5%)에서 Structural 모드의 "스윗 스팟(sweet-spot)" 분석 결과, 모델이 1% 베이스라인 대비 절반 미만의 구조적 어텐션 비용만으로도 컨텍스트 검색 신호의 90% 이상을 유지할 수 있음을 발견했습니다.

의의 및 주장

본 논문은 RIS-Kernel이 확률적 희소화를 통해 O(N2)O(N^2) 어텐션 병목을 성공적으로 우회하면서도 사실적 검색 능력을 보존한다고 주장합니다. 주요 의의는 다음과 같습니다:

  1. 범용 하드웨어에서의 실현 가능성: GPU 가속 없이도 표준 학술용 하드웨어(데스크톱 CPU)에서 심층 문서 검색이 가능하다는 것을 증명했습니다.
  2. 희소성을 통한 정규화: 저밀도 희소 어텐션이 노이즈를 필터링하여 밀집 베이스라인보다 정확도를 높이는 정규화 역할을 할 수 있음을 보여주었습니다.
  3. 아키텍처 독립성: 검색 커널이 위치 인코딩과 구별됨을 확립했습니다. 즉, RIS가 신호를 보존하더라도, 그 신호의 무결성은 긴 문맥에서 위치적 일관성을 유지하는 호스트 모델의 능력(예: YaGN 활용)에 달려 있습니다.
  4. 상보적 모드: Structural Mode는 엄격한 예산과 근접 앵커 회복에 최적이며, Stochastic Mode는 더 넓은 전역적 커버리지와 정규화에 우수하다는 유틸리티 경계를 정의했습니다.

저자들은 이 접근 방식이 더 큰 파라미터 수로의 확장을 막는 아키텍처적 제약을 부과하지 않는다고 결론지었으나, 이는 향후 테스트가 필요합니다. 재현을 위한 코드, 데이터셋 및 추론 스크립트가 공개되어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →