← 최신 논문
🔬 optics

PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection

PRISM 은 긴 컨텍스트 LLM 추론 시 발생하는 KV 캐시 스캔의 O(n) 메모리 병목 현상을 해결하기 위해, 광학적 브로드캐스트 및 가중치 매핑을 활용하여 O(1) 복잡도로 유사도 검색을 수행함으로써 4K~64K 토큰 구간에서 GPU 대비 4 자릿수 수준의 에너지 효율 향상과 16 배의 트래픽 감소를 달성하는 새로운 아키텍처를 제안합니다.

원저자: Hyoseok Park, Yeonsang Park

게시일 2026-03-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hyoseok Park, Yeonsang Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: "도서관에서 책 한 권 찾기"의 고통

인공지능이 긴 문맥 (예: 10 만 단어 이상의 소설) 을 이해하고 다음 단어를 예측하려면, 이전에 읽은 모든 내용을 기억해야 합니다. 이를 **KV 캐시 (Key-Value Cache)**라고 하는데, 마치 거대한 도서관에 쌓아둔 책들입니다.

  • 현재의 방식 (전자기반):
    AI 가 다음 단어를 만들 때마다, 도서관 사서 (GPU) 는 모든 책장 (메모리) 을 일일이 훑어보며 "어떤 책이 지금 질문과 가장 관련이 있을까?"라고 찾아냅니다.
    • 문제점: 책장이 100 권이면 100 번, 100 만 권이면 100 만 번 훑어야 합니다. 이 과정은 계산 속도보다 **메모리에서 책을 꺼내는 속도 (대역폭)**에 의해 제한받습니다. 마치 "책 한 권을 찾기 위해 도서관 전체를 뛰어다니느라, 정작 책을 읽을 시간이 없다"는 상황입니다.

2. 해결책: PRISM (빛으로 한 번에 훑어보기)

저자들은 이 문제를 해결하기 위해 **빛 (광학)**을 이용했습니다. PRISM 은 **"빛을 쏘아서 한 번에 모든 책의 표지를 비교하는 장치"**입니다.

🌟 핵심 비유: "우편배달부 vs 레이저 빔"

  • 기존 방식 (우편배달부):
    배달부 (전자 신호) 가 한 명씩 책장 (N 개) 을 돌아다니며 "이 책이 필요해?"라고 물어봅니다. N 개의 책장이 있으면 N 번 돌아다녀야 합니다. (시간: O(N))
  • PRISM 방식 (레이저 빔):
    질문을 담은 레이저 빔을 쏘면, 그 빔이 **1 분할기 (Splitter)**를 통해 N 개의 책장 모두에 동시에 퍼집니다.
    • 각 책장에는 미리 설정된 **빛의 필터 (미세공진기)**가 달려 있습니다.
    • 질문과 관련된 책장만 필터를 통과해 빛이 강해지고, 관련 없는 책은 빛이 약해집니다.
    • 결과: 책장 100 만 개가 있더라도, 빛이 퍼지는 순간 한 번에 (O(1)) 모든 비교가 끝납니다.

3. PRISM 의 작동 원리 (간단한 5 단계)

  1. 질문 준비: AI 가 "다음 단어를 찾아줘"라고 질문을 준비합니다.
  2. 빛으로 변환: 이 질문을 빛의 파장 (색깔) 으로 바꿉니다.
  3. 동시 방송: 이 빛을 거울로 나누어 모든 책장 (KV 블록) 에 동시에 쏩니다.
  4. 자동 필터링: 각 책장에 있는 **미세한 고리 (MRR)**가 질문과 얼마나 비슷한지 빛의 세기로 계산합니다. (이때 전기적인 계산 없이 빛 자체의 물리 법칙으로 계산됩니다.)
  5. 최고점 선택: 가장 빛이 강하게 반사된 책장 (가장 관련 있는 정보) 만 골라내어, 실제 AI 가 읽을 수 있도록 가져옵니다.

4. 왜 이것이 혁명적인가요?

  • 속도: 전자기기가 100 만 개의 책을 훑는 데 5 마이크로초가 걸린다면, PRISM 은 빛의 속도로 9 나노초 만에 끝냅니다. (약 500 배 빠름)
  • 에너지: 전자기기는 책을 훑을 때마다 많은 전기를 쓰지만, PRISM 은 빛을 쏘는 것만으로는 거의 전기를 쓰지 않습니다. (약 1,000 배 이상 에너지 효율이 좋음)
  • 정확도: 실험 결과, 긴 문맥 (4 만~6 만 단어) 에서도 AI 의 답변 정확도는 떨어지지 않았습니다. 오히려 불필요한 정보를 걸러내어 더 깔끔하게 작동했습니다.

5. 요약: "메모리 벽"을 뚫는 빛의 창

지금까지 AI 개발자들은 "계산 속도"를 높이는 데만 집중했습니다. 하지만 긴 글을 다룰 때는 "메모리에서 정보를 가져오는 속도"가 병목이 되었습니다.

PRISM은 이 문제를 해결하기 위해 "계산을 하지 않고, 빛의 물리 법칙을 이용해 한 번에 비교하는" 방식을 제안합니다.

마치:

  • 기존: 수천 개의 문을 하나씩 두드려서 누가 있는지 확인하는 것.
  • PRISM: 모든 문에 동시에 스톡카메라를 쏘아, 가장 큰 소리가 난 문 (가장 중요한 정보) 만 골라내는 것.

이 기술이 상용화되면, AI 는 수백만 단어의 책이나 긴 대화 기록을 실시간으로 처리하면서도 배터리나 전력 소모는 크게 줄일 수 있게 될 것입니다. 이는 AI 가 더 길고 복잡한 작업을 수행할 수 있는 새로운 시대를 열 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →