SmartRAG: Native Graph-Based RAG for Mobile Device
SmartRAG는 지능을 지속적으로 학습 가능한 개체 인식기와 3계층 지식 그래프를 중심으로 하는 조정된 모듈들로 분해함으로써, 대규모 모델 압축을 요구하지 않고도 효율적이고 프라이빗하며 오프라인인 LLM 어시스턴스를 가능하게 하여 보급형 스마트폰에서 경쟁력 있는 멀티홉 추론 성능을 달성하는 완전한 온디바이스 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 휴대폰 안에 사는 아주 똑똑한 로봇 친구를 상상해 보세요. '대규모 언어 모델(LLM)'로 구동되는 이 친구는 대화도 하고, 이야기도 쓰고, 거의 무엇이든 답할 수 있습니다. 하지만 한 가지 조건이 있습니다. 진정으로 도움이 되려면, 이 로봇은 당신의 사진, 메모, 개인적인 대화와 같은 당신의 삶을 기억해야 하지만, 이 데이터가 유실되거나 도난당할 위험이 있는 거대한 클라우드 서버로 전송되어서는 안 됩니다. 이것이 바로 **온디바이스 AI(on-device AI)**의 세계입니다. 즉, 브레인과 기억을 바로 여기 당신의 주머니 속에 간직하여 프라이버시와 속도를 모두 잡는 것입니다.
하지만 휴대폰에 들어갈 만큼 작은 뇌를 만드는 것은 마치 배낭 안에 도서관 전체를 꾸역꾸역 집어넣으려는 것과 같습니다. 가장 큰 과제는 **메모리(기억)**입니다. 표준적인 로봇의 뇌는 자신의 '파라메트릭 메모리(내부 가중치)' 안에 모든 것을 기억하려고 노력하지만, 이는 휴대폰에 담기에는 너무 무겁고 새로운 것을 배웠을 때 업데이트하기가 쉽지 않습니다. 이를 해결하기 위해 과학자들은 **RAG(검색 증강 생성)**를 사용합니다. RAG를 로봇에게 공책을 주는 것이라고 생각해 보세요. 질문을 받았을 때, 로봇은 단순히 추측하는 것이 아니라 공책을 넘겨가며 사실을 찾아낸 다음 답변을 작성합니다. 문제는 대부분의 공책이 그저 흩어진 종이 뭉치라는 점입니다. 만약 서로 다른 세 페이지에 있는 세 가지 서로 다른 사실을 연결해야 하는 복잡한 질문을 던진다면, 흩어진 종이 뭉치는 탐색하기가 매우 어렵습니다. 이 논문은 다음과 같이 묻습니다. 어떻게 하면 슈퍼컴퓨터 없이도 휴대폰에서 복잡한 퍼즐을 풀 수 있는 스마트하고 체계적인 공책을 만들 수 있을까?
문제점: "거대한 뇌" vs. "작은 휴대폰"
한동안 AI를 더 똑똑하게 만드는 해결책은 단순해 보였습니다. 그냥 뇌를 더 크게 만드는 것이었죠. 하지만 이 논문의 저자인 SmartRAG는 이것이 모바일 기기에는 잘못된 접근 방식이라고 주장합니다. 거대한 클라우드 뇌를 휴대폰에 맞게 단순히 축소할 수는 없습니다. 너무 무겁고, 배터리를 너무 많이 사용하며, 생각하는 데 시간이 너무 오래 걸리기 때문입니다.
그들은 다른 아이디어를 제안합니다. 하나의 거대한 뇌가 모든 것을 다 하려고 하는 대신, 특화된 경량 작업자들의 팀을 구성하자는 것입니다. 그들은 이를 SmartRG라고 부릅니다. 이는 당신의 개인 데이터를 단순한 텍스트 뭉치가 아니라 구조화된 "지식 그래프(연결된 사실들의 웹)"로 정리하여 스마트폰에서 완전히 실행되도록 설계된 시스템입니다.
팀 구성: 네 명의 전문 작업자
SmartRAG는 스마트한 비서의 역할을 네 가지 별도의 역할로 나누며, 각 역할은 서로 다른 모듈에 의해 처리됩니다.
- 인지 (탐정): 이 팀원은 당신의 문자 메시지와 메모를 읽습니다. 이들은 EvoNER라는 특별한 도구를 사용하여 중요한 이름과 사실을 포착합니다. 멋진 점은 무엇일까요? EvoNER는 "지속적으로 학습 가능"하다는 것입니다. 마치 매일 새로운 종류의 단서를 배우면서도 다시 학교에 갈 필요가 없는 탐정을 상상해 보세요. 만약 당신이 새로운 유형의 엔티티(예: 새로운 유행어나 니치한 취미)를 언급한다면, EvoNER는 전체 거대한 뇌를 다시 훈련할 필요 없이 스스로의 "레이블 인벤토리"를 업데이트하며 실시간으로 이를 인식하는 법을 배울 수 있습니다.
- 메모리 (사서): 탐정이 사실을 찾아내면, 사서가 그것을 정리합니다. 하지만 단순히 서랍에 파일로 넣어두는 것이 아니라, 사서는 3개 층으로 이루어진 지식 그래프인 MRGraph를 구축합니다.
- 1계층은 사실을 그것이 나온 정확한 단락과 연결합니다 (따라서 정보의 출처를 알 수 있습니다).
- 2계층은 유사한 사실들을 하나의 클러스터(예: "주제" 폴더)로 묶습니다.
- 3계층은 빠른 읽기를 위해 원문 텍스트를 준비해 둡니다.
이 구조는 질문을 했을 때 시스템이 사실들이 어떻게 연결되는지 정확히 알 수 있게 하며, 모든 정보의 "출처(provenance)"를 보존합니다.
- 집중 (내비게이터): 당신이 질문을 하면, 내비게이터는 단순히 키워드만 검색하지 않습니다. 이들은 하이브리드 파이프라인을 사용합니다. 연결의 웹(그래프)을 살펴보고, 단어를 매칭(어휘 검색)하며, 의미를 이해(시맨틱 검색)합니다. 만약 당신이 "내가 좋아했던 영화의 감독이 쓴 책의 저자는 누구인가?"와 같은 다단계 질문을 던진다면, 내비게이터는 단순히 추측하는 대신 그래프를 통해 경로를 추적하며 한 사실에서 다음 사실으로 건너갈 수 있습니다.
- 사고 (뇌): 이 부분만이 고성능 대규모 언어 모델(LLM)을 사용합니다. 하지만 여기에는 비결이 있습니다. LLM은 오직 "고가치" 업무에만 호출됩니다. LLM은 모든 페이지를 읽지 않습니다. 검색 계획을 세우거나, 새로운 유형의 사실에 레이블을 붙이거나, 최종 답변을 작성할 때만 개입합니다. LLM을 엄격하게 통제함으로써 시스템은 엄청난 양의 배터리와 메모리를 절약합니다.
실생활에서의 작동 방식
연구진은 실제 스마트폰(특히 Snapdragon 프로세서가 탑려된 OnePlus 기기)에서 이 시스템을 테스트했습니다. 그들은 매우 작고 효율적인 버전의 LLM(클라우드에서 사용하는 거대 모델에 비해 아주 작은 17억 개의 파라미터)을 사용했습니다.
그들은 SmartRAG를 다음과 같은 다른 방법들과 비교했습니다:
- LLM 전용: 모든 것을 기억하려고 노력하는 작은 뇌.
- 나이브(Naïve) RAG: 검색할 때 엉망으로 흩어진 종이 뭉치를 가진 작은 뇌.
- 클라우드 규모 모델: 휴대폰에서 실행할 수 없는 거대한 뇌(최대 320억 개의 파라미터).
결과:
여러 조각의 증거를 연결해야 하는 복잡한 질문(멀티홉 추론)에 대해, 17억 개의 파라미터를 가진 작은 뇌를 가진 SmartRAG는 거대한 클라우드 모델과 대등하거나 때로는 더 나은 성능을 보였습니다.
- MultiHopQA 벤치마크에서, SmartRAG는 **50.17%**의 정답률을 기록하며, 17억 모델의 "LLM 전용" 버전(22.00%)을 크게 앞질렀고, 320억 모델(31.54%)마저 능가했습니다.
- 하지만, 직접적인 사실 확인 질문을 위한 벤치마크인 TriviaQA에서는 320억 모델이 여전히 우위를 점하며 51.45%를 기록했고, SmartRAG는 50.00%를 기록했습니다.
- 전반적으로, SmartRAG는 NQ, HotpotQA, MultiHopQA와 같은 지식 집약적 작업에서 훨씬 더 큰 모델들과 대등하거나 능가하는 성능을 보여주었으며, 이 모든 과정이 데이터 프라이버시를 위해 휴대폰 내에서 완전히 실행되었습니다. 응답 시간은 실용적인 수준이었으나, 저자들은 전체 프로세스 중 "첫 번째 토큰 생성 시간(말을 시작하기까지 걸리는 시간)"이 17억 모델 기준으로 약 36.9초였는데, 이는 주로 메모리를 먼저 검색해야 했기 때문이라고 언급했습니다.
제외된 사항들
이 논문은 몇 가지 일반적인 생각들에 대해 명시적으로 반박합니다:
- 클라우드 압축하기: 거대한 클라우드 기반 그래프 시스템을 단순히 휴대폰용으로 줄일 수는 없습니다. 수학적 계산과 에너지 비용이 너무 높기 때문입니다.
- LLM 네이티브 추출: 메모리를 조직화하는 모든 작업(사실 추출 및 그래프 구축)을 거대한 LLM이 수행하게 하는 것은 휴대폰 환경에서 너무 느리고 에너지를 많이 소비한다는 것을 발견했습니다. "인지" 모듈은 무거운 LLM이 아니라 가볍고 학습 가능한 구성 요소여야 합니다.
- 나이브 벡터 검색: 단순히 "시맨틱 유사성"(비슷한 소리가 나는 단어를 찾는 것)에만 의존하는 것은 논리적 연결이 필요한 복잡한 질문을 해결하기에 부족합니다.
결론
저자들은 온디바이스 AI의 미래가 뇌를 더 크게 만드는 것이 아니라, 시스템을 더 똑똑하게 만드는 것에 있다고 제안합니다. 사실을 인지하는 것(Perception), 사실을 정리하는 것(Memory), 사실을 찾는 것(Focus), 그리고 사실에 대해 생각하는 것(Thinking)을 분리함으로써, SmartRAG는 작고 효율적인 휴대폰이 보통 슈퍼컴퓨터가 필요한 복잡한 추론 작업을 수행할 수 있음을 보여줍니다.
이 시스템이 아직 완벽하지는 않지만(AI나 정치와 같은 매우 구체적인 주제에서는 여전히 어려움을 겪으며, 속도 또한 더 빨라질 필요가 있음), 이 실험은 구조화된 그래프 기반 접근 방식이 프라이버시 중심의 오프라인 AI 비서를 위한 실행 가능한 경로임을 입증합니다. 이는 적절한 아키텍처가 있다면, 당신의 휴대폰 개인 비서가 곧 클라우드의 거인만큼 똑똑해질 수 있으며, 그 모든 비밀은 여전히 당신의 주머니 속에 안전하게 머물 수 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.