Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory
Nexus는 시맨틱 룩사이드 버퍼와 압축된 시그니처를 통해 도구 라우팅을 비용이 많이 드는 스키마 프리필링으로부터 분리하고, 회전 위치 임베딩 드리프트에도 불구하고 출력 충실도를 유지하기 위해 폴백 재디코딩을 포함한 깊이 적응형 KV 캐시 스플라이싱 메커니즘을 채택함으로써 통합 메모리 상에서 에이전트형 LLM을 가속화합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급격히 진화하는 인공지능의 세계에서, 특정 유형의 소프트웨어 에이전트가 우리를 대신해 행동하는 법을 배우고 있습니다. 이 디지털 비서들은 단순히 질문에 답하는 것에 그치지 않고, 달력을 확인하거나, 데이터베이스를 검색하거나, 이메일을 보내는 것과 같은 도구들을 사용하기 위해 손을 뻗습니다. 이를 위해 소프트웨어는 먼저 자신이 사용할 수 있는 모든 도구에 대한 상세한 사용 설명서를 이해해야 합니다. 사용 가능한 도구의 수가 수백 개로 늘어남에 따라, 이 설명서들은 방대해져서 에이전트가 생각을 시작하기도 전에 컴퓨터의 단기 기억을 반복적인 텍스트로 가득 채우게 됩니다. 이는 병목 현상을 일으킵니다. 에이전트가 가진 도구가 많아질수록, 컴퓨터가 매 단계마다 이 거대한 지침 세트를 다시 읽고 처리해야 하기 때문에 작업을 시작하는 데 더 오랜 시간이 걸립니다.
연구자들은 이 병목 현상을 우회할 방법을 찾아왔습니다. 한 가지 아이디어는 컴퓨터가 이 지침들에 대한 작업을 압축된 형태, 즉 책갈피와 같은 형태로 저장했다가 필요할 때마다 다시 메모리에 붙여넣는 것이었습니다. 이것은 효율적으로 들리지만, 현대의 AI 모델이 시간과 순서를 추적하는 방식과 관련하여 근본적인 문제에 부딪힙니다. 이 모델들은 단어의 시퀀스 내에서 자신이 어디에 있는지 기억하는 시스템을 사용하는데, 만약 저장된 작업 덩어리를 메모리의 다른 위치로 옮기면 모델은 사건의 순서에 대해 혼란을 느끼게 됩니다. 이는 마치 책 중간에 있는 페이지를 꺼내 다른 장에 붙여넣는 것과 같습니다. 이야기는 여전히 말이 될지 모르지만, 문장 사이의 미묘한 연결 고리가 끊어져 오류를 초래할 수 있습니다.
한 독립 연구팀은 이 까다로운 지형을 탐색하기 위해 '넥서스(Nexus)'라고 불리는 시스템을 구축했습니다. 그들은 이 저장된 지침 블록들을 위험 없이 단순히 옮길 수는 없지만, 그것들을 어디에 배치하고 필연적으로 발생하는 오류들을 어떻게 수정하느냐에 따라 옮길 수 있다는 사실을 발견했습니다. 현대적인 노트북에서 발견되는 특정 유형의 강력한 컴퓨터 칩에서 테스트된 그들의 연구는, AI의 출력이 신뢰할 수 없게 되기 전까지 이 블록들을 얼마나 멀리 이동할 수 있는지에 대한 정밀한 경계선을 밝혀냈습니다. 그들은 블록이 너무 멀리 이동하면 모델의 시퀀스 이해도가 표류하지만, 이 표류는 예측 가능하다는 것을 발견했습니다. 연구진은 이 표류가 너무 커졌을 때를 감지하고, 기억을 완벽하게 다시 엮어내기 위해 필요한 부분만을 자동으로 다시 읽는 방법을 설계했습니다.
이 연구의 가장 중요한 발견은, 시스템이 가장 중요한 작업인 '어떤 도구를 사용할지 결정하는 일'에는 이러한 위험한 메모리 지름길에 의존할 필요가 없다는 것입니다. AI에게 도구를 선택하기 위해 방대한 지침서를 읽도록 강요하는 대신, 넥서스는 별도의 초고속 조회 시스템을 사용합니다. 이 시스템은 컴팩트한 도구 이름과 설명 목록을 스캔하여 마이크로초 단위로 적절한 일치 항목을 찾아냅니다. 도구가 선택되면, AI는 전체의 비대해진 텍스트 대신 종종 수십 단어에 불과한 아주 작고 압축된 지침 요약을 사용하여 필요한 인자(arguments)를 생성합니다. 이 접근 방식은 메인 메모리를 깨끗하게 유지하며, 에이전트가 전체 설명서를 다시 읽는 데 걸리는 시간보다 절반도 안 되는 시간 안에 첫 번째 답변의 단어를 찾을 수 있게 하여 작업을 훨씬 빠르게 시작할 수 있게 합니다.
연구진은 또한 그들의 메모리 스플라이싱(splicing) 기술의 한계를 엄격하게 테스트했습니다. 그들은 이 방법이 짧은 거리에서는 잘 작동하지만, 명확한 한계가 있음을 확인했습니다. 만약 저장된 블록이 원래 생성되었던 위치에서 256개 위치보다 더 멀리 배치되면, 오류가 무시할 수 없을 정도로 심각해집니다. 이 지점에서 시스템은 메모리를 패치하려는 시도를 중단하고, 대신 전체 텍스트를 다시 읽는 더 느리지만 안전한 방법으로 돌아갑니다. 이는 최종 출력이 컴퓨터가 지름길을 시도하지 않았을 때와 똑같이 정확함을 보장합니다. 또한 그들은 메모리의 내부 상태를 빠르게 점검하여 언제 멈출지를 추측하는 더 단순하고 저렴한 방법은, 오류를 안정적으로 예측하지 못하기 때문에 작동하지 않는다는 것을 증명했습니다.
테스트에서 넥서스 시스템은 250개의 서로 다른 도구 레지스트리를 처리하면서도 속도가 저하되지 않았으며, 올바른 도구를 선택하는 데 높은 성공률을 유지했습니다. 문맥(context)이 중간 정도였을 때, 시스템은 모든 것을 다시 읽는 전통적인 방식보다 최대 1.7배 더 빨랐습니다. 그러나 대화가 길어지고 깊어짐에 따라 속도 이점은 자연스럽게 사라져 결국 표준 방식의 성능과 일치하게 되었습니다. 이것은 실패가 아니라 그들 설계의 특징입니다. 시스템은 빠르기보다 정답을 맞히는 것을 우선시합니다. 이는 출력이 표준 방식보다 결코 나쁘지 않음을 보장하며, 때로는 동일한 시간이 걸릴 수도 있음을 의미합니다.
이 연구는 프로세서가 기기의 다른 부분으로 데이터를 이동시키지 않고 데이터에 직접 접근할 수 있는 통합 메모리 아키텍처를 가진 단일 유형의 컴퓨터 칩에서 수행되었습니다. 이 특정 하드웨어 설정은 메모리 스플라이싱 기술이 작동하는 데 필수적이었는데, 왜냐하면 이 기술은 메모리 셀에 대한 직접적인 물리적 접근을 요구하기 때문입니다. 연구진은 속도 수치가 이 특정 설정에 국한되어 있지만, 메모리 블록을 이동시키는 한계와 별도의 라우팅 시스템의 필요성에 대한 근본적인 원칙은 이 모델들이 기능하는 방식에 대한 보편적인 진리인 것으로 보인다고 명시했습니다. 그들은 지름길이 작동하는 곳, 작동이 깨지는 곳, 그리고 속도와 신뢰성을 모두 전달하기 위해 그 경계를 존중하는 시스템을 구축하는 방법을 보여주는 명확한 지도를 제공했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.