Token-Native Storage: Read and Write in your Agent's Language
이 논문은 텍스트를 UTF-8 문자가 아닌 BPE 토큰 ID로 직접 저장하는 패러다임인 "토큰 네이티브 스토리지(token-native storage)"를 옹호하며, 이 접근 방식이 반복적인 번역과 재토큰화 과정을 제거함으로써 AI 에이전트를 위한 저장 용량을 크게 줄이고 읽기/쓰기 작업을 가속화한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기계의 언어 vs. 인간의 언어
당신이 아주 똑똑한 로봇에게 도서관의 책들을 읽는 법을 가르치고 있다고 상상해 보세요. 책들은 우리가 보고 이해할 수 있는 글자와 단어를 사용하여 인간의 언어로 쓰여 있습니다. 하지만 로봇은 글자를 "보는" 것이 아니라 숫자를 봅니다. 로봇에게 "cat"이라는 단어는 단어가 아니라, 일종의 비밀 ID 번호와 같은 특정 코드입니다. 이것이 현대 인공지능이 작동하는 방식입니다. AI는 텍스트를 "토큰"이라고 불리는 아주 작은 조각들로 나누고, 각 조각에 고유한 숫자를 할당하여 처리합니다.
수십 년 동안 컴퓨터는 인간이 쓰는 방식 그대로, 즉 글자의 나열(UTF-8 등)로 텍스트를 저장해 왔습니다. 이는 우리에게는 좋지만, 로봇에게는 다소 번거로운 방식입니다. 로봇이 도서관의 책을 읽으려 할 때마다, 로봇은 인간의 글자를 자신의 비밀 숫자로 번역하고, 작업을 수행한 뒤, 다시 숫자를 글자로 번역하여 우리에게 답을 보여줘야 합니다. 이 번역 과정은 시간과 공간을 소모합니다. 마치 책의 페이지를 한 장 읽을 때마다 매번 그 책을 외국어로 번역해야 하는 것과 같습니다. 로봇이 우리의 디지털 세상에서 더 많은 읽기와 쓰기를 수행하게 됨에 따라, 이 끊임없는 번역 과정은 병목 현상이 되어 속도를 늦추고 추가적인 공간을 차지하고 있습니다.
논문의 핵심 아이디어: 번역을 멈추고, "로봇어"로 말하기
"토큰 네이티브 스토리지(Token-Native Storage)"라는 제목의 이 논문은 로봇이 데이터베이스에 접근할 때마다 인간의 텍스트를 번역하도록 강요하는 것을 멈춰야 한다고 주장합니다. 대신, 저자는 텍스트를 로봇이 보는 그대로, 즉 토큰 숫자 리스트로 저장할 것을 제안합니다. 이를 "토큰 네이티브 스토리지"라고 부릅니다.
이렇게 생각해 보세요. 현재 우리의 디지털 도서관은 모든 그림이 인간이 읽을 수 있는 보호 라벨로 감싸져 있는 박물관과 같습니다. 로봇에게 그림을 보여주려면, 라벨을 풀고, 라벨을 로봇 코드로 번역하고, 로봇이 보게 한 뒤, 다시 포장해야 합니다. 저자는 그림들이 이미 로봇의 모국어로 걸려 있는 새로운 종류의 박물관을 제안합니다. 로봇이 들어오면, 어떤 포장이나 번역 없이 즉시 예술 작품을 감상할 수 있습니다.
연구 결과:
연구자는 이 아이디어를 테스트했으며, 텍스트를 토큰 숫자로 저장하는 것이 글자로 저장하는 것보다 빠를 뿐만 아니라 공간도 적게 차지한다는 것을 발견했습니다.
- 속도: 로봇이 이 새로운 유형의 저장소에서 읽을 때, 번역 단계를 완전히 건너뜁니다. 논문에서는 이를 작업에 따라 기존 방식보다 약 10배에서 600배 더 빠르다고 측정했습니다. 이는 통역사가 문장을 끝내기를 기다리는 것과 생각을 직접 듣는 것의 차이와 같습니다.
- 공간: 토큰 숫자는 긴 글자열이 아니라 작은 정수(예: 1, 2, 3)이기 때문에 자연스럽게 더 압축적입니다. 화려한 압축 기술을 사용하지 않더라도, 단순히 이 숫자들을 함께 묶는 것만으로도 공간을 절약할 수 있습니다. 영어 텍스트의 경우, 이 원시 패킹(raw packing)만으로도 표준 텍스트 저장 방식보다 2.25배 더 작았습니다. 여기에 간단한 압축 기술(가장 흔한 숫자가 가장 작은 숫자를 갖도록 재정렬하는 방식)을 추가했을 때, 데이터를 훨씬 더 줄여 표준 텍스트보다 3.30배 더 작게 만들 수 있었습니다.
논문이 반대하는 점:
이 논문은 로봇이 주요 독자이자 작성자인 시스템에서 텍스트를 인간이 읽을 수 있는 글자(UTF-8)로 저장하는 현재의 표준 방식에 대해 명시적으로 반대합니다. 저자는 텍스트를 인간 형식으로 유지하는 것이 시스템으로 하여금 모든 읽기 및 쓰기 작업마다 "번역 세금"을 지불하게 만든다고 지적합니다. 또한, 공간을 절약하기 위해 복잡하고 무거운 압축 알고리즘이 필요하다는 생각에도 반대합니다. 저자는 단순히 토큰 숫자의 순서를 (발견된 순서가 아닌 빈도수에 따라) 바꾸는 것만으로도 느리고 복잡한 압축 도구 없이 매우 빠른 디코딩이 가능하다는 것을 발견했습니다.
얼마나 확신하는가?
저자는 자신의 측정값에 대해 매우 확신하고 있습니다. 단순히 추측한 것이 아니라 영어 기사, 컴퓨터 코드, 힌디어 텍스트를 포함한 실제 데이터를 사용하여 테스트를 수행했습니다. 기존의 최상급 압축 도구들(zstd, gzip 등)과 비교했을 때, 새로운 방식이 속도와 크기 모두에서 일관되게 능가하거나 대등한 성능을 보였습니다. 저자는 데이터 읽기 및 쓰기에 걸리는 시간을 마이크로초(백만 분의 1초) 단위로 측정하여, 속도 차이가 실제로 존재하며 유의미함을 보여주었습니다.
"빈도 순서(Frequency Order)" 트릭
이 논문에서 가장 영리한 부분 중 하나는 AI 연구소들이 토큰 목록을 어떻게 구성해야 하는지에 대한 제안입니다. 현재 토큰 숫자는 훈련 중에 AI가 발견한 순서에 따라 다소 무작위로 할당됩니다. 저자는 만약 가장 흔한 단어가 가장 작은 숫자(예: 1, 2, 3)를 갖고 희귀한 단어가 더 큰 숫자를 갖도록 토큰 숫자를 재정렬한다면, 데이터를 훨씬 더 잘 압축할 수 있다는 것을 발견했습니다.
이를 "+freq" 방식이라고 부릅니다. 이는 옷장을 정리하는 것과 같습니다. 자주 입는 옷을 손이 닿기 쉬운 선반(작은 숫자)에 두면 시간과 공간을 아낄 수 있습니다. 이렇게 함으로써, 복잡한 압축의 이점을 거의 모두 누리면서도 디코딩 속도는 7배 더 빠르게 만들 수 있었습니다. 저자들은 AI 기업들이 이 "무료 속도 향상"의 혜택을 모두 누릴 수 있도록 자신들의 토큰 목록을 이 "빈도 순서"대로 공개할 것을 요청하고 있습니다.
장애물: 같은 언어 사용하기
논문은 이 시스템이 완벽하게 작동하기 위한 한 가지 큰 제약 조건이 있음을 인정합니다. 이 시스템이 제대로 작동하려면 시스템 내의 모든 로봇이 정확히 같은 "토큰 언어"(동일한 어휘집)를 사용해야 합니다. 현재 서로 다른 AI 모델들은 대개 서로 다른 사전(vocabulary)을 사용합니다. 만약 한 로봇은 "cat"이 500번인 사전을 사용하고, 다른 로봇은 "cat"이 12번인 사전을 사용한다면, 그들은 저장소를 쉽게 공유할 수 없습니다.
저자는 해결책으로 우리가 모두 동일한 알파벳(ASCII)이나 동일한 문자 인코딩(UTF-8)을 사용하기로 합의했던 것과 유사한 "표준화"를 제시합니다. 만약 AI 업계가 공유된 "토큰 알파벳"에 합의한다면, 이 토큰 네이티브 스토리지는 우리의 디지털 인프라를 실행하는 로봇들에게 더 빠르고 저렴하게 만드는 새로운 표준이 될 수 있습니다.
요약하자면, 이 논문은 로봇이 우리의 디지털 읽기와 쓰기를 더 많이 담당하게 됨에 따라, 데이터를 인간 형식으로 저장하는 것을 멈추고 그들이 태생적으로 읽도록 만들어진 형식으로 저장해야 한다고 제안합니다. 이는 파일을 저장하는 방식의 작은 변화이지만, 미래에 엄청난 양의 시간과 비용을 절약해 줄 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.