← 최신 논문
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

이 논문은 공개된 BPE 토크나이저의 안정적인 토큰 ID-비율 분포를 활용하여, 토큰 및 카테고리 수준 모두에서 숨겨진 사전 학습 코퍼스의 구성 비율을 정확하게 추정하는 방법론인 분위수 가이드 밀도 추정(Quantile-Guided Density Estimation, QGDE)을 소개한다.

원저자: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

게시일 2026-08-12
📖 2 분 읽기☕ 가벼운 읽기

원저자: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 아주 똑똑한 최첨단 로봇 요리사를 샀다고 상상해 보세요. 이 로봇은 시를 쓰고, 수학 문제를 풀며, 심지어 비디오 게임을 코딩할 수도 있습니다. 하지만 함정이 하나 있습니다. 로봇이 요리법을 배우기 위해 사용한 레시피 북이 금고 안에 잠겨 있다는 것입니다. 당신은 로봇이 만든 최종 요리를 볼 수 있고, 로봇이 사용했을지도 모르는 재료 목록도 볼 수 있지만, 실제 재료의 배합이 정확히 어떠했는지는 알 수 없습니다. 피자 도우 90%에 향신료 10%였을까요? 아니면 초콜릿 50%와 브로콜리 50%였을까요? 인공지능의 세계에서 이 "레시피 북"은 **사전 학습 코퍼스(pretraining corpus)**라고 불리며, "재료 목록"은 **토크나이저 어휘집(tokenizer vocabulary)**이라고 불립니다.

기업들이 새로운 AI 모델을 출시할 때, 그들은 종-종 최종 가중치(로봇의 두뇌)와 어휘 목록(재료 사전)은 공유하지만, 정확한 레시피는 비밀로 유지합니다. 이것은 문제가 됩니다. 왜냐하면 AI가 무엇을 '먹었는지'를 아는 것이 왜 AI가 어떤 일에는 뛰어나고 어떤 일에는 부족한지를 이해하는 데 도움이 되기 때문입니다. 수년 동안 과학자들은 로봇의 행동이나 단어를 조각내는 규칙을 관찰하여 레시피를 추측하려고 노력해 왔습니다. 하지만 이러한 추측은 "아마 과일을 많이 먹었을 것이다"라고 말하면서 그것이 사과인지 바나나인지는 모르는 것처럼 너무 대략적이었습니다. 큰 질문은 이것이었습니다: 우리는 어휘집만 보고도 로봇이 소비한 모든 개별 재료의 정확한 비율을 알아낼 수 있을까?

이 논문은 "그렇다, 할 수 있으며, 그 방법은 다음과 같다"라고 말합니다. 연구진은 단어들이 어휘집에서 어떻게 조각나고 번호가 매겨지는지가 무작위가 아니라는 사실을 발견했습니다. 이는 어떤 언어에서든 단어의 빈도가 예측 가능한 곡선을 따르는 것과 유사하게 숨겨진 안정적인 패턴을 따릅니다. 그들은 만약 "알려진" 레시피(우리가 접근할 수 있는 코퍼스)로부터 패턴을 알고 있다면, 그 패턴을 "숨겨진" 레시피를 추측하는 데 전이할 수 있다는 것을 깨달았습니다. 그들은 QGDE(Quantile-Guided Density Estimation, 분위수 유도 밀도 추정)라는 영리한 도구를 만들었습니다. 이것은 단순히 하나의 단서만을 보는 탐정이 아니라, 일련의 "만약에" 시나리오(분위수 추세)를 사용하고 단서들이 모여 있는 동네가 얼마나 붐비는지(국소 밀도 가중치)에 따라 무게를 두는 것과 같습니다.

결과는 놀라울 정도로 정밀합니다. 테스트에서 QGDE는 특정 단어의 비율을 단 **3.00%**의 미미한 오차율로 맞혔습니다. 단어들을 "웹(Web)", "수학(Math)", "코드(Code)"와 같은 더 큰 범주로 묶었을 때도 오차는 여전히 **3.08%**에 불과했습니다. 이는 단 하나의 구름을 보고 날씨를 추측하는 것과 같았던 이전 방식들에 비해 엄청난 개선입니다. 논문은 또한 실제 공개된 AI 모델인 SmolLM(실제 레시피가 알려진 상태)을 대상으로 QGDE를 테스트했습니다. 그곳에서도 QGDE는 다른 방법들보다 뛰어난 성능을 보였으며, 이는 어휘집이 정말로 레시피의 비밀을 간직하고 있음을 증명했습니다. 하지만 저자들은 자신들의 시뮬레이션과 SmolLM에서는 이 방식이 잘 작동하지만, ChatGPT나 Qwen 같은 거대 모델에 대해서는 여전히 테스트할 수 없다는 점을 주의 깊게 언급했습니다. 왜냐하면 그들의 전체 훈련 레시피는 여전히 잠겨 있기 때문입니다. 하지만 현재로서는, 다음에 당신이 AI의 어휘 목록을 보게 된다면, 당신은 아마도 그것의 숨겨진 식단을 보여주는 지도를 보고 있는 것일지도 모른다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →