Emergent retokenization symmetry in large language models: phenomenology and applications
이 논문은 거대 언어 모델이 훈련 과정에서 의미론적으로 동등한 토큰 분할에 대해 부분적인 창발적 대칭성을 발달시킨다는 것을 입증하며, 이는 '재토큰화(retokenization)'—표준 토큰화를 대안적인 유효 분할로 교체하는 것—가 구성적 이해를 위한 깨끗한 프로브(probe) 역할을 수행하고 기존 방식들이 놓친 해답을 복구할 수 있는 새로운 추론 시점 샘플링 전략으로서 기능함을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 책을 읽고 있다고 상상해 보세요. 하지만 단어를 통째로 읽는 대신, 모든 단어가 서로 다른 크기의 덩어리로 쪼개져 인쇄되어 있습니다. 어떤 때는 "probable"이 하나의 덩어리이지만, 다른 때는 "prob"과 "able"이라는 두 개의 덩어리로 나뉩니다.
LLM(거대 언어 모델)의 세계에서, 모델은 정확히 이 방식으로 읽습니다. 그들은 글자를 보는 것이 아니라 "토큰"(텍스트 덩어리)을 봅니다. 보통 컴퓨터에는 "probable"을 "prob"과 "able"로 나누라고 지시하는 엄격한 규칙서(토크나이저)가 있습니다. 이것이 정형적인(canonical) 방식입니다.
이 논문은 매혹적인 질문을 던집니다: 만약 우리가 규칙을 깨뜨린다면 어떻게 될까? 만약 우리가 모델에게 똑같은 문장을 주되, 이를 다르게 쪼개서 준다면(예: "pro" + "b" + "able") 어떻게 될까요? 모델이 혼란스러워할까요, 아니면 여전히 그 의미를 이해할 수 있을까요?
저자들은 이 과정을 **재토큰화(Retokenization)**라고 부릅니다. 연구 결과는 다음과 같습니다.
1. 모델의 "비밀 언어"
연구진은 모델이 표준적인 방식으로 단어를 읽도록 훈련받았음에도 불구하고, 비표준적인 방식도 비밀리에 이해하고 있다는 사실을 발견했습니다.
- 비유: 요리사가 양파를 완벽하고 균일한 정육면체 모양으로 썰도록 훈련받았다고 상상해 보세요. 만약 당신이 그들에게 울퉁불퉁하고 이상한 모양으로 썰린 양파 더미를 건네준다면, 그들은 여전히 수프를 요리할 수 있을 것입니다. 그들은 양파의 모양이 어떻든 간에 "양파"가 "양파"라는 것을 이해합니다.
- 발견: 모델은 이러한 이상한 모양들에 대해 완전히 눈먼 상태가 아닙니다. 모델은 여전히 계산을 하고, 코드를 작성하고, 질문에 답할 수 있습니다. 하지만 그렇다고 해서 완벽하게 무감각한 것도 아닙니다. 이상한 모양들은 모델의 내부 "두뇌"(은닉 상태, hidden states)를 약간 다르게 작동하게 만듭니다. 이는 마치 요리사가 양파가 이상하게 썰려 있어도 수프 맛은 괜찮겠지만, 평소보다 약간 더 스트레스를 받는 것과 같습니다.
2. "주사위를 던지는" 새로운 방법
우리가 AI에게 문제를 풀라고 요청할 때, 우리는 보통 몇 번 시도해 보고 가장 좋은 답을 찾는 방식을 사용합니다. 이것을 **온도 샘플링(Temperature Sampling)**이라고 합니다. 이는 다음에 무엇을 말할지 결정하기 위해 주사위를 던지는 것과 같습니다.
저자들은 새로운 방법인 **재토큰화 샘플링(Retokenization Sampling)**을 찾아냈습니다.
- 비유: 당신이 미로를 풀려고 노력하고 있다고 상상해 보세요.
- 표준 샘플링: 당신은 같은 경로를 걷지만, 갈림길이 나올 때마다 왼쪽으로 갈지 오른쪽으로 갈지 결정하기 위해 동전을 던집니다.
- 재토큰화 샘플링: 당신은 같은 경로를 걷지만, 지도를 약간 바꿉니다. 아마도 벽을 다시 그리거나 갈림길의 라벨을 바꿀 수도 있습니다. 목적지는 같더라도, 새로운 지도는 당신의 뇌가 그곳에 도달하기 위해 다른 경로를 택하도록 강제합니다.
- 결과: 때때로 이 "새로운 지도"는 AI가 표준적인 지도를 사용할 때 놓쳤던 해결책을 찾도록 도와줍니다. 이는 마치 다른 각도에서 청사진을 보아야만 보이는 숨겨진 문을 찾는 것과 같습니다.
3. 작동하는 곳 (그리고 작동하지 않는 곳)
연구진은 이 방법을 세 가지 유형의 작업에서 테스트했습니다:
- 수학 (GSM8K): 모델은 괜찮은 성적을 냈습니다. 이상하게 쪼개는 것이 큰 도움이 되지는 않았지만, 모델을 망가뜨리지도 않았습니다.
- 객관식 (MMLU): 모델은 이 작업에서 매우 민감했습니다. 덩어리를 바꾸면 정답을 맞힐 확률이 약간 낮아졌습니다.
- 코딩 (HumanEval): 이곳에서 흥미로운 일이 벌어졌습니다. 코딩에는 동일한 문제를 해결하는 많은 방법이 있습니다. 연구진은 코드가 어떻게 쪼개지느냐에 따라, AI가 기존에는 찾지 못했을 완전히 다른 방식의 올바른 프로그램 작성법을 가끔 찾아낸다는 것을 발견했습니다.
4. 창의성의 대가
하지만 함정이 있습니다.
- 비유: 당신이 책을 더 빨리 읽으려고 노력하고 있다고 상상해 보세요.
- 표준 방식: 당신은 단어를 정상적으로 읽습니다.
- 재토큰화 방식: 당신은 읽기 전에 모든 단어를 다시 쪼개야 합니다.
- 발견: 모델이 이러한 "이상하게 쪼개진" 단어들을 처리해야 하기 때문에, 답을 얻는 데 더 많은 컴퓨터 자원(및 시간)이 소모됩니다. 이는 표준적인 방식보다 효율성이 떨어집니다. 논문은 이 방법이 새로운 해결책을 찾기 위한 멋진 도구이긴 하지만, 표준적인 AI 사용 방식을 대체할 마법의 해결책은 될 수 없다고 결론짓습니다. 왜냐하면 더 느리고 비용이 많이 들기 때문입니다.
요약
이 논문은 AI 모델이 우리가 생각했던 것보다 더 똑똑하다는 것을 보여줍니다. 그들은 단순히 단어를 읽는 한 가지 방식을 암기하는 것이 아니라, 텍스트의 다양한 "쪼개기"를 처리할 수 있는 유연한 이해력을 갖추고 있습니다.
의도적으로 텍스트를 이상한 덩어리로 나눔으로써, 연구자들은 AI가 약간씩 다른 방식으로 생각하도록 강제할 수 있으며, 이는 때때로 (특히 코딩에서) 놓쳤을 법한 정답을 찾아내기도 합니다. 이는 AI가 생각하는 방식을 탐구하는 새로운 도구이며, 컴퓨터에 정보를 입력하는 방식이 정보 그 자체만큼이나 중요하다는 것을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.