← 최신 논문
💬 NLP

CharBench: Evaluating the Role of Tokenization in Character-Level Tasks

이 논문은 기존 벤치마크보다 두 배 이상 큰 'CharBench'를 도입하여 토큰화 방식이 문자 단위 태스크 수행에 미치는 영향을 분석한 결과, 문자 위치 파악에는 긴 토큰 길이가 부정적 영향을 주지만, 문자 카운팅에는 토큰화 특성보다 단어 길이와 실제 문자 수가 더 중요한 역할을 한다는 것을 밝혔습니다.

원저자: Omri Uzan, Yuval Pinter

게시일 2026-04-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Omri Uzan, Yuval Pinter

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: AI 는 왜 '알파벳'을 못 세나요?

우리가 '딸기'라는 단어를 볼 때, 뇌는 s-t-r-a-w-b-e-r-r-y라는 알파벳 11 개를 한눈에 봅니다. 하지만 AI 는 다릅니다.

  • AI 의 시선: AI 는 알파벳 하나하나를 보지 않고, '조각 (토큰)' 단위로 봅니다.
    • 예: 'strawberry'라는 단어는 AI 에게 straw + berry처럼 두 개의 큰 덩어리로 나뉘어 보입니다.
    • 마치 레고 블록을 조립할 때, 개별 블록 (알파벳) 보다는 이미 붙어 있는 큰 블록 (단어 조각) 으로만 생각하는 것과 비슷합니다.

연구자들은 "아마도 AI 가 알파벳 대신 '조각' 단위로 생각하기 때문에, 조각 안에 숨겨진 알파벳 위치를 찾거나 세는 데 서툴러서 이런 실수가 생긴 게 아닐까?"라고 의심했습니다.

2. 해결책: 거대한 시험지 'CHARBENCH'

이 의심을 검증하기 위해 연구자들은 **기존 시험지보다 100 배나 더 큰 'CHARBENCH'**라는 새로운 시험지를 만들었습니다.

  • 시험 내용:
    1. 세기 (Counting): "단어 안에 'a'가 몇 개 있나요?"
    2. 찾기 (Indexing): "단어에서 'e'가 처음 나오는 위치는 몇 번째인가요?"
  • 참가자: GPT-4, Llama, Mistral 등 최신 AI 모델 7 개를 초대했습니다.

3. 놀라운 결과: AI 는 여전히 '초보'입니다

시험 결과는 충격적이었습니다.

  • 평균 점수: AI 들의 평균 점수는 50% 대였습니다. 즉, 동전 던지기 (50%) 만 못하거나 비슷하게 찍는 수준입니다.
  • 특이점:
    • GPT-4o가 가장 잘했지만, 그래도 70% 정도밖에 못 했습니다.
    • 위치 찾기 (Indexing) 문제가 세기 (Counting) 문제보다 훨씬 더 어려웠습니다. "첫 번째 'r'은 어디에 있나요?"라고 물으면 AI 는 길을 잃기 쉽습니다.

4. 핵심 발견: 왜 틀릴까요? (비유로 설명)

연구자들은 AI 가 틀리는 이유를 분석해서 두 가지 중요한 사실을 발견했습니다.

A. "단어가 길수록 AI 는 더 혼란스러워한다"

  • 비유: 짧은 단어는 작은 상자에 담겨 있어 찾기 쉽지만, 긴 단어는 거대한 창고처럼 되어 있습니다.
  • 현실: 단어의 길이가 길어질수록 AI 가 정답을 맞힐 확률은 꾸준히 떨어집니다. AI 는 긴 문장을 한 번에 처리하는 데 한계가 있습니다.

B. "조각 (토큰) 이 너무 크면 알파벳 위치를 잃는다"

이게 이 논문의 가장 중요한 발견입니다.

  • 상황: AI 가 'strawberry'를 strawberry로 나눴다고 가정해 봅시다.
    • 만약 우리가 straw 조각 안에 있는 'r'을 찾으라고 하면, AI 는 그 조각이 너무 커서 정확히 어느 위치에 있는지 기억해내지 못합니다.
  • 비유: **거대한 책 한 권 (긴 토큰)**을 한 번에 읽으라고 하면, 책의 특정 페이지 (알파벳 위치) 를 기억하기 어렵습니다. 하지만 **작은 포스트잇 (짧은 토큰)**에 적혀 있다면 위치를 쉽게 찾을 수 있습니다.
  • 결론: AI 가 단어를 '조각'으로 잘게 쪼개는 것이 오히려 알파벳의 위치 정보를 흐리게 만들 수 있다는 것입니다.

C. "조각의 개수보다는 '실제 숫자'가 중요하다"

  • 많은 사람들은 "단어를 조각으로 몇 개로 나눴느냐 (토큰 수)"가 중요할 거라고 생각했습니다.
  • 하지만 연구 결과, 토큰의 개수나 크기보다는 **"실제로 그 알파벳이 몇 번 나왔는지 (정답의 크기)"**가 AI 의 성능과 더 깊은 연관이 있었습니다. 즉, AI 는 '조각' 자체의 구조보다는 '내용의 양'에 더 민감하게 반응했습니다.

5. 요약 및 결론

이 논문의 핵심 메시지는 다음과 같습니다:

  1. AI 는 아직 '문자'를 잘 못 다룹니다: 최신 AI 가 고난도 수학이나 논리 문제는 잘 풀지만, 알파벳을 세거나 위치를 찾는 아주 기초적인 작업에서는 여전히 인간보다 훨씬 못합니다.
  2. 원인은 '조각화' (Tokenization) 에 있습니다: AI 가 단어를 알파벳이 아닌 '조각' 단위로 처리하는 방식이, 알파벳의 정확한 위치를 파악하는 것을 방해합니다. 특히 조각이 클수록 위치를 찾기 더 어려워집니다.
  3. 미래의 방향: 앞으로 AI 를 더 똑똑하게 만들려면, 단순히 단어를 큰 덩어리로 처리하는 방식에서 벗어나 알파벳 하나하나의 위치와 관계를 더 잘 이해할 수 있도록 설계해야 합니다.

한 줄 요약:

"AI 는 거대한 레고 블록 (조각) 으로만 세상을 보다가, 작은 알파벳 하나하나의 위치를 잃어버리고 있습니다. 이 '눈가림'을 해결하는 것이 다음 세대 AI 의 핵심 과제입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →