← 최신 논문
💬 NLP

On the Proper Treatment of Units in Surprisal Theory

이 논문은 인간 처리 노력에 대한 명시적이고 엄격한 모델링을 보장하기 위해 토큰화를 과학적 원시 요소가 아닌 구현 세부 사항으로 취급해야 한다고 주장하며, 서프라이설 이론에서 언어 단위의 정의와 평가 영역을 분리하기 위한 통합 프레임워크를 제안한다.

원저자: Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Surprisal Theory 에서 단위 처리에 대한 올바른 접근"이라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 제시합니다.

큰 문제: "잘못된 자"

당신이 심리학자라고 상상해 보세요. 인간의 뇌가 문장을 읽을 때 얼마나 많은 노력이 필요한지 측정하려고 합니다. 당신은 Surprisal Theory(놀라움 이론)라는 이론을 가지고 있는데, 이 이론은 다음과 같습니다: 단어를 예측하기가 어려울수록, 그 단어를 읽는 데 더 많은 정신적 노력이 든다.

이를 검증하려면 그 노력을 측정할 "자"가 필요합니다. 과거 연구자들은 단어와 완벽하게 일치하는 자 (예: 인치를 사용하여 테이블을 측정하는 것) 를 사용했습니다. 하지만 오늘날 우리는 GPT-2 와 같은 강력한 AI 모델을 사용하여 측정을 수행합니다. 문제는 무엇일까요? 이러한 AI 모델은 "인간의 단어"로 말하지 않습니다. 그들은 "토큰 (token)"으로 말합니다.

토큰을 레고 블록이라고 생각해보세요.

  • 인간은 **"don't"**라는 단어를 봅니다.
  • AI 는 두 개의 블록을 봅니다: **"don"**과 "'t".
  • 인간은 **"words"**라는 단어를 봅니다.
  • AI 는 하나의 블록을 봅니다: "words".
  • 인간은 **"equal"**이라는 단어를 봅니다.
  • AI 는 하나의 블록을 봅니다: "equal".

AI 의 "블록"(토큰) 이 우리의 "단어"와 맞지 않기 때문에, 연구자들은 AI 의 블록을 인간의 단어에 맞게 붙여놓으려 노력해 왔습니다. 그들은 "임시방편 (ad hoc)" 접착제를 사용해 왔습니다. 때로는 단어 앞쪽에 공백을 붙이고, 때로는 뒤쪽에 붙입니다. 때로는 구두점을 무시하기도 합니다.

이 논문의 주요 주장: 이러한 "붙이기"는 messy(지저분하고) 일관성이 없습니다. 마치 자를 볼 때마다 자의 길이가 변하는 자로 방을 재려는 것과 같습니다. 저자들은 무엇을 "단위"(단어, 문자, 구절) 로 간주할지 선택하는 것은 단순한 기술적 세부 사항이 아니라 과학적 결정이라고 주장합니다. 우리는 AI 의 내부 블록 구조가 우리의 과학을 지배하도록 두는 것을 멈춰야 합니다.

해결책: "자신의 단위를 가져오세요"

저자들은 연구자가 AI 를 보기 전에 정확히 "단위"가 무엇인지 결정하는 새로운 프레임워크를 제안합니다.

  1. 단위를 선택하세요: 전체 단어를 연구하고 싶으신가요? 개별 문자를 원하시나요, 아니면 특정 품사 부분을 원하시나요?
  2. AI 를 번역하세요: AI 를 강제로 변경하는 대신, AI 의 이상한 블록을 당신이 선택한 단위로 변환하는 "번역기"(전환기라고 불리는 수학적 도구인 transducer) 를 구축합니다.

비유:
AI 가 "밀가루, 설탕, 계란의 그램"으로만 말하는 요리사라고 상상해 보세요. 당신이라는 과학자는 얼마나 많은 "케이크"가 만들어지고 있는지 알고 싶습니다.

  • 옛 방식: 요리사의 무작위 측정을 바탕으로 몇 그램이 케이크 한 개를 만드는지 추측해 봅니다.
  • 새로운 방식: 요리사의 그램을 받아 당신의 레시피에 따라 완벽하게 "케이크"(또는 "컵케이크"나 "머핀") 로 자동 조립하는 기계를 만듭니다. 요리사는 변하지 않습니다. 당신의 기계가 당신의 특정 질문에 맞게 출력을 올바르게 해석할 뿐입니다.

실험: 다양한 자 테스트

주장을 입증하기 위해 저자들은 MECO 데이터셋(텍스트를 읽는 사람들의 안구 추적 데이터 모음) 을 사용하여 실험을 수행했습니다. 사람들이 단어에 시선을 머무는 시간을 얼마나 잘 예측하는지 확인하기 위해 네 가지 다른 "자"(단어 목록) 를 테스트했습니다.

  1. 토큰: AI 의 기본 블록 사용 (예: "don"과 "'t"를 별개의 것으로 간주).
  2. 문자: 모든 개별 문자 측정 (예: d, o, n, ', t).
  3. 문맥 없는 단어: 간단한 규칙으로 텍스트 분할 (예: "공백마다 잘라내기"). 이는 구슬 모양에 관계없이 공백이 있을 때마다 구슬 줄을 자르는 것과 같습니다.
  4. 문맥적 단어: 문맥을 이해하는 지능적인 규칙 사용 (예: 펜실베니아 트리뱅크 가이드라인). 예를 들어, "1,000"에서 쉼표는 숫자의 일부이지만 "Hello, world"에서 쉼표는 멈춤을 나타낸다는 것을 아는 것입니다.

결과: 무엇을 측정하느냐가 중요합니다

이 연구는 자를 바꾸면 결과도 바뀐다는 것을 발견했습니다.

  • 전체 단어 (문맥적): 구두점과 문법을 존중하는 "지능적인" 단어 단위를 사용했을 때, AI 의 예측은 인간의 안구 움직임과 매우 잘 일치했습니다.
  • 토큰: AI 의 기본 블록은 나쁘지 않았지만, 지능적인 단어만큼 잘 작동하지는 않았습니다.
  • 문자: 문자 단위로 측정하는 것은 읽는 시간을 예측하는 데 잘 작동하지 않았습니다. 왜냐하면 인간은 거의 단일 문자에 시선을 멈추지 않고 전체 단어를 보기 때문입니다.
  • "접착제" 문제: 공백 처리 방식 (선행 vs 후행) 이 수학적으로 상당한 변화를 가져온다는 것을 발견했습니다.

핵심 교훈:
나쁜 자를 사용하면 실제로는 잘못된 것을 측정했을 뿐인데도 "Surprisal Theory 가 틀렸다"거나 "AI 모델이 나쁘다"고 결론 내릴 수 있습니다.

핵심 교훈

이 논문은 토큰화는 카메라 렌즈의 브랜드와 같은 단순한 기술적 세부 사항이라고 결론 내립니다. 그것은 무대의 주인공이 되어서는 안 됩니다.

  • 옛 사고방식: "AI 는 토큰을 사용하므로 우리는 토큰을 연구해야 한다."
  • 새 사고방식: "나는 인간이 단어를 어떻게 처리하는지 연구하고 싶다. AI 의 출력을 받아 수학적으로 단어로 변환하여 나의 과학적 질문에 올바르게 답할 것이다."

"단위"의 정의를 기본 설정이 아닌 의도적인 과학적 선택으로 취급함으로써, 연구자들은 인간 뇌가 언어를 처리하는 방식에 대해 더 명확하고 정확한 답변을 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →