← 최신 논문
🤖 AI

You Can Learn Tokenization End-to-End with Reinforcement Learning

이 논문은 분산을 줄이기 위해 스코어 함수 추정치와 시간 할인(time discounting)을 사용하는 강화 학습을 통해 토큰화를 엔드투엔드로 학습하는 방법을 제안하며, 이 접근 방식이 1억 파라미터 규모에서 기존의 스트레이트-스루(straight-through) 방식보다 성능이 우수함을 입증한다.

원저자: Sam Dauncey, Roger Wattenhofer

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sam Dauncey, Roger Wattenhofer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 컴퓨터는 인간의 언어를 자연스럽게 이해하지 못하며, 오직 숫자만을 이해합니다. 이 간극을 메우기 위해 텍스트를 처리하는 인공지능 시스템은 먼저 단어와 문장을 자신이 소화할 수 있는 숫자의 흐름으로 변환해야 합니다. 수년 동안 이를 수행하기 위한 표준적인 방법은 토큰화(tokenization)라고 불리는 경직되고 미리 프로그래밍된 단계였습니다. 이 과정을 기계가 책을 읽기 전에 사서가 정해진 규칙에 따라 페이지를 특정 조각으로 잘라내는 것에 비유해 보십시오. 이 규칙 책은 어디에서 한 단어가 끝나고 다음 단어가 시작되는지를 결정하며, 흔히 공통된 철자 조합을 함께 묶기도 합니다. 이 방식은 효과적이긴 하지만, 인공지능의 두뇌 외부에서 독립적으로 존재하는 수동적이고 정적인 단계입니다. 이러한 디지털 지능이 더 커지고 유능해짐에 따라, 과학자들은 이 경직되고 미리 잘려진 접근 방식이 그들을 제약하고 있는 것은 아닌지, 그리고 기계가 자신의 내부 논리에 더 부합하는 방식으로 스스로 텍스트를 자르는 법을 배울 수 있을지에 대해 의문을 갖기 시작했습니다.

취리히 연방 공과대학교(ETH Zurich)의 연구진은 아무런 사전 작성된 규칙 없이 인공지능이 처음부터 스스로 텍스트를 자르는 법을 배우도록 가르침으로써 그 질문에 답하기 위한 중요한 발걸음을 내디뎠습니다. 새로운 연구에서 그들은 컴퓨터 모델이 단순히 실수를 최소화하며 학습하는 과정만으로 텍스트 사이의 경계를 정확히 어디에 배치할지 결정하도록 훈련될 수 있음을 입증했습니다. 고정된 매뉴얼을 따르거나 공백과 문장 부호를 이용한 영리한 추측을 사용하는 대신, 모델은 동물이 미로를 통과하는 법을 배우는 것과 유사한 시행착오 방식을 사용합니다. 모델은 확률적으로 어디를 자를지 추측하고, 다음 부분의 텍스트를 얼마나 잘 예측하는지 확인한 뒤, 자신의 전략을 조정합니다. 만약 어떤 추측이 더 나은 예측으로 이어진다면 모델은 그 결정을 강화하고, 만약 혼란을 야기한다면 다른 방법을 시도합니다. 시간이 흐르면서 모델은 언어를 배우는 동시에 언어의 규칙을 스스로 깨우치며, 자신만의 최적화된 방식으로 언어를 분해하는 법을 발견하게 됩니다.

연구진은 모델이 이런 방식으로 학습하게 했을 때, 아무런 지시를 받지 않았음에도 불구하고 단어 사이의 공백이나 문장의 끝처럼 인간이 하는 것과 동일한 위치에 자연스럽게 절단선을 배치하기 시작한다는 것을 발견했습니다. 이는 모델에게 문법이나 언어 구조에 대한 구체적인 지침이 주어지지 않았음에도 일어난 일이었습니다. 1억 개 이상의 파라미터를 가진 데이터셋을 사용한 테스트에서, 이 자기 학습 방식은 다른 덜 직접적인 수학적 기법을 사용하여 경계를 학습하려 했던 이전의 방법들보다 더 효과적임이 증명되었습니다. 이 새로운 방법은 사전 지식이 없음에도 불구하고 기존의 수작업으로 만들어진 규칙 책에 의존하는 시스템의 성능과 일치했을 뿐만 아니라 더 나은 결과를 만들어냈습니다.

이 발견의 가장 놀라운 측면 중 하나는 모델이 효율적으로 행동하는 법을 배웠다는 점입니다. 모델은 일반적인 텍스트를 읽든 컴퓨터 코드를 이해하든, 자신의 특정 과업에 적합한 의미 있는 덩어리로 데이터를 묶는 법을 알아냈습니다. 연구진이 파이썬(Python) 코드로 모델을 테스트했을 때, 모델은 함수 이름의 시작 부분에서 새로운 덩어리를 시작하고 특정 공통 구절들을 함께 유지하는 법을 배웠으며, 이는 읽고 있는 코드의 구조를 직관적으로 파악하고 있음을 보여주었습니다. 이는 모델이 단순히 패턴을 암기하는 것이 아니라, 처리하는 텍스트의 의미와 일치하는 전략을 능동적으로 개발하고 있음을 시사합니다.

또한 이 연구는 이러한 종류의 학습을 어렵게 만들었던 주요 장애물인 '학습 신호의 노이즈' 문제를 다루었습니다. 텍스트를 자를지 말지의 결정은 이진 선택(binary choice), 즉 여기서 자를 것인가 말 것인가의 문제이기 때문에, 모델에게 정확히 어떻게 개선해야 하는지 알려주는 것은 수학적으로 매우 어렵습니다. 연구진은 에이전트가 보상과 처벌을 통해 학습하는 분야인 강화 학습의 기법을 빌려와 이 문제를 해결했습니다. 그들은 노이즈를 완화하는 방법을 도입하여, 모델이 긴 텍스트 구간에 걸쳐 어떤 구체적인 결정이 성공이나 실패의 원인이었는지 파악할 수 있도록 했습니다. 이를 통해 모델은 불가능할 정도로 방대한 컴퓨팅 파워를 필요로 하지 않고도 효과적으로 학습할 수 있었습니다.

현재의 실험은 특정 크기의 모델을 대상으로 수행되었지만, 그 결과는 인공지능의 미래에 대한 설득력 있는 비전을 제시합니다. 텍ext를 준비하기 위한 별도의 프로그래밍된 단계를 제거함으로써, 연구진은 언어 처리가 완전히 통합된 엔드 투 엔드(end-to-end) 학습 과정이 될 수 있음을 보여주었습니다. 모델은 단순히 말하는 법을 배우는 것이 아니라, 듣는 법과 주변 세상을 가장 효율적인 방식으로 파악하는 법을 배웁니다. 이 접근 방식은 결국 인간이 설계한 규칙 책이 존재하지 않는 언어나 데이터 유형까지도 다룰 수 있는 시스템으로 이어질 수 있으며, 인공지능을 더욱 적응력 있고 포용적으로 만들 것입니다. 이 연구는 기계에 데이터를 공급하는 방식의 경직되고 장인적인 설계가 곧, 기계가 자신만의 방식으로 세상을 읽는 법을 스스로 발견하는 더 유연한 방식으로 대체될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →