← 최신 논문
🤖 machine learning

Efficient numeracy in language models through single-token number embeddings

본 논문은 IEEE 754 이진 부동소수점 표현에 기반한 새로운 단일 토큰 인코딩 전략인 BitTokens 를 소개하며, 이를 통해 언어 모델이 산술 알고리즘을 거의 완벽하게 학습하고 다중 토큰 숫자 분할이나 외부 도구에 의존하는 기존 방법보다 복잡한 수치 문제를 더 효율적으로 해결할 수 있게 합니다.

원저자: Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 다소 서투른 로봇에게 수학하는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 **대형 언어 모델 (LLM)**입니다. 현재 이 로봇에게 두 개의 큰 수를 곱하라고 요청하면, 로봇은 단순히 답을 "알고" 있는 것이 아닙니다. 대신 스스로와 대화하며 단계별 지시를 작성하고, 작업을 반복해서 점검하는 방식으로 답을 찾아냅니다.

이 논문은 이러한 "스스로와 대화하는" 방식이 극도로 비효율적이라고 주장합니다. 마치 4,314.97×4,080,0004,314.97 \times 4,080,000을 계산할 때, 단순히 하나의 숫자를 얻기 위해 모든 단계를 설명하는 10 페이지 분량의 에세이를 작성하도록 요구하는 것과 같습니다. 로봇은 기본적인 산술 연산을 수행하기 위해 막대한 양의 "두뇌 공간"(토큰) 을 소모하여, 더 어려운 문제를 해결할 여지가 없게 됩니다.

문제: "단어별" 수학의 함정

현재 이러한 로봇들은 숫자를 단어와 동일하게 취급합니다. "4,080,000"이라고 입력하면 로봇은 이를 책의 글자를 한 글자씩 읽듯, 별도의 조각들 (토큰) 의 긴 문자열로 인식합니다.

  • 비유: "123"이라는 숫자를 "1", "2", "3"이라는 세 개의 별도 글자로 읽으며 수학을 하려 한다고 상상해 보세요. 이를 더하려면 각 글자를 개별적으로 처리하고, 십의 자리에서 "1"을 올림해야 하는 등 번거로운 과정을 거쳐야 합니다. 이는 느리고, 어색하며, 오류가 발생하기 쉽습니다.

이로 인해 로봇은 간단한 곱셈 문제를 해결하기 위해 수천 개의 단어로 된 "추론"을 생성해야만 합니다.

해결책: "마법 신분증" (BitTokens)

저자들은 로봇에게 숫자를 가르치는 새로운 방식을 제안하는데, 이를 BitTokens라고 부릅니다.

숫자를 조각으로 나누는 대신, BitTokens 는 모든 숫자에 단일하고 고유한 신분증을 부여합니다.

  • 비유: 숫자를 읽어야 하는 문장이 아니라, 팔레트의 특정 색상으로 생각하세요. "빨간색"을 "파란색과 노란색의 혼합"이라고 설명하는 대신, 로봇에게 빨간색 그 자체인 단일 카드를 건네는 것입니다.
  • 작동 원리: 이들은 컴퓨터가 숫자를 저장하는 표준 방식 (소수점 저장 방식에 대한 보편적인 설계도인 IEEE 754) 을 활용합니다. 그리고 이 설계도를 단일 토큰 (로봇에게 하나의 "단어") 으로 변환합니다.
  • 결과: 로봇이 4,080,000 이라는 숫자를 볼 때, 긴 숫자 문자열을 보는 것이 아닙니다. 대신 그 숫자의 크기, 정밀도, 부호에 대해 필요한 모든 정보를 즉시 알려주는 단 하나의 기호를 보게 됩니다.

이것이 중요한 이유

이 논문은 (간단하고 통제된 상태를 유지하기 위해) 작은 로봇 모델들을 대상으로 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  1. 속도와 효율성: BitTokens 를 사용하면 로봇이 수학을 하기 위해 10 페이지 분량의 에세이를 작성할 필요가 없습니다. 기본 덧셈, 곱셈, 나눗셈을 거의 완벽하게 단일 단계로 해결할 수 있습니다.
  2. 알고리즘 학습: 숫자가 컴퓨터 칩과 마찬가지로 이진 비트를 사용하여 구조화되고 논리적으로 인코딩되기 때문에, 로봇은 실제로 수학의 규칙을 "학습"할 수 있습니다. 이는 아이에게 "5"를 세는 법을 가르칠 때, 매번 다섯 개의 개별 자갈을 세게 하는 대신 "5"에 해당하는 단일 블록을 주는 것과 같습니다.
  3. 절충점: 논문은 매우 복잡하고 다단계인 문제들 (예: 거대한 숫자 목록의 표준 편차 계산) 의 경우, 단일 토큰 방식이 로봇이 한 번에 수행할 수 있는 "사고"의 깊이에 의해 여전히 제한된다고 지적합니다. 그러나 표준 산술 연산의 경우, 이는 기존 방식보다 훨씬 우수했습니다.

이 논문이 주장하지 않는 것

저자들이 실제로 말한 내용에 충실하는 것이 중요합니다.

  • 그들은 이것이 즉시 의료 진단이나 금융 조언을 해결할 것이라고 주장하지 않았습니다.
  • 그들은 이것이 세계에서 가장 크고 비싼 모델들에서도 작동한다고 주장하지 않았습니다 (그들은 작고 "나노" 모델들에서 이를 테스트했습니다).
  • 그들은 추론을 완전히 중단해야 한다고 말하지 않았습니다. 대신 기본 수학을 효율적으로 만들어 로봇이 정말 어려운 문제들을 위해 추론을 사용할 수 있는 더 많은 "두뇌 공간"을 확보할 수 있도록 제안합니다.

결론

이 논문은 AI 모델들이 기본 수학에서 넘어지지 않도록 해주는 숫자를 위한 새로운 "언어"를 소개합니다. 숫자에 긴 엉망진창인 설명 대신 단일하고 효율적인 "신분증"을 부여함으로써, 이러한 모델들은 더 빠르고, 정확하게, 그리고 낭비되는 노력 없이 계산할 수 있게 됩니다. 이는 AI 가 숫자의 세계를 "보는" 방식에 대한 근본적인 업그레이드입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →