← 최신 논문
🤖 machine learning

The Discrete-Log Clock: How a Transformer Learns Modular Multiplication

이 논문은 트랜스포머가 모듈로 곱셈을 학습할 때 나타나는 겉보기 복잡성이 잘못된 분석적 기저를 사용한 데서 비롯된 인위적인 결과임을 입증하며, 이들이 곱셈의 성질을 가진 캐릭터(character) 공간 내에서 곱셈을 덧셈으로 환원함으로써 실제로는 희소하고 해석 가능한 "이산 로그 시계(Discrete-Log Clock)" 알고리즘을 구현하고 있음을 밝힌다.

원저자: Huu Danh Nguyen (Stanford University)

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Huu Danh Nguyen (Stanford University)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 미스터리: 왜 AI는 "혼란"스러워 보였을까?

로봇에게 수학을 가르치고 있다고 상상해 보세요. 구체적으로, 당신은 로봇에게 모듈로 곱셈(두 수를 곱한 뒤 특정 숫자(예: 113)로 나눈 나머지만 남기는 것)을 가르치고 싶습니다.

오랫동안 과학자들은 이상한 점을 발견했습니다. 로봇이 마침내 문제를 "깨우쳤을" 때(단순히 답을 암기하는 단계를 넘어 규칙을 이해하게 되는 현상을 **그로킹(grokking)**이라고 합니다), 로봇의 내부 수학 구조가 매우 무질서해 보였던 것입니다.

  • 기존의 관점: 과학자들이 표준 도구를 사용하여 로봇의 뇌를 들여다보았을 때, 그들은 '조밀한(dense)' 혼돈을 보았습니다. 마치 로봇이 문제를 해결하기 위해 가능한 모든 소리의 주파수를 다 사용하고 있는 것처럼 보였습니다. 이는 단순한 덧셈을 해결할 때 보여주었던 깔끔하고 조직적인 모습과는 달리, 매우 혼란스럽고 이해하기 어려워 보였습니다.
  • 문제점: 과학자들은 잘못된 안경을 쓰고 로봇의 뇌를 보고 있었습니다. 그들은 덧셈을 위해 설계된 "표준 자"를 사용하고 있었지만, 로봇은 실제로 곱셈을 하고 있었던 것입니다.

해결책: 렌즈를 바꾸다

이 논문의 저자들은 곱셈을 이해하려면 숫자를 있는 그대로(1, 2, 3...) 보는 것을 멈추고, 숫자를 생성원(generator)의 거듭제곱으로 보기 시작해야 한다는 것을 깨달았습니다.

이렇게 생각해보세요:

  • 표준 관점 (덧셈): 1부터 12까지 적힌 시계 판을 상상해 보세요. 1을 더하면 한 칸 움직입니다. 이것은 보기 쉽습니다.
  • 숨겨진 관점 (곱셈): 이제 시계 위의 숫자들이 뒤섞여 있다고 상상해 보세요. 숫자 "1"은 사실 "3"이고, 숫자 "2"는 "9"이며, 이런 식입니다. 이 뒤섞인 세계에서는 곱셈이 실제로는 덧셈과 똑같이 작동합니다.

이 논문은 이를 **"이산 로그 시계(Discrete-Log Clock)"**라고 부릅니다. 이는 복잡한 곱셈 문제를 단순한 덧셈 문제로 변환하는 비밀 코드와 같습니다.

그들이 발견한 것 ("아하!"의 순간)

연구진이 이 새로운 "뒤섞인" 렌즈(저자들은 이를 **곱셈적 특성 변환(multiplicative character transform)**이라 부릅니다)를 사용하여 로봇의 뇌를 재검토했을 때, 혼돈은 사라졌습니다.

  1. 노이즈가 신호가 되다: 무질서하고 조밀한 스펙트럼을 보는 대신, 그들은 매우 깨끗하고 희소한(sparse) 패턴을 발견했습니다. 로봇은 모든 주파수를 사용하는 것이 아니라, 수학을 하기 위해 오직 4개의 특정 주파수만을 사용하고 있었습니다. 이는 마치 소음 가득한 방 안에서 단 하나의 맑은 멜로디를 찾아낸 것과 같았습니다.
  2. 뉴런이 조직화되다: 로봇에게는 수천 개의 작은 처리 장치(뉴런)가 있습니다. 기존의 관점에서는 이들이 무작위로 보였습니다. 하지만 새로운 관점에서 보면, 97%의 뉴런이 정확히 그 4개 주파수 중 하나에 맞춰져 있었습니다. 그들은 마치 모든 가수가 어떤 음을 내야 할지 정확히 알고 있는 합창단과 같았습니다.
  3. 패턴의 출현: 데이터를 이 비밀 코드를 바탕으로 재배열했을-때, 로봇의 내부 활동은 완벽한 대각선 줄무늬를 형성했습니다. 이는 로봇이 특정 기술을 학습했음을 증명했습니다:
    • 1단계: 숫자를 "비밀 코드"(이산 로그)로 변환합니다.
    • 2단계: 코드를 함께 더합니다(일반적인 덧셈처럼).
    • 3단계: 결과를 다시 일반적인 숫자로 변환합니다.

"시계" 비유

이 논문은 덧셈에 사용되는 유명한 "시계 알고리즘(Clock Algorithm)"에 비유합니다.

  • 덧셈의 경우: 로봇은 시계 바늘을 회전시키는 법을 배웁니다.
  • 곱셈의 경우: 로봇은 다른 종류의 시계(이산 로그 시계)의 바늘을 회전시키는 법을 배웁니다. 일단 이 특별한 시계의 바늘을 회전시키면, 정답이 바로 그곳에 나타납니다.

이전의 과학자들은 왜 놓쳤을까?

당신이 노래를 들으려고 하는데, 베이스 소리만 통과시키는 노이즈 캔슬링 헤드폰을 쓰고 있다고 상상해 보세요. 당신은 쿵쾅거리는 무질서한 소리를 듣고 "이 노래는 그냥 소음일 뿐이야"라고 결론 내릴 것입니다.

이전의 연구자들은 그런 "헤드폰"(표준 수학 도구)을 쓰고 있었습니다. 그들은 "쿵쾅거리는 소리"(조밀한 스펙트럼)를 보고서 로봇이 복잡하고 설명할 수 없는 방법을 사용하고 있다고 생각했습니다. 저자들은 단순히 헤드폰을 벗고, 올바른 주파수로 전환하여, 로봇이 사실은 아름답고 단순한 멜로디를 연주하고 있었다는 것을 깨달았습니다.

핵심 요약

이 논문의 주요 교훈은 단순히 수학에 관한 것이 아니라, 우리가 사물을 바라보는 방식에 관한 것입니다.

  • 교훈: 복잡한 시스템(AI나 집단 같은)을 이해하려고 한다면, 반드시 그 작업에 맞는 올바른 "언어"나 "기저(basis)"를 사용하고 있는지 확인해야 합니다.
  • 결과: 분석 도구를 실제 문제의 구조(이 경우에는 곱셈을 위한 "곱셈적" 렌즈 사용)와 일치시키면, 무질서하고 설명할 수 없는 소음은 명확하고 단순하며 이해 가능한 알고리즘으로 변합니다.

로봇은 수학을 하는 새롭고 신비로운 방법을 발명한 것이 아닙니다. 그저 어려운 문제를 쉬운 문제로 바꾸는 비밀 코드를 찾아냈을 뿐이며, 연구자들은 마침로 그 코드를 읽는 법을 알아낸 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →