← 최신 논문
💻 computer science

Twos All the Way Down: A Hidden Condition Every Deployed RoPE Schedule Satisfies

이 논문은 모든 RoPE 주파수의 쌍별 구별성을 요구하는 이전에 명시되지 않았던 "max_cluster = 1" 조건을 식별하고 검증하며, 추론 시에 이 암묵적인 제약을 위반하는 것이 대규모 언어 모델에서 치명적인 성능 저하를 일으킨다는 점을 입증하는 동시에, 표준 기하학적 스케줄이 그 로그 밑수의 초월적 성질 덕분에 본질적으로 이를 충족함을 증명한다.

원저자: Sungmin Ryu

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sungmin Ryu

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델(챗봇을 구동하는 것과 같은)을 하나의 노래를 연주하려는 거대한 오케스트라라고 상상해 보십시오. 음악의 박자를 맞추기 위해서, 모든 악기는 시퀀스 내에서 자신이 어디에 위치해 있는지 정확히 알아야 합니다. 현대 AI에서 이 "박자 맞추기"는 RoPE(Rotary Position Embedding)라고 불리는 시스템에 의해 처리됩니다.

RoPE를 AI의 두뇌 속에 들어 있는 일련의 메트로놈이라고 생각해 보십시오. 각 메트로놈은 서로 다른 속도로 똑딱거립니다. 어떤 것은 매우 느리게(느린 드럼 비트처럼) 똑딱거리고, 어떤 것은 믿을 수 없을 정도로 빠르게(높은 음조의 바이올린 트릴처럼) 똑딱거립니다. AI는 이 서로 다른 속도들을 사용하여 "첫 번째 단어", "열 번째 단어", 그리고 "천 번째 단어"의 차이를 이해합니다.

*"Twos All the Way Down"*이라는 제목의 이 논문은 모든 성공적인 AI 오케스트라가 따르는 숨겨진 규칙을 발견하고, 실수로 그 규칙을 어겼을 때 어떤 일이 발생하는지 설명합니다.

숨겨진 규칙: "두 개의 메트로놈이 정확히 같은 속도로 똑딱거려서는 안 된다"

저자들은 모든 작동하는 AI 모델에서 모든 메트로노는 반드시 고유한 속도를 가져야 한다는 사실을 발견했습니다. 설령 두 속도가 매우 가깝더라도, 결코 정확히 같아서는 안 됩니다.

이 논문은 이 규칙을 max_cluster = 1이라고 부릅니다. 쉬운 말로 하면, "중복은 없다"는 뜻입니다.

만약 64개의 메트로놈이 있다면, 반드시 64개의 서로 다른 속도를 가져야 합니다. 만약 두 개가 우연히 정확히 같은 속도로 똑딱거린다면, AI는 혼란에 빠집니다.

실험: 규칙을 어기면 어떻게 될까?

연구진은 두 개의 유명한 실제 AI 모델(Mistral-7B 및 Qwen2.5-7B)을 가져와 테스트 중에 의도적으로 규칙을 깨뜨림으로써 이를 테스트했습니다. 그들은 한 그룹의 메트로놈이 정확히 같은 속도로 똑딱거리도록 강제하여, 동일한 주파수의 "클러스터(집단)"를 만들었습니다.

결과? 완전한 혼돈.

  • 대참사: 이 중복된 값들을 만들었을 때, 텍스트를 이해하는 AI의 능력이 붕식되었습니다. AI의 "퍼플렉시티(perplexity, 당혹도/혼란도 측정치)"가 치솟았습니다. 어떤 경우에는 AI가 다음 단어를 예측하는 능력이 214배나 더 나빠졌습니다. 이는 마치 오케스트라가 갑자기 리듬을 잊어버리고 뒤섞인 소음의 덩어리를 연주하는 것과 같았습니다.
  • 대조군: 연구진은 다른 트릭도 시도했습니다. 속도를 약간 변경하되 모두 고유하게 유지하는 방식이었습니다. AI는 이를 눈치채지 못했습니다. AI는 이전과 다름없이 잘 작동했습니다.
  • 교훈: 문제는 숫자가 "거칠거나" "품질이 낮은" 것이 아니었습니다. 문제는 순수하게 구조적인 것이었습니다. 속도가 고유하기만 하면 AI는 괜찮았습니다. 하지만 두 속도가 동일해지는 순간, AI는 망가졌습니다.

왜 이런 일이 발생하는가? (The "Sub-Trajectory" 비유)

AI의 두뇌를 거대한 다차원 댄스 플로어 위에서 움직이는 무용수라고 상상해 보십시오.

  • 훈련: 훈련 과정에서 무용수는 이 플로어 위에서 매우 구체적이고 복잡한 패턴을 따라 움직이는 법을 배웁니다. 이 패턴은 메트로놈의 고유한 속도들에 의해 결정됩니다.
  • "중복"의 재앙: 두 메로놈이 같은 속도로 똑딱거리도록 강제하면, 사실상 두 차원의 댄스 플로어를 하나로 붙여버리는 것과 같습니다. 무용수는 이제 복잡한 3D 형상이 아닌, 직선이나 평면 위에서 움직여야만 합니다.
  • 충돌: AI는 이 평평하게 붙여진 바닥 위에서 춤추는 법을 배운 적이 없습니다. AI가 그곳에서 춤을 추려고 할 때, 발을 헛디디고 넘어집니다. "혼란"은 AI가 자신의 복잡한 훈련 내용을 단순화되고 망가진 현실에 적용하려고 할 때 발생합니다.

표준 설계의 "마법"

여러분은 이렇게 물을 수도 있습니다: "왜 모든 AI 모델이 이런 식으로 망가지지 않나요? 왜 그들은 제대로 작동하나요?"

논문은 엔지니어들이 이 메트로놈을 만드는 표준적인 방식(100,000과 같은 베이스 숫자를 사용하는 특정 수학적 공식 활용)에 내장된 안전 장치가 있다고 설명합니다.

**헤르미트-린데만 정리(Hermite–Lindemann theorem)**라는 심오한 수학적 원리 덕분에, 표준 공식이 우연히 두 개의 동일한 속도를 만들어내는 것은 수학적으로 불가능합니다. 이 숫자들은 그것들이 절대 완벽하게 일치할 수 없음을 보장하는 "초월적(transcendental)"인 성질을 가지고 있습니다. 이는 마치 절대로 걸리지 않도록 수학적으로 보장된 자물쇠와 같습니다.

이 논문은 이 "마법"이 표준 모델들이 작동하는 유일한 이유임을 증명합니다. 모델들은 단순히 운이 좋은 것이 아니라, 수학이 그들에게 고유한 속도를 갖도록 강제하고 있는 것입니다.

AI를 망가뜨리는 두 가지 다른 방법

또한 논문은 AI의 시간 측정이 실패하는 데에는 두 가지 서로 다른 방식이 있으며, 이들은 스펙트럼의 양 끝단에서 발생한다는 점을 명시합니다.

  1. "너무 느린" 실패 (저점 측면):

    • 문제: 일부 메트로놈이 너무 느리게 똑딱거려서 훈련 세션 동안 단 한 번의 전체 사이클도 완료하지 못합니다. AI는 긴 텍스트를 위해 이들을 사용하는 법을 배우지 못합니다.
    • 해결책: 메트로놈이 더 빠르게 똑딱거리게 만듭니다 (베이스 숫자를 변경).
    • 위치: 이는 "느린" 메트로놈들에 영향을 미칩니다.
  2. "중복" 실패 (고점 측면 - 이 논문의 주제):

    • 문제: "빠른" 메트로놈들(AI가 세부 사항을 파악하는 데 사용하는 것들)이 실수로 동일한 속도로 똑딱거리게 됩니다.
    • 해결책: 어떤 두 속도도 결코 동일하지 않도록 보장합니다.
    • 위치: 이는 "빠른" 메트로놈들에 영향을 미칩니다.

시사점

이 논문은 AI의 숨겨된 "안전 코드"를 드러냅니다: 고유성(Uniqueness)은 타협할 수 없는 조건입니다.

이 모델들의 표준 설계가 작동하는 이유는 수학이 자연스럽게 두 개의 시간 측정기가 동일한 속도를 갖지 않도록 방지하기 때문입니다. 만약 이 규칙을 깨뜨린다면—실수로든, 혹은 모델의 메모리를 압축(양자화)하려는 시도 때문이든—여러분은 단순히 조금 더 성능이 낮은 AI를 얻는 것이 아니라, 시간과 맥락에 대한 감각을 완전히 상실한 모델을 얻게 됩니다.

저자들은 우리가 어떻게 속도를 고유하게 유지할 수 있는지(표준 공식을 사용하는 법)는 알고 있지만, 왜 AI가 단어들을 구별하기 위해 "빠른" 메트로놈들에 그토록 크게 의존하는지, 그리고 왜 그 고유성을 깨뜨리는 것이 그토록 거대한 붕괴를 초래하는지에 대해서는 여전히 정확히 이해할 필요가 있다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →