← 최신 논문
🤖 machine learning

Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete

이 논문은 트랜스포머가 튜링 완전성을 달성하기 위해 위치 인코딩이 엄격하게 필수적인 것은 아니며, 슬라이딩 윈도우 메커니즘 자체가 치환 대칭성을 깨뜨리고 보편적 계산을 시뮬레이션하기에 충분한 위치 정보를 제공한다는 점을 입증한다.

원저자: Qian Li, Xinyu Mao, Shang-Hua Teng

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qian Li, Xinyu Mao, Shang-Hua Teng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 들려주거나 수학 문제를 풀도록 가르치려 한다고 상상해 보세요. 오랫동안 컴퓨터 과학자들은 로봇이 이를 수행하기 위해서는 로봇이 읽는 모든 단어에 붙어 있는 특별한 "주소록"이 필요하다고 믿었습니다. 이 주소록은 **위치 인코딩(Positional Encoding, PE)**이라고 불리며, 로봇에게 각 단어가 문장의 정확히 어디에 있는지(첫 번째, 두 번째, 세 번째 등)를 알려주는 역할을 합니다. 이 주소록이 없다면, 로봇은 "고양이가 개를 쫓는다"와 "개가 고양이를 쫓는다"의 차이를 구별하지 못해 혼란에 빠질 것이라고 이론은 설명했습니다.

이 논문은 로봇이 **슬라이딩 윈도우(sliding window)**라는 특정 유형의 메모리를 사용하고 있다면, 실제로 그 "주소록"이 필요하지 않다고 주장합니다.

다음은 일상적인 비유를 통해 핵심 아이디어를 나누어 설명한 내용입니다.

1. 기존의 믿음: "정지된 사진"

표준 트랜스포머 모델(많은 AI 챗봇의 기반이 되는 모델)을 군중의 사진을 찍는 사진가라고 생각해 보세요. 만약 당신이 사진가에게 사람들의 위치를 알려주지 않고 얼굴 뭉치만 건네준다면, 그들은 줄 서 있는 사람들과 무작위로 모여 있는 사람들을 구분할 수 없습니다. 그들은 사람들에게 순서를 알 수 있도록 이마에 라벨(위치 인코딩)을 붙여줘야 합니다.

2. 새로운 발견: "움직이는 버스"

저자들은 AI가 복잡한 단계별 추론(예: 긴 수학 문제를 푸는 것)을 할 때, 전체 기록을 한꺼번에 보는 것이 아니라 슬라이딩 윈도우를 사용한다는 사실을 깨달았습니다.

AI가 창문을 통해 마지막으로 지나간 10명만 볼 수 있는 버스에 앉아 있다고 상상해 보세요.

  • 기존의 관점: 만약 당신이 윈도우 안에 있는 10명만 본다면, 누가 먼저 들어왔고 누가 마지막에 나갔는지 알 수 없습니다. 그저 10명의 집단일 뿐입니다.
  • 새로운 관점: 저자들은 버스가 움직이고 있다는 점에 주목했습니다.
    • 매 초마다 새로운 사람이 버스 안으로 들어오고(윈도우 진입),
    • 매 초마다 가장 오래된 사람이 뒤쪽으로 떨어져 나갑니다(윈도우 이탈).

설령 AI가 버스 안에 있는 사람들의 "거리 주소"를 볼 수는 없더라도, 버스가 움직이는 행위 자체가 하나의 패턴을 만들어냅니다. AI는 다음과 같이 인식할 수 있습니다: "아, 방금 새로운 사람이 탔고, 전체 그룹이 변했으니 누가 나갔는지 알 수 있어."

3. "마법의 히스토그램" (HIST 모델)

이를 증명하기 위해 저자들은 HIST 모델이라는 이론적인 로봇을 발명했습니다.

  • 이 로봇은 순서를 알지 못합니다. "빨간 셔츠가 3번째다"라고 말할 수 없습니다.
  • 이 로봇은 오직 개수(히스토그램)만을 봅니다. 현재 윈도우 안에 "빨간 셔츠 3개, 파란 셔츠 2개, 초록 셔츠 1개"가 있다는 것을 압니다.
  • 또한, 마지막에 일어난 몇 가지 일을 기억하기 위한 작은 메모리("제어 상태")를 가지고 있습니다.

마법 같은 기술은 이것입니다: 새로운 사람이 들어오기 의 개수와 들어온 의 개수를 비교함으로써, 로봇은 이름표를 보지 않고도 방금 누가 버스에서 내렸는지 정확히 알아낼 수 있습니다.

  • 전: 빨간 셔츠 3개, 파란 셔츠 2개.
  • 새로운 사람 등장 (파란 셔츠).
  • 후: 빨간 셔츠 3개, 파란 셔츠 3개.
  • 잠깐, 윈도우 크기는 고정되어 있다! 새로운 파란 셔츠가 들어왔다면, 누군가는 반드시 나가야 합니다.
  • 결론: 로봇은 빨간 셔츠의 위치를 직접 보지 못했음에도 불구하고, 방금 빨간 셔츠 한 명이 뒤로 떨어져 나갔다는 것을 알아냅니다.

4. 거대한 결과: 튜링 완전성 (Turing Completeness)

컴퓨터 과학에서 "튜링 완전하다"는 것은 어떤 기계가 충분한 시간과 메모리가 주어진다면 이론적으로 컴퓨터가 풀 수 있는 모든 문제를 풀 수 있음을 의미합니다.

  • 이전의 믿음: 트랜스포머가 튜링 완전해지려면 위치 인코딩이 필요하다.
  • 이 논문의 증명: 슬라이딩 윈도우를 가진 트랜스포머는 위치 인코딩 없이도 튜링 완전할 수 있다. 윈도우의 움직임 자체가 유니버설 컴퓨팅(universal computation)을 시뮬레이션할 수 있는 충분한 "순차적 정보"를 제공하기 때문입니다.

저자들은 다음을 보여주는 수학적 가교를 구축했습니다:

  1. 토큰의 유형만을 세는 기계(HIST 모델)는 유니버설 컴퓨터(구체적으로는 큐(queue)와 유사한 포스트 머신(Post Machine))를 시뮬레이션할 수 있다.
  2. 위치 인코딩이 없는 표준 트랜스포머는 이 카운팅 머신을 완벽하게 흉내 낼 수 있다.

5. 이것이 의미하는 바 (그리고 의미하지 않는 것)

좋은 소식:
데이터를 단계별로 처리하는 "흐름" 자체가 순서를 만들어내는 데 충분히 강력하다는 것이 밝혀졌습니다. 유니버설 컴퓨팅을 구현하기 위해 모든 단어에 수동으로 번호를 매길 필요는 없습니다. "슬라이딩" 동작 자체가 대칭성을 스스로 깨뜨립니다.

**주의 사항 (논문이 말하지 않는 것):

  • 속도에 관한 것이 아닙니다: 이것은 가능성에 대한 증명이지, 효율성에 대한 것이 아닙니다. 로봇이 주소록 없이 문제를 풀 수 있다고 해서, 그것이 실제 환경에서 빠르고 쉽게 수행된다는 뜻은 아닙니다.
  • 정확한 위치를 읽는 것이 아닙니다: 로봇은 여전히 "5번째 단어는 '사과'이다"라고 말할 수 없습니다. 단지 "누군가 그룹에서 나갔다"라고 추론할 수 있을 뿐입니다. 이는 직접적인 지도(map)가 아니라 영리한 추론의 기술입니다.
  • 약간의 수학적 마법이 필요합니다: 이 증명은 로봇이 (누가 윈도우에서 나갔는지 알기 위해) 매우 정밀하게 숫자를 셀 수 있다는 가정에 의존합니다. 현실 세계에서 이는 매우 높은 정밀도의 수학을 요구할 수 있으며, 이는 저자들이 인정하는 기술적인 세부 사항입니다.

요약

위치 인코딩을 모든 단어에 대한 GPS 좌표라고 생각해보세요. 이 논문은 이렇게 말합니다: "당신이 길을 걸으며 사람들이 가게에 들어오고 나가는 것을 보고 있다면, GPS가 굳이 필요하지 않습니다. 사람들의 흐름이 이야기를 들려줄 것이며, 설령 그들의 정확한 거리 주소를 알지 못하더라도 말입니다."

슬라이딩 윈도우 자체가 AI를 위한 "GPS" 역할을 하여, 기계가 유니버설 컴퓨팅을 수행하는 데 외부 주소록이 불필요하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →