← 최신 논문
🤖 machine learning

Parity, Sensitivity, and Transformers

본 논문은 민감도 제약으로 인해 1 계층 트랜스포머가 패리티 태스크를 계산할 수 없음을 증명함으로써 1 계층 트랜스포머가 패리티 태스크를 계산할 수 있는지라는 미해결 문제를 해결하는 동시에, 길이 의존적 위치 인코딩이나 하드맥스와 같이 이전에 필수적이었던 비실용적 가정에 의존하지 않고 패리티를 해결하는 실용적인 4 계층 트랜스포머 구조를 제시합니다.

원저자: Alexander Kozachinskiy, Tomasz Steifer, Przemysław Wał\cega

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexander Kozachinskiy, Tomasz Steifer, Przemysław Wał\cega

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 경직된 로봇에게 **"패리티 게임 (The Parity Game)"**이라는 간단한 게임을 가르치려 한다고 상상해 보세요.

이 게임에서 로봇은 빨간색 (0) 과 파란색 (1) 으로 이루어진 긴 빛의 문자열을 보여줍니다. 로봇의 유일한 임무는 한 가지 질문에 답하는 것입니다:"파란색 빛의 총 개수가 짝수인가요, 아니면 홀수인가요?"

파란색 빛이 3 개라면 답은 "홀수"입니다. 4 개라면 답은 "짝수"입니다.

이것은 우리에게 쉬워 보이지만, **트랜스포머 (Transformer)**라는 특정 유형의 AI 아키텍처 (현대적인 챗봇과 번역기를 구동하는 기술) 에게는 이 게임이 미스터리였습니다. 과학자들은 논쟁해 왔습니다:이 로봇이 게임을 해결하려면 몇 단계의"생각 (layers)"이 필요한가?

이 논문이 발견한 바를 간단히 설명하면 다음과 같습니다:

1."한 단계 (One-Layer)"로봇은 너무 멍청합니다

저자들은 먼저 질문했습니다:"단 한 단계의 생각만 가진 트랜스포머가 이 게임을 해결할 수 있는가?"

그들은 답이 아니다임을 증명했습니다.

비유: 로봇이 빨간색 또는 파란색 카드를 들고 있는 사람들이 가득 찬 방에 서 있는 사람이라고 상상해 보세요. 그 사람은 모두를 한 번에 바라보고 빠른"평균"시선을 취할 수 있을 뿐입니다.

  • "패리티"게임은 매우 민감합니다. 단 사람의 카드를 빨간색에서 파란색으로 바꾸기만 해도 답이 완전히 뒤집힙니다 (짝수에서 홀수로).
  • 저자들은 한 단계 로봇이 너무"부드럽고""게으르다"고 보였습니다. 그것은 단일 변화에 날카롭게 반응할 수 없습니다. 허리케인 속에서 평균 풍속만 듣고 단일 핀이 떨어지는 소리를 감지하려는 것과 같습니다. 로봇의"민감도"는 게임을 해결하는 데 필요한 작고 중요한 변화를 포착할 만큼 너무 느리게 증가합니다.

판결: 이 문제를 해결하려면 적어도 두 단계의 생각이 필요합니다.

2."옛 해결책"에는 너무 많은 편법이 있었습니다

이 논문 이전까지 다른 과학자들은 게임을 해결할 수 있는 트랜스포머를 만드는 방법을 알아냈지만, 그들은 몇 가지"편법"이나 비현실적인 설정을 사용해야 했습니다:

  • "마법의 자": 그들은 로봇이 읽기 시작하기 전에 문자열의 정확한 길이를 아는 자를 주었습니다 (예:"이 문자열은 정확히 1,000 자입니다"). 실제 로봇은 보통 읽기를 끝낼 때까지 읽는 문장의 길이를 알지 못합니다.
  • "완벽한 스위치": 그들은 실제 로봇이 사용하는"부드럽고 모호한"확률 스위치 대신 즉각적인 이진 결정을 내리는"하드 스위치"를 사용했습니다.
  • "오류 제로"필터: 그들은 로봇의 숫자가 무한대로 폭발하는 것을 방지하는 안전 필터 (LayerNorm) 를 제거했습니다.

이러한 해결책은 이론적으로는 작동했지만, 실제 AI 학습에는 존재하지 않는 가정에 의존했기 때문에 현실 세계에서는 작동하지 않았습니다.

3. 새로운, 현실 세계의 해결책

이 논문의 저자들은 이러한 편법 없이 패리티 게임을 해결하는 새로운 로봇을 만들었습니다.

  • 마법의 자 없음: 그것은"길이 독립적"위치 인코딩을 사용합니다. 문자열의 총 길이를 미리 알 필요가 없으며, 서로에 대한 상대적인 위치만 보면 됩니다.
  • 부드러운 스위치: 그것은 실제 챗봇에서 사용되는 표준"부드러운"어텐션 (attention) 을 사용합니다.
  • 안전 필터: 안전 필터를 제거할 필요 없이 작동합니다.
  • 단점: 편법 없이 이렇게 하려면 로봇은 두 단계 대신 네 단계의 생각이 필요합니다.

비유:
옛날"편법"해결책을 테이블 아래에 숨겨진 정답 키를 엿봄으로써 퍼즐을 해결하는 마술사로 생각하세요.
새로운 해결책은 모든 단서를 신중하게 검토하고 상호 참조하며 조금 더 많은 작업 (두 단계 대신 네 단계) 을 수행함으로써 같은 퍼즐을 해결하는 명탐정 같습니다. 그것은 조금 더 느리고 더 많은"두뇌 능력"(깊이) 을 필요로 하지만, 마술 무대가 아닌 실제 법정에서 작동합니다.

획기적인 발견의 요약

  1. 하한선:한 단계만 가진 트랜스포머는 수학적으로 패리티 게임을 해결할 수 없습니다. 이는 학습 문제가 아닙니다. 로봇은 아키텍처상 그것을 할 수 없습니다.
  2. 상한선: 트랜스포머로 게임을 해결할 수는 있지만, 길이 의존적 트릭으로 속이거나 안전 필터를 제거하는 등 현실적인 방식으로 하려면 네 단계가 필요합니다.

이 논문은 본질적으로 모래 위에 명확한 선을 그었습니다:"현실적인 AI 에게 홀수와 짝수를 세게 하려면 최소한 네 단계의 깊이를 주십시오. 그보다 적으면 수학적으로 불가능합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →