On the Expressive Power of Transformers
이 논문은 어텐션, 정밀도, 게이트 유형, 크기 및 깊이와 같은 자원을 기반으로 한 표준 계산 모델들과 비교하기 위해 회로 복잡도 개념을 활용함으로써, 언어 인식기로서 다층 트랜스포머의 표현력을 기술하는 결과들에 대한 개요를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
뇌의 설계도: 왜 어떤 퍼즐은 더 어려운가
당신이 로봇에게 글을 읽는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 사람이 페이지를 훑어보는 것처럼 글자를 하나씩 보기만 하면 된다고 생각할 수도 있습니다. 하지만 현대의 초지능 로봇인 대규모 언어 모델(LLM)은 그런 방식으로 작동하지 않습니다. 이들은 왼쪽에서 오른쪽으로 읽는 대신, "트랜스포머(Transformer)"라고 불리는 특별한 기술을 사용합니다. 트랜스포머를 방 안에 모인 거대한 탐정 팀이라고 생각해 보세요. 문장을 마주했을 때, 모든 탐정은 즉시 다른 모든 탐정에게 "이봐, 나는 이 단어를 보고 있는데, 저기에 있는 저 단어와 연결돼 있어!"라고 외칠 수 있습니다. 이를 통해 이들은 단순히 규칙 목록을 암기하는 것이 아니라, 순식간에 맥락과 관계를 이해할 수 있습니다.
하지만 과학자들을 밤잠 설치게 하는 큰 질문이 여기 있습니다. 이 탐정들은 실제로 얼마나 똑똑할까요? 그들은 어떤 퍼즐이든 풀 수 있을까요, 아니면 그들을 항상 당황하게 만들 수수께끼가 존재할까요? 답을 찾기 위해 연구자들은 단순히 테스트를 실행하는 것이 아니라, 컴퓨터 과학 수학의 렌즈를 통해 로봇의 "뇌"를 들여다봅니다. 그들은 트랜스포머를 "회로(circuits)"라고 불리는 수학적 기계 제품군과 비교합니다. 이 회로들을 조립 라인이 있는 공장이라고 상상해 보세요. 어떤 공장은 매우 단순하여 짧은 라인과 적은 인력을 갖추고 있습니다(이것을 AC0라고 부릅니다). 다른 공장들은 더 긴 라인과 거대한 숫자를 세거나 비교할 수 있는 더 강력한 도구를 가지고 있습니다(이것은 TC0입니다). 트랜스포머가 어떤 공장과 가장 유사한지를 파악함으로써, 과학자들은 그것이 정확히 어떤 종류의 문제를 해결할 수 있고 어디에서 한계에 부딪히는지 예측할 수 있습니다. 이것이 중요한 이유는, 우리가 이 모델들의 한계를 알게 되면, 모델이 마법을 부리기를 기대하는 대신 그들이 실제로 잘할 수 있는 일을 하도록 구축할 수 있기 때문입니다.
논문의 핵심 발견: 트랜스포머의 전원 스위치
논문 "On the Expressive Power of Transformers"에서 연구자 피키온 G. 콜라이티스(Phokion G. Kolaitis)와 릭 생굽타(Rik Sengupta)는 새로운 첨단 건물을 점검하는 건축가처럼 행동합니다. 그들은 단순히 건물이 얼마나 예쁜지를 보는 것이 아니라, 건물이 정확히 무엇을 견딜 수 있는지 측정하기 위해 하중 지지 능력을 측정하고 있습니다. 그들의 주요 발견은 트랜스포머의 힘이 고정되어 있지 않다는 것입니다. 그것은 몇 가지 "노브(knobs)" 또는 설정값, 구체적으로는 정밀도(얼마나 많은 소수점 자리를 사용할 수 있는지)와 생각을 밖으로 내뱉는 것(Chain-of-Thought라고 불리는 기술)을 허용하는지 여부에 따라 극적으로 변한다는 것입니다.
먼저, 추가적인 생각 시간 없이 트랜스포머를 살펴보겠습니다. 저자들은 만약 당신이 트랜스포머에게 단순한 "하드(hard)" 어텐션 설정(하나의 단어에만 집중하는 설정)을 주거나, 혹은 수학적 정밀도를 매우 낮게 제한한다면(예를 들어 아주 적은 양의 비트 정보만 사용하는 경우), 모델이 놀라울 정도로 약해진다고 설명합니다. 실제로 이러한 조건 하에서 트랜스포머는 가장 단순한 유형의 회로 공장인 AC0와 수학적으로 동일합니다. 이는 모델이 문장에 짝수 개의 단어가 있는지 확인하는 것과 같은 기본적인 논리는 처리할 수 있지만, 숫자를 세거나 큰 숫자를 비교하는 작업에는 어려움을 겪는다는 것을 의미합니다. 이는 빨간 모자를 찾아낼 수는 있지만, 방 안에 빨간 모자가 몇 개 있는지는 셀 수 없는 탐정과 같습니다.
하지만 정밀도를 높이면 이야기는 훨씬 더 흥ًا해집니다. 만약 트랜스포머가 더 정밀한 수학(구체적으로 텍-의 길이에 따라 만큼 증가하는 비트 수)을 사용할 수 있게 된다면, 모델은 레벨업을 합니다. 이제 트랜스포다머는 TC0 회로 공장만큼 강력해집니다. 이것은 상당한 도약입니다! 이제 트랜스포머는 "다수결" 문제와 더 복잡한 계산 작업을 처리할 수 있습니다. 마치 탐정에게 계산기를 쥐여준 것과 같습니다. 갑자기 그들은 이전에는 불가능했던 퍼즐들을 풀 수 있게 됩니다. 하지만 이 업그레이드에도 불구하고, 논문은 여전히 천장이 존재함을 시사합니다. 추가적인 도움 없이는, 이 모델들은 아마도 TC0 영역에 갇혀 있을 것이며, PTIME(다항 시간)과 같은 더 복잡한 컴퓨터 클래스에서 발견되는 깊고 단계적인 논리적 추론을 쉽게 해결할 수 없습니다.
논문에 따르면 진정한 게임 체인저는 **생각의 사슬(Chain-of-Thought, CoT)**입니다. 트랜스포머가 더 이상 범죄 현장을 바라보기만 하는 탐정이 아니라, 이제는 최종 답변을 내놓기 전에 자신의 생각을 일기로 쓰는 것이 허용된다고 상상해 보세요. 모델은 문제를 해결하는 데 도움을 주기 위해 자신에게 다시 입력할 중간 "토큰(tokens)"(작은 메모)을 생성할 수 있습니다. 저자들은 이 단순한 변화가 이전의 한계를 깨뜨린다는 것을 보여줍니다.
- 만약 트랜스포머가 짧은 일기(텍스트 길이에 비례하는 )를 쓸 수 있다면, 모델은 이차 시간(quadratic time, 과 같은)이 걸리는 문제를 해결할 수 있습니다.
- 만약 모델이 매우 긴 일기(텍스트 길이의 다항식에 비례하는 $poly(n)$)를 쓸 수 있다면, 모델은 표준 컴퓨터 알고리즘을 시뮬레이션할 수 있을 만큼 강력해져서 PTIME 클래스에 도달합니다.
- 그리고 만약 무제한의 사고 공간과 정밀도를 가진다면, 모델은 **튜링 머신(Turing Machine)**을 시뮬레이션할 수 있는데, 이는 모든 계산 가능한 문제를 해결할 수 있는 보편적 컴퓨터의 이론적 정의입니다.
이 논문은 이것이 무엇을 의미하는지에 대해 매우 명확하게 밝히고 있습니다: 트랜스포머는 본질적으로 "전지전능"하거나 "쓸모없는" 것이 아닙니다. 어려운 문제를 해결하는 능력은 전적으로 당신이 얼마나 많은 "연습장"(Chain-of-Thought)과 얼마나 많은 "수학적 정밀도"를 제공하느냐에 달려 있습니다. 이러한 자원이 없다면, 모델은 단순하고 얕은 논리에 국한됩니다. 이러한 자원을 갖춘다면, 모델은 복잡성의 사다리를 올라가 완전한 컴퓨터를 시뮬레이션할 수 있습니다.
저자들은 또한 몇 가지 구체적인 한계점을 지적합니다. 그들은 "하드(hard)" 어텐션 모델(로봇이 단 하나의 단어만을 선택하는 모델)이 "소프트(soft)" 어텐션 모델(여러 단어에 가중치를 두는 모델)보다 엄격하게 약하며, 어떤 경우에는 가장 단순한 회로 클래스의 완전한 힘에도 도달할 수 없다고 주장합니다. 나아가, 그들은 트랜스포머가 충분한 Chain-of-Thought를 통해 이론적으로 튜링 머신을 시뮬레이션할 수 있지만, 이것은 이론적인 한계임을 강조합니다. 현실 세계에서 우리는 무한한 메모리나 무한한 시간을 들여 무한한 중간 생각을 생성할 수 없으므로, 실제 모델은 이론적 최대치보다 낮은 실질적인 천장을 갖게 될 것입니다.
요약하자면, 콜라이티스와 생굽타는 트랜스포머의 "전력망"을 그려냈습니다. 그들은 이 모델들이 마법 같은 블랙박스가 아니라, 자원에 의해 제한되는 기계라는 것을 보여줍니다. 만약 당신이 모델이 어려운 퍼즐을 풀기를 원한다면, 단순히 "더 열심히 노력하라"고 요구할 것이 아니라, 더 많은 정밀도, 더 많은 레이어, 그리고 무엇보다도 단계별로 생각할 수 있는 능력을 갖춘 적절한 도구를 제공해야 합니다. 논문은 이러한 한계를 이해하는 것이 매우 중요하다고 결론짓습니다. 이는 우리가 이 모델들에게 불가능한 일을 기대하는 것을 멈추고, 이들이 가진 본질적인 모습, 즉 믿을 수 없을 정도로 강력하지만 궁극적으로는 경계가 있는 패턴 인식기로서 최선의 버전을 설계하도록 도와줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.