RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers
RecurrentGPT는 게이트형 변조(gated modulation)를 통해 단일 공유 핵심 레이어를 반복하는 순환적 깊이 트랜스포머(recurrent depth transformer) 아키텍처를 도입하여, 파라미터 수를 적응적 깊이 재사용(adaptive depth reuse)과 효과적으로 교환함으로써 표준 딥 트랜스포머보다 우수한 정확도와 메모리 효율성을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능은 모델을 더 똑똑하게 만드는 것이 종종 모델을 더 무겁게 만드는 것을 의미하는 지점에 도달했습니다. 문장을 이해하거나 이야기를 쓰기 위해, 이 시스템들은 파라미터라고 알려진 방대한 수학적 연결망에 의존합니다. 표준적인 설계에서는 사고 과정의 모든 단계마다 고유한 연결 세트를 사용합니다. 이 방식은 잘 작동하지만, 하나의 부담을 만듭니다. 즉, 추론의 깊이를 더하기 위해 엔지니어들은 더 많은 메모리를 추가해야 하며, 이는 빠르게 비용이 많이 들고 물리적 하드웨어에서 관리하기 어렵게 만듭니다. 깊고 복잡한 사고에 대한 갈망과 컴퓨터 메모리의 물리적 한계 사이에는 커지는 긴장이 존재합니다.
수십 년 동안 과학자들은 동일한 단순한 과정을 반복하는 것이 믿을 수 없을 정도로 복잡한 문제를 해결할 수 있다는 것을 알고 있었습니다. 앨런 튜링의 기초적인 연구에 뿌리를 둔 이 아이디어는, 시스템이 사고하기 위해 거대한 고유 도구 라이브러리를 가질 필요는 없으며, 단 하나의 정제된 도구를 반복적으로 적용함으로써 지능을 달 수 있다는 점을 시사합니다. 현대의 언어 모델들은 많은 서로 다른 층을 쌓는 방식을 선호하며 이러한 반복적 스타일에서 주로 벗어났지만, 새로운 접근 방식은 단순히 시스템을 느리게 만드는 것이 아니라 반복을 더 똑똑하게 만듦으로써 반복의 힘을 다시 가져오고자 합니다. 목표는 더 많은 고유한 부품을 저장하지 않고도 더 깊게 "생각"할 수 있는 모델을 만드는 것입니다.
카이로 독일 대학교, 뮌헨 공과대학교, 그리고 Cerebras Systems의 연구진은 이 문제를 해결하기 위해 RecurrentGPT라고 불리는 새로운 아키텍처를 개발했습니다. 긴 고유 층의 사슬을 구축하는 대신, 그들은 여러 번 재사용되는 작고 고정된 층 세트를 설계했습니다. 하나의 숙련된 노동자가 작업을 수행한 다음, 제품을 자신에게 다시 전달하여 정제하고, 다시 자신에게 전달하는 공장 조립 라인을 상상해 보십시오. 이 새로운 시스템에서 "노동자"는 모델 뇌의 공유된 블록입니다. 이 블록은 입력을 처리한 다음, 자신의 출력을 받아 다시, 그리고 또 다시 정해진 횟수만큼 처리합니다. 이를 통해 모델은 훨씬 더 큰 시스템의 역할을 수행하면서도 고유한 부품의 아주 적은 부분만을 저장할 수 있습니다.
하지만 단순히 같은 과정을 반복하는 것은 새로운 문제를 일으킵니다. 만약 노동자가 매번 정확히 똑같은 일을 한다면, 제품은 진정으로 변하지 않을 것입니다. 연구진은 프로세스를 변화시키는 메커니즘이 없다면, 반복되는 단계들이 하나의 무익한 변환으로 붕계될 것이라는 점을 발견했습니다. 이를 해결하기 위해 그들은 새로운 정보가 기존의 정보를 얼마나 대체할지를 제어하는 학습된 의사결정 메커니즘인 '다이내믹 게이트(dynamic gate)'를 도입했습니다. 이 게이트는 현재 모델의 상태, 원래의 입력, 그리고 약간의 무작위 노이즈를 살펴보고 매 단계마다 무엇을 유지하고 무엇을 업데이트할지를 정확히 결정합니다. 이를 통해 비록 동일한 가중치가 반복적으로 사용되더라도, 모델은 매 차례 다르게 동작하여 단계가 깊어짐에 따라 사고를 전문화할 수 있게 합니다.
이 접근 방식의 결과는 놀랍습니다. 모델의 훈련 및 실행에 사용되는 총 컴퓨팅 파워가 표준적인 더 큰 모델과 동일하게 유지되는 엄격한 제약 조건 하에서 테스트했을 때, 이 새로운 시스템은 동일한 수준의 성능을 보여주었습니다. 한 특정 테스트에서, 10번 반복되는 3개의 고유 가중치 층을 가진 모델은 표준 12개 층 모델의 정확도와 일치했습니다. 이는 새로운 설계가 64% 적은 고유 파라미터를 사용하면서도 동일한 품질을 달-성했음을 의미합니다. 연구진이 모델이 생각하는 과정 중에 더 많은 컴퓨팅 파워를 사용하도록 허용하되 저장된 부품의 수는 동일하게 유지했을 때, 반복 시스템은 실제로 표준 시스템보다 뛰어난 성능을 보였으며, 이는 깊이와 반복이 메모리 비용을 팽창시키지 않고도 지능을 향상시키는 강력한 방법이 될 수 있음을 보여주었습니다.
시스템은 또한 유용한 부수 효과를 스스로 발견했습니다. 모델이 반복 사이클의 어느 지점에서든 멈출 수 있도록 훈련되었기 때문에, 모델은 반복 과정 중에 일찍 멈추더라도 높은 품질의 답변을 생성하는 법을 배웠습니다. 이는 시스템이 속도와 품질 사이의 조절 다이얼 역할을 할 수 있게 합니다. 즉, 매우 짧은 시간 안에 빠르고 거친 답변을 내놓을 수도 있고, 더 정밀한 답변으로 정제하기 위해 더 많은 사이클을 소비할 수도 있으며, 이 모든 것이 동일한 단일 훈련 모델으로부터 가능합니다. 이러한 유연성은 서로 다른 속도를 위해 별도의 모델이 필요한 현재의 시스템에서는 보기 드문 특징입니다.
실질적인 관점에서, 이는 제한된 메모리를 가진 장치가 현재보다 훨씬 더 유능한 언어 모델을 실행할 수 있음을 의미합니다. 연구진은 그들의 대규모 버전이 유사한 능력을 가진 표준 모델보다 생성 중 피크 메모리를 59% 적게 요구한다는 것을 측정했습니다. 텍젝트를 생성하는 데 걸리는 시간은 반복 단계로 인해 약간 증가했지만, 메모리가 병목 현상이 되는 환경에서는 이 트레이드오프가 매우 중요합니다. 이 연구는 효율적인 인공지능의 미래가 더 크고 무거운 뇌를 만드는 것이 아니라, 작은 뇌가 자신의 생각을 다시 되짚어봄으로써 더 깊게 생각하는 법을 가르치는 데 있을 수 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.