TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
이 논문은 표준 트랜스포머 서브레이어를 교차 토큰 게이트 잔차 업데이트(cross-token gated residual update)로 대체하여 수학 및 교육 데이터셋에서 우수한 성능을 달al성하는 새로운 언어 모델 아키텍처인 TANGO와, 기존 선형 시간 모델들을 능가하는 선형 복잡도 변체인 WANGO를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 언어를 이해하기 위한 가장 강력한 도구들은 트랜스포머(Transformer)라고 불리는 구조에 의존합니다. 긴 문서를 훑어보는 독자를 상상해 보십시오. 특정 단어를 이해하기 위해 독자는 문맥을 파악하고자 그 이전에 나왔던 단어들을 되돌아보아야 합니다. 표준 AI 모델은 두 가지 별개의 단계를 사용하여 이 작업을 수행합니다. 첫째, 모델은 텍스트의 전체 이력을 스캔하여 과거의 단어들로부터 관련 정보를 수집하는데, 이는 사서가 특정 주제와 관련된 모든 책을 빠르게 찾아내는 과정과 비슷합니다. 둘 둘째, 모델은 수집된 정보를 가져와 문장의 매 위치마다 별도의 독립적인 필터를 통해 처리함으로써 의미를 정교하게 다듬습니다. 이 두 단계의 춤은 이 분야에서 잘 기능해 왔지만, 계산 집약적입니다. 특히 텍스트가 길어질수록 모델이 새로운 단어를 생성할 때마다 엄청난 양의 계산을 수행해야 하기 때문입니다. 연구자들은 이 단계들을 결합하거나 간소화하여, 방대한 양의 정보를 처리할 때 필요한 수학적 계산의 무게에 짓눌리지 않고도 더 똑똑하고 효율적으로 방대한 정보를 처리할 수 있는 모델을 구축하기 위해 오랫동안 방법을 모색해 왔습니다.
인디애나 대학교 블루밍턴의 한 연구자가 이러한 모델들이 언어와 상호작용하는 방식을 근본적으로 재편하는 새로운 접근법을 도입했습니다. 그들은 자신들의 창조물을 토큰 집계 비선형 게이팅 연산자(TANGO, Token-Aggregated Nonlinear Gating Operators)라고 부릅니다. 정보를 수집하는 단계와 정보를 정제하는 단계를 분리하여 유지하는 대신, TANGO는 이들을 하나의 통합된 동작으로 병합합니다. 이 새로운 설계에서는 문장의 모든 단어가 제어의 원천 역할을 합니다. 모델이 글을 읽어 나감에 따라, 각 단어는 텍스트의 서로 다른 특징들에 얼마나 많은 중요성을 부여할지를 결정하는 특정 지침 세트, 즉 '게이트(gates)'를 생성합니다. 모델이 새로운 단어에 도달했을 때, 단순히 가장 관련 있는 과거의 단어들을 찾아보는 것에 그치지 않고, 그 과거의 단어들이 어떤 지침을 준비해 두었는지 확인합니다. 그런 다음 모델은 이 지침들을 평균화하고, 이를 사용하여 현재 단어의 특징들을 조절(scale)하거나 조정하여 모델의 메모리에 추가합니다. 이는 과거 단어의 영향력이 단순히 무엇을 말하느냐뿐만 아니라, 그 단어가 현재의 단어에게 자신을 어떻게 해석하라고 말하느냐에 달려 있음을 의미합니다.
연구자는 정확도와 속도 사이의 서로 다른 절충안을 테스트하기 위해 두 가지 버전의 시스템을 개발했습니다. 첫 번째인 TANGO는 텍스트에서 얼마나 멀리 떨어져 있든 상관없이 현재 단어 이전에 나온 모든 단어를 살펴봅니다. 이 '전체 접두사(full-prefix)' 방식은 모델이 대화나 문서의 전체 이력을 끌어올 수 있게 하여, 문맥에 대한 매우 정확한 이해를 가능하게 합니다. 그러나 현재의 단어를 이전의 모든 단어와 비교해야 하기 때문에, 텍스트가 길어질수록 수행해야 하는 작업량이 급격히 증가합니다. 두 번째 버전인 WANGO는 매우 긴 텍스트를 위한 더 실용적인 접근 방식을 취합니다. WANGO는 가장 최근의 단어들에 세심한 주의를 기울이며, 첫 번째 모델과 마찬가지로 상세한 전체 이력 관리를 수행합니다. 최근 범위를 벗어난 오래된 단어들에 대해서는, WANGO는 이들의 영향력을 요약하는 더 효율적인 방법을 사용합니다. WANGO는 오래된 단어들이 생성한 지침들의 누적 합계를 유지함으로써, 개별 단어 하나하나와 관계를 다시 계산할 필요 없이 그들의 지혜를 통합할 수 있습니다. 이러한 수정 덕분에 Wango 모델의 작업량은 텍스트가 길어짐에 따라 폭발적으로 증가하는 대신 직선 형태로 늘어나며, 이는 긴 시퀀스 처리에 있어 훨씬 더 빠릅니다.
이 새로운 설계들이 기존 기술와 어떻게 맞서는지 확인하기 위해, 연구자는 정확히 동일한 양의 데이터, 동일한 수의 파라미터, 동일한 학습 일정을 사용하여 여섯 가지 서로 다른 모델을 학습시켰습니다. 연구진은 세 가지 매우 다른 과제를 통해 이 모델들을 테스트했습니다: 교육용 웹 텍스트 모음, Lean이라는 프로그래밍 언어로 작성된 공식 수학 증명 라이브러리, 그리고 DeepMind의 수학 문제 세트입니다. 결과에 따르면, 전체 이력을 보는 TICO 모델은 세 가지 테스트 모두에서 가장 높은 정확도를 달al성하며, 시퀀스의 다음 단어에 대해 가장 신뢰할 수 있는 예측을 생성했습니다. TANGO는 레이어 간에 파라미터를 공유하는 전통적인 방식들을 포함한 다른 모든 모델보다 뛰어난 성능을 보였습니다. WANGO 모델 또한 효율적인 모델들을 대상으로 한 카테고리에서 매우 우수한 성능을 보였습니다. 계산 비용이 통제 불능으로 치솟지 않으면서도 긴 텍스트를 처리할 수 있는 아키텍처들 중에서, Wango는 가장 정확한 결과를 만들어냈습니다. 심지어 유사한 양의 계산을 사용하면서도 오래된 표준 기술에 의존하는 모델보다도 더 나은 성적을 거두었습니다.
이 연구는 이러한 시스템이 어떻게 구축될 수 있는지에 대한 중요한 변화를 강조합니다. 단어들이 집계된 게이트를 통해 다른 단어의 처리를 제어하도록 함으로써, 연구자는 강력하면서도 (Wango의 경우처럼) 효율적인 모델을 만드는 방법을 찾아냈습니다. TANGO 모델은 정보를 수집하고 정제하는 단일 통합 단계가, 모델이 더 많은 수학적 작업을 수행해야 하는 상황에서도 전통적인 두 단계 프로세스보다 뛰어난 성능을 낼 수 있음을 입증했습니다. 한편, Wango 모델은 이러한 높은 수준의 성능이 반드시 속도의 희생을 수반할 필요는 없다는 것을 증명했습니다. 오래된 정보를 지능적으로 요약함으로써, Wango는 높은 정확도를 유지하면서도 계산 비용을 관리 가능한 수준으로 유지했습니다. 연구자는 이러한 결과가 시퀀스의 다음 단어를 예측하는 능력, 즉 언어 이해의 표준 척도에 기반한 것이며, 이 모델들이 반드시 수학 문제를 완벽하게 풀거나 증명을 스스로 써낼 수 있다는 주장까지는 아니라는 점을 분명히 했습니다. 그러나 이 결과는 새로운 방식의 정보 게이팅이 복잡한 언어와 긴 문맥을 더 정밀하고 효율적으로 이해할 수 있는 AI를 구축하는 데 유망한 길을 제시한다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.