← 최신 논문
🤖 machine learning

You Do Not Fully Utilize Transformer's Representation Capacity

이 논문은 이전 레이어의 표현을 학습된 라우팅 가중치를 통해 통합함으로써 은닉 상태 크기를 늘리지 않고도 퍼플렉서티(perplexity), 작업 성능 및 특징 엔트로피를 개선하여 표현 붕괴를 완화하는 트랜스포머용 경량 확장 기술인 레이어 통합 메모리(Layer-Integrated Memory, LIMe)를 소개한다.

원저자: Gleb Gerasimov, Yaroslav Aksenov, Nikita Balagansky, Viacheslav Sinii, Daniil Gavrilov

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gleb Gerasimov, Yaroslav Aksenov, Nikita Balagansky, Viacheslav Sinii, Daniil Gavrilov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능은 종종 트랜스포머(Transformer)라고 불리는 특정한 유형의 컴퓨터 프로그램에 의존합니다. 이 프로그램들은 오늘 우리가 사용하는 많은 고급 언어 도구들의 엔진이며, 방대한 양의 텍스트를 읽고 인간과 유사한 응답을 생성할 수 있는 능력을 갖추고 있습니다. 이들이 어떻게 작동하는지 이해하기 위해, 긴 이야기를 처리하는 독자를 상상해 보십시오. 독자가 첫 문장부터 마지막 문장까지 이동하면서, 전체적인 서사를 이해하기 위해서는 모든 세부 사항, 모든 등장인물, 그리고 모든 논리적 연결 고리를 계속 추적해야 합니다. 표준 트랜스포머에서 이 기억은 프로그램의 한 층(layer)에서 다음 층으로 정보를 전달하는 단일하고 좁은 통로에 의해 처리됩니다. 각 층은 텍스트에 대한 이해를 정교화하며, 그 정교화된 버전을 다음 단계로 전달합니다. 하지만 마치 하나의 복도가 너무 많은 사람을 동시에 통과시키려 하면 혼잡해지고 세부 사항을 놓치게 되는 것처럼, 이 좁은 통로는 텍스트가 길어지거나 프로그램이 깊어짐에 따라 서로 다른 단어나 아이디어 사이의 중요한 구분을 흐릿하게 만들 수 있습니다. '표현 붕괴(representation collapse)'라고 알려진 이 현상은 토큰(텍스트의 기본 단위) 사이의 미묘하지만 결정적인 차이를 소실하게 만들어, 모델이 복잡한 문제를 추론하거나 긴 시퀀스를 정확하게 기억하는 것을 어렵게 만듭니다.

T-Tech의 연구진은 이 병목 현상을 해결하기 위한 새로운 방법을 제안하며, '층 통합 메모리(Layer-Integrated Memory)', 즉 LIMe라고 부르는 방식을 도입했습니다. 모든 정보를 단 하나의 직전 층으로만 통과시키는 대신, 이 새로운 설계는 프로그램의 각 부분이 이미 처리한 이전의 어떤 층으로부터도 직접 정보를 끌어올 수 있도록 허용합니다. 이것을 독자가 독서 과정의 매 단계마다 포스트잇을 붙여두는 것으로 생각해보십시오. 어려운 개념을 마주했을 때, 독자는 더 이상 현재 손에 들고 있는 메모 하나에만 국한되지 않습니다. 그들은 시작 부분이나 중간, 혹은 그 사이 어디에서든 붙여둔 메모를 다시 훑어보며, 현재의 문장을 이해하는 데 도움이 될 가장 관련성 높은 세부 사항을 선택할 수 있습니다. 이 접근 방식은 더 넓은 복도를 만들거나 더 많은 메모리 저장 공간을 추가할 필요 없이, 단순히 기존 메모를 어떻게 액세스(access)할지를 재구성하여 프로그램이 자신의 사고 과정 중 초기 단계로부터 특정 특징들을 검색할 수 있게 해줍니다.

연구팀은 정보를 동적으로 경로를 지정(route)하는 법을 배우는 모델을 구축하여 이 아이디어를 테스트했습니다. 그들은 각 어텐션 헤드(attention head, 프로그램이 어떤 단어에 집중할지 결정하는 부분)가 가중치 세트를 학습하도록 하는 시스템을 만들었습니다. 이는 즉, 바로 이전 층의 정보를 얼마나 신뢰할지, 아니면 아주 첫 번째 층이나 그 사이의 어떤 층의 정보를 얼마나 신뢰할지를 결정하는 것입니다. 이 학습 과정은 훈련 중에 자동으로 이루어집니다. 연구진은 이러한 유연성이 모델의 복잡한 과제 수행 능력을 크게 향상시킨다는 것을 발견했습니다. 수학적 추론과 논리 퍼즐을 포함한 테스트에서, 새로운 모델들은 표준 버전들을 큰 차이로 능가했습니다. 예를 들어, 여러 단계가 있는 산술 문제를 풀도록 요청받았을 때, 표준 모델들은 단계가 늘어남에 따라 자주 실패했는데, 이는 아마도 중간 단계의 숫자들을 놓쳤기 때문일 것입니다. 그러나 새로운 모델들은 문제가 더 어려워지더라도 정확도를 유지했으며, 이는 모델이 필요한 수치적 구분을 명확하게 유지하는 데 더 뛰어났음을 시사합니다.

단순히 테스트 점수가 좋아지는 것을 넘어, 연구진은 모델 내부를 들여다보며 어떤 일이 일어나고 있는지 확인했습니다. 그들은 표준 모델들이 층이 깊어질수록 서로 다른 단어들을 거의 동일한 표현으로 압축하여, 결과적으로 그 사이의 경계를 흐릿하게 만든다는 것을 발견했습니다. 반면, 새로운 모델들은 훨씬 더 풍부하고 다양한 표현을 보존했습니다. 단어의 핵심 의미를 담고 있는 내부 '값(value)' 벡터들은 네트워크의 가장 깊은 곳에서도 뚜렷하고 다양하게 유지되었습니다. 이러한 세부 사항의 보존은 모델이 여러 가능성을 탐색하거나 논리의 사슬을 따라가는 데 필수적인, 서로 다른 추론 경로를 분리하여 유지할 수 있게 해주었습니다. 연구는 프로그램이 자신의 이력에 더 자유롭게 접근할 수 있게 함으로써, 정보가 지나치게 단순화되는 함정을 피할 수 있음을 보여주었습니다.

결과는 모델의 크기와 깊이에 관계없이 일관되었습니다. 연구진이 최대 128개 층까지 가진 매우 깊은 네트워크를 구축한 실험에서, 새로운 방식은 64개 층을 가진 모델이 128개 층을 가진 표준 모델만큼 혹은 그보다 더 나은 성능을 내도록 했습니다. 이는 단순히 더 많은 층을 쌓아 올리는 것보다 정보 흐름의 품질이 더 중요하다는 것을 시사합니다. 연구진 또한 모델이 학습한 '경로 가중치(routing weights)'를 분석하였으며, 프로그램이 장기적인 문맥을 위해 초기 층의 특징들을 체계적으로 재사용하는 동시에, 단기적인 세부 사항을 위해 직전 이웃 층들에 의존한다는 것을 발견했습니다. 이 패턴은 모델이 메모리의 부담을 단일한 흐름에 몰아넣기보다는 전체 네트워크에 걸쳐 분산시키는 법을 배웠음을 나타냅니다.

새로운 방식은 이러한 연결을 계산하는 데 약간의 추가 시간이 필요하지만, 성능과 효율성 측면에서 얻는 이득에 비하면 그 대가는 미미합니다. 이 접근 방식은 기존 하드웨어와 호환되며 대규모의 메모리 증가를 요구하지 않으므로, 현재 시스템에 대한 실용적인 업그레이드입니다. 연구는 표준 트랜스포머의 한계가 용량의 부족이 아니라, 그 용량을 사용하는 방식의 병목 현상에 있다고 결론지었습니다. 층 사이의 정보 흐름을 개방함으로써, 이 새로운 방식은 더 높은 수준의 추론과 표현을 이끌어내며, 때로는 앞으로 나아가는 가장 좋은 방법이 이미 지나온 곳을 기억하는 것임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →