← 최신 논문
🤖 machine learning

Adaptive Computation Depth via Learned Token Routing in Transformers

본 논문은 컨텍스트의 난이도에 따라 개별 토큰에 대해 불필요한 레이어 연산을 동적으로 건너뛰어 최소한의 품질 저하와 명시적인 깊이 정규화 없이 상당한 효율성 향상을 가능하게 하는 경량 엔드투엔드 미분 가능한 게이트 메커니즘인 토큰 선택적 어텐션 (TSA) 을 소개합니다.

원저자: Ahmed Abdelmuniem Abdalla Mohammed

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ahmed Abdelmuniem Abdalla Mohammed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

공장에서 컨베이어 벨트를 따라 나오는 모든 제품이 정확히 동일한 처리를 받는다고 상상해 보세요. 단순하고 완벽한 위젯이든 복잡하고 고장 난 위젯이든, 모든 항목은 각 스테이션에서 정확히 동일한 시간을 보냅니다. 이것이 현재 표준 AI 모델 (Transformer) 이 작동하는 방식입니다: 이해하기 쉬운 단어든 어려운 단어든 관계없이 문장의 모든 단어를 동일한 수의 '사고 레이어'를 통해 처리합니다.

이 논문은 **토큰 선택적 어텐션 (Token-Selective Attention, TSA)**이라는 새로운 시스템을 소개합니다. TSA 를 공장의 각 스테이션마다 설치된 스마트한 자동 게이트키퍼로 생각하세요.

문제: "일률적 적용" 공장

표준 AI 모델에서 "To be, or not to be"라고 쓰라고 요청하면, 모델은 "To"라는 단어와 "question"이라는 단어를 동일한 양의 두뇌 에너지를 사용하여 처리합니다.

  • 쉬운 단어(예: "the"나 "is")는 단순한 위젯과 같습니다. 많은 처리가 필요하지 않습니다.
  • 어려운 단어(예: 복잡한 개념이나 희귀한 이름)는 고장 난 위젯과 같습니다. 수정하기 위해 추가 시간과 주의가 필요합니다.

현재 공장은 쉬운 위젯을 어려운 위젯과 동일한 강도로 처리함으로써 에너지를 낭비하고 있습니다.

해결책: 스마트 게이트키퍼 (TSA)

저자들은 AI 의 각 레이어 사이에 작은 경량 '게이트키퍼'(작은 신경망) 를 추가했습니다. 이 게이트키퍼는 각 단어 (토큰) 를 개별적으로 살펴보고 다음과 같이 묻습니다: "이 단어가 다음 처리 스테이션을 거쳐야 할까요, 아니면 건너뛸 수 있을까요?"

  • 결정: 게이트키퍼는 단순히 "예" 또는 "아니오"라고 말하지 않습니다. 대신 확률 점수 (예: 조명 디밍 스위치) 를 제공합니다. 단어가 쉬우면 게이트키퍼는 "다음 단계를 건너뛸 수 있어" 또는 "반만 하면 돼"라고 말할 수 있습니다. 단어가 어렵다면 "전 과정을 거쳐"라고 말합니다.
  • 마법: 가장 좋은 점은 게이트키퍼가 스스로 학습한다는 것입니다. 어떤 단어가 어려운지 인간이 알려줄 필요가 없습니다. 실수를 최소화하려고 노력함으로써 순수하게 학습합니다. 특정 단어에 대해 단계를 건너뛰는 것이 오류를 유발하면, 게이트키퍼는 다음 번에는 그 단어를 활성화 상태로 유지하도록 학습합니다. 건너뛰는 것이 잘 작동하면 에너지를 절약하도록 학습합니다.

실제 작동 방식

이 논문은 두 가지 주요 항목에 대해 이를 테스트했습니다:

  1. 간단한 논리 퍼즐: AI 가 숫자 목록을 복사해야 할 때, 게이트키퍼는 "이건 쉬워"라고 판단하고 작업의 약 65% 를 건너뛰었습니다. 숫자를 정렬해야 할 때 (더 어렵습니다) 는 작업의 약 27% 만 건너뛸 수 있었습니다. 더 어려운 작업이 더 많은 단계가 필요하다는 것을 자연스럽게 파악한 것입니다.
  2. 스토리 작성: 셰익스피어처럼 쓰거나 위키백과 기사를 요약하라고 요청받았을 때, AI 는 컴퓨팅 파워를 **14% 에서 23%**까지 절약했습니다.
    • 문장 부호, 공백, 일반적인 단어는 쉽고 빠르게 처리할 수 있음을 학습했습니다.
    • 고유한 내용 단어는 전체 '공장' 처리가 필요함을 학습했습니다.

결과: 더 빠르고 더 똑똑함

  • 품질 저하 없음: AI 는 표준 모델과 똑같이 잘 썼지만, 훨씬 적은 에너지 (컴퓨팅 파워) 를 사용했습니다.
  • "조기 종료 (Early Exit)"보다 우수함: 다른 방법들은 AI 가 "확신"을 느낄 때 전체 문장을 일찍 종료하려고 시도합니다. TSA 는 더 똑똑합니다. 개별 단어들이 불필요한 단계를 거치는 것을 막으면서 어려운 단어들은 계속 진행되도록 합니다. 논문은 동일한 양의 에너지를 절약하도록 설정되었을 때, TSA 가 이러한 구식 방법들보다 더 좋은 결과를 산출했다고 밝혔습니다.
  • 실제 속도: 연구자들이 실제로 컴퓨터에서 코드를 실행했을 때, 건너뛴 단어들의 수학을 컴퓨터가 실제로 수행할 필요가 없었기 때문에 실제 속도 향상 (약 2.3% 빠름) 을 목격했습니다.

결론

이 논문은 AI 모델을 가능한 한 가장 똑똑하게 "게으르게" 만드는 방법을 제시합니다. 모든 단어가 동일한 양의 일을 하도록 강요하는 대신, TSA 는 AI 가 실시간으로 어떤 단어가 쉽고 어떤 단어가 추가 도움이 필요한지 결정하게 합니다. 쉬운 제품들은 라인을 빠르게 통과하고 어려운 제품들은 풀 VIP 대우를 받는 공장을 가진 것과 같습니다. 이는 품질을 희생하지 않으면서 시간과 에너지를 절약합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →