← 최신 논문
💻 computer science

Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

이 논문은 태스크별 레지스터를 활용하여 서로 다른 비전 트랜스포머 태스크 전반에 걸쳐 토큰의 순위를 동적으로 매기고 프루닝 예산을 할당함으로써, 이미지 분류, 시맨틱 세그멘테이션 및 객체 탐지에서 경쟁력 있는 성능을 유지하면서도 상당한 처리량 향상을 달야내는 태스크 적응형 프루닝(Task-Adaptive Pruning, TAP) 방법을 제안한다.

원저자: Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

게시일 2026-08-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사진을 보고 그 안에 무엇이 들어있는지 이해하려고 노력하는 초지능 로봇 두뇌를 가지고 있다고 상상해 보세요. 이 두뇌는 거대한 작은 일꾼들의 팀처럼 만들어졌으며, 각 일꾼은 퍼즐의 한 조각(이른바 "토큰")을 들고 있습니다. 결정을 내리기 위해서 모든 일꾼은 서로 다른 모든 일꾼과 대화를 나누어야 합니다. 문제는, 사진이 커지면 대화의 수가 폭발적으로 늘어나서 두뇌가 과부하에 걸리고, 느려지며, 전기를 갈구하게 된다는 점입니다. 과학자들은 두뇌에게 사진의 지루한 부분들은 무시하고 중요한 것들만 유지하도록 말함으로써 이 문제를 해결하려고 노력해 왔습니다. 이는 마치 선생님이 반 학생들에게 똑똑한 말을 할 수 있는 학생들에게만 집중하라고 말하는 것과 비슷합니다. 이것을 "토큰 프루닝(token pruning)"이라고 부릅습니다. 하지만 까다로운 점은, 무엇이 "똑똑한지" 또는 "중요한지"는 로봇이 무엇을 하려고 하는지에 따라 달라진다는 것입니다. 고양이를 찾아내는 데 결정적인 사진 조각은 하늘의 색깔을 파악하는 데는 쓸모없을 수도 있습니다. 오랫동안 과학자들은 모든 작업에 대해 동일한 "무시 목록"을 사용하는 방법을 시도했지만, 하나의 크기가 모든 것에 적합하지는 않다는 것이 밝혀졌습니다.

"Putting Registers to Work"라는 제목의 이 논문은 바로 그 문제를 다룹니다. 런던 퀸 메리 대학교의 연구진인 저자들은 무엇이 중요한지 결정하는 규칙이 작업마다 완전히 다르다는 것을 발견했습니다. 그들은 물체를 찾는 데(예: 공원에서 개를 찾는 것) 아주 효과적인 전략이 장면을 이해하는(예: 개가 잔디 위에 있는지 보도 위에 있는지 파악하는 것) 로봇의 능력에는 오히려 해가 될 수 있다는 것을 발견했습니다. 이를 해결하기 위해 그들은 **태스크 적응형 프루닝(Task-Adaptive Pruning, TAP)**이라는 영리하고 새로운 시스템을 발명했습니다.

로봇의 두뇌를 바쁜 주방이라고 생각해 보세요. 보통 셰프(프루닝 정책)는 수프를 만들든 케이크를 만들든 상관없이 재료를 버리기로 결정할 때 동일한 레시피를 사용합니다. 저자들은 이것이 실수였다는 것을 깨달았습니다. 대신, 그들은 주방에 특별한 "태스크 레지스터(Task Registers)"를 주었습니다. 이것은 요리하는 요리에 따라 변하는 똑똑하고 마법 같은 레시피 카드와 같습니다. 로봇이 고양이를 식별해야 할 때, 그것은 "고양이 카드"를 꺼내어 두뇌에 이미지의 정확히 어느 부분을 유지하고 어느 부분을 무시할지 알려줍니다. 장면 전체를 지도화해야 할 때는 "방 카드"로 교체합니다. 이 카드들은 단순히 무엇을 버릴지 결정할 뿐만 아니라, 두뇌가 이미지를 처리하는 과정에서 레이어별로 언제 버릴지도 결정합니다.

연구진은 표준 로봇 두뇌를 동결시킨 채로 재학습 없이 다양한 "무시 규칙"을 시도하며 이를 테스트했습니다. 그들은 세 가지 큰 놀라움을 발견했습니다. 첫째, 물체를 찾는 데 중요한 조각을 고르는 최선의 방법은 장면을 매핑하는 데 최선의 방법과 정반대였습니다. 둘째, 로봇은 특히 고양이인지 개인지 구별하는 것과 같은 단순한 작업을 수행할 때 초기 처리 레이어를 어떻게 다루는지에 매우 민민합니다. 셋째, 로봇이 사진의 조각을 버릴 때, 나중에 빈 공간을 채우기 위해 그것이 어떻게 생겼었는지 기억해야 합니다. 하지만 여기서 핵심은, 물체를 찾는 경우에는 그냥 그 조각이 전혀 없었던 것처럼 가장하고 근처의 이웃을 사용하여 빈 공간을 채우는 것이 더 낫다는 것입니다. 반면 장면을 매핑하는 경우에는 실제 차이점을 기억했다가 나중에 다시 붙여넣는 것이 더 낫습니다.

이 모든 것을 해결하기 위해, TAP는 현재 작업에 대한 단 하나의 "활성(active)" 레지스터 카드를 사용합니다. 이 카드는 두뇌를 통과하며 이미지를 관찰하고 세 가지 결정을 즉석에서 내립니다:

  1. 선택(Selection): 어떤 토큰을 유지하고 어떤 것을 버릴 것인가.
  2. 예산(Budget): 각 단계에서 얼마나 많은 토큰을 버릴 것인가 (초기에 조금 버릴 수도 있고, 나중에 더 많이 버릴 수도 있으며, 혹은 그 반대일 수도 있음).
  3. 복구(Recovery): 로봇이 상세한 지도를 그려야 할 때 얼마나 많은 "잊힌" 세부 사항을 다시 가져올 것인가.

결과는 인상적입니다. 이러한 작업별 카드를 사용함으로써, 로봇은 지능을 거의 잃지 않으면서 훨씬 빨라졌습니다. 물체 찾기(COCO)에 대한 표준 테스트에서, 정확도는 거의 유지하면서(단 0.3점 하락) 1.32배 더 빨라졌습니다. 장면 매핑(ADE20K) 테스트에서는 품질이 아주 약간 떨어졌지만 1.30배 더 빨라졌습니다. 단순한 이미지 분류에 대해서도 경쟁력을 유지했습니다.

저자들은 이 접근 방식이 진정한 통합 로봇 두뇌를 향한 한 단계라고 제안합니다. 즉, 자동차를 포착하거나, 거리의 그림을 그리거나, 표지판을 읽는 등, 동일한 핵심 엔진을 사용하면서도 실시간으로 다른 "사고 방식"을 활성화하여 전환할 수 있는 두뇌 말입니다. 그들은 단순히 이것이 작동할 것이라고 추측한 것이 아니라, 두뇌를 동결시켜 개별 규칙을 테스트하고, 그들의 새로운 "레지스터" 시스템이 기존의 "하나의 크기가 모든 것에 맞는" 방식보다 일관되게 우수하다는 것을 보여줌으로써 이를 증명했습니다. 이는 AI의 세계에서 때로는 가장 똑똑한 일이 소음을 언제 무시해야 할지 정확히 아는 것이며, "소음"의 정의는 당신이 무엇을 보려고 하는지에 달려 있다는 사실을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →