← 최신 논문
🤖 AI

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA는 토큰을 의미적, 맥락적, 세부 역할로 분할하고 이를 어텐션 앵커 영역(Attention-Anchored Regions)을 통해 할당함으로써, 유지된 토큰을 서로 교체 가능한 것으로 취급하지 않고도 포괄적인 객체 범위를 보장하여 멀티모달 거대 언어 모델의 추론 효율성과 정확도를 향상시키는 훈련 불필요 시각적 토큰 프루닝 프레임워크이다.

원저자: Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 세상을 보는 법을 가르치려 한다고 상상해 보세요. 단순히 사진 한 장을 보여주는 것이 아니라, "토큰"이라고 불리는 아주 작은 디지털 퍼즐 조각들의 거대하고 끝없는 흐름을 로봇에게 입력하는 것입니다. 각 조각은 이미지에 대한 아주 작은 정보의 일부를 담고 있습니다. 단순한 사진이라면 이 방식도 괜찮습니다. 하지만 고해외상도 사진, 비디오, 혹은 복잡한 장면의 경우, 로봇은 수천 개의 조각들이 쏟아져 들어오는 상황에 직면하게 됩니다. 이는 마치 구석에 있는 고양이에 대해 질문 하나에 답하기 위해 도서관 전체의 책을 읽어야 하는 것과 같습니다. 로봇은 압도당하고, 생각하는 데 한참이 걸리며, 그 모든 조각을 머릿속에 담아두기 위해 엄청난 양의 메모리를 필요로 하게 됩니다. 이것이 바로 멀티모달 거대 언어 모델(MLLM) 분야의 연구자들이 해결하려고 노력 중인 문제입니다. 즉, 어떻게 하면 로봇이 노이즈에 빠져 허우적거리지 않고 이미지의 중요한 부분에 집중할 수 있게 도울 것인가 하는 점입니다.

일반적인 요령은 덜 중요해 보이는 조각들을 버리는 것입니다. 하지만 여기에는 함정이 있습니다. 로봇의 뇌는 무엇이 중요한지 결정하는 데 완벽하지 않다는 점입니다. 때때로 로봇은 이미지의 가장자지에 정신이 팔리거나 특정 지점에 꽂혀서, 정작 당신이 물어본 실제 대상은 무시하기도 합니다. 다른 방법들은 이미지 전체에 조각들을 고르게 분산시키려고 시도하지만, 이는 마치 군중의 사진을 찍으면서 모든 사람의 얼굴은 놓친 채 모든 사람의 옷에서 픽셀 몇 개씩만 골라내는 것과 같습니다. 그 결과는 종-종 로봇이 배경은 보지만 정작 중요한 사건은 놓치게 만드는 결과를 낳습니다.

여기서 RoRA(Role-Oriented Regional Allocation, 역할 기반 지역 할당)라고 불리는 새로운 방법이 등장합니다. 이 방법은 로봇의 시야를 위한 영리한 편집자 역할을 합니다. 단순히 "가장 중요한" 조각을 고르거나 무작위로 조각을 퍼뜨리는 대신, RoRA는 이미지를 올바른 이야기를 전달하기 위해 세 가지 특정 종류의 증거가 필요한 하나의 이야기처럼 취급합니다.

첫째, RoRA는 **시맨틱 코어(Semantic Core, 의미론적 핵심)**를 식별합니다. 이것은 이야기의 "주인공"이라고 생각하면 됩니다. 만약 당신이 "저 선수의 유니폼에 적힌 숫자가 무엇인가요?"라고 묻는다면, 코어는 유니폼 위에 있는 매우 신뢰도가 높은 특정 픽셀들입니다. RoRA는 이 조각들을 필사적으로 보호하여, 나머지 이미지를 아무리 많이 잘라내더라도 로봇이 절대 주인공을 놓치지 않도록 보장합니다.

둘째, RoRA는 **보완적 컨텍스트(Complementary Context, 보완적 맥락)**를 찾습니다. 이것은 "조연"이자 "배경"입니다. 로봇이 주인공을 파악하고 나면, 그 주인공이 어디에 서 있고 주변에서 어떤 일이 일어나고 있는지 알아야 합니다. RoRA는 주인공의 즉각적인 영역 밖에서도 조각들을 확보하여, 로봇이 단순히 떠다니는 유니폼만 보는 것이 아니라 그것이 경기장에 있는 선수 위에 있다는 것을 이해할 수 있도록 합니다. RoRA는 같은 지점에서 너무 많은 조각을 가져오는 것(이는 중복입니다)을 능동적으로 피하며, 대신 주변 지역에서 새로운 정보를 찾아 나섭니다.

셋째, RoRA는 **미세한 디테일(Fine-Grained Detail)**을 위한 아주 작은 예산을 남겨둡니다. 이것들은 "반전 요소"나 작은 단서들로, 예를 들어 표지판의 아주 작은 글씨, 천의 질감, 혹은 구석에 숨어 있는 작은 물체 같은 것들입니다. 이러한 디테일들은 흔히 작고 놓치기 쉽기 때문에, RoRA는 이들이 단지 사진에서 가장 큰 것이 아니라는 이유로 실수로 삭제되지 않도록 특별한 "구조 임무"를 부여합니다.

RoRA의 마법은 이러한 역할들을 조직하는 방식에 있습니다. 단순히 "어떤 조각이 가장 빛나는가?"라고 묻지 않습니다. 대신, "우리에게 주인공이 있는가? 배경이 있는가? 그리고 작은 단서들이 있는가?"라고 묻습니다. RoRA는 **어텐션 앵커 영역(Attention-Anchored Regions, AARs)**이라는 스마트한 지도를 사용하여 주인공이 어디에 있는지 표시함으로써, 배경을 찾기 위해 어디를 봐야 하는지(지도 밖)와 단서를 찾기 위해 어디를 봐야 하는지(지도 안)를 정확히 알 수 있게 합니다.

결과는 인상적입니다. LLaVA나 Qwen-VL 같은 강력한 로봇 뇌를 대상으로 테스트했을 때, RoRA는 일부 모델에서 이미지 조각을 최대 **88.9%**까지 대폭 줄이면서도 원래 정확도의 **96.5%**를 유지해 냈습니다. 실제로 어떤 테스트에서는 매우 효율적이어서, 로봇의 생각 시간을 24.6% 단축시켜 원본 버전보다 1.33배 더 빠르게 만들었습니다. 더욱 중요한 것은, RoRA가 단순히 추측한 것이 아니라 실제 하드웨어(NVIDIA H800 GPU)에서 이를 측정했다는 점이며, 어떤 조각을 남길지 결정하는 데 단 0.7 밀리초밖에 걸리지 않았음을 보여주었습니다.

모든 조각을 서로 대조하며 확인하느라 느리고 비용이 많이 드는 기존의 방식들과 달리, RoRA는 빠르고 집중력이 높습니다. RoRA는 이미지 조각들에게 단순히 "최고의 것"을 고르는 대신 특정 "직업"을 부여함으로써, 우리가 이 초지능 로봇들이 데이터를 너무 많이 받아 머리가 아프지 않으면서도 세상을 명확하고 빠르게 볼 수 있게 만든다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →