← 최신 논문
💻 computer science

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

이 논문은 단일 순전파 과정 내에서 널 토큰 프로브(null token probe)를 통해 태스크 조건부 어텐션과 모델 유도 사전 확률(model-induced priors)을 명시적으로 분리함으로써, 공격적인 토큰 예산 하에서도 정확도-효율성 트레이드오프를 개선하여 멀티모달 거대 언어 모델을 가속화하는 학습이 필요 없는 토큰 감소 방법인 PriorTR을 소개한다.

원저자: Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

게시일 2026-06-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "시끄러운 방"

당신이 아주 똑똑한 친구(AI)와 진지한 대화를 나누려고 하는데, 그곳이 수백 명의 사람들(이미지를 나타내는 시각적 토큰들)로 가득 찬 시끄럽고 북적이는 방이라고 상상해 보세요.

당신의 친구는 당신이 던진 구체적인 질문, 예를 들어 *"빨간 셔츠를 입은 사람이 무엇을 하고 있나요?"*라는 질문에 답하려고 노력 중입니다.

하지만 당신의 친구에게는 나쁜 습癖이 하나 있습니다. 바로 당신이 무엇을 물어보든 상관없이, 방 안에서 가장 크고 화려한 목소리를 내는 사람들에게 자연스럽게 시선을 빼앗긴다는 점입니다. 만약 어떤 사람이 스피커 옆에서 밝은 노란색 슈트를 입고 있다면, 그 사람이 당신의 질문과 아무런 관련이 없더라도 당신의 친구는 즉시 그 사람에게 눈길을 고정할 것입니다.

AI의 세계에서는 이를 **"모델 유도 사전 지식(model-induced prior)"**이라고 부릅니다. AI는 당신의 특정 지시 때문이 아니라, 단지 시각적으로 "시끄럽기" 때문에 이미지의 대비가 강하거나 질감이 화려한 부분(예: 밝은 하늘이나 복잡한 배경)에 자연스럽게 집중하게 됩니다.

기존 방식: 가장 큰 목소리를 선택하기

이러한 AI 모델의 속도를 높이려는 기존 방법들은 시간을 아끼기 위해 방 안의 대부분의 사람들을 무시하는 방식을 사용했습니다. 그들은 AI가 누구에게 가장 많은 주의를 기울이고 있는지를 살펴보고, 그 사람들만을 남겨두었습니다.

결함: 기존의 방식들은 AI가 "시끄러운" 사람들(배경 소음)에게 편향되어 있었기 때문에, 결국 잘못된 사람들을 남겨두게 되었습니다. 그들은 노란색 슈트를 입은 사람을 남겨두고, 정작 당신이 물어본 동작을 수행 중인 빨간 셔츠의 사람은 버렸습니다. AI가 남겨진 인원이 매우 적은 상황("엄격한 토큰 예산")에서 추측해야 할 때, AI는 엉뚱한 증거를 보고 있었기 때문에 종종 오답을 내놓았습니다.

새로운 해결책: PriorTR ("침묵 필터")

저자들은 PriorTR이라는 새로운 방법을 제안합니다. 이것은 AI가 자신의 나쁜 습관을 무시하고 오직 당신이 요청한 것에만 집중할 수 있도록 돕는 영리한 트릭이라고 생각하면 됩니다.

작동 방식은 다음과 같습니다.

1. "조용한 관찰자" (Null Token)

AI가 질문에 답하기 전에, 연구진은 AI에게 "더미(dummy)" 질문을 던집니다. 이미지 바로 뒤, 그리고 당신의 질문이 나오기 직전에 조용하고 비어 있는 토큰(마치 빈 공간이나 일시 정지와 같은 것)을 삽입합니다.

  • 비유: 친구에게 이렇게 말하는 것과 같습니다. "그냥 방을 둘러보고, 내가 특별히 아무것도 묻지 않았을 때 누가 가장 눈에 띄는지 말해봐."
  • 결과: 당신의 친구는 시끄럽고 화려한 사람들을 지목할 것입니다. 이 주의 집중 지도(attention map)가 바로 **"사전 지식(Prior)"**입니다. 이는 AI가 자연적으로 무엇을 보고 싶어 하는지를 보여줍니다.

2. "진짜 질문" (Posterior)

그다음, 당신은 실제 질문을 던집니다: "빨간 셔츠를 입은 사람이 무엇을 하고 있나요?"

  • 비유: 당신의 친구는 다시 방을 살피지만, 이번에는 빨간 셔츠를 입은 사람을 찾으려고 노력합니다. 이것이 "사후 확률(Posterior)"(지시어가 포함된 주의 집중)입니다.

3. "뺄셈의 기술" (Prior Correction)

이제 PriorTR은 두 지도를 비교합니다.

  • 쉬운 수학 설명: "진짜 질문" 지도에서 "조용한 관찰자" 지도를 뺍니다.
  • 결과: 만약 AI가 두 경우 모두에서 시끄러운 노란색 슈트를 보고 있었다면, 뺄셈을 통해 그 부분이 상쇄됩니다. 만약 당신이 질문했기 때문에 비로소 빨간 셔츠를 입은 사람을 보기 시작했다면, 그 신호는 강력하게 남게 됩니다.

이것이 "사전 수정된(Prior-Corrected)" 지도를 만들어냅니다. 이는 당신의 구체적인 질문에 의해 제공된 새롭고 유용한 정보만을 강조하며, AI의 자연스러운 편향을 제거합니다.

보상: 더 빠르고 더 똑똑하게

AI가 어떤 사람들이(토큰들이) 실제로 자신의 질문과 관련이 있는지 정확히 알게 되면, 나머지 사람들은 버릴 수 있습니다.

  • 물리적 가지치기(Physical Pruning): AI는 단순히 추가적인 사람들을 "무시"하는 것이 아닙니다. AI는 메모리에서 그들을 물리적으로 제거하고 더 이상 생각하지 않도록 합니다.
  • 이점: 이 방식은 AI를 훨씬 빠르게 만들고(계산 능력 필요량 감소), 더 저렴하게(메모리 사용량 감소) 만들지만, 놀랍게도 배경 소음에 방해받지 않기 때문에 답변의 정확도는 더 높아집니다.

이것이 왜 중요한가

이 논문은 AI에게 매우 적은 수의 "사람"만 남도록 강제할 때(공격적인 토큰 감소), 기존 방식들이 엉뚱한 사람들을 남겨두기 때문에 처참하게 실패한다는 것을 보여줍니다. PriorTR은 이 "침묵 필터" 트릭을 사용하여 올바른 사람들을 남깁니다.

요약하자면: PriorTR은 AI에게 "자연적으로 보고 싶어 하는 것"과 "당신이 실제로 보기를 원하는 것"을 구분하도록 가르쳐서, 똑똑함을 유지하면서도 더 빠르게 작동할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →