← 최신 논문
🤖 AI

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

MuCRASP는 시각-언어 모델의 멀티모달 체인-오브-생각 추론 정확도를 보존하기 위해 추론에 결정적인 피벗 토큰을 식별하고 보호하며 교차 모드 활성화 차이를 해결하는 새로운 구조적 가지치기 프레임워크로, 높은 압축률에서도 기존 방법보다 우수한 성능을 보입니다.

원저자: Aritra Dutta, Somak Aditya

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aritra Dutta, Somak Aditya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 복잡한 퍼즐을 해결하는 데 탁월한 다재다능한 조수가 있다고 가정해 봅시다. 이 조수는 어지러운 방 사진 같은 이미지를 보고 "화분을 넘어뜨리면 고양이가 젖을까요?"와 같은 질문을 읽을 수 있습니다. 답을 내기 위해 이 조수는 단순히 추측하지 않고, 생각을 어떻게 연결하는지 설명하는 단계별 사고 일지를 작성합니다. 이를 연쇄 사고 (Chain-of-Thought, CoT) 추론이라고 합니다.

그러나 이 조수는 매우 큽니다. 실행하려면 막대한 컴퓨터 메모리와 에너지가 필요하여 많은 사람들이 일상생활에서 사용하기에는 비용이 너무 비쌉니다.

문제: "가위" 실수
과학자들은 이 조수를 작게 만들기 위해 "가지치기 (pruning)"를 시도해 왔습니다. 즉, 사용하지 않는다고 생각되는 뇌의 일부를 잘라내는 것입니다. 마치 정원사가 거대한 관목을 작은 화분에 맞게 다듬는 것과 같습니다.

이전 방법들의 문제는 그들이 맹인 가위를 들고 있는 정원사 같았다는 점입니다. 그들은 관목이 실제로 무엇을 하고 있는지 이해하지 못한 채, 가지가 일반적으로 얼마나 "무겁거나" "활발한지"에 따라 잘라냈습니다.

  • 결과: 관목을 작게 만들기 위해 가지치기를 할 때, 논리적 단계를 연결해 주는 매우 구체적이고 작은 나뭇가지를 실수로 잘라버렸습니다. 조수는 작고 빨라졌지만, 논리적으로 생각하는 능력을 잃었습니다. 여전히 유창하게 말할 수는 있지만, 추론은 깨졌습니다. 마치 문장 자체는 individually 의미가 있지만 줄거리가 전혀 말이 안 되는 이야기와 같습니다.

해결책: µCRASP (똑똑한 정원사)
이 논문의 저자인 아리트라 두타 (Aritra Dutta) 와 소막 아디티야 (Somak Aditya) 는 µCRASP라는 새로운 방법을 개발했습니다. 맹인 정원사 대신 µCRASP 는 관목이 수행하는 특정 작업인 추론을 이해하는 똑똑한 정원사입니다.

다음은 세 가지 간단한 비유를 사용하여 µCRASP 가 작동하는 방식입니다:

  1. "회전 지점" 찾기 (방향 지시등):
    긴 추론 과정에서 대부분의 단어는 단순히 채워진 말뿐입니다. 하지만 "화분이 보입니다" \rightarrow "따라서 떨어질 수 있습니다"와 같이 조수가 한 생각에서 다음 생각으로 전환하는 몇 가지 결정적인 순간들이 있습니다. 저자들은 이를 **회전 토큰 (pivot tokens)**이라고 부릅니다.

    • 비유: 기차 여행을 상상해 보세요. 대부분의 선로는 곧은 선일 뿐입니다. 하지만 기차가 선로를 바꾸는 분기점이 가장 중요한 부분입니다. 만약 분기점에서 선로를 잘라내면 기차가 탈선합니다. µCRASP 는 이러한 분기점을 식별하고, 지루하고 곧은 선로를 더 많이 잘라내더라도 분기점은 절대로 잘라내지 않습니다.
  2. "두 뇌" 시스템 존중 (시각 + 언어):
    이 조수는 이미지를 보는 것 (시각) 과 단어를 읽는 것 (언어) 을 위한 두 가지 뚜렷한 사고 방식을 가지고 있습니다. 이 두 부분은 끊임없이 서로 소통해야 합니다.

    • 비유: 사진작가와 작가로 구성된 두 사람의 팀이 미스터리를 해결하기 위해 함께 일한다고 상상해 보세요. 기존의 가지치기 방법은 이들을 하나의 거대한 덩어리로 취급하고 무작위로 잘라냈습니다. 반면 µCRASP 는 사진작가와 작가가 소통하는 사람들을 잘라내면 팀이 무너진다는 것을 깨닫습니다. 이 두 뇌가 연결되는 "회의실"을 특별히 보호합니다.
  3. 전체 예산 (배낭):
    목표는 뇌의 특정 비율 (예: 30%) 을 잘라내어 작게 만드는 것입니다.

    • 비유: 배낭 (컴퓨터 메모리) 이 있고 많은 장비를 넣어야 한다고 상상해 보세요. 이전 방법들은 무거운 부츠의 30% 와 가벼운 양말의 30% 를 잘라내어 부츠는 없고 양말만 너무 많이 남게 할 수 있습니다. µCRASP 는 똑똑한 포장꾼처럼 행동합니다. 각 항목 (뉴런) 의 무게에 대한 가치를 살펴봅니다. 무거운 부츠는 (추론에 필수적이므로) 유지하고 가벼운 양말은 많이 잘라내어 배낭은 작지만 여전히 완전히 기능하도록 결정할 수 있습니다.

결과
연구진은 여러 다른 "조수" (AI 모델) 에 대해 이를 테스트한 결과 다음과 같은 사실을 발견했습니다:

  • 이전 방법들은 추론 능력을 매우 빠르게 파괴했습니다. 25~30% 이상을 잘라내는 순간, 논리가 완전히 붕괴되었습니다.
  • µCRASP는 모델을 **50%**까지 잘라내더라도 논리를 온전하게 유지했습니다.
  • 모델이 원래 크기의 절반이 되었음에도 불구하고, 거대하고 비싼 버전과 동일한 논리적 명료함으로 복잡한 시각적 퍼즐 (물리 문제나 사물 세기 등) 을 해결할 수 있었습니다.

요약
µCRASP 는 AI 의 뇌를 망가뜨리지 않고 똑똑한 AI 모델을 축소하는 새로운 방법입니다. 이는 AI 가 한 생각에서 다음 생각으로 전환하는 작고 중요한 순간들을 신중하게 식별하고 보호하며, AI 의 "눈"과 "입"이 연결되도록 보장함으로써 이를 수행합니다. 이를 통해 강력한 추론 도구가 단계별로 생각하는 능력을 잃지 않고도 작고 저렴한 컴퓨터에서 실행될 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →