← 최신 논문
🤖 machine learning

Improving MLLM Training Efficiency via Stage-Aware Sparsity

본 논문은 정렬 단계 동안 시각 토큰을 동적으로 압축하고 지시 미세조정 단계 동안 불필요한 레이어를 건너뛰어 다양한 계산적 중복 요인을 해결함으로써 멀티모달 대규모 언어 모델의 학습 효율성을 향상시키는 단계 인식형 프레임워크인 희소 학습 방식 (STS) 을 제안한다.

원저자: Kean Shi, Liang Chen, Haozhe Zhao, Baobao Chang

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kean Shi, Liang Chen, Haozhe Zhao, Baobao Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 그림과 글자를 모두 이해하도록 가르치려 하지만, 매우 똑똑하면서도 배고픈 학생 (AI) 을 가르치고 있습니다. 이 학생은 "멀티모달 대규모 언어 모델 (MLLM)"입니다. 문제는 이 학생을 가르치는 일이 엄청나게 비싸고 느리다는 점입니다. 왜냐하면 이 학생은 사진의 모든 단일 픽셀을 보고, 교과서의 모든 단일 층을 읽으려 하기 때문입니다. 비록 그 정보의 대부분이 단순한 노이즈나 반복일지라도요.

이 논문은 **STS(희소 훈련 기법)**라는 새로운 훈련 방법을 제안합니다. STS 를 단일한 요술이 아니라, 학생이 현재 무엇을 배우고 있는지에 따라 접근 방식을 바꾸는 현명한 2 단계 코칭 전략으로 생각하세요.

다음은 간단한 비유로 풀어낸 작동 원리입니다:

핵심 문제: "너무 많은 노이즈"

이러한 AI 모델을 훈련시킬 때, 두 가지 요소가 많은 시간을 낭비합니다:

  1. 시각적 중복성: 사진에는 10,000 개의 픽셀이 있을 수 있지만, 그중 8,000 개는 그저 푸른 하늘이나 빈 배경일 뿐입니다. AI 는 빈 하늘을 처리하는 데 에너지를 낭비합니다.
  2. 층 중복성: AI 는 생각의 여러 "층"(책의 장과 유사) 을 가지고 있습니다. 훈련 초기에는 AI 가 기초를 배우기 위해 모든 장을 읽을 필요가 없습니다.

이 논문은 이러한 "낭비적인" 부분이 학습의 모든 단계에서 동일하지 않다고 주장합니다. 초기에 시간을 낭비하는 것과 후반부에 시간을 낭비하는 것은 다릅니다.

해결책: 2 단계 코칭 계획

저자들은 훈련 단계에 따라 전술을 전환하는 시스템을 설계했습니다. 마치 코치가 선수가 워밍업 중인지 경쟁 중인지에 따라 훈련 방법을 바꾸는 것과 같습니다.

1 단계: "사진 필터" (모달리티 정렬)

상황: 시작 단계에서 AI 는 그림과 글자를 연결하는 법을 배우고 있습니다. AI 의 "언어" 부분은 고정되어 있습니다 (아직 새로운 단어를 배우지 않음), 하지만 너무 많은 그림 세부 사항에 빠져 허우적거리고 있습니다.
비유: 4K 영화를 보여줘서 이야기를 설명한다고 상상해 보세요. 학생은 프레임의 압도적인 수에 압도당합니다.
해결책 (시각 토큰 압축기): 영화 전체를 보여주는 대신, 코치 (STS) 는 스마트 필터를 사용합니다. 이 필터는 이미지를 빠르게 스캔하며 "이 부분은 그냥 푸른 하늘이니 건너뛰어. 이 부분은 얼굴이니 유지해."라고 말합니다.

  • AI 가 이미지를 보기 전에도 지루하고 반복적인 부분을 제거합니다.
  • 이는 시작 단계에서 막대한 에너지를 절약해 줍니다.

2 단계: "개요 독서" (지시 미세 조정)

상황: 이제 AI 는 그림을 보는 법을 알았으며, 복잡한 지시를 따르고 대화하는 법을 배우는 시기입니다. AI 의 "언어" 부분은 이제 활성화되어 학습 중입니다.
비유: 학생이 두꺼운 교과서를 읽고 있다고 상상해 보세요. 초반에는 기초를 이해하기 위해 모든 단어를 읽어야 하지만, 똑똑해짐에 따라 "나는 1 장과 2 장을 이미 알고 있어. 10 장의 새롭고 까다로운 부분에 집중하기 위해 이 부분들은 빠르게 훑어볼 수 있어."라고 깨닫기 시작합니다.
해결책 (층 동적 건너뛰기): 코치는 AI 에게 말합니다. "이 특정 수업에서는 당신의 전체 두뇌 능력을 사용할 필요가 없어. 처음 몇 개의 '생각 층'을 건너뛰고 바로 더 깊은 층으로 뛰어넘을 수 있어."

  • 훈련이 진행되고 AI 가 나아질수록, 코치는 점차 다시 더 많은 층을 읽도록 만듭니다.
  • 이는 AI 가 이미 이해하는 것들에 대해 불필요한 정신적 체조 (기교) 를 하지 않도록 막아줍니다.

결과: 더 빠르고, 날렵하며, 여전히 똑똑함

이 논문은 여러 다른 AI 모델에서 이 "2 단계 코칭"을 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • 막대한 절약: AI 는 훈련에 필요한 컴퓨팅 파워 (FLOPs) 를 약 17% 적게 사용했습니다. 이는 마라톤을 17% 더 짧은 시간에 완주하는 것과 같습니다.
  • 지능의 큰 하락 없음: 많은 작업을 건너뛰었음에도 불구하고, AI 는 모든 작업을 수행했을 때 얻을 수 있었을 시험 점수의 **97% 에서 99%**를 여전히 얻었습니다.
  • 균형 잡힌 접근: 논문은 "사진 필터"만 사용하거나 "개요 독서"만 사용할 경우 결과가 그다지 좋지 않다고 발견했습니다. 속도와 지능의 가장 좋은 균형을 얻으려면 두 가지 전략을 적절한 시기에 함께 작동시켜야 합니다.

요약하자면

이 논문은 이렇게 말합니다: "AI 훈련 과정을 하나의 길고 지루한 고역으로 취급하지 마세요. 서로 다른 지형을 가진 여정으로 취급하세요. AI 가 그림을 볼 때는 배경 노이즈를 무시하도록 도와주고, AI 가 말하는 법을 배울 때는 이미 알고 있는 장을 건너뛰게 하세요. 이렇게 함으로써 우리는 AI 가 지능을 잃지 않은 채 훨씬 더 빠르게 초지능 AI 모델을 훈련시킬 수 있습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →