ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
ReGATE는 안내 손실과 난이도 추정을 활용하여 불필요한 토큰을 적응적으로 가지치기함으로써 멀티모달 대규모 언어 모델 학습을 가속화하는 교사-학생 프레임워크로, 전체 토큰 소비를 크게 줄이면서도 더 빠른 수렴과 우수한 성능을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑한 로봇에게 비디오를 이해하도록 가르치려 한다고 상상해 보세요. 현재 이 작업을 수행하는 표준 방식은 로봇이 영화를 보는 동안 "the", "is", "and" 같은 지루한 단어까지 스크립트의 단어 하나하나를 읽도록 강요하는 것과 같습니다. 이는 매우 느리고 비용이 많이 들며 많은 에너지를 낭비합니다. 로봇이 불필요한 작업을 수행하기 때문입니다.
이 논문은 REGATE(Reference-Guided Adaptive Token Elision, 참조 기반 적응형 토큰 생략) 라는 새로운 방법을 소개합니다. REGATE 를 초고효율 학습 코치로 생각하면 되는데, 이 코치는 로봇이 어떤 단어에 집중해야 하고 어떤 단어를 건너뛰어야 하는지 정확히 알려줌으로써 로봇이 더 빠르게 학습하도록 도와줍니다.
간단한 비유를 들어 작동 원리를 설명해 보겠습니다.
1. 문제: 스크립트 전체를 읽는 것
기존 방식 (표준 학습) 에서는 로봇이 비디오 설명의 모든 "토큰"(텍스트 조각) 을 처리합니다.
- 비유: 모든 단어가 형광색으로 강조된 책을 읽으며 새로운 언어를 배우려 한다고 상상해 보세요. 당신은 실제로 이야기의 맥락을 가르쳐 주지 않는 "the"나 "a" 같은 흔한 단어들을 수 시간 동안 뚫어지게 바라보게 됩니다. 당신은 지쳐가고, 학습 속도는 느려집니다.
2. 해결책: "교사"와 "학생"
REGATE 는 두 명의 팀으로 구성됩니다.
- 학생: 우리가 훈련시키려는 주요 로봇 모델입니다. 이 모델은 비디오와 텍스트를 모두 봅니다.
- 교사: 이는 오직 텍스트만 보는 "동결된"(변하지 않는) 로봇 버전입니다. 이 교사는 비디오를 볼 수 없습니다.
두 사람이 어떻게 협력하는지:
교사는 문장을 보고 "비디오를 보지 않고 텍스트만 읽어서 이 단어의 의미를 추측할 수 있을까?"라고 묻습니다.
- 만약 단어가 "the"나 "is"라면, 교사는 "쉬워요! 이건 알아요"라고 말합니다.
- 만약 단어가 "red(빨간)", "spinning(회전하는)", "mixing(섞는)"이라면, 교사는 "와, 그림을 보지 않으면 이걸 추측할 수 없어요! 이 단어는 비디오가 필요해요"라고 말합니다.
3. "난이도 점수"
REGATE 는 교사의 추측과 학생의 과거 학습 기록을 결합합니다.
- 비유: 학생이 모의고사를 치르고 있다고 상상해 보세요. REGATE 는 학생이 계속 틀리는 질문들을 기록해 둡니다.
- 교사가 "이 단어는 비디오가 필요해요"라고 말하고, 동시에 학생이 이전에 비슷한 단어들을 어려워했다면, REGATE 는 그 단어를 **"우선순위 높음"**으로 표시합니다.
- 교사가 "이 단어는 알아요"라고 말하고, 학생이 이미 완전히 마스터했다면, REGATE 는 그것을 **"건너뛰기"**로 표시합니다.
4. 결과: "스마트 건너뛰기"
학습 과정에서 REGATE 는 마스킹을 생성합니다. 로봇에게 "이 중요한 단어들은 읽되, 지루한 단어들은 건너뛰어"라고 알려주는 것입니다.
- 비유: 책 페이지를 한 장씩 모두 읽는 대신, 로봇은 이제 이야기를 실제로 진행시키는 강조된 문장들만 읽습니다. 불필요한 단어들은 무시합니다.
- 효과: 로봇은 작업을 40% 덜 수행합니다 (더 적은 토큰을 처리). 하지만 이미 알고 있는 것들에 에너지를 낭비하지 않기 때문에 동일하거나 더 나은 수준으로 학습합니다.
논문이 주장하는 바 (결과)
저자들은 이 방법을 세 가지 다른 유형의 비디오 학습 로봇에서 테스트했습니다.
- VideoChat2
- VideoLLaMA2
- InternVL3.5
그들은 다음과 같은 사실을 발견했습니다.
- 속도: 로봇들은 평소보다 두 배 빠른 속도로 최고 성능에 도달했습니다.
- 효율성: 표준 방식에 비해 토큰 (단어/조각) 을 38% 만 사용했습니다.
- 정확도: 많은 경우, REGATE 로 훈련된 로봇은 기존 방식으로 훈련된 로봇보다 더 똑똑해졌습니다. 특히 복잡한 비디오 질문에서 그랬습니다.
- 추가 비용 없음: 이 방법은 새로운 로봇을 만들거나 추가 부품을 추가할 필요가 없습니다. 학습 중 로봇이 읽는 방식만 바꾸면 됩니다.
요약
REGATE 는 AI 학습을 위한 스마트 필터와 같습니다. AI 에게 스크립트의 모든 단어를 읽게 하는 대신, "텍스트 전용" 전문가를 활용하여 실제로 비디오 문맥이 필요로 하는 단어를 식별합니다. 쉽고 중복된 단어들을 건너뛰음으로써 AI 는 더 빠르게 학습하고, 더 적은 전력을 사용하며, 모든 것을 읽었을 때보다 종종 더 똑똑해집니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.