← 최신 논문
💻 computer science

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

본 논문은 멀티모달 대규모 언어 모델이 사전 채우기 어텐션에 잠재된 시간적 그라운딩 능력을 보유하고 있음에도 생성 과정에서 이를 활용하지 못한다는 점을 밝혀내어, 이러한 어텐션 단서를 추출하여 시각적 컨텍스트를 제한하고 비디오 시간적 그라운딩 성능을 획기적으로 향상시키는 훈련 없는 추론 프레임워크를 제안합니다.

원저자: Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"MLLMs Know When Before Speaking" 논문은 간단한 언어와 창의적인 비유를 통해 설명합니다.

큰 문제: "모든 것을 아는 사람"이 잊어버리는 경우

아주 똑똑하고 여행을 많이 다녀본 친구 (멀티모달 대규모 언어 모델, 또는 MLLM) 가 있다고 상상해 보세요. 이 친구는 동영상을 완벽하게 묘사할 수 있습니다. 여러분이 이 친구에게 자동차를 수리하는 남자의 동영상을 보여주고 "그가 볼트를 조이기 시작하는 시점은 언제인가요?"라고 물어본다고 가정해 봅시다.

친구는 전체 동영상을 보고 잠시 생각한 후 "아, 그건 2 분 00 초에서 2 분 30 초 사이에 일어납니다"라고 말합니다. 하지만 틀렸습니다. 볼트는 실제로 1 분 10 초에서 1 분 20 초 사이에 조여졌습니다.

이 논문의 연구자들은 놀라운 사실을 발견했습니다: 친구는 실제로 올바른 시간을 알고 있었지만, 말을 하기까지 그 사실을 잊어버린 것입니다.

발견: "내부 GPS" 대 "시끄러운 방"

연구팀은 모델의 "뇌" (주의 메커니즘) 를 들여다보면서 분열된 성격을 발견했습니다:

  1. "프리필 (Prefill)" 단계 (메뉴 읽기): 모델이 처음 질문을 읽고 동영상을 스캔할 때, 소수의 특수한 뉴런들 (시간적 grounding 헤더라고 부름) 이 레이저처럼 초점을 맞춘 GPS 역할을 합니다. 이는 행동이 일어나는 정확한 초를 고정합니다. 이 순간 모델은 답에 대해 100% 확신을 가지고 있습니다.
  2. "디코딩 (Decoding)" 단계 (메뉴 주문하기): 모델이 답변을 한 단어씩 타이핑하기 시작하면 산만해집니다. GPS 신호를 잊어버리고 동영상에서 가장 시각적으로 소란스러운 부분을 보기 시작합니다. 만약 동영상 배경에 밝은 빨간색 자동차가 있다면, 모델은 혼란을 겪으며 "아, 그 행동은 빨간색 자동차가 보일 때일 거야!"라고 말할 수 있습니다. 심지어 빨간색 자동차가 볼트와 전혀 관련이 없더라도 말입니다.

비유: 여러분이 붐비는 시끄러운 방 (동영상) 에 있다고 상상해 보세요. 여러분은 친구 (사건) 를 잠시 동안 선명하게 발견합니다. 하지만 그다음에 시끄러운 밴드가 연주를 시작하면 (산만함), 친구는 군중 속에서 사라집니다. 여러분이 친구가 어디 있는지 누군가에게 말하려고 할 때, 친구 대신 밴드를 가리키게 되는 것입니다.

해결책: "읽은 후 다시 말하기"

저자들은 모델을 재학습시키지 않았습니다 (이는 비용이 많이 들고 느리기 때문입니다). 대신, 모델이 답변할 때 작동하는 "스마트 편집자"와 같은 교묘한 "추론 시간 프레임워크"를 구축했습니다.

그들의 두 단계 과정은 다음과 같이 작동합니다:

단계 1: "코로 맡아보기" (읽기)
모델이 최종 답변을 허용받기 전에, 시스템은 읽기 단계 동안 그 특수한 뉴런들로부터의 "GPS 신호"를 확인합니다.

  • 질문: "모델이 실제로 올바른 장소를 찾았는가?"
  • 모델이 확신하는 것처럼 보이고 GPS 신호가 답변과 일치하면, 그냥 모델이 말하게 합니다.
  • 모델이 혼란스러워 보이거나 GPS 신호가 약하면, 시스템은 "중지! 산만해지고 있습니다"라고 말합니다.

단계 2: "집중 필터" (다시 말하기)
모델이 혼란스러워하면 시스템이 개입합니다. 시스템은 동영상을 가져와 GPS 신호가 가리킨 특정 시간 구간을 제외하고는 모든 것을 잘라냅니다.

  • 하드 크롭 (Hard Crop): 동영상 클립을 실제로 그 몇 초만으로 잘라 모델에게 다시 보게 합니다.
  • 소프트 마스크 (Soft Mask): 전체 동영상을 유지하되 산만한 부분 위에 "안대"를 씌워 모델이 관련 있는 몇 초만 "볼" 수 있게 합니다.

이제 소음이 제거되었으므로 모델은 동영상을 다시 봅니다. 산만함이 사라졌기 때문에 혼란을 겪을 수 없습니다. 모델은 질문을 다시 읽고 훨씬 더 정확한 답변을 제시합니다.

결과: 학습 없이 이루어진 "마법"

이 논문은 Qwen3-VL 과 MiMo-VL 과 같은 여러 다른 AI 모델에서 이를 테스트했습니다.

  • 새로운 학습 없음: 그들은 모델에게 새로운 것을 가르칠 필요가 없었습니다. 단지 모델이 답변하는 방식을 변경했을 뿐입니다.
  • 향상된 정확도: 모델들은 올바른 시간을 찾는 데 훨씬 더 능숙해졌습니다. 예를 들어, 한 테스트에서 정확도가 3.5 포인트나 급증했는데, 이는 이 분야에서 매우 큰 성과입니다.
  • 범용성: 이 방법은 일반적으로 이런 작업에 능하지 않은 범용 모델에서 작동했을 뿐만 아니라, 이미 이 작업을 위해 특별히 학습된 모델에서도 작동했습니다.

요약

이 논문은 AI 모델들이 종종 올바른 답을 내부에 숨기고 있지만, 동영상이 너무 시끄럽고 산만하기 때문에 그 답을 잃어버린다는 것을 증명합니다. "읽은 후 다시 말하기" 전략을 사용하여 모델의 내부 집중을 먼저 확인한 다음 산만함을 제거함으로써, 연구자들은 모델들이 이미 알고 있던 것을 기억하도록 도와주었습니다. 이로 인해 모델들은 사건이 언제 일어나는지 우리에게 알려주는 데 훨씬 더 능숙해졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →