Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition
Zero-MELO는 미세한 시각적 증거 획득을 위한 트리 탐색 메커니즘과 점수 편향을 완화하기 위한 보정 모듈을 채택함으로써 멀티모달 거대 언어 모델의 제로샷 미세 제스처 인식을 향상시키는 새로운 테스트 시점 증거 보정 프레임워크이며, 이를 통해 벤치마크 데이터셋에서 기존 베이스라인들을 유의미하게 능가한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 움직임은 그 자체로 하나의 언어이며, 손을 흔들거나 엄지를 치켜세우는 것과 같은 커다란 몸짓뿐만 아니라, 찰나의, 거의 보이지 않는 신체의 변화를 통해서도 전달됩니다. 이것들은 미세 제스처(micro-gestures)입니다. 턱을 살짝 긁거나, 손가락을 잠시 꼬거나, 입술을 약간 긴장시키는 것 등이 이에 해당합니다. 수십 년 동안 연구자들은 이러한 미세한 움직임을 연구해 왔는데, 그 이유는 이러한 동작들이 사람이 말을 내뱉기도 전에 그가 무엇을 느끼고 생각하는지를 드러내는 경우가 많기 때문입니다. 하지만 컴퓨터에게 이러한 찰나의 신호를 인식하도록 가르치는 것은 완고한 과제였습니다. 움직임이 너무 빠르고, 너무 작으며, 사람마다 너무 다양해서 표준적인 비디오 분석 도구로는 이를 안정적으로 포착하기 어려웠습니다.
최근 몇 년 사이, 멀티모달 거대 언어 모델(multimodal large language models)로 알려진 새로운 세대의 인공지능이 등장했습니다. 이 시스템들은 이미지를 이해하고 비디오를 일반적인 관점에서 파악하는 데 매우 뛰어납니다. 장면을 묘요하거나, 개를 식별하거나, 복잡한 사건을 설명할 수 있습니다. 그러나 연구자들이 이 강력한 모델들을 사용하여 미세 제스처라는 아주 구체적이고 미세한 움직임을 포착하려고 시도했을 때, 결과는 실망스러웠습니다. 모델들은 미세한 동작을 완전히 놓치곤 했으며, 실제 비디오에서 일어나고 있는 일이 아니라 그 사람이 어떻게 생겼는지 또는 모델이 예상하는 바에 근거하여 추측하곤 했습니다. 이는 마치 모델이 전체 그림은 보고 있지만, 정답을 쥐고 있는 작고 결정적인 세부 사항은 알아채지 못하는 것과 같았습니다.
한 연구팀은 왜 이러한 첨단 모델들이 이토록 특정한 작업에서 실패하는지 이해하고, 모델을 처음부터 다시 학습시키지 않고도 이를 해결할 방법을 찾기 위해 연구를 시작했습니다. 그들은 문제가 모델이 움직임을 볼 능력이 부족해서가 아니라, 올바른 곳을 보고 있지 않으며 스스로의 내부적 기대치에 의해 현혹되고 있다는 점임을 발견했습니다. 모델들은 텍-로부터 학습한 언어 패턴에 너무 많이 의존하여, 비디오를 바탕으로 답을 내는 것이 아니라 질문을 바탕으로 답을 추측하는 경향이 있었습니다. 또한 그들은 종종 신체의 엉뚱한 부분에 집중하여, 제스처를 정의하는 특정 손이나 얼굴의 움직임을 놓치곤 했습니다.
이를 해결하기 위해 연구자들은 Zero-MELO라고 불리는 새로운 방법을 개발했습니다. 모델에게 즉시 단 하나의 답을 내놓으라고 요구하는 대신, 이 시스템은 모델이 주의 깊은 관찰자처럼 행동하도록 강제하는 과정을 설계했습니다. 먼저, 시스템은 모델에게 비디오를 살펴보고 손, 얼굴, 목과 같이 관련이 있을 법한 신체 부위가 어디인지 식별하도록 요청합니다. 그다음, 모델이 해당 특정 영역을 확대하여 더 나은 증거를 수집할 수 있도록 유도하며 일련의 근접 뷰(close-up views)를 생성합니다. 이는 마치 사람이 작은 세부 사항을 보기 위해 눈을 가늘게 뜨고 화면에 가까이 다가가는 것과 유사하지만, 컴퓨터는 비디오 전체에 걸쳐 이를 체계적으로 수행합니다.
모델이 이러한 상세하고 국소적인 뷰를 모두 수집하고 나면, 시스템은 자신의 편향을 교정하기 위한 두 번째 단계를 적용합니다. 연구자들은 모델이 비디오 내용과 상관없이 특정 흔한 답변을 내놓는 강한 경향이 있다는 것을 발견했습니다. 이를 대처하기 위해, 시스템은 모델에게 움직임이나 시각적 세부 사항이 없는 상태의 비디오를 상상하게 하고, 다시 한번 정적인 외형만을 가진 상태를 상상하게 합니다. 이러한 "만약에(what-if)" 시나리오를 실제 비디오와 비교함으로써, 시스템은 모델의 잘못된 추측을 제거하고 진정한 시각적 증거에 집중할 수 있습니다. 마지막으로, 시스템은 서로 다른 확대된 뷰들로부터 얻은 모든 정보와 교정된 점수들을 결합하여 최종 결정을 내립니다.
이 접근 방식의 결과는 상당했습니다. 수천 개의 미세 제스처 사례가 포함된 표준 데이터셋을 통해 테스트했을 때, 새로운 방법은 모델의 정확도를 극적으로 향 향상시켰습니다. 한 데이터셋에서는 성공률이 약 16%에서 거의 27%로 급증했으며, 다른 데이터셋에서는 10%에서 22% 이상으로 두 배 넘게 뛰었습니다. 이 수치들은 상당한 진전을 의미하며, 모델이 주의 깊게 보고 신중하게 생각하도록 유도하기만 한다면 이러한 미세한 움직임을 이해할 능력이 충분히 있다는 것을 보여줍니다.
이 연구는 현재 인공지능이 정교한 인간의 움직임을 이해하는 데 겪는 한계가 반드시 지능의 부족 때문이 아니라, 주의를 집중할 수 있는 적절한 도구의 부재 때문임을 시사합니다. 모델에게 특정 증거를 찾고 자신의 가정을 의심하도록 가르침으로써, 연구자들은 이러한 시스템이 세밀한 관찰을 요구하는 작업에서 훨씬 더 신뢰할 수 있게 만들어질 수 있음을 입증했습니다. 이 작업은 단순히 하나의 작업을 개선하는 것에 그치지 않습니다. 이는 인공지능이 인간이 신체의 미묘한 언어를 관찰할 때 사용하는 것과 같은 정밀함과 세부 사항에 대한 주의력을 가지고 세상을 바라볼 수 있도록 돕는 새로운 사고방식을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.