Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates
Human-JEPA는 앵커 기반 예측(anchored forecasting)을 통해 비디오로 학습된 인간 중심의 비전 모델로서, 기존의 전문 모델들보다 훨씬 적은 파라미터로도 정적 인지와 미래 예측 모두에서 최첨단 성능을 동시에 달성하며, 움직임 이해와 모델 붕괴에 관한 이전의 한계들을 극복한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 시각은 이중 엔진입니다. 단순히 지금 일어나고 있는 일을 기록하는 데 그치지 않고, 다음에 일어날 일이 무엇인지에 대한 시뮬레이션을 끊임없이 실행합니다. 당신이 누군가 컵을 향해 손을 뻗는 것을 볼 때, 당신의 뇌는 동시에 그 사람을 식별하고, 자세를 추적하며, 손이 도착하기 전에 정확히 어디에 닿을지를 예측합니다. 수십 년 동안 인공지능은 이 방정식의 두 번째 절반을 복제하는 데 어려움을 겪어 왔습니다. 기계는 한 장의 사진을 분석하여 사람의 얼굴, 의복 또는 자세를 식별하는 데는 매우 뛰어나게 되었지만, 시간의 흐름에는 대체로 눈이 멀어 있었습니다. 기계는 정지된 이미지를 매우 상세하게 묘사할 수는 있지만, 비디오 내에서의 미래 움직임을 예측하지는 못합니다. 이러한 격차는 인간 이해의 상당 부분을 컴퓨터의 영역 밖으로 남겨두었으며, 컴퓨터가 자연스럽거나 안전한 방식으로 세상과 상호작용하는 능력을 제한했습니다.
새로운 연구는 이 간극을 메우기 위해 설계된 Human-JEPA라는 시스템을 소개합니다. 연구진은 인간의 라벨이나 수동 주석 없이 오직 비디오 영상만을 사용하여, 현재를 지각함과 동시에 미래를 예측하도록 학습하는 모델을 구축했습니다. 이 발견의 핵심은 시스템을 어떻게 훈련시켰느냐에 있습니다. 기존의 인간 움직임을 가르치려는 시도들은 학습 과정 자체에 결함이 있었기 때문에 실패하는 경우가 많았습니다. 시스템이 비디오로부터 학습하려고 할 때, 정적인 패턴을 복제하는 데 너무 집중한 나머지 팔다리의 모양이나 옷의 질감과 같은 인체의 세부 사항을 이해하는 능력을 조용히 상실하곤 했습니다. 연구진은 인간 형태에 대한 시스템의 기억을 고정된 시작점에 닻을 내리게 하고, 과거의 빈 부분을 채우는 대신 미래를 예측하도록 강제함으로써 이러한 붕괴를 방지할 수 있다는 것을 발견했습니다. 그 결과, 이 모델은 해당 분야의 이전 선두 모델들보다 훨씬 작으면서도, 인간의 움직임을 추적하고 개인을 식별하는 능력에서 더 뛰어난 성능을 보이는 동시에 다음 상황을 추측하는 능력까지 유지하게 되었습니다.
팀이 직면한 과제는 기존의 강력한 모델들이 정지된 이미지로 훈련되었다는 점이었습니다. 이 모델들은 사진을 읽는 데는 탁월하지만, 움직임은 이해하지 못합니다. 움직이는 사람을 이해하는 시스템을 만들기 위해, 연구진은 인터넷으로부터 일반적인 패턴을 이미 학습한 비디오 기반 모델로 시작했습니다. 그런 다음 이를 인간에게 집중하도록 특화시켰습니다. 그러나 단순히 이 모델에게 사람의 영상을 더 많이 보여주는 것만으로는 효과가 없었습니다. 시스템은 퇴보하기 시작하여 신체 부위나 의복과 같은 미세한 세부 사항을 인식하는 능력을 잃었는데, 이는 훈련 과정에서조차 오류 신호를 나타내지 않을 정도로 미묘한 실패였습니다. 모델은 움직임을 배우려고 노력하는 동안 인간이 어떻게 생겼는지를 사실상 잊어가고 있었던 것입니다.
이를 해결하기 위해 연구진은 '앵커링 포캐스팅(anchored forecasting)'이라 부르는 방법을 도입했습니다. 이미 알고 있는 기초를 잊으라는 지시를 받으며 새로운 기술을 배우려는 학생을 상상해 보십시오. 그 학생은 아마 혼란에 빠져 기초를 잃게 될 것입니다. 연구진은 시스템의 인간 형태에 대한 이해를 원래 지식의 얼어붙은 변하지 않는 복사본에 "고정(pinning)"함으로써 이를 방지했습니다. 이 닻은 모델이 미래의 움직임을 예측하는 동안에도 현재를 인식하는 능력을 잃지 않도록 보장했습니다. 또한, 사람의 정지 영상을 활용한 훈련 데이터 스트림을 추가하여 시스템이 인간의 외형에 대한 날카로운 감각을 유지하도록 도왔습니다. 이 조합을 통해 모델은 움직임을 예측하는 법을 배우면서도 인체의 상세한 지각 능력을 유지할 수 있었습니다.
두 번째 주요 변화는 훈련 중 시스템을 테스트하는 방식에 있었습니다. 표준적인 방법들은 종 often 모델에게 비디오의 누락된 블록을 채우도록 요구하는데, 이는 모델이 시간과 공간상에서 주변의 것을 단순히 복사하도록 유도합니다. 이것은 장면이 어떻게 진화하는지를 진정으로 학습하는 것을 방해하는 지름길입니다. 연구진은 이를 순수한 '과거 대 미래 분할(past-to-future split)'로 교체했습니다. 모델에게 비디오 클립의 전반부를 보여주고 후반부를 예측하도록 요청했습니다. 미래가 완전히 가려져 있었기 때문에, 성공할 수 있는 유일한 방법은 장면이 시간에 따라 어떻게 변하는지에 대한 진정한 모델을 구축하는 것뿐이었습니다. 이로 인해 시스템은 정적인 패턴을 암기하는 대신 인간 움직임의 역학을 학습하도록 강제되었습니다.
이러한 접근 방식의 결과는 놀라웠습니다. (더 이상의 학습을 허용하지 않는) 동결된 체크포인트에서 테스트했을 때, 새 모델은 파라미터 수가 2.7배 적음에도 불구하고 사용 가능한 가장 크고 전문화된 인간 시각 모델들을 능가했습니다. 이 모델은 인간의 자세를 추적하고 군중 속에서 개인을 식별하는 데 있어 더 높은 정확도를 달しまいました. 예를 들어, 사람을 재식별하는 표준 테스트에서 자체 기본 버전보다 점수를 2.7점 높였으며, 기존의 이미지 기반 전문가 모델을 넘어섰습니다. 아마도 가장 중요한 점은, 이러한 변화들에도 불구하고 미래를 예측하는 모델의 능력이 저하되지 않았다는 것입니다. 실제로, 시스템의 예측 헤드(predictor head)는 다른 능력들을 해치지 않으면서 예측 능력을 향상시킨 첫 번째 사례였습니다.
연구팀은 또한 직관적인 아이디어들이 작동하지 않음을 엄격하게 테스트하여 몇 가지를 배제했습니다. 연구진은 사람 자체를 예측의 단위로 삼아, 사람 전체를 마스킹 처리하여 모델이 파트너를 추적할 수 있는지 실험했습니다. 이 접근 방식은 모델의 상호작용 이해 능력을 완전히 붕괴시키며 실패했습니다. 또한 단순히 더 많은 데이터를 추가하거나 모델의 크기를 키우는 것만으로는 모델의 학습 과정에서 발생한 근본적인 문제를 해결할 수 없다는 것을 발견했습니다. 실패의 원인은 데이터나 컴퓨팅 파워의 부족이 아니라, 학습 목표가 구조화된 방식의 근본적인 결함 때문이었습니다. 연구는 인간을 시간 속에서 이해하는 열쇠는 단지 그들을 관찰하는 것이 아니라, 그들의 형태에 대한 지각을 고정하면서 동시에 그들의 미래를 예측하도록 강제하는 데 있다는 결론을 내렸습니다.
이 연구는 인공지능의 새로운 방향을 제시합니다. 하나의 모델이 정적인 현재의 지각과 동적인 미래의 예측이라는, 이전에는 별도의 접근 방식이 필요하다고 생각되었던 두 가지 과제를 성공적으로 처리할 수 있음을 입증했습니다. 상세한 지각의 조용한 붕괴를 방지하고 진정한 학습을 방해하는 지름길을 제거함으로써, 연구진은 사람들이 존재하는 그대로의 모습, 즉 시간 속에서 움직이고 변화하는 존재로서의 사람을 보는 시스템을 만들어냈습니다. 이 결과는 기계가 인간을 진정으로 이해하기 위해서는 단순히 뒤를 돌아보는 것이 아니라 앞을 내다보도록 가르쳐야 한다는 점을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.