The semantic geometry of action: convergence across foundation models, human behaviour and the brain
이 연구는 파운데이션 모델이 자연스러운 행동들을 인간의 행동적 판단 및 피질 표현과 수렴하는 의미론적 기하학 내에 구조화하며, 인간의 유사성 평가와 뇌 활동 모두를 예측하는 데 있어 전통적인 비디오 인코더보다 뛰어난 성능을 보인다는 점을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
인간은 움직이는 세상을 읽는 데 있어 달인입니다. 우리는 다른 사람을 관찰할 때 단순히 공간을 이동하는 신체를 보는 것이 아니라, 그들이 무엇을 하려고 하는지, 왜 그것을 하는지, 그리고 다음 동작이 무엇일지를 즉각적으로 이해합니다. 이러한 역동적인 동작을 해석하는 능력은 인간 지능의 초석이며, 이를 통해 복잡한 사회적 상황을 탐색하고 타인과 협력할 수 있습니다. 수십 년 동안 과학자들은 이와 동일한 능력을 갖춘 인공지능을 구축하기 위해 노력해 왔습니다. 현대의 컴퓨터 프로그램은 이제 사람이 걷는 것과 뛰는 것을 구별하는 등 높은 정확도로 동작을 식별할 수 있지만, 연구자들은 오랫동안 이 기계들이 인간과 같은 방식으로 움직임 이면에 담긴 의미를 실제로 이해하고 있는지 의문을 제기해 왔습니다. 이 기계들이 우리가 사용하는 것과 동일한 논리에 기반하여 내부적인 '마음' 속에 이러한 동작들을 조직하는 것인지, 아니면 단순히 픽셀의 패턴을 매칭하는 것에 불격한 것인지 말입니다.
중국 자동화 연구소(Institute of Automation)의 연구팀은 이제 이 질문에 답하기 위한 중요한 발걸음을 내디뎠습니다. 그들은 인간과 첨단 인공지능이 인간의 동작이라는 개념을 어떻게 조직하는지에 대한 숨겨진 구조를 매핑하고자 했습니다. 대규모 언어 모델, 시각과 텍스트를 모두 처리할 수 있는 멀티모달 모델, 그리고 인간의 뇌가 가진 행동의 내부적 '지형'을 비교함으로써, 그들은 놀라운 수렴을 발견했습니다. 이 연구는 인공 시스템이 방대한 양의 데이터로 학습될 때, 인간의 지각과 밀접하게 일치하며 심지어 인간의 뇌가 이러한 움직임을 처리하는 방식을 모방하는 방식으로 인간의 동작에 대해 생각하는 법을 자발적으로 개발한다는 것을 시사합니다.
이를 탐구하기 위해 연구진은 인공지능 모델을 심리학 실험의 참가자처럼 다루었습니다. 그들은 모델들에게 요리, 원예, 싸움, 춤 등 사람들이 다양한 일을 하는 수천 개의 짧은 비디오 클립과 텍스트 설명을 제시했습니다. 모델들에게는 단순하지만 결정적인 과제가 주어졌습니다. 세 가지 서로 다른 동작이 주어졌을 때, 그중 어떤 것이 '다른 하나(odd one out)'인지 식별하는 것이었습니다. 예를 들어, 누군가 스키를 타는 영상, 그림을 그리는 영상, 암벽 등반을 하는 영상을 보여주면, 모델은 나머지 둘과 가장 다른 동작이 무엇인지 결정해야 했습니다. 연구진은 모델이 이러한 선택을 수백만 번 수행하도록 함으로써, 모델이 동작을 분류하는 데 사용하는 보이지 않는 정신적 지도를 재구성할 수 있었습니다. 연구진은 또한 대규모의 인간 참가자 그룹을 대상으로 동일한 작업을 수행하여, 사람들이 자연스럽게 행동을 그룹화하고 구별하는 기준(baseline)을 만들었습니다.
결과에 따르면, 동작에 대한 설명만을 읽는 텍스트 전용 모델과 실제 영상을 시청하는 멀티모달 모델 모두 인간의 지도와 매우 유사한 내부 지도를 개발했습니다. 이 지도들은 무작위가 아니었습니다. 이들은 유사한 행동은 가깝게 배치하고 서로 다른 행동은 멀리 떨어뜨려 놓는 저차원 공간 내에 동작들을 조직했습니다. 결정적으로, 이 인공 지도는 단순한 시각적 특징에 의존하는 전통적인 비디오 분석 도구들보다 인간의 선택을 더 잘 예측했습니다. 연구는 모델들이 단순히 영상을 암기하는 것이 아니라, 인간이 움직임을 이해하기 위해 사용하는 추상적인 목표와 사회적 맥락을 포착하고 있다는 것을 발견했습니다. 예를 들어, 모델들은 '사회적'인 행동들을 함께 묶고 이를 '고립된' 과업들과 분리하는 법을 배웠으며, 이는 사람들이 하는 방식과 동일했습니다.
이러한 내부 지도가 진정으로 의미 있는 것이며 단순히 통계적인 속임수가 아님을 증명하기 위해, 연구진은 두 가지 엄격한 방식으로 테스트를 진행했습니다. 첫째, 그들은 모델의 내부 지도를 비디오 생성 시스템을 가이드하는 데 사용했습니다. 모델의 내부 표현에서 단 하나의 수치를 조정함으로써, 그들은 비디오의 내용을 부드럽게 변화시킬 수 있었습니다. 만약 '자연 관련' 차원의 값을 높이면 실내 장면이 실외 장면으로 변했고, '스포츠' 차원을 높이면 활동이 운동 경기 쪽으로 이동했습니다. 이는 모델이 새로운 일관된 시각적 장면을 만들어낼 수 있도록 조절 가능한 뚜로 된 동작 개념을 학습했음을 입증했습니다.
둘째, 그리고 아마도 가장 중요한 점은, 연구진이 이 인공 지도가 인간의 뇌 활동을 예측할 수 있는지 테스트했다는 것입니다. 그들은 모델로부터 학습된 고정된 지도를 가져와서, 사람들이 수천 개의 서로 다른 동작 영상을 시청할 때의 뇌 스캔 데이터셋에 적용했습니다. 그 결과, 모델의 내부 조직화가 특정 동작을 볼 때 인간의 뇌 어느 부분이 활성화될지를 성공적으로 예측한다는 것을 발견했습니다. 영상을 전혀 본 적 없이 오직 언어적 설명만을 통해 동작 개념을 학습한 텍스트 기반 모델들은, 복잡한 사회적 및 목표 지향적 행동을 이해하는 데 책임이 있는 고차원 뇌 영역의 활동을 예측하는 데 특히 뛰어났습니다. 이는 언어를 통해 순수하게 학습된 동작의 추상적 개념이 움직임을 표현하는 인간 뇌의 핵심 구조를 포착하기에 충분하다는 것을 시사합니다.
이 연구는 모델 유형 간의 흥미로운 차이점도 강조했습니다. 영상을 시청하는 모델은 미세한 시각적 세부 사항을 포착한 반면, 텍스트 전용 모델은 동작을 광범위하고 의미 있는 범주로 조직하는 데 놀라울 정도로 효과적이었습니다. 일부 뇌 영역에서는 텍스트 기반 모델이 인간의 신경 반응을 예측하는 데 있어 비디오 모델보다 더 나은 성능을 보이기도 했습니다. 이는 동작에 대한 개념적 이해, 즉 사람이 무엇을 달성하려고 하는지를 아는 것이, 움직임이 어떻게 보이는지에 대한 구체적인 시각적 세부 사항보다 인간과 같은 지각을 하는 데 더 중요할 수 있음을 암시합니다.
궁극적으로, 이 연구는 인공 지능과 생물학적 지능 사이의 관계를 이해하는 강력하고 새로운 방법을 제공합니다. 이는 기계가 충분한 데이터에 노출되면, 인간과 공유된 의미론적 기하학(semantic geometry)을 개발하여 우리 자신의 방식과 기능적으로 유사한 방식으로 세상의 동작을 조직할 수 있음을 보여줍니다. 이 연구는 기계에게 인간의 규칙을 명시적으로 프로그래밍해야 한다고 주장하는 것이 아니라, 오히려 인간 경험의 풍요로움에 대한 노출을 통해 스스로 이러한 구조를 발견하도록 두어야 한다고 제안합니다. 이 연구는 기계가 의식이나 감정을 가지고 있다고 주장하는 것은 아니지만, 기계가 인간의 행동에 대해 깊이 정렬된 구조적 이해를 구축할 수 있음을 입증하며, 이는 인간과 기계 사이의 미래 상호작용을 위한 유망한 토대를 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.