← 최신 논문
💻 computer science

Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers

본 논문은 양방향 카메라로 촬영된 돌봄 제공자와 영아 간의 녹화 자료에서 상호 시선과 공동 주의를 자동으로 탐지하는 효율적인 듀얼 스트림 트랜스포머 아키텍처를 소개하며, 이는 기존 베이스라인을 크게 능가하고 발달 심리학 연구를 위한 확장 가능하고 오픈 소스 도구를 제공합니다.

원저자: Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

아기와 부모 사이의 대화를 이해하려 한다고 상상해 보세요. 발달 심리학 세계에서는 두 가지 특정 순간이 매우 중요합니다: 상호 시선(Mutual Gaze, 서로의 눈을 직접 바라보는 순간)과 공동 주의(Joint Attention, 같은 장난감이나 물체를 함께 바라보는 순간)입니다.

수십 년 동안 이러한 순간들을 연구하는 것은 돋보기로 모래 알갱이를 세어보려는 것과 같았습니다. 연구자들은 비디오 녹화물 앞에 앉아 느린 모션으로 재생하며, 아기와 부모가 서로를 보거나 같은 것을 볼 때마다 수동으로 버튼을 클릭해야 했습니다. 이는 느리고 피로하며 인간의 실수에 취약했습니다.

이 논문은 이러한 작업을 자동으로 수행하는 새로운'디지털 조수'를 소개하며, 이전 시도들보다 훨씬 더 잘 수행합니다. 작동 원리를 간단히 설명하면 다음과 같습니다:

문제: "두 대의 카메라"퍼즐

연구자들은 한 방에 두 대의 카메라를 설치했습니다. 하나는 아기에 초점을 맞추고 다른 하나는 부모에 초점을 맞춥니다. 그들이 주의를 공유하는지 파악하려면 컴퓨터가 동시에 두 가지를 이해해야 합니다:

  1. 아기는 무엇을 보고 있는가?
  2. 부모는 무엇을 보고 있는가?
  3. 그 두 가지가 연결되어 있는가?

이전 컴퓨터 프로그램들은 한 번에 하나의 숫자만 보며 수학 문제를 풀려고 하는 학생들과 같았습니다. 서로 다른 두 카메라 뷰 사이의 연결점을 찾는 데 어려움을 겪었습니다.

해결책: "이중 스트림"뇌

저자들은 이중 스트림 트랜스포머(Dual-Stream Transformer)라는 새로운 AI 시스템을 구축했습니다. 이 시스템을 두 쌍의 눈과 그 사이에 있는 초능력을 가진 뇌를 갖춘 고도로 숙련된 탐정으로 생각해보세요.

  1. **두 쌍의 눈 **(백본): 시스템은 비디오 스트림을 보는 두 개의"눈"(신경망) 을 가지고 있습니다. 한 눈은 아기를, 다른 한 눈은 부모를 지켜봅니다.
    • 비밀 무기: 이 눈들은 처음부터 시작하는 것이 아닙니다. 이미 사람의 시선이 어디를 향하고 있는지 파악하는 법을 배운"동결된"사전 훈련된 뇌 (GazeLLE라고 함) 를 사용하고 있습니다. 이는 탐정에게 이미 눈을 완벽하게 추적하는 법을 알고 있는 첨단 안경을 주는 것과 같습니다.
  2. **초능력 뇌 **(트랜스포머): 두 눈이 정보를 수집하면 중앙의"뇌"(트랜스포머) 로 전달합니다. 이 뇌는 아거나 부모를 따로따로 보는 것이 아니라, 함께봅니다. "좋아, 아기는 빨간 블록을 보고 있고 부모도 빨간 블록을 보고 있군. 이것이 공동 주의인가? 아니면 아기는 부모를 보고 부모는 아기를 보고 있는가? 이것이 상호 시선인가?"라고 묻습니다.
  3. 토큰 융합: 시스템은 두 카메라 뷰를 붙여 뇌가 그들 사이의 관계를 이해할 수 있도록 하는 특별한"접착제"(토큰 융합 메커니즘이라고 함) 를 사용합니다.

훈련: 실생활에서 배우기

팀은 가짜 비디오만 사용하지 않았습니다. 그들은 실험실에서 실제 아기와 부모가 노는 장면을 녹화했습니다.

  • 데이터: 약 7 회씩 놀이한 13 개의 다른 부모 - 아기 쌍이 있었습니다.
  • 인간의 손길: AI 가 학습하기 전에 인간 전문가들이 비디오를 시청하여 특별한 순간이 정확히 언제 발생했는지 표시해야 했습니다. 이를 쉽게 하기 위해 팀은 이벤트를 빠르게 라벨링할 수 있는 맞춤형 비디오 도구를 구축했습니다.
  • 결과: AI 는 수천 개의 이러한 라벨링된 순간들을 시청함으로써 이러한 패턴을 인식하는 법을 배웠습니다.

대결: 어떻게 수행되었는가?

연구자들은 새로운"이중 스트림 탐정"을 두 가지 다른 방법과 비교하여 테스트했습니다:

  1. **오래된 학교 방식 **(합성곱 네트워크): 이는 패턴을 찾지만 두 사람 사이의 관계를 실제로"이해"하지 않는 표준 카메라와 같습니다. 이는 완전히 실패하여 추측보다 barely 더 나을 뿐이었습니다.
  2. **대형 언어 모델 **(LLM): 이는 매우 똑똑한 챗봇처럼 볼 수 있는 거대하고 범용적인 AI 입니다. 비록 똑똑하지만 너무 느렸고 이 특정 작업에 특화되지 않았기 때문에 종종 잘못 추측했습니다.

승자: 새로운 이중 스트림 트랜스포머가 압도적으로 승리했습니다.

  • 훨씬 더 정확했습니다(상호 시선의 경우 약 82%, 공동 주의의 경우 77% 정확도).
  • 훨씬 더 빨랐습니다. 대형 언어 모델이 몇 초 분량의 비디오를 처리하는 데 오랜 시간이 걸리는 동안, 새로운 시스템은 거의 즉시 처리할 수 있었습니다.

왜 이것이 중요한가

저자들은 단순히 모델을 구축한 것이 아니라 과학자들을 위한 도구를 구축했습니다.

  • 오픈 소스: 그들은 코드와"뇌"가중치를 무료로 공개했습니다. 이는 다른 연구실들이 이 도구를 가져와 자신의 방에 맞게 약간 조정하고 처음부터 시스템을 구축할 필요 없이 데이터를 분석하기 시작할 수 있음을 의미합니다.
  • 확장성: 빠르고 정확하기 때문에 심리학자들은 이제 며칠 대신 몇 분 안에 수시간 분량의 비디오를 분석할 수 있습니다.

단점 (한계)

이 논문은 시스템이 아직 무엇을 할 수 없는지 정직하게 밝힙니다:

  • 얼굴이 필요합니다: 시스템은 먼저 얼굴을 찾는 별도의 도구에 의존합니다. 카메라가 얼굴을 볼 수 없다면 (아마도 아기가 숨겨져 있을 때), 시스템은 시선을 추측할 수 없습니다.
  • 시간적으로 다소 느립니다: 이는 1 초마다 비디오를 한 번 확인합니다. 그보다 빠르게 발생하는 매우 짧은 순간의 눈길은 놓칠 수 있습니다.
  • 구체적입니다: 이는 13 개의 특정 가족을 대상으로 훈련되었습니다. 잘 작동하지만 완전히 다른 조명이나 카메라 각도를 가진 다른 방에서 사용되면 약간의"파인 튜닝"이 필요할 수 있습니다.

한 마디로: 이 논문은 행동 과학자들에게 강력하고 빠르며 무료인"자동 조수"를 제공합니다. 이 조수는 부모 - 아기 비디오를 시청하고 연결의 마법 같은 순간들을 즉시 찾아내어 지루한 수동 작업의 시간을 절약해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →