← 최신 논문
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL는 시각적 스캔패스 예측 작업을 비전-언어 모델 내에서의 자기회귀적 토큰 생성으로 재구성함으로써 시각적 스캔패스 예측의 새로운 최첨단 성능을 확립하며, 이를 통해 관찰자의 정체성과 과업에 대한 유연한 조건부 설정을 가능하게 하는 동시에 상당한 성능 향상을 달さと 실제적인 인실리코(in-silico) 행동 시뮬레이션을 용이하게 합니다.

원저자: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사람이 사진을 볼 때 다음에 어디를 쳐다볼지 예측하는 것을 상상해 보세요. 오랫동안 과학자들은 이 작업만을 위해 만들어진 특수하고 경직된 기계들을 구축해 왔습니다. 이 기계들은 고정된 규칙(예: "사람은 항상 중앙을 먼저 본다")을 가지고 있었으며, "이 사람은 진단을 위해 찾는 의사이다"라거나 "이 사람은 장난감을 찾는 아이이다"와 같이 새로운 기술을 쉽게 배울 수 없었습니다.

이 논문은 게임의 판도를 바꾸는 DeepGaze3.5-VL이라는 새로운 모델을 소개합니다. 저자들은 눈의 움직임을 이야기를 쓰는 것처럼 다룹니다.

다음은 이 모델이 어떻게 작동하는지와 연구 결과에 대한 내용을 쉬운 비유를 사용하여 정리한 것입니다.

1. 핵심 아이디어: "텍스트" 이야기로서의 눈의 움직임

사람의 시선 경로(scanpath)를 하나의 문장이라고 생각해 보세요.

  • 기존 방식: 당신은 문장을 그리기 위한 맞춤형 로봇을 만들었지만, 만약 스타일을 바꾸고 싶다면(예: 아이의 글씨체에서 성인의 글씨체로), 로봇을 다시 만들어야 했습니다.
  • 새로운 방식: 저자들은 눈의 움직임이 단순히 좌표의 시퀀스(예: "여기를 보고, 그다음 저기를 본다")라는 점을 깨달았습니다. 그리고 거대한 사전 학습된 AI(대규모 시각-언어 모델)에게 이 좌표들을 문장 속의 단어처럼 취급하도록 가르쳤습니다.

이 좌표들을 "토큰"(단어 속의 글자와 같은 것)으로 변만큼으로써, AI는 이미 이미지와 언어를 이해하도록 훈련된 거대한 두뇌를 사용하여 다음 "단어"(눈이 다음에 머물 곳)를 예측할 수 있게 됩니다.

2. "프롬프트"의 마법

이 모델은 언어 방식으로 사고하기 때문에, 마치 챗봇에게 질문을 던지듯 명령을 내릴 수 있습니다.

  • 비유: 가이드 투어를 상상해 보세요. 만약 당신이 가이드에게 "관광객처럼 박물관을 보여주세요"라고 말하면, 가이드는 유명한 조각상들을 보여줍니다. 하지만 "미술사학자처럼 보여주세요"라고 말하면, 가이드는 붓터치를 지목합니다.
  • 결과: 연구진은 텍스트 프롬프트(예: "고양이를 찾는 사람의 시선을 예측하라" vs "그냥 주변을 둘러보는 사람의 시선을 예측하라")를 변경하는 것만으로도 모델이 즉각적으로 적응한다는 것을 보여주었습니다. 모델은 새로운 하드웨어나 복잡한 코드 변경 없이도 단순히 지시 사항을 읽고 동작합니다.

3. 왜 더 나은가: "스마트함" 대 "거대함"의 논쟁

연구진은 질문했습니다: 이 모델이 단순히 거대해서 좋은 것인가, 아니면 실제로 장면을 이해하고 있기 때문에 좋은 것인가?

  • 테스트: 그들은 동일한 "눈"(시각 인코더)을 사용하지만 서로 다른 "두뇌"를 가진 다른 최상위 모델들과 비교했습니다.
  • 발견: "두뇌"(AI의 언어 부분)가 단순히 큰 "눈"을 갖는 것보다 더 중요했습니다. 이미지의 의미와 눈의 움직임이라는 "이야기"를 이해하는 모델이, 단순히 픽셀만을 보는 모델보다 훨씬 더 뛰어난 성능을 보였습니다.
  • 점수: 표준 테스트(MIT1003)에서 이 모델은 이전 최고의 방법보다 예측 정확도를 46% 향상시켰습니다.

4. "타임머신" 실험 (개입)

이 논문이 보여주는 가장 멋진 것 중 하나는 실제 인간을 필요로 하지 않고 컴퓨터 안에서 "만약 ~했다면"의 시나리오를 실행할 수 있다는 점입니다.

  • 비유: 비디오 게임에서 시간을 멈추고 한 가지 변수(예: "플레이어가 피곤했다")를 바꾼 뒤, 상황이 어떻게 다르게 전개되는지 즉시 확인할 수 있는 게임을 상상해 보세요.
  • 실험: 연구진은 사람이 사진을 아주 짧은 시간(50ms) 동안 바라본 특정 순간을 가져와서 모델에게 물었습니다: "만약 그들이 더 오래(600ms) 바라보았다면 어떻게 되었을까?"
  • 결과: 모델은 짧은 응시는 빠르고 본능적인 훑어보기(반사 작용과 같은)인 반면, 긴 응시는 더 방황하고 사색적인 탐색으로 이어진다고 예측했습니다. 모델은 데이터를 읽는 것만으로 이러한 복잡한 인간 행동을 파악해 냈으며, 이는 인간의 시각에 대한 디지털 샌드박스 역할을 했습니다.

5. "누구인가"의 요소 (개인화)

이 모델은 또한 누가 보고 있는지도 알려줄 수 있습니다.

  • 비유: 만약 당신의 친구가 강아지를 좋아한다는 것을 안다면, 그리고 그에게 공원 사진을 보여준다면, 당신은 그가 강아지를 먼저 볼 것이라는 점을 알 수 있습니다. 하지만 똑같은 사진을 새를 좋아하는 사람에게 보여준다면, 그는 나무를 먼저 볼 것입니다.
  • 결과: 모델에 특정 "피험자 ID"(예: "Subject A3F8")를 입력함으로써, 모델은 그 특정 개인의 독특한 습관을 예측하는 법을 배웠습니다. 새로운 아키텍처를 구축할 필요 없이, 단지 서로 다른 "캐릭터"들이 서로 다른 "스토리라인"을 가지고 있다는 것을 학습한 것입니다.

요약

DeepGaze3.5-VL은 인간이 어디를 보는지 예측하는 새로운 방법입니다. 저자들은 경직되고 특화된 도구를 만드는 대신, 시선 추적을 언어 문제로 전환했습니다. 이를 통해 다음과 같은 모델을 만들어 냈습니다:

  1. 더 스마트함: 장면의 맥맥락과 의미를 이해합니다.
  2. 유연함: 새로운 명령어를 타이핑하는 것만으로 동작을 바꿀 수 있습니다.
  3. 정확함: 이전의 모든 기록을 큰 차이로 경신했습니다.
  4. 실험적임: 실제 물리적 실험을 수행하지 않고도 인간의 시각에 대한 "만약 ~했다면" 시나리오를 즉시 시뮬레이션할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →