← 최신 논문
💻 computer science

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

이 논문은 멀티모달 거대 언어 모델과 합성된 "생각 소리 내어 말하기(think-aloud)" 전사 데이터를 활용하여 인간의 시선 스캔패스를 목표에 대한 자유 형식의 자연어 기술로 해독하는 새로운 프레임워크인 Gazette를 소개하며, 이를 통해 기존의 범주적 해독을 넘어 인간 의도의 개방적인 뉘앙스를 포착합니다.

원저자: Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 눈을 어두운 방 안의 손전등 불빛이라고 상상해 보세요. 당신이 무언가를 볼 때, 그 불빛은 가만히 머물러 있는 것이 아니라 아주 짧은 찰나의 순간 동안 이곳저곳을 빠르게 움직입니다. 이러한 움직임의 패턴을 "스캔패스(scanpath)"라고 부릅니다. 오랫동안 과학자들은 당신의 손전등 불빛이 어디에 닿는지를 관찰함으로써 당신이 무엇을 생각하고 있는지 알아내려 노력해 왔습니다. 보통 그들은 이를 객관식 퀴즈처럼 다루었습니다. 그들은 "이 사람이 고양이를 찾고 있나요, 아니면 개를 찾고 있나요?"라고 묻고, 컴퓨터는 정해진 목록 중 하나의 답을 선택하게 했습니다. 하지만 인간의 생각은 복잡하고 창의적입니다. 때때로 당신은 단순히 "개"를 찾는 것이 아니라, "소파 뒤에 숨어 있는 빨간 스카프를 두른 지저прав한 황금빛 리트리버"를 찾고 있는 것일 수도 있습니다. 질문하는 방식이 너무 단순했기에 그런 종류의 세밀함을 포Capture할 수 없었던 것입니다. 여기서 "시선 디코딩(gaze decoding)"이라는 새로운 분야가 등장하여, 눈의 움직임을 우리 머릿속에서 일어나는 풍부하고 열린 결말의 이야기로 번역하려고 시도합니다.

이 퍼즐을 풀기 위한 영리하고 새로운 방법을 소개하는 새로운 연구 논문이 등장했습니다. 스토니브룩 대학교와 애들레이드 대학교의 연구진은 Gazette라는 시스템을 구축했습니다. Gazette는 컴퓨터가 여러 선택지 중 하나를 고르도록 강요하는 대신, 사람이 하는 것처럼 자연어를 사용하여 사람이 무엇을 찾고 있는지에 대한 자유로운 형식의 이야기를 쓰도록 설계되었습니다. 이것은 경직된 체크리스트에서, 당신이 무엇을 보는지 정확하게 묘사할 수 있는 창의적인 작가로 업그레이드하는 것과 같습니다.

연구진이 직면한 큰 문제는 사람들이 같은 것을 보고 있더라도 저마다 눈을 움직이는 방식이 조금씩 다르다는 점이었습니다. 만약 열 명의 사람에게 "빨간 자동차"를 찾아보라고 한다면, 열 명의 사람은 각기 조금씩 다른 방식으로 자동차를 볼 것입니다. 어떤 사람은 바퀴를 먼저 볼 수도 있고, 다른 사람은 창문을 먼저 볼 수도 있습니다. 만약 당신이 단 한 사람의 눈 움직임만을 컴퓨터에 보여준다면, 컴퓨터는 그 모든 개인적인 습관 때문에 혼란에 빠질 것입니다. 이는 마치 한 사람이 음이 이탈하며 흥얼거리는 노래를 듣고 곡을 추측하려는 것과 같습니다. 선율은 들릴지 몰라도 소음 때문에 확신하기 어려울 것입니다.

이를 해결하기 위해 팀은 "생각하며 말하기(think-aloud)" 전략을 이용한 영리한 묘수를 찾아냈습니다. 그들은 사람들의 눈 움직임은 제각각 다르지만, 움직이는 이유는 같다는 점을 깨달았습니다. 그래서 그들은 강력한 AI(GPT-4)를 사용하여 특정 물체를 찾으려고 노력하는 여러 사람의 눈 움직임을 살펴보게 했습니다. AI는 탐정처럼 개인의 특이한 습관들을 무시하고, 공통된 패턴, 즉 인간이 특정 사물을 찾는 데 필요한 "비밀 레시피"를 찾아냈습니다. 그 후 AI는 "먼저 큰 형태를 보고, 그다음 빨간 부분을 확대하라"와 같이 전략을 설명하는 "생각하며 말하기 전사본(transcript)"을 작성했습니다.

그들은 이 새로운 모델인 Gazette가 이 AI 생성 이야기와 눈의 움직임을 함께 읽도록 학습시켰습니다. 이는 모델이 "목표(사람이 찾고 있는 것)"와 "소음(사람의 고유한 방식)"을 구분하는 법을 배우는 데 도움이 되었습니다. 테스트 결과, Gazette는 이전 방식들보다 목표를 훨씬 더 잘 맞혔습니다. 예를 들어, 사진 속 특정 자동차를 찾으라는 요청을 받았을 때, Gazette는 단순히 "자동차"라고 말하는 데 그치지 않고 "오른쪽 상단에 있는 검은색 자동차"라고 말할 수 있었으며, 까다로운 과제에서도 높은 정확도를 보였습니다.

이 논문은 컴퓨터에게 눈의 움직임 그 자체뿐만 아니라 그 움직임 뒤에 숨겨진 전략을 가르침으로써, 우리가 인간의 의도를 훨씬 더 상세하게 해독할 수 있다는 것을 보여줍니다. 이 시스템은 사람들이 찾는 것에 대해 의견이 일치할 때(예: 특정 물체 찾기) 가장 잘 작동하지만, 이는 우리가 단순히 어디를 보느냐를 관찰함으로써 컴퓨터가 우리의 목표를 이해할 수 있는 미래에 더 가까워지고 있음을 시사합니다. 이는 더 나은 보조 기술과 우리가 세상과 상호작용하는 방식에 대한 더 깊은 이해로 가는 문을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →