← 최신 논문
🤖 AI

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite는 예측된 시선에 따라 비디오를 정확하게 크롭함으로써 멀티모달 LLM을 위한 토큰 효율적인 1인칭 시점 비디오 이해를 가능하게 하며, 전용 시선 추적 하드웨어의 필요성을 제거하는 동시에 설명 품질을 유지하면서 소비자용 하드웨어에서 실시간으로 작동하는 경량 온디바이스 이중 프로세스 시선 예측기입니다.

원저자: Matteo Stoiber, Niels Buus Lassen

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Matteo Stoiber, Niels Buus Lassen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 눈을 통해 세상을 관찰하고 당신이 무엇을 하고 있는지 설명해 주는 스마트 안경을 착용하는 모습을 상상해 보십시오. 이 기술은 외과의사가 복잡한 수술 과정을 기억해 내거나, 정비사가 수리를 수행하도록 안내하거나, 시각 장애가 있는 사람에게 주변 환경을 이야기해 줌으로써 도움을 줄 수 있다는 약속을 담고 있습니다. 이를 실현하기 위해 안경은 이미지를 이해하고 언어를 구사할 수 있는 강력한 인공지능 시스템으로 비디오 피드를 전송해야 합니다. 하지만 여기에는 큰 병목 현상이 존재합니다. 고화질 비디오를 전송하려면 소형 웨어러블 기기가 쉽게 전송하거나 처리할 수 있는 양보다 훨씬 더 많은 방대한 양의 데이터가 필요하기 때문입니다. 이러한 영상을 이해하는 컴퓨터 시스템 또한 한 번에 너무 많은 시각 정보가 입력되면 엄청난 양의 픽셀에 압도되어 어려움을 겪곤 합니다.

연구자들은 사람이 실제로 보고 있는 부분에만 집중함으로써 이 데이터 문제를 해결하는 영리한 방법을 찾아냈습니다. 전체 넓은 화면을 보내는 대신, 사용자의 시선이 고정된 작은 영역만을 보여주도록 비디오를 크롭(절단)할 수 있습니다. 이는 컴퓨터가 처리해야 할 데이터 양을 약 90% 줄여주어 작업을 훨씬 더 빠르고 저렴하게 만듭니다. 지금까지 이 방식은 사용자의 눈 움직임을 정밀하게 추적하기 위해 안경에 내장된 특수하고 비싼 하드웨어를 필요로 했습니다. 전용 하드웨어가 없다면 시스템은 어디를 보아야 할지 알 수 없었고, 이로 인해 스마트 안경의 잠재력은 일반 소비자들에게 실현되지 못한 채 남아 있었습니다.

한 연구팀은 전용 시선 추적 센서가 반드시 필요한 것은 아니라는 점을 입증했습니다. 그들은 비디오 스트림 자체를 분석하여 사람이 어디를 보고 있는지 예측할 수 있는 가벼운 소프트웨어 프로그램을 개발했습니다. 'EgoGazeLite'라고 불리는 이 프로그램은 표준 스마트폰에서 직접 실행될 수 있으며, 값비싼 하드웨어 센서를 대체할 수 있을 만큼 정확합니다. 연구진은 비디오 클립을 인공지능 시스템에 입력한 뒤, 실제 시선 추적 데이터 또는 소프트웨어의 예측값에 따라 비디오를 크롭하여 테스트를 진행했습니다. 그런 다음 인공지능에게 비디오 속 동작을 설명하도록 요청했습니다. 결과는 예측된 시선을 통해 생성된 설명이 실제 시선 추적 데이터로 생성된 설명과 거의 동일하다는 것을 보여주었습니다. 모든 테스트 케이스에서 소프트웨어 예측은 하드웨어 측정값만큼 잘 작동했으며, 이는 전용 센서 없이도 시스템이 작동할 수 있음을 증명했습니다.

이 소프트웨어는 놀라울 정도로 효율적입니다. 현대적인 스마트폰의 프로세서와 같은 소비자용 하드웨어에서 실시간으로 실행될 수 있을 만큼 작으며, 각 비디오 프레임의 예측과 크롭을 22밀리초 미만 안에 완료합니다. 이러한 속도는 시스템이 지연 시간 없이 라이브 비디오 피드를 따라갈 수 있다는 점에서 매우 중요합니다. 연구진은 요리, 자전거 수리, 축구, 심폐소생술 등 다양한 과업을 수행하는 사람들의 수천 시간 분량의 비디오를 통해 이 소프트웨어를 학습시켰습니다. 새로운 미학습 비디오를 대상으로 테스트했을 때, 소프트웨어는 높은 정밀도로 사람이 어디를 보고 있는지 성공적으로 식별해 냈습니다. 이 소프트웨어는 두 가지 서로 다른 주의 집중 방식을 학습하여 작동합니다. 하나는 장면 내에서 시각적으로 밝거나 움직이는 것에 기반한 것이고, 다른 하나는 사람이 잠시 전까지 어디를 보고 있었는지에 기반한 것입니다. 소프트웨어는 이 두 가지 단서를 결합하여 다음 초점을 예측합니다.

연구진은 자신들의 발견이 견고함을 보장하기 위해 단일 평가 방법에 의존하지 않았습니다. 그들은 두 가지 서로 다른 대규모 언어 모델을 사용하여 비디오 설명을 생성했고, 자동 점수 산정 시스템과 다른 고급 인공지능 모델들을 통해 그 설명을 판정하게 했습니다. 그들은 예측된 시선으로부터 얻은 설명의 품질을 실제 하드웨어 센서로부터 얻은 정답(ground truth), 그리고 단순히 화면 중앙을 크롭한 기준점(baseline)과 비교했습니다. 결과는 명확했습니다. 예측된 시선은 중앙 크롭 방식보다 훨씬 더 나은 설명을 생성했으며, 하드웨어 기반의 시선과는 통계적으로 구분이 불가능할 정도로 유사했습니다. 사실, 소프트웨어 예측은 실제 시선 추적 데이터와 너무나 가까워서 연구진이 수행한 10가지 테스트 시나리오 모두에서 그 차이가 유의미하게 측정되지 않을 정도였습니다.

이 연구는 시선 인지 인공지능의 광범위한 도입을 가로막는 주요 장벽을 제거합니다. 소프트웨어 모델이 하드웨어 센서를 대체할 수 있음을 입증함으로써, 연구진은 미래의 스마트 안경이 유용하게 쓰이기 위해 값비싸고 전력을 많이 소모하는 시선 추적 부품을 부담할 필요가 없다는 것을 보여주었습니다. 이제 이 시스템은 카메라와 표준 프로세서가 있는 모든 기기에 배포될 수 있어, 다양한 일상 활동에서 저렴한 실시간 보조 도구로서의 길을 열어주었습니다. 비록 이 연구가 특정 데이터셋과 모델을 대상으로 수행되었으나, 결과는 우리가 인간의 주의력을 단순히 보는 것을 통해 이해하는 가볍고 지능적인 소프트웨어로 나아가며, 특수 하드웨어 중심에서 벗어나는 근본적인 변화를 맞이하고 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →