← 최신 논문
🤖 AI

See Through the Noise: Improving Domain Generalization in Gaze Estimation

이 논문은 시선 추정에서 라벨 노이즈의 부정적 영향을 최초로 포괄적으로 분석하고, 프로토타입 기반 변환과 친화도 정규화를 통해 노이즈를 제거하고 도메인 간 일반화 성능을 향상시키는 'SeeTN' 프레임워크를 제안합니다.

원저자: Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제 상황: "잘못된 지도를 들고 길을 잃는 나침반"

우리가 AI 에게 눈을 어디로 보고 있는지 가르칠 때, 보통 사람 눈으로 찍은 사진을 보고 "여기는 왼쪽을 보고 있어"라고 라벨 (정답) 을 붙여줍니다. 하지만 이 과정은 생각보다 훨씬 까다롭습니다.

  • 현실의 문제: 사람의 시선은 불안정하고, 빛이나 머리 각도 때문에 사진이 흐릿할 수 있습니다. 그래서 사람이 직접 정답을 적어주는 과정에서 실수가 생깁니다.
  • 비유: 이게 마치 나침반을 가르치는 선생님과 같은데, 선생님이 지도를 잘못 그려서 "북쪽은 저쪽이야 (실제로는 남쪽)"라고 가르치는 꼴입니다.
  • 결과: AI 는 이 **잘못된 지도 (노이즈가 있는 라벨)**를 맹신하고 배우게 됩니다. 그래서 실험실 안에서는 잘 작동하다가, 실제 거리 (새로운 환경) 에 나가면 나침반이 빙글빙글 돌며 엉뚱한 방향으로 가버립니다.

기존 연구들은 "새로운 환경에 잘 적응하자"라고만 고민했지만, 정작 가르치는 자료 자체가 엉망일 수 있다는 점을 간과했습니다.

2. 해결책: "SeeTN (소음을 뚫어보다)"이라는 새로운 프레임워크

저희가 제안한 SeeTN은 이 문제를 해결하기 위해 세 가지 마술을 부립니다.

🧱 1 단계: '의미의 지도 (Semantic Manifold)' 만들기

AI 는 보통 숫자만 보고 학습합니다. 하지만 시선은 숫자가 아니라 '방향'과 '관계'를 가진 연속된 흐름입니다.

  • 비유: 기존의 AI 는 "1, 2, 3 점"만 외우는 학생이라면, SeeTN은 **"점과 점 사이의 거리와 방향감"**을 이해하는 학생입니다.
  • 우리는 AI 가 학습하는 공간에 **'원형 지도'**를 그렸습니다. 이 지도 위에서는 "왼쪽을 보는 눈"과 "왼쪽을 살짝 더 보는 눈"이 서로 가까이 있게 배치됩니다. 이렇게 하면 AI 는 숫자 값보다 **눈의 시선 흐름 (의미)**을 더 잘 이해하게 됩니다.

🔍 2 단계: "누가 거짓말쟁이야?" 가려내기 (노이즈 탐지)

이제 지도 위에서 데이터들을 살펴봅니다.

  • 상황: 어떤 데이터는 지도 위의 위치와 정답 (라벨) 이 잘 맞습니다. (예: 지도상에서 왼쪽에 있는데, 정답도 "왼쪽"이라고 함) → 깨끗한 데이터
  • 문제: 어떤 데이터는 지도상에서는 오른쪽에 있는데, 정답은 "왼쪽"이라고 되어 있습니다. → 노이즈 (거짓말) 데이터
  • 방법: 우리는 **'친화도 (Affinity)'**라는 개념을 써서, "이 눈의 모양과 정답이 서로 잘 어울리는지"를 계산합니다. 두 가지가 너무 어긋나면, 그 데이터는 라벨이 틀린 '노이즈' 샘플이라고 판단합니다.

🛡️ 3 단계: "깨끗한 친구에게서 배우게 하기" (강력한 학습)

노이즈가 있는 데이터를 그냥 버리면 안 됩니다. 그 사진 속의 눈 모양 자체는 유용할 수 있으니까요.

  • 전략:
    1. 깨끗한 데이터에게는 정답을 그대로 가르치고,
    2. 노이즈가 있는 데이터에게는 "네가 가진 눈 모양 (특징) 은 깨끗한 친구들과 비슷하니까, 깨끗한 친구들의 시선 방향을 따라가 봐"라고 간접적으로 가르칩니다.
  • 비유: 시험 문제를 틀린 학생에게, "네가 푼 문제 자체는 엉망이지만, 네가 쓴 풀이 과정 (눈의 특징) 은 훌륭한 친구들의 풀이와 비슷해. 그러니 훌륭한 친구들의 답을 참고해서 네 답을 수정해 봐"라고 도와주는 것입니다.

3. 왜 이 방법이 대단한가요?

기존 방법들은 "새로운 환경에 맞춰라"에 집중했다면, SeeTN은 **"가르치는 자료의 오류를 먼저 고쳐라"**는 접근을 취했습니다.

  • 결과: 실험 결과, 이 방법을 쓴 AI 는 새로운 환경 (실제 거리, 다른 카메라 등) 에 나가서도 눈을 훨씬 정확하게 따라잡았습니다.
  • 핵심: 소음이 섞여 있는 지도 (데이터) 를 가지고 길을 찾는 대신, 지도의 오류를 보정하고 나침반의 방향감 (시선의 의미) 을 강화함으로써, 어디를 가도 길을 잃지 않게 된 것입니다.

요약

이 논문은 **"AI 가 눈을 가르칠 때, 실수한 정답 (노이즈) 에 속지 않도록, 눈의 시선 흐름을 자연스럽게 연결된 지도로 만들고, 오류가 있는 데이터는 깨끗한 데이터의 도움을 받아 교정해 주는 새로운 학습법 (SeeTN)"**을 제안했습니다.

이는 마치 잘못된 나침반을 고쳐주는 기술로, AI 가 어떤 환경에서도 인간의 시선을 정확하게 읽을 수 있게 도와줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →