← 최신 논문
💻 computer science

Disentangling Model and Human Data Uncertainty in Apparent Facial Age Estimation

이 논문은 APPA-REAL 데이터셋으로 학습된 베이지안 신경망이 얼굴 연령 추정에서 우연적 불확실성과 인식론적 불확실성을 효과적으로 분리하고 정량화할 수 있음을 입증하며, 우연적 불확실성은 데이터셋 크기에 관계없이 안정적으로 유지되는 반면 인식론적 불확실성은 훈련 데이터가 감소함에 따라 증가한다는 것을 밝혀낸다.

원저자: Andrei Foitos, Ivo Pascal de Jong, Matias Valdenegro-Toro

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andrei Foitos, Ivo Pascal de Jong, Matias Valdenegro-Toro

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사진 속 낯선 사람의 나이를 보고 추측하려고 한다고 상상해 보세요. 당신은 "서른 살 정도로 보이는데"라고 말할 수도 있지만, 친구는 "말도 안 돼, 마흔 살처럼 보여!"라고 할 수도 있습니다. 인공지능의 세계에서 이것은 단순한 사소한 의견 차이가 아니라 거대한 퍼즐입니다. AI 시스템은 얼굴을 보고 나이를 추측하는 능력이 점점 좋아지고 있지만, 종종 지나치게 자신만만한 '척척박사'처럼 행동하곤 합니다. 그들은 단 하나의 숫자만을 제시하며 그것이 절대적인 진리인 것처럼 행동하는데, 정작 답이 모호한 상황에서도 말이죠. 이것은 위험합니다. 컴퓨터가 틀린 답에 대해 너무 확신을 가지면, 십 대에게 술을 팔게 하거나 노인이 웹사이트 이용을 못 하게 막는 것과 같은 잘못된 결정을 내릴 수 있기 때문입니다. 이를 해결하기 위해 과학자들은 AI에게 자신이 추측하고 있다는 사실을 인정하도록 가르치고 있습니다. 그들은 컴퓨터가 "서른 살인 것 같지만, 확신은 50%뿐입니다"라거나 "서른 살인 것 같지만, 매우 확 уверен히 확신합니다"라고 말할 수 있게 만들기를 원합니다. 이를 위해 연구자들은 '불확실성'을 두 가지 종류로 나누었습니다. 바로 데이터 자체의 자연스러운 무질서함인 알레아토리(aleatoric) 불확실성(예를 들어 인간들 사이에서 의견이 일치하지 않는 방식)과, AI 자신의 무지함인 에피스테믹(epistemic) 불확실성(예를 들어 공부를 충분히 하지 못한 학생)입니다.

이 논문은 조사관들이 컴퓨터에게 "데이터가 혼란스러운 것인지"와 "내가 혼란스러운 것인지"를 구별하도록 가르치려는 탐정 이야기와 같습니다. 연구자들은 수천 명의 실제 사람들이 동일한 얼굴을 보고 나이를 투표한 APPA-REAL이라는 특별한 데이터셋을 사용했습니다. 매우 많은 사람이 투표했기 때문에, 연구자들은 인간들이 얼마나 의견이 일치하지 않는지(즉, '무질서함')를 정확하게 측정할 수 있었고, 이를 사용하여 AI를 훈련시켰습니다. 그들은 세 가지 유형의 "베이지안(Bayesian)" AI 모델을 구축했습니다. 이는 각각 약간씩 다른 전략을 사용하여 추측하고 자신의 확신도를 측정하는 세 팀의 탐정이라고 생각하면 됩니다. 그들은 아주 적은 양의 사진부터 전체 라이브러리에 이르기까지, 다양한 양의 데이터를 AI에게 입력하며 이 팀들을 테스트했습니다.

여기서 발견한 큰 성과는 두 종류의 불확실성이 매우 다르게 행동하며, AI가 이를 분리하여 학습할 수 있다는 점입니다. 데이터의 '무질서함'(알레토리 불확실성)은 AI가 얼마나 많은 사진을 보느냐에 관계없이 정확히 동일하게 유지되었습니다. 이는 마치 소음이 있는 방과 같습니다. 한 명이 듣든 천 명이 듣든 배경 소음의 수준은 변하지 않습니다. 논문은 이 소음 수준이 약 18년 제곱(이는 표준 편차로 약 4.2년에 해당함)으로 안정적임을 밝혔습니다. 이는 어떤 혼란은 인간의 지각 특성에 내재되어 있다는 것을 확인시켜 줍니다.

반면에, AI 자신의 무지함(에피스테믹 불확실성)은 예상대로 작동했습니다. 즉, AI가 더 많은 데이터를 볼수록 급격히 감소했습니다. AI가 훈련 데이터의 단 1%(약 40장의 이미지)만 보았을 때는 엄청나게 불확실했습니다. 하지만 데이터를 최대 **100%**까지 계속 입력하자 AI는 훨씬 더 확신을 갖게 되었습니다. 예를 들어, "DropConnect" 방식은 데이터의 **5%**에서 약 12.9년 제곱이었던 에피스테믹 불확실성이 전체 데이터셋을 사용했을 때 6.0년 제곱까지 떨어지는 것을 보여주었습니다. "Deep Ensembles" 방식은 전반적으로 가장 정확했으며, 최종적으로 8.0년의 평균 절대 오차(MAE)를 기록했습니다. 반면 "Flipout"은 학습 속도가 다소 느려 최종적으로 8.9년의 MAE를 기록했습니다.

또한 논문은 이 똑똑한 AI 탐정들이 새로운 다른 얼굴 세트(UTKFace 데이터셋)를 처리할 수 있는지 테스트했습니다. 결과는 AI의 확신 수준이 데이터가 변함에 따라 적절하게 변화했음을 보여주었으며, 이는 모델들이 불확실성에 대한 이해를 일반화할 수 있음을 증명했습니다. 그러나 저자들은 "Flipout" 방식이 특히 데이터가 부족할 때 다소 불안정하고 흔들리는 모습을 보였다고 언급하며, 이는 AI가 제한된 정보로 매우 신뢰할 수 있어야 하는 상황에서는 최선의 선택이 아닐 수 있음을 시사합니다.

궁극적으로, 이 연구는 두 종류의 불확실성을 분리하는 것이 단순한 예/아니오 분류 작업보다 나이 추정(회귀 작업)에서 실제로 더 효과적임을 시사합니다. 연구는 Deep Ensembles가 가장 정확하지만, DropConnect 방식이 데이터가 많아짐에 따라 AI의 확신이 어떻게 성장하는지를 가장 명확하게 보여준다고 결론지었습니다. 이는 우리가 단순히 나이를 추측하는 것을 넘어, 자신이 언제 추측하고 있는지를 스스로 아는 AI에 한 걸음 더 다가갔음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →