← 최신 논문
🤖 machine learning

Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning

본 논문은 전통적인 대리 과업(proxy tasks) 대신 후회 최소화(regret minimization)에 기반하여 인식론적 불확실성을 평가하기 위한 의사결정 이론적 프레임워크를 제안하며, 표준 상관관계 지표가 운영 효용을 예측하는 데 실패함을 입증하고 의사결정 이론적 순위와 대리 과업 기반 순위 사이의 상당한 불일치를 밝힌다.

원저자: Jakub Paplhám, Willem Waegeman, Eyke Hüllermeier, Vojtěch Franc

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jakub Paplhám, Willem Waegeman, Eyke Hüllermeier, Vojtěch Franc

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 혼돈스러운 성운을 항해하는 우주선의 함장이라고 상상해 보십시오. 당신의 우주선 컴퓨터는 믿을 수 없을 정도로 똑똑하지만, 두 가지 뚜렷한 유형의 "불확실성"을 보고해야 합니다. 첫 번째는 **알레아토릭 불확실성(aleatoric uncertainty)**입니다. 이것은 "전쟁의 안개"와 같습니다. 센서의 노이즈, 라디오의 잡음, 그리고 성운 자체가 본질적으로 무질서하고 예측 불가능하다는 사실입니다. 컴퓨터가 아무리 뛰어나더라도 이 노이즈는 항상 존재할 것입니다. 이는 우주의 줄일 수 없는 혼돈입니다. 두 번째는 **에피스테믹 불확실성(epistemic uncertainty)**입니다. 이것은 컴퓨터의 "무지"입니다. 컴퓨터가 한 번도 본 적 없는 공간을 바라보며 "이 지역에 대해 공부한 적이 없어서 저기에 무엇이 있는지 전혀 모르겠다"라고 느끼는 감정입니다. 이러한 종류의 불확실성은 줄일 수 있습니다. 컴퓨터가 더 많이 학습한다면, 이 두려움은 사라질 것입니다.

오랫동안 더 나은 AI를 만들기 위해 노력해 온 과학자들은 컴퓨터에게 '안개'와 '자신의 무지'를 구분하는 법을 가르치는 데 집착해 왔습니다. 왜일까요? 컴퓨터가 자신이 무지하다는 것을 알게 된다면, "모르겠습니다, 묻지 마십시오"라고 말하며 위험한 실수를 피할 수 있기 때문입니다. 하지만 까다로운 점은, 컴퓨터가 자신의 무지를 포착하는 능력이 정말로 좋은지 어떻게 테스트하느냐는 것입니다. 전통적으로 연구자들은 두 가지 주요 "대리 테스트(proxy tests)"를 사용해 왔습니다. 하나는 분포 외(Out-of-Distribution, OOD) 탐지로, "당신이 한 번도 본 적 없는 아주 이상한 것을 보고 있을 때 그것을 구별할 수 있는가?"라고 묻는 것입니다. 다른 하나는 **능동 학습(Active Learning)**으로, "만약 당신이 새로운 데이터를 하나 더 공부할 수 있다면, 어떤 것이 당신을 가장 많이 가르쳐 줄 것인가?"라고 묻는 것입니다. 큰 질문은 이것입니다. 이 테스트들이 실제로 컴퓨터가 자신의 무지를 포착하는 데 능숙한지를 알려주는 것일까요, 아니면 그저 다른 무언가를 테스트하고 있는 것일까요?

"에피스테믹 불확실성 평가: OOD 탐지와 능동 학습을 넘어(Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning)"라는 제목의 이 논문은 우리가 잘못된 게임을 하고 있다고 주장합니다. 프라하, 겐트, 뮌헨의 대학 연구진으로 구성된 저자들은 컴퓨터가 이상한 데이터를 포착하는 능력(OOD)이나 최고의 학습 자료를 고르는 능력(Active Learning)에 대한 수학적 "완벽한 정답"이, 자신의 무지를 포착하는 데 대한 "완벽한 정답"(후회, Regret)과는 완전히 다르다는 것을 발견했습니다.

이를 이해하기 위해, 당신이 학생을 채점하는 선생님이라고 상상해 보십시오.

  • OOD 테스트는 선생님에게 "이 질문이 외계인이 쓴 것인지 구별할 수 있습니까?"라고 묻는 것과 같습니다. 완벽한 정답은 학생이 답을 아는지 여부와 상관없이 오직 질문이 어떻게 생겼는지에 달려 있습니다.
  • 능동 학습 테스트는 "학생이 가장 많이 배우기 위해 다음에 어떤 질문을 던져야 할까요?"라고 묻는 것과 같습니다. 완벽한 정답은 학생의 미래 지식이 얼마나 향상될지에 달려 있습니다.
  • **후회 테스트(에피스테믹 불확실성)**는 "이 특정 질문에 대해, 학생이 단지 내용을 모른다는 이유로 틀릴 가능성이 얼마나 됩니까?"라고 묻는 것입니다.

논문은 이 세 가지 "완벽한 정답"이 종종 완전히 다른 곳을 가리킨다는 것을 수학적으로 증명합니다. 어떤 컴퓨터는 외계인의 질문을 포착하는 데는 뛰어나지만, 특정 수학 문제를 풀 때 자신이 실패할 것임을 인지하는 데는 서툴 수 있습니다. 실제로 저자들은 (로셀리니 함수라고 불리는 함수에서 영감을 받은) 단순한 1차원 "샌드박스" 세계를 구축하여, OOD 탐지를 위한 최선의 전략은 특정 영역을 거부하라고 말하는 반면, 후회를 최소화하기 위한 최선의 전략은 바로 그 영역을 수용하라고 말할 수 있음을 보여주었습니다. 이 둘은 근본적으로 어긋나 있습니다.

이러드 불일치 때문에, 저자들은 OOD 탐지나 능동 학습을 자신의 무지를 파악하는 능력을 판단하는 "대리 지표"로 사용하는 것이 결함이 있다고 주장합니다. 그들은 모델이 이상한 데이터를 포착하는 능력(OOD)에서 1위를 차지한 방법이 후회(Regret) 테스트에서는 10위를 할 수도 있고, 그 반대의 경우도 있을 수 있음을 보여줍니다. 예를 들어, 인간의 다양한 의견이 포함된 이미지 데이터셋인 CIFAR-10H에 대한 테스트에서, "에비덴셜 네트워크(Evidential Networks)"는 이상한 데이터를 포착하는 데는 형편없었지만, 자신이 무지하여 실수할 가능성이 높은 상황을 식별하는 데는 단연 최고였습니다. 반대로 "딥 앙상블(Deep Ensembles)"은 이상한 데이터를 포착하는 데는 뛰어났지만 후회를 최소화하는 데는 실패했습니다.

또한 이 논문은 "엉킴 해제(disentanglement)"라고 불리는 분야의 인기 있는 아이디어를 다룹니다. 최근 일부 연구자들은 컴퓨터의 "안개" 점수와 "무지" 점수가 서로 밀접하게 연관되어 있다면(함께 올라가고 내려간다면), 컴퓨터가 두 개념을 분리하는 데 실패한 것이라고 주장했습니다. 저자들은 이에 도전합니다. 그들은 설령 두 점수의 상관관계가 높더라도, 컴퓨터가 여전히 완벽한 결정을 내릴 수 있음을 보여줍니다. 저자들은 단순히 상관관계를 확인하는 대신, 더 실용적인 테스트인 **파레토-갭(Pareto-gap)**을 제안합니다.

파레토-갭을 "의사결정 지도"라고 생각해 보십시오. 질문에 답하는 양(Coverage), 실수하는 정도(Risk), 그리고 피하는 무지의 정도(Regret) 사이의 관계를 보여주는 3D 그래프를 상상해 보십시오. "완벽한" 컴퓨터는 이 지도 위에 매끄럽고 이상적인 곡선을 그립니다. 저자들은 실제 컴퓨터의 곡선이 이 완벽한 선에 얼마나 가까운지를 측정합니다. 그들은 높은 상관관계를 가진 방법들이(누군가는 이것이 나쁘다고 생각했지만) 실제로 완벽한 곡선에 매우 가까운 곡선을 그릴 수 있으며, 즉 운영상 유용할 수 있다는 것을 발견했습니다.

요약하자면, 저자들은 우리가 단순히 모델이 이상한 데이터를 포착하거나 학습 주제를 선택하는 능력을 보는 것만으로는 모델이 자신의 무지를 이해하는지 알 수 없다는 것을 증명합니다. 그들은 불확실성을 더 나은 결정을 내리기 위한 도구로 취급하는 새로운 프레임워크를 제공하며, 기존의 방식들이 우리가 어떤 AI 모델이 실제로 안전하고 신뢰할 수 있는지에 대해 잘못된 결론을 내리게 만들고 있음을 보여줍니다. 이들의 연구 결과는 엄격한 수학적 증명과 밀집된 인간 주석이 포함된 실제 데이터셋에 대한 광범위한 벤치마크를 바탕으로 하며, 이는 학계가 편리하지만 오해의 소지가 있는 대리 테스트에 의존하는 것을 멈추고, 실제 우리가 피하고자 하는 '후회'를 바탕으로 불확실성을 측정하기 시작해야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →