← 최신 논문
🤖 machine learning

Invertible Logits Transformation for Accuracy-Preserving Post-Hoc Uncertainty Calibration

이 논문은 로짓에 적용되는 공유된 단조 스칼라 MLP를 사용하여 미교정 상태를 수정하고 대규모 라벨 공간으로 효율적으로 확장하는 동시에, 재학습 없이 원래 분류기의 예측을 엄격하게 보존하는 사후 교정 방법인 가역 로짓 변환(Invertible Logits Transformation, InvLT)을 제안한다.

원저자: Lening Zhao, Qipeng Zhan, Li Shen

게시일 2026-08-12
📖 7 분 읽기🧠 심층 분석

원저자: Lening Zhao, Qipeng Zhan, Li Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려는 탐정이라고 상상해 보세요. 하지만 당신의 믿음직한 돋보기에 결함이 생겼습니다. 이 돋보기는 정확한 용의자를 찾아내기는 하지만, 실제로는 60%만 확신하면서도 계속해서 "99% 확신합니다!"라고 외쳐댑니다. 인공지능의 세계에서 이것은 흔히 발생하는 문제입니다. AI 모델은 고양이, 강아지 또는 종양을 놀라운 정확도로 식별해내는 똑똑한 탐정과 같지만, 종종 자신의 확신 수준을 잘못 판단하곤 합니다. 그들은 틀린 답에 대해 터무니없이 과하게 자신감을 가질 수 있으며, 이는 매우 위험합니다. 만약 의사나 자율주행 자동차가 그 말을 듣고 있다면 말이죠. 이 연구 분야를 "교정(calibration)"이라고 부릅니다. 이것은 AI에게 새로운 기술을 가르치거나 뇌를 재학습시키는 것이 아니라, 사후에 그 "목소리"를 수정하는 작업입니다. 즉, AI가 "90% 확신한다"라고 말할 때, 그것이 실제로 10번 중 9번은 맞다는 것을 의미하도록 만드는 것입니다. 목표는 AI가 내놓는 정답 자체를 바꾸지 않으면서도, AI를 정직하게 만드는 것입니다.

**InvLT(Invertible Logits Transformation, 가역 로짓 변환)**라는 새로운 방법이 등장했습니다. 연구자 Zhao, Zhan, Shen이 제안한 이 방법은 AI의 가공되지 않은 생각(로짓이라 불리는 것)을 숫자의 무질서한 더미라고 생각해 보세요. 기존의 방법들은 이 숫자의 전체 볼륨을 줄이는 방식(노래 전체의 볼륨을 낮추는 것처럼)을 사용하거나, 모든 범주에 대해 숫자를 다르게 조정하는 복잡하고 무거운 기계를 사용하는 방식을 취했습니다. 문제는 무거운 기계 방식은 카테고리가 수천 개가 되면 느려지고 서툴러진다는 것이며, 단순한 볼륨 조절 방식은 데이터의 특정 이상 지점을 수정할 만큼 유연하지 못하다는 점입니다.

InvLT는 마치 숫자의 더미를 하나씩 훑어보는 영리한 1인 편집자와 같습니다. 전체 노래의 볼륨을 조절하거나 거대한 기계를 사용하는 대신, 이 편집자는 각 숫자 각각에 대해 학습된 유연한 규칙을 적용합니다. 여기서 마법 같은 기술은 이 편집자가 "가역적(invertible)"으로 훈련된다는 점입니다. 이는 수학적으로 "되돌릴 수 있다"는 뜻이며, 만약 당신이 편집 과정을 완벽하게 되돌릴 수 있다면, 숫자의 순서가 뒤섞이지 않았음을 알 수 있다는 것을 의미합니다. 이는 만약 AI가 원래 "개"를 최선의 추측으로 생각했다면, 편집 후에도 여전히 "개"를 최선의 추측으로 생각하도록 보장합니다. 연구진은 CIFAR-10, CIFAR-100, 그리고 거대한 ImageNet과 같은 유명한 이미지 데이터셋을 통해 이를 테스트했습니다. 그들은 InvLT가 다른 거의 모든 방법보다 AI의 확신도를 실제 정확도와 더 잘 일치시키면서도, 가장 강력한 경쟁자보다 훨씬 빠르게 학습된다는 것을 발견했습니다. InvLT는 정답을 바꾸지 않으면서도 AI가 불확실할 때 솔직하게 인정하게 만드는 단순하고 빠르며 정직한 방법입니다.

탐정의 결함: 왜 교정이 필요한가

이 논문이 왜 중요한지 이해하려면, 먼저 "탐정"(AI)과 그 "결함"(오교정)을 이해해야 합니다.

머신러닝의 세계에서 AI 모델은 이미지를 보고 숫자 목록을 내뱉습니다. 이 숫자들은 모델이 각 가능한 정답을 얼마나 "선호하는지"를 나타냅니다. 예를 들어, 모델이 고양이 사진을 보면 "고양이" 카테고리에 높은 숫자를 주고 "강아지" 카테고리에 낮은 숫자를 줄 수 있습니다. 이 가공되지 않은 숫자들을 백분율(예: "이것이 고양이일 확률 85%")로 바꾸기 위해 모델은 "소프트맥스(softmax)"라는 수학적 단계를 사용합니다.

문제는 현대의 AI 모델들이 자신의 확신도를 판단하는 데 서투를 때가 많다는 것입니다. 그들은 사진이 고양이일 때 실제로는 강아지임에도 불구하고 99% 확신할 수 있습니다. 이를 "과잉 확신(overconfident)"이라고 합니다. 만약 당신이 질병을 진단하기 위해 AI를 사용하는 의사라면, 당신은 단순히 AI가 무엇을 진단하는지만 알고 싶은 것이 아니라, AI가 얼마나 확신하고 있는지도 알아야 합니다. 만약 AI가 "암일 확률 99%"라고 말하는데 실제로는 그 확률이 50%에 불과하다면, 그것은 재앙입니다.

여기서 **사후 교정(Post-Hoc Calibration)**이 등장합니다. "사후(Post-hoc)"란 "사건이 일어난 후"를 의미합니다. 전체 AI 모델을 다시 학습시키는 대신(이는 며칠의 시간과 거대한 컴퓨터를 필요로 합니다), 교정은 작은 별도의 도구를 사용하여 모델의 출력을 수정하려고 시도합니다. 이것은 초점이 약간 맞지 않는 사진을 찍은 후, 사진을 다시 찍는 대신 필터를 사용하여 선명하게 만드는 것과 같습니다.

목표는 간단합니다. 만약 AI가 80% 확신한다고 한다면, 실제로 80%의 확률로 맞아야 합니다. 50%라고 한다면, 절반의 확률로 맞아야 합니다. 이 논문은 AI의 최종 결정은 바꾸지 않으면서 이 작업을 수행하는 방법에 초점을 맞춥니다. 만약 AI가 원래 "고양이"를 선택했다면, 교정 도구는 실수로 "강아지"를 선택하게 만들어서는 안 됩니다. 이를 **정확도 보존(Accuracy Preservation)**이라고 합니다.

기존의 방식들: 너무 단순하거나 너무 무겁거나

InvLT 이전에 과학자들은 이 확신도 결함을 해결하기 위한 몇 가지 방법을 가지고 있었습니다.

  1. 온도 스케일링 (Temperature Scaling, TS): AI의 가공되지 않은 숫자들이 뜨거운 수프라고 상상해 보세요. 온도 스케일링은 그냥 전체 냄비에 얼음을 조금 넣어 식히는 것과 같습니다. 이 방식은 하나의 숫자(하나의 "온도")를 사용하여 모든 것을 조정합니다. 빠르고 간단하며, 승자를 바꾸지 않습니다("고양이"는 여전히 "고양이"로 남습니다). 하지만 너무 경직되어 있습니다. 특정 문제를 해결할 수 없습니다. 만약 AI가 "고양이"에 대해서는 과잉 확신하지만 "강아지"에 대해서는 저확신 상태라면, 이 방법은 두 가지를 동시에 해결할 수 없습니다.
  2. 무거운 기계들 (UMNN 및 기타): 특정 문제를 해결하기 위해 일부 연구자들은 모든 숫자에 대해 고유한 규칙을 학습하는 복잡한 도구를 만들었습니다. UMNN이라 불리는 한 인기 있는 방법은 규칙이 엄격하게 "단조(monotone)"되도록(즉, 입력이 올라가면 출력도 올라가야 함) 강제하는 특수한 수학을 사용합니다. 이는 정답의 순서가 유지됨을 보장합니다. 그러나 이 방법은 계산 비용이 많이 듭니다. 마치 카드 한 덱을 분류하기 위해 거대하고 느린 로봇을 사용하는 것과 같습니다. 작동은 하지만, 학습하는 데 오랜 시간이 걸리고 사용하는 데는 더 오랜 시간이 걸립니다. 또한, 카테고리의 수가 늘어나면(예: 1,000개의 클래스가 있는 ImageNet), 이러한 방법들은 느려지거나 과적합(학습 데이터를 통째로 외워버리는 현상)될 수 있습니다.

새로운 영웅: InvLT

이 논문의 저자인 Zhao, Zhan, Shen은 **가역 로짓 변환(Invertible Logits Transformation, InvLT)**이라는 새로운 방법을 제안합니다.

핵심 아이디어:
하나의 단순한 노브(온도 스케일링처럼)를 사용하거나 거대한 로봇(UMNN처럼)을 사용하는 대신, InvLT는 각 숫자를 개별적으로 보고 커스텀 규칙을 적용하는 작은 유연한 "번역기"(신경망)를 사용합니다.

  • 공유 번역기: 고양이든, 강아지든, 자동차든 상관없이 모든 숫자에 대해 동일한 번역기가 사용됩니다. 이는 카테고리를 추가하더라도 방법이 더 느려지거나 복잡해지지 않음을 의미합니다. 이는 거대한 데이터셋에서도 아름답게 확장됩니다.
  • "가역적"인 트릭: 가장 큰 과제는 번역기가 순서를 뒤섞지 않도록 하는 것입니다. 만약 번역기가 "9"를 "2"로 바꾸고 "5"를 "10"으로 바꾼다면, AI는 갑자기 "강아지"가 "고양이"보다 더 낫다고 생각하여 최종 답변을 바꿀 수도 있습니다. 이를 방지하기 위해, 이 논문은 영리한 트릭인 **재구성(Reconstruction)**을 사용합니다.

재구성 트릭의 작동 방식:
영어를 프랑스어로 바꾸는 번역기가 있다고 상상해 보세요. 이 번역기가 의미를 뒤섞지 않는 "좋은" 번역기인지 확인하기 위해, 문장을 프랑스어로 번역한 다음 즉시 다시 영어로 번역하게 합니다. 만약 최종 영어 문장이 원래 문장과 같다면, 번역기가 제대로 작동하고 있으며 의미를 뒤섞지 않았음을 알 수 있습니다.

InvLT에서 연구자들은 두 개의 네트워크를 함께 훈련시킵니다.

  1. 순방향 네트워크 (f): AI의 확신도를 조정하는 메인 번역기입니다.
  2. 역방향 네트워크 (g): "역번역기"입니다.

연구자들은 일련의 테스트 숫자들을 순방향 네트워크에 넣고, 그 결과를 얻은 다음, 그 결과를 역방향 네트워크에 넣습니다. 그리고 역방향 네트워크가 그 결과를 원래의 숫자로 되돌릴 수 있는지 확인합니다. 만약 되돌릴 수 없다면, 역방향 네트워크가 가능해질 때까지 순방향 네트워크를 미세하게 조정합니다. 이 "재구성 손실(reconstruction loss)"은 순방향 네트워크가 복잡하고 느린 수학을 강요하지 않고도 **단조성(monotone)**을 갖도록 부드럽게 유도하는 역할을 합니다.

이것이 더 나은 이유:

  • 속도: 수치 적분(numerical integration)과 같은 무겁고 느린 수학을 필요로 하지 않기 때문에 훨씬 빠르게 훈련됩니다. 논문에 따르면 InvLT는 이전의 최고 방법(UMNN)보다 약 3.5배 빠르게 훈련되며, 실제 모델을 사용할 때(추론 시)는 5배 더 빠릅니다.
  • 정확도: AI의 원래 결정(예: "고양이"를 "강아지"로 바꾸는 것)을 보존하면서 확신도 수준을 수정합니다.
  • 성능: CIFAR-10, CIFAR-100, ImageNet 테스트에서 InvLT는 AI의 확신도가 실제 정확도와 일치하도록 만드는 데 있어 다른 거의 모든 방법보다 일관되게 우수한 성능을 보였습니다. 예를 들어, ImageNet에서 InvLT는 확신도 오차(ECE)를 **0.39%**로 줄였으며, 이는 차순위 방법인 UMNN의 **0.56%**보다 뛰어난 결과입니다.

결과: 명백한 승리

연구진은 세 가지 주요 데이터셋을 사용하여 방법을 테스트했습니다.

  • CIFAR-10: 10개의 카테고리를 가진 작은 이미지들.
  • CIFAR-100: 100개의 카테고리.
  • ImageNet: 1,000개의 실제 세계 이미지 카테고리.

그들은 이 방법이 다양한 유형의 모델에서 작동하는지 확인하기 위해 다양한 AI 아키텍처(ResNet, VGG, ViT 등)를 사용했습니다.

주요 결과:

  • 최고의 성능: InvLT는 거의 모든 테스트에서 가장 낮은 오차율을 달-성했습니다. ResNet-152 모델을 사용한 ImageNet 테스트에서, InvLT는 **0.39%**의 ECE를 달성했는데, 이는 교정되지 않은 모델(12.83%) 및 다른 모든 교정 방법보다 훨씬 뛰어난 수치입니다.
  • 강건성(Robustness): 학습할 데이터가 매우 적을 때(단 500개의 샘플)도, 복잡한 파라미터에 의존하는 다른 방법들(Matrix Scaling 등)이 완전히 실패하여 항등 함수(identity map)가 되어버린 것과 달리, InvLT는 여전히 좋은 성능을 보여주었습니다.
  • 보존: 논문은 "재구성" 트릭이 AI의 원래 답변을 온전히 유지한다는 것을 확인했습니다. 이 트릭이 없었다면 답변의 순서가 뒤섞여 AI의 정확도가 약간 떨어졌을 것입니다. 하지만 이 트릭 덕분에 정확도는 원래 모델과 동일하게 유지되었습니다.

한계와 미래

저자들은 자신들의 한계에 대해서도 솔직하게 밝히고 있습니다. InvLT는 각 숫자를 독립적으로 처리하기 때문에, 서로 다른 카테기 간의 복잡한 관계(예: "고양이"와 "강아지"는 모두 동물이며 서로 혼동될 수 있다는 사실)를 포착할 수는 없습니다. 그러나 그들은 대부분의 실용적인 용도에서 InvLT의 속도와 단순성이 최선의 선택이라고 주장합니다.

또한, 재구성 트릭이 순서 보존을 "시사"하기는 하지만, 그것이 수학적으로 철저하게 완벽한 보장은 아니라는 점도 언급했습니다. 따라서 자율주행 자동차와 같이 극도로 안전이 중요한 상황에서는 답변이 바뀌지 않았는지 확인하는 최종 점검 단계를 추가할 것을 권장합니다.

결론

결국, InvLT는 AI 모델을 더 정직하게 만드는 스마트하고 효율적인 방법입니다. 강력한 AI의 "결함 있는" 확신도를 가져와서, 속도를 늦추지 않으면서도 가볍고 유연한 도구로 수정합니다. 이는 때때로 문제를 해결하기 위해 더 크고 무거운 기계가 필요한 것이 아니라, 더 영리하고 가역적인 트릭이 필요하다는 것을 보여줍니다. AI의 결정에 의존하는 모든 이들에게, 이 방법은 AI가 주는 숫자를 신뢰할 수 있게 해주며, 그 숫자가 실제로 진실을 반영하고 있음을 알려줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →