← 최신 논문
🤖 machine learning

Empirical Bayes Conformal Prediction for Vision and Language Models

본 논문은 rr-값을 활용하여 점수 변이성을 불확실성 기반의 비동일성 점수로 변환함으로써 비전 및 언어 모델에서 분포 무관한 커버리지 보장을 유지하면서 랭킹 안정성을 향상시키고 고분산 오검출 후보의 포함을 줄이는 경험적 베이지안 컨포멀 예측 프레임워크를 제시한다.

원저자: Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng, Michael A. Newton, Vikas Singh

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng, Michael A. Newton, Vikas Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

재능 쇼의 심사위원이 되어 있다고 상상해 보세요. 당신은 참가자 (후보자) 목록을 가지고 있으며, 다음 라운드로 진출할 최고의 공연자들로 구성된 '안전 목록'을 선택해야 합니다. 실제 우승자가 당신의 목록에 포함되도록 95% 확신을 얻고 싶지만, 동시에 나쁜 공연을 보는 시간을 낭비하지 않도록 목록은 가능한 한 짧아야 합니다.

이것은 바로 **적합성 예측 (Conformal Prediction, CP)**이 AI 모델에게 수행하는 작업입니다. CP 는 대부분 올바른 답을 포함하도록 보장되는 답의 '안전 목록'을 생성합니다.

그러나 표준 AI 모델에는 문제가 하나 있습니다. 바로 때때로 불안정하다는 점입니다. 같은 질문을 두 번 하거나 같은 이미지를 두 번 보더라도 모델은 약간 다른 점수를 줄 수 있습니다. 때로는 운이 좋아 나쁜 답이 높은 점수를 받기도 하고 ('운 좋은 추측'), 때로는 운이 나빠 좋은 답이 낮은 점수를 받기도 합니다.

표준 CP 는 이러한 점수 중 하나만을 봅니다. 이는 심사위원이 흔들리는 단일 공연을 바탕으로 결정을 내리는 것과 같습니다. 모델이 '운 좋은 추측'의 순간을 겪으면 나쁜 답이 안전 목록에 포함되어 목록이 길어지고 유용성이 떨어집니다.

새로운 아이디어: 'r-value'(안정성 점검)

이 논문은 **r-value 를 사용한 경험적 베이지안 적합성 예측 (Empirical Bayes Conformal Prediction using r-values)**이라는 새로운 방법을 소개합니다. r-value를 **'안정성 점수'**나 **'일관성 배지'**로 생각하세요.

"점수가 얼마나 높았는가?"를 묻는 대신, 이 새로운 방법은 **"점수가 얼마나 일관되었는가?"**를 묻습니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

비유: '운 좋은 학생' vs '신뢰할 수 있는 학생'

시험을 보는 두 명의 학생을 상상해 보세요:

  1. 학생 A (바위): 시험을 치르라고 할 때마다 매번 90 점으로 일관됩니다. 그들은 안정적이고 신뢰할 수 있습니다.
  2. 학생 B (롤러코스터): 때로는 95 점, 때로는 40 점, 때로는 92 점을 받습니다. 그들의 평균은 높을 수 있지만, 점수는 들쑥날쑥합니다.

표준 CP는 학생 B 가 운 좋게 맞춘 95 점을 보고 "와, 95 점은 훌륭해! 그들은 최상위 그룹이야!"라고 말합니다. 학생 B 는 실제로는 신뢰할 수 없음에도 불구하고 안전 목록에 포함시킵니다.

r-value 방법은 전체 그림을 봅니다. 학생 B 가 롤러코스터라는 것을 알아챕니다. "비록 한 번 95 점을 맞췄지만, 너는 너무 흔들려서 최상위 후보로 신뢰할 수 없어. 다음 번에는 40 점으로 떨어질지도 몰라."라고 말합니다. 따라서 학생 B 를 안전 목록에서 제외하거나 목록에서 아래로 밀어내고, 학생 A(바위) 를 최상단에 유지합니다.

실제 작동 방식

연구자들은 이 방법을 두 가지 유형의 AI 에 대해 테스트했습니다:

  1. 시각 모델 (이미지 분류기): 고양이 사진을 보는 로봇과 같습니다.

    • 기법: 로봇에게 같은 사진을 1,000 번 보게 하되, 아주 작은 무작위 변화를 주었습니다 (친구에게 같은 사진을 약간 다른 단어로 설명해 달라고 요청하는 것과 유사).
    • 결과: 로봇이 매번 '고양이'라고 말하면 높은 r-value 를 받았습니다. '고양이', '개', '토스터' 사이를 계속 오갔다면 낮은 r-value 를 받았습니다. 이 방법은 우연히 발생한 '토스터' 추측들을 성공적으로 걸러냈습니다.
  2. 언어 모델 (챗봇): 퀴즈 질문에 답하는 로봇과 같습니다.

    • 기법: 로봇에게 같은 질문을 했지만 20 가지 다른 방식으로 재구성하여 질문했습니다 (예: "대통령은 누구인가?" 대 "국을 이끄는 사람은 누구인가?").
    • 결과: 로봇이 20 가지 버전 모두에 훌륭한 답을 주면 '바위'로 간주되었습니다. 한 버전에는 훌륭한 답을 주고 다른 버전에는 터무니없는 답을 주면 '롤러코스터'로 간주되었습니다. r-value 방법은 이를 활용하여 더 짧고 정확한 답 목록을 생성했습니다.

주요 결론

  • 규칙을 위반하지 않습니다: 새로운 방법은 여전히 올바른 답이 목록에 포함될 확률을 95% 로 보장합니다 (구方法与 동일하게).
  • 목록을 더 짧게 만듭니다: '운 좋은 추측'(불안정한 높은 점수) 을 필터링함으로써 후보 목록이 더 작아지고 유용해집니다.
  • 불확실성에 대해 똑똑합니다: 모델이 매우 안정적이라면 (변동성이 없음), 새로운 방법은 구方法与 동일하게 작동합니다. 하지만 모델이 흔들린다면, 새로운 방법은 그 흔들림을 이용하여 나쁜 후보들을 제거하는 데 활용합니다.
  • 이미지와 텍스트 모두에서 작동합니다: AI 가 사진을 보든 문장을 읽든, 일관성을 점검하면 최종 결정이 더 좋아집니다.

요약하자면, 이 논문은 AI 가 단일한 '운 좋은' 점수를 신뢰하는 것을 멈추고 일관된 성능을 신뢰하도록 가르칩니다. 이는 AI 의 own '불일치성'을 더 좋고 안전한 예측을 만들기 위한 도구로 전환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →