← 최신 논문
💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

이 논문은 비전-언어 모델에서 출력의 정확성을 신뢰성 있게 예측하고 최첨단 보정(calibration)을 달める 데 필요한 스칼라 측도를 생성하기 위해, 알레아토리적 임베딩 수준 불확실성과 에피스테믹 모델 수준 불확실성을 분석적으로 융합하는 베이지안 프레임워크인 FUSE를 소개한다.

원저자: Harry Zhang, Luca Carlone

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Harry Zhang, Luca Carlone

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 때때로 과하게 자신만만한 로봇 비서에게 사진에 대해 질문한다고 상상해 보세요. 당신은 "고양이 모자 색깔이 뭐야?"라고 묻습니다. 로봇은 이미지를 보고 "검은색"이라고 답합니다. 하지만 만약 이미지가 흐릿하거나, 사실은 파란색인데 그림자 때문에 검게 보이는 것이라면 어떻게 될까요? 로봇이 추측을 하고 있는 것인지, 아니면 정말로 확신하고 있는 것인지 어떻게 알 수 있을까요?

이것이 바로 FUSE라는 논문이 해결하고자 하는 문제입니다. 이 기술은 로봇이 틀린 답을 내놓기 전에 "잘 모르겠습니다"라고 말할 수 있는 방법을 제공합니다.

FUSE가 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.

두 가지 종류의 "모름"

저자들은 로봇이 확신하지 못하는 데에는 두 가지 매우 다른 이유가 있다는 것을 깨달았습니다. FUSE는 이 두 가지를 모두 측정하여 하나의 점수로 결합합니다.

1. "지저분한 입력" 문제 (Aleatoric Uncertainty - 데이터 불확실성)

  • 비유: 당신이 손글씨 노트를 읽으려고 하는데, 잉크가 번져 있고 종이는 구겨져 있으며 글씨체도 엉망인 상황을 상상해 보세요. 당신이 세계 최고의 독서가라 할지라도, 입력 그 자체가 혼란스러운 상태입니다.
  • 논문에서의 의미: 이는 이미지나 텍스트 질문이 모호할 때 발생합니다. 사진이 어둡거나 질문이 막연할 수 있습니다. FUSE는 가공되지 않은 데이터(이미지와 텍스트)를 살펴보고 이것이 얼마나 "흐릿하거나" 모호한지를 계산합니다. 데이터가 지저분하다면, 로봇은 자신이 틀릴 수도 있다는 "의구심"을 먼저 갖게 됩니다.

2. "브레인 포그(머릿속 안개)" 문제 (Epistemic Uncertainty - 모델 불확실성)

  • 비유: 친구에게 질문을 던졌다고 상상해 보세요. 친구가 확신에 차 있다면 명확한 답변 하나를 줄 것입니다. 하지만 확신이 없다면, "음, 컵일 수도 있고, 아니면 꽃병일 수도 있고, 아마도 어떤 용기일 거야"라고 말하며 목소리가 떨릴 수 있습니다. 답변의 다양성이 그들이 진실을 모른다는 것을 알려줍니다.
  • 논문에서의 의미: FUSE는 로봇에게 같은 질문을 50번 던집니다. 만약 로봇이 50번 모두 다른 답변(예: "컵", "꽃병", "상자")을 내놓는다면, 이는 로봇이 혼란스러워하고 있음을 보여줍니다. 반대로 50번 모두 동일한 답변을 내놓는다면, 로봇은 확신하고 있는 것입니다. FUSE는 로봇의 답변들이 얼마나 서로 "흩어지는지" 또는 일치하지 않는지를 측정합니다.

마법의 기술: 베이지안 퓨전 (Bayesian Fusing)

보통 사람들은 지저운 입력을 보거나 혹은 흩어진 답변만을 확인하곤 합니다. 하지만 FUSE는 더 똑똑한 방식을 사용합니다. **베이지안 퓨전(Bayesian Fusion)**이라는 수학적 레시피를 사용하여 이 둘을 결합하는 것입니다.

  • 비유: 탐정이 범죄를 해결하는 과정을 생각해 보세요.
    • 단서 A (입력): 범죄 현장이 매우 안개가 자욱합니다 (지저분한 입력). 이로 인해 탐정은 사건이 까다롭다고 의심합니다.
    • 단서 B (답변): 목격자가 계속 말을 바꿉니다 (흩어진 답변). 이로 인해 탐정은 목격자가 거짓말을 하거나 혼란스러워한다고 의심합니다.
    • 판결: FUSE는 이 두 단서를 모두 가져와 하나의 "신뢰도 점수"를 계산합니다. 만약 현장도 안개가 자욱하고 목격자의 말도 계속 바뀐다면, 점수는 "불확실성 높음! 이 답변을 믿지 마세요"라고 말합니다. 만약 현장이 선명하고 목격자의 말도 일관적이라면, 점수는 "불확실성 낮음! 이 답변은 맞을 가능성이 높습니다"라고 말합니다.

이것이 왜 중요한가요?

이 논문은 FUSE가 기존 방식들보다 '환각(hallucination, 잘못된 정보를 사실처럼 말하는 것)'을 잡아내는 데 훨씬 뛰어나다는 것을 보여줍니다.

  • 기존 방식: 때때로 로봇은 틀렸음에도 불구하고 매우 자신만만할 수 있습니다. 모자가 실제로는 파란색임에도 불구하고, 로봇이 과하게 자신감이 넘치기 때문에 99%의 확신을 가지고 "검은색"이라고 말할 수 있습니다.
  • FUSE: 사진의 "흐릿함"과 답변의 "일관성"을 모두 확인함으로써, FUSE는 이러한 실수를 잡아낼 수 있습니다.

결과: "정지" 표지판

최종 출력물은 하나의 숫자(점수)입니다.

  • 낮은 점수: "저는 확신합니다. 제 답변을 그대로 사용하세요."
  • 높 높은 점수: "저는 혼란스럽습니다. 사진이 까다롭고 제 답변들이 제각각입니다. 제 답변을 믿지 말아 주세요."

이 논문은 다양한 시각적 질의응답 데이터셋(이미지에 대해 질문하는 작업 등)에서 테스트를 진행했으며, FUSE가 언제 "모르겠다"고 말해야 하는지, 그리고 언제 정답을 주어야 하는지를 판단하는 데 있어 최고라는 것을 입증했습니다. 이는 특히 잘못된 답변이 큰 문제를 일으킬 수 있는 상황에서 AI를 더 안전하고 신뢰할 수 있게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →