← 최신 논문
📊 statistics

Conformal Calibration for Multi-Modal Regression with Missing Modalities

이 논문은 누락되거나 상충하는 데이터가 있는 다중 모드 회귀에서 불일치 점수를 활용하여 구간 너비를 동적으로 조절하거나 캘리브레이션을 계층화함으로써, 다양한 데이터셋과 결측 레짐에 걸쳐 우수한 성능과 강건한 커버리지를 달성하는 양식 인식 컨포멀 캘리브레이션 레이어를 소개한다.

원저자: Ilia Azizi

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ilia Azizi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 전문가 팀을 활용해 미래를 예측하려고 한다고 상상해 보십시오. 어떤 전문가들은 날씨를 보고, 어떤 이들은 주식 시장을 보며, 또 다른 이들은 소셜 미디어 트렌드를 살핍니다. 그들이 모두 동의할 때, 당신은 확신을 느낍니다. 하지만 날씨 전문가가 "맑음"이라고 말하는 동안 주식 전문가가 "폭락"이라고 비명을 지른다면 어떻게 될까요? 혹은 한 전문가가 갑자기 휴가를 떠나 입을 닫아버린다면요? 이것이 현대 인공지능, 특히 **머신러닝(machine learning)**이라 불리는 분야가 매일 겪는 고충입니다. AI 모델은 추측을 하는 데는 뛰어나지만, 자신이 얼마나 확신하는지를 우리에게 말하는 법을 자주 잊어버리곤 합니다.

이를 해결하기 위해 과학자들은 **컨포멀 예측(conformal prediction)**이라는 영리한 기술을 사용합니다. 이것은 안전망과 같다고 생각하면 됩니다. 단순히 하나의 숫자(예: "월세는 2,000달러가 될 것입니다")를 주는 대신, AI는 범위(예: "1,800달러에서 2,200달러 사이")를 제공합니다. 목표는 시간이 흐름에 따라 실제 정답이 그 범위 안에 들어올 확률을 95%로 만드는 것입니다. 이를 "커버리지 보장(coverage guarantee)"이라고 합니다. 이는 20번 중 19번은 맞겠다고 약속하는 일기 예보와 같습니다. 하지만 여기에는 함정이 있습니다. 전통적인 안전망은 "일률적(one-size-fits-all)"입니다. 전문가들이 전적으로 동의하든 서로 비명을 지르며 싸우든 상관없이 똑같은 크기로 늘어납니다. 이 논문은 AI의 입력값(텍스트, 이미지, 숫자 등)이 때때로 충돌하거나 사라지는 복잡한 현실을 다루며 다음과 같이 질문합니다. 우리가 안전망을 더 똑똑하게 만들어서, 정말 필요할 때만 늘어나도록 할 수 있을까?


문제점: "일률적인" 안전망

멀티모달 AI의 세계에서 컴퓨터는 단 한 가지만 보는 것이 아니라, 여러 가지를 동시에 봅니다. 집 매물 정보(텍스트)를 읽고, 방 사진(이미지)을 보고, 주변 지역 통계(숫자)를 확인할 수도 있습니다. 보통 이러한 정보원들은 서로를 돕습니다. 하지만 때때로 그들은 서로 의견이 다릅니다. 예를 들어, 텍스트에는 "아늑한" 집이라고 되어 있지만, 사진에는 아주 작은 벽장처럼 보일 수도 있습니다. 혹은 파일이 손상되어 사진이 아예 누락될 수도 있습니다.

이를 처리하는 기존 방식은 **글로벌 분위수(global quantile)**를 사용하는 것이었습니다. 마치 선생님이 학생이 A+ 우등생인지 아니면 학습에 어려움을 겪고 있는지와 상관없이 모든 학생에게 똑같은 크기의 안전망을 주는 것과 같습니다. 만약 AI의 정보원들이 완전히 일치한다면, 안전망은 너무 헐거워져서 낭비가 됩니다(wasteful). 반대로 정보원들이 서로 싸우고 있다면, 안전망이 너무 좁아서 실제 정답이 범위를 벗어나는 위험한 상황이 발생할 수 있습니다(dangerous). 이 논문은 입력값이 엉망이거나 불완전할 때 이러한 "평균적인" 접근 방식이 실패한다고 주장합니다.

해결책: 스마트하고 형태가 변하는 안전망

저자인 일리아 아지지(Ilia Azizi)는 **모달리티 인식 컨포멀 캘리브레이션 레이어(modality-aware conformal calibration layer)**라는 새로운 지능 계층을 제안합니다. 이것을 AI 전문가 팀을 감독하는 스마트한 관리자라고 생각하십시오.

  1. 불일치 점수(The Disagreement Score): 관리자는 전문가들의 말을 듣습니다. 텍스트 전문가, 이미지 전문가, 숫자 전문가가 모두 "월세는 2,000달러"라고 말한다면, 관리자는 "좋아, 의견이 일치하군!"(낮은 불일치)이라고 기록합니다. 만약 텍스트는 "2,000달러"라고 하는데 이미지는 "3,500달러"를 시사한다면, 관리자는 "어라, 큰 충돌이 발생했다!"(높은 불일치)라고 기록합니다.
  2. 두 가지 도구: 논문은 이 점수를 사용하여 안전망을 수정하는 두 가지 방법을 소개합니다.
    • "늘어나는" 방식 (Disagreement-Scaled): 이것은 마법의 고무줄과 같습니다. 전문가들이 동의하면 고무줄이 줄어들어 정밀하고 날카로운 예측을 제공합니다. 전문가들이 싸우면 고무줄이 넓게 늘어나 실제 정답을 잡아내어 안전을 보장합니다. 이 방식은 95%의 적중률이라는 전체적인 약속을 지키면서도 예측을 훨씬 더 정교하게 만듭니다.
    • "그룹" 방식 (Mondrian Calibration): 이것은 상황에 따라 학생들을 서로 다른 교실로 분류하는 것과 같습니다. 만약 사진이 누락되었다면, 그 학생은 자신만의 특정 안전망 크기를 가진 "사진 누락" 교실로 갑니다. 텍스트가 누락되었다면 "텍스트 누락" 교실로 갑니다. 각 그룹은 자신의 구체적인 문제에 딱 맞는 크기의 안전망을 받게 됩니다.

연구 결과: 더 똑똑한 그물, 더 적은 실수

연구팀은 스위스 아파트 임대, 반려동물 사진, 영화 리뷰를 포함한 네 가지 실제 데이터셋을 통해 이 아이디어를 테스트했습니다. 실험의 확실성을 위해 다양한 설정으로 60번의 실험을 수행했습니다.

  • "늘어나는" 방식의 승리: 60번의 테스트 중 59번에서, 새로운 불일치 기반 방식이 기존의 "일률적인" 방식보다 더 나은 예측 구간을 만들어냈습니다. 이 방식은 정확도를 잃지 않으면서도 구간을 더 좁게(더 정밀하게) 만드는 데 성공했습니다. 실제로 이 방식은 "커버리지"(정답을 맞히는 비율)를 목표치인 **95%**에 매우 가깝게 유지했습니다.
  • 누락된 데이터 해결: 진짜 마법은 데이터를 누락시켰을 때(예: 사진이나 텍스트를 삭제함) 나타났습니다. AI가 정보의 한 유형 전체를 놓치고 있는 가장 어려운 경우, 기존 방식은 겨우 76% 정도만 성공하며 처참하게 실패했습니다. 새로운 "마스크 매칭(mask-matched)" 방식은 이를 해결하여 성공률을 **95.3%**까지 끌어올렸습니다. 이는 19.5 퍼센트 포인트라는 엄청난 회복입니다.
  • 트레이드오프(Trade-off): 데이터가 누락되었을 때 그 추가적인 안전을 확보하기 위해, 안전망은 더 넓어져야 했습니다. 예를 들어, 표 형식의 데이터(tabular data)만 사용 가능할 때 예측 구간의 너비는 125% 증가했습니다. 하지만 저자는 이것이 공정한 거래라고 주장합니다. 목표를 놓치는 좁은 그물보다는, 넓더라도 안전한 그물을 갖는 것이 낫기 때문입니다.

이것이 중요한 이유

이 논문은 단순히 새로운 수학적 기교를 제안하는 것이 아니라, 거의 모든 AI 시스템에 추가할 수 있는 실용적인 "플러그 앤 플레이(plug-and-play)" 계층을 제공합니다. 이 방식은 AI가 의사결정 나무를 사용하는지, 신경망을 사용하는지 등을 따지지 않습니다. 핵심적인 교훈은 불확실성은 상황에 따라 변해야 한다는 것입니다. AI가 혼란스럽거나 퍼즐의 조각이 부족할 때는, 범위를 넓힘으로써 이를 인정해야 합니다. 확신이 있을 때는 정밀해야 합니다.

불일치와 누락된 데이터를 오류가 아닌 '신호'로 취급함으로써, 저자는 우리가 단순히 추측하는 것이 아니라, "잘 모르겠으니 만약을 대비해 범위를 크게 잡겠습니다"라고 말할 줄 아는, 더 똑똑하고 정직한 AI 시스템을 구축할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →