← 최신 논문
🤖 machine learning

Online Conformal Prediction Beyond Feedback

이 논문은 전략적으로 레이블을 질의함으로써 배포된 예측으로부터 직접적인 피드백 없이도 작동하며, 이를 통해 쿼리 비용을 최소화하면서 서브리니어 회한(sublinear regret)과 높은 커버리지 보장을 달성하는 비독립 동일 분포(non-i.i.d.) 데이터 스트림을 위한 새로운 불확실성 정량화 프레임워크인 질의를 포함한 온라인 컨포멀 예측(Online Conformal Prediction with Queries, OCPQ)을 소개한다.

원저자: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 어둡고 안개가 자욱한 미로를 통과하는 법을 가르치고 있다고 상상해 보십시오. 당신은 로봇이 앞으로 나아갈 만큼 충분히 자신감을 갖되, 벽에 부딪히지 않을 만큼은 신중하기를 바랍니다. 인공지능의 세계에서 이것은 '불확실성 정량화(uncertainty quantification)'라고 불립니다. 이는 로봇이 "저건 아마 벽일 거야"라고 말하는 것과 "전혀 모르겠지만 일단 찍어볼게"라고 말하는 것의 차이입니다. 이러한 신중함을 가르치는 한 가지 인기 있는 방법은 '등각 예측(conformal prediction)'입니다. 이는 단순히 하나의 답(예: "저건 고양이야")을 주는 것이 아니라, 수학적으로 대부분의 경우에 진실을 포함하도록 보장되는 가능한 답들의 안전망(예: "고양이거나, 개거나, 혹은 여우야")을 제공하는 방법입니다.

보통, 더 잘하기 위해서 로봇은 피드백을 받습니다. 로봇이 추측을 하면, 누군가(혹은 센서)가 "맞았어" 또는 "틀렸어"라고 알려줍니다. 로봇은 이 피드백을 사용하여 다음 라운드를 위한 자신의 안전망을 조정합니다. 하지만 만약 로봇이 자신의 추측에 대해 결코 피드백을 받을 수 없는 상황에 처한다면 어떻게 될까요? 어떤 사람이 위협적인 존재인지 결정해야 하는 보안 요원을 상상해 보십시오. 만약 요원이 "위협"이라고 추측했는데 틀렸다면, 그 사람은 "헤이, 당신이 실제로 위협이었나요?"라고 물을 수 없습니다. 그렇게 묻는다면 보안 점검의 목적 자체가 무색해지기 때문입니다. 요원은 오직 자신이 멈춰 서서 지원 요청을 하기로 결정했을 때만 '진짜 정답'을 확인할 수 있지만, 매번 그렇게 할 수는 없습니다. 이것이 바로 까다로운 '피드백 너머(beyond feedback)' 문제입니다. 즉, 자신의 답을 확인할 수 없을 때 어떻게 안전하게 학습할 것인가의 문제입니다.

이 논문은 정확히 이 퍼즐을 풀기 위해 OCPQ(Online Conformal Prediction with Queries)라는 영리하고 새로운 방법을 소개합니다. 연구진은 이 문제를 매 턴마다 플레이어에게 두 가지 선택지를 주는 고난도의 게임처럼 다룹니다. 예측을 하거나(이 경우 피드백은 전혀 받지 못함), 혹은 '질의(query)'를 하여 정답을 확인하거나(이 경우 해당 턴에 대한 예측은 받지 못함) 중 하나를 선택해야 합니다. 이는 마치 비디오 게임을 할 때, 목표물을 맞추기 위해 일단 쏴보거나, 아니면 게임을 일시 정지하고 지도를 보는 것과 같습니다. 하지만 두 가지를 동시에 할 수는 없습니다.

연구팀은 아주 적은 빈도로, 구체적으로는 전체 라운드 수를 TT라고 할 때 약 T1/3T^{1/3} 라운드마다 한 번씩 "일시 정지하고 지도를 보는 것(질의)"을 선택함으로써, 여전히 매우 정확하게 학습할 수 있다는 것을 발견했습니다. 그들은 이 아주 적은 양의 엿보기만으로도, 진실이 사용자가 원하는 빈도(β\beta)만큼 자주 로봇의 안전망에 포함되도록 하는 것을 수학적으로 증명했습니다. 이 전략의 '비용'은 완벽한 피드백이 있을 때보다 안전망이 약간 더 커질 수 있다는 것이지만, 그 차이는 게임이 진행됨에 따라 줄어듭니다.

실험에서 연구진은 손글씨 숫자 이미지와 대규모 언어 모델의 텍스트 프롬프트를 포함한 실제 데이터를 사용하여 OCPQ를 테스트했습니다. 그들은 데이터가 예상치 못하게 변하거나(예: 맑은 날에 훈련된 로봇이 비 오는 날을 항해하려는 경우) 데이터가 의도적으로 까다로운 경우(적대적 공격)에도 OCPQ가 안전망을 신뢰할 수 있게 유지한다는 것을 발견했습니다. 또한 사용자가 β\beta라는 단 하나의 노브를 조절함으로써, 얼마나 안전을 우선시할지 혹은 얼마나 정밀함을 우선시할지를 결정할 수 있음을 보여주었습니다. 결과는 우리가 안전하기 위해 끊임없이 자신의 답을 확인할 필요는 없으며, 때로는 가끔씩만 확인하는 것만으로도 세상이 우리를 속이려 할 때 전체 시스템을 정직하게 유지하기에 충분하다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →