← 최신 논문
📊 statistics

Prior laundering: learned priors with inherited, undetectable overconfidence

이 논문은 레거시 재구성(legacy reconstructions)을 생성적 사전 확률(generative priors)의 학습 데이터로 사용하는 관행, 즉 "사전 세탁(prior laundering)"이 모델이 실제 데이터로부터 배우는 대신 아카이브의 편향을 상속하고 증폭하게 함으로써, 부적정(ill-posed) 역문제에서 탐지 불가능한 과잉 확신과 열악한 불확실성 정량화로 이어진다고 경고한다.

원저자: Ali Siahkoohi, Sina Alemohammad

게시일 2026-07-27
📖 6 분 읽기🧠 심층 분석

원저자: Ali Siahkoohi, Sina Alemohammad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보이지 않는 지도의 미스터리

당신이 범죄를 해결하려는 탐정이라고 상상해 보세요. 하지만 당신에게 주어진 것은 현장의 흐릿하고 불완전한 사진 한 장뿐입니다. 당신은 물리 법칙(빛이 굴절되는 방식, 소리가 전달되는 방식)을 알고 있지만, 사진에는 거대한 정보의 공백이 있습니다. 이 빈틈을 채우기 위해 당신은 '사전 지식(prior)'—즉, 누락된 부분이 보통 어떤 모습인지에 대한 교육된 추측—이 필요합니다. 과학계에서는 이를 **역문제(inverse problem)**라고 부릅니다. 혼란스러운 결과로부터 원래의 원인을 역으로 찾아내는 과정입니다.

수십 년 동안 과학자들은 이러한 추측을 위해 "이미지는 매끄러울 것이다"라거나 "물체는 단순할 것이다"와 같은 수작업으로 만든 규칙들을 사용해 왔습니다. 하지만 최근에는 이러한 규칙을 학습하기 위해 AI를 사용하기 시작했습니다. AI는 수천 개의 과거 해결책을 살펴보며 무엇이 '그럴듯한' 답인지 학습하여 **생성적 사전 지식(generative prior)**을 만들어냅니다. 이는 강력한 도구이지만, 한 가지 함정이 있습니다. AI를 훈련시키려면 '진짜 정답(ground truth)'을 알아야 한다는 점입니다. 지질 탐사(지표 아래를 들여다보는 일)나 의료 영상(인체 내부를 들들이는 일) 같은 분야에서 진짜 정답은 거의 존재하지 않습니다. 땅속의 암석 층이 정확히 어떤 모습인지, 환자의 몸속 건강한 조직이 정확히 어떤 상태인지는 침습적인 수술 없이는 알 수 없기 때문입니다.

그렇다면 과학자들은 무엇을 할까요? 그들은 조금, 혹은 그렇게 믿고 싶어 하는 방식으로 '속임수'를 씁니다. 이전 방법들이 내놓은 '과거의 추측'을 가져와서, 그것을 마치 진실인 것처럼 취급하며 새로운 AI를 훈련시키는 것입니다. 이 논문은 이 과정을 **"사전 세탁(prior laundering)"**이라고 부릅니다. 이것은 마치 이전 화가가 그린 스케치를 가져와서 세탁기에 돌려 사진처럼 보이게 만든 다음, 그 새로운 사진이 실제 데이터에 기반한 것이라고 주장하는 것과 같습니다. 여기서 큰 의문이 생깁니다. 이 속임수가 효과가 있을까요, 아니면 위험한 비밀을 숨기는 것일까요?

세탁 사이클: 어떻게 "깨끗한" AI가 더러워지는가

**"사전 세탁: 상속된, 감지 불가능한 과잉 확신을 가진 학습된 사전 지식(Prior Laundering: learned priors with inherited, undetectable overconfidence)"**이라는 제목의 이 논문은, 실제 진실 대신 이러한 '유산(legacy)' 재구성 결과물로 강력한 AI를 훈련시킬 때 정확히 어떤 일이 발생하는지를 조사합니다. 저자인 Ali Siahkoohi와 Sina Alemohammad는 매우 우려스러운 현상을 발견했습니다. AI가 단순히 데이터로부터 배우는 것이 아니라, 자신이 훈련받은 예전 방식의 **맹점(blind spots)**과 **거짓 확신(false confidence)**을 그대로 물려받는다는 사실입니다.

이 문제의 핵심을 간단한 비유로 설명하겠습니다:

당신이 밀봉된 상자 안에 무엇이 들어있는지 맞히려고 노력한다고 상상해 보세요. 당신은 상자를 흔들어 달그락거리는 소리를 들을 수 있습니다(이것이 측정값/데이터입니다).

  1. 해결된 방향: 만약 상자 안에 느슨한 동전이 들어있다면, 소리가 명확하게 들릴 것입니다. 데이터는 동전이 정확히 어디에 있는지 알려줍니다.
  2. 맹목적인 방향: 하지만 상자 안에는 소리를 전혀 내지 않는 무거운 납 덩어리가 들어있을 수도 있습니다. 상자를 아무리 세게 흔들어도, 데이터는 납 덩어리에 대해 아무것도 알려주지 않습니다.

완벽한 세상이라면, 데이터가 침묵할 때 당신은 이렇게 말해야 합니다. "나는 저 납 덩어리가 어떻게 생겼는지 전혀 모르겠어. 무엇이든 될 수 있어." 하지만 바로 여기서 '세탁'이 일어납니다.

과학자들은 과거의 추측치 아카이브를 가지고 AI를 훈련시켰습니다. 그 과거의 추측들에서, 제작자들은 '침묵하는 납 덩어리는 항상 완벽하고 매끄러운 정육면체일 것'이라고 가정하는 규칙(정규화 도구/regularizer)을 사용했습니다. 데이터가 이 가정을 반박할 수 없었기 때문에(납이 소리를 내지 않으므로), 과거의 추측들은 항상 매끄러운 정육면체를 보여주었습니다.

새로운 AI가 이 과거의 추측들로 훈련되었을 때, AI는 매우 구체적인 교훈을 얻었습니다. "데이터가 침묵할 때, 정답은 매끄러운 정육면체다." AI는 이 교훈을 흔드는 상자(데이터)로부터 배운 것이 아니라, 오래된 스케치(아카이브)로부터 배웠습니다.

확실성이라는 위험한 환상

이 논문은 이것이 **감지 불가능한 과잉 확신(undetectable overconfidence)**으로 이어진다는 것을 밝혀냈습니다.

AI가 새로운 문제를 해결하기 위해 배치되었을 때, AI는 데이터의 침묵하는 부분을 보고 자신 있게 보고합니다. "나는 납 덩어리가 매끄러운 정육면체라고 99% 확신합니다!" AI는 자신의 추측 주위에 매우 좁고 타이트한 원을 그립니다. 통계학에서는 이를 **신뢰 구간(credible interval)**이라고 합니다. 만약 이 구간이 너무 좁다면, AI는 "과잉 확신" 상태인 것입니다.

무서운 점은 아무도 AI가 거짓말을 하고 있다는 것을 알아챌 수 없다는 것입니다.

  • 데이터 검증의 실패: 만약 당신이 흔드는 상자와 AI의 답을 대조해 본다면, AI의 답은 완벽하게 통과할 것입니다. AI의 추측은 소리와 완벽하게 일치하는데, 왜냐하면 소리는 납 덩어리에 대해 신경 쓰지 않기 때문입니다.
  • 자기 검증의 실패: 과학자들은 종-종 AI가 정직한지 확인하기 위해 **시뮬레이션 기반 보정(simulation-based calibration)**이라는 테스트를 사용합니다. AI에게 예측을 시킨 뒤, 실제 진실이 AI의 신뢰 원 안에 들어오는지 확인하는 것입니다. 하지만 AI는 과거의 '매끄러운 정육면체' 규칙을 바탕으로 훈련되었기 때문에, 자신의 훈련 내용과 완벽하게 일치합니다. AI는 매번 테스트를 통과하지만, 침묵하는 부분에 대해서는 자신 있게 틀리고 있는 상태입니다.

이 논문은 수학적으로 이러한 "맹목적인 방향"에서 AI의 불확실성이 **고정(frozen)**된다는 것을 증명합니다. 그것은 자신이 훈련받은 예전의 수작업 규칙과 정확히 같습니다. 만약 예전 규칙이 너무 좁았다면(너무 확신했다면), 새로운 AI도 너무 좁습니다. 만약 예전 규칙이 틀렸다면, 새로운 AI도 틀립니다. 데이터는 이를 바로잡을 수 없습니다. 데이터가 애초에 그 부분을 "보지" 못했기 때문입니다.

"단일 최적해"의 함정

상황은 **단일 최적해 큐레이션(single-best curation)**이라는 흔한 관행 때문에 더욱 악화됩니다. 흔히 아카이브는 다양한 가능성의 범위(추측의 '구름')를 저장하는 것이 아니라, 단 하나의 가장 좋은 추측(최대 사후 확률/MAP 추정치)만을 저장합니다.

논문은 만약 AI를 이러한 단 하나의 완벽해 보이는 이미지들로 훈련시킨다면, 맹점에서의 AI 확신도가 **제로 너비(zero width)**로 붕괴된다는 것을 보여줍니다. AI는 절대적으로 확신하게 됩니다. "나는 납 덩어리가 매끄러운 정육면체라고 100% 확신합니다."라고 말이죠.

현실에서 납 덩어리는 구형일 수도, 피라미드 형태일 수도, 혹은 울퉁불퉁한 바위일 수도 있습니다. 하지만 아카이브에는 오직 정육면체만이 등장했기 때문에, AI는 정육면체가 유일한 가능성이라고 생각합니다. 논문은 이것이 **제로 커버리지(zero coverage)**로 이어진다는 것을 입증합니다. 즉, 테스트를 실행하면 실제 정답이 AI의 아주 작고 자신만만한 원 안에 들어올 확률은 거의 없습니다.

실험 결과

저자들은 이것이 단순한 종이 위의 수학이 아님을 증명하기 위해 두 가지 실제 시나리오에 대한 시뮬레이션을 수행했습니다.

  1. 지진 영상 기술(Seismic Imaging): 지하 암석층을 들여다보는 작업입니다. 그들은 오래된 '이동(migrated)' 영상들로 AI를 훈련시켰습니다. 결과는 어떠했을까요? AI는 빛(데이터)이 약한 이미지의 깊고 어두운 부분에 대해 믿기 힘들 정도로 확신을 가졌습니다. AI는 너무 작은, 좁은 불확실성 띠를 그렸습니다. (테스트를 위해 구축한) '진실'은 이 띠 밖에 있는 경우가 많았습니다.
  2. 지하수 흐름(Groundwater Flow): 지하의 물을 매핑하는 작업입니다. 그들은 '최선의 추측' 지도들로 훈련된 다른 유형의 AI(노멀라이징 플로우)를 사용했습니다. 결과는 마찬가지였습니다. AI는 맹점 부분에서 과잉 확신을 보였으며, 엄청난 불확실성이 있어야 할 곳에서 불확실성이 '제로'라고 보고했습니다.

두 경우 모두, '진실'을 바탕으로 훈련받은 AI(대조군)는 훨씬 더 정직했습니다. 그들은 자신이 모르는 부분이 있을 때 이를 인정하며 넓고 흐릿한 불확실성 띠를 보여주었습니다. 반면, "세탁된" AI는 더 선명하고 자신감 있어 보였지만, 그것은 **확신의 환상(hallucination of certainty)**이었습니다.

결론: 가장 깨끗한 이미지를 믿지 마라

이 논문은 **사전 세탁(prior laundering)**이 표준적인 검사로는 감지할 수 없는 구조적 결함을 만든다고 결론짓습니다. AI는 예전 방식의 '맹목적인 믿음'을 물려받습니다.

저자들은 간단하고 실용적인 해결책을 제안합니다: 데이터가 실제로 보고 있는 것을 보고하라.
AI의 불확실성을 신뢰하기 전에, 과학자들은 데이터가 실제로 해상도를 가질 수 있는 부분(resolved subspace)과 맹목적인 부분을 계산해야 합니다. 맹목적인 부분에 대한 확신은 "데이터에 의해 뒷받침됨"이 아니라 "파이프라인으로부터 상속됨"이라고 보고해야 합니다.

만약 당신이 지하 지도를 보고 있거나 환자의 스캔 영상을 보고 있는데, AI가 "이 어둡고 흐릿한 구석에 대해 나는 100% 확신합니다"라고 말한다면, 당신은 의심해야 합니다. 그 확신은 데이터에서 온 것이 아니라, 세탁 과정에서 온 것입니다. 데이터는 침묵했고, AI는 그저 낡은 추측을 새로운 광택제로 덧칠하여 반복했을 뿐입니다.

이 논문은 AI 사용을 중단하라는 말이 아닙니다. 다만, 훈련된 '오래된 추측'이 침묵하는 구석에서 AI를 '데이터 기반'으로 만든다는 착각을 멈춰야 한다고 말합니다. 데이터에는 한계가 있으며, 데이터가 말을 멈출 때 AI의 확신은 과거의 유령일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →