← 최신 논문
🤖 machine learning

Reliability Scales Inversely: Bigger Models Compound Mistakes Faster via a Hidden Auto-Regressive Risk Regime

이 논문은 언어 모델이 규모를 키워감에 따라, 저확률 토큰 오류가 확신에 찬 눈덩이 효과식의 환각을 유발하여 모델 자체의 불확실성 신호가 감지할 수 있는 것보다 더 오래 지속되는 자기 영속적인 "자기 회귀적 위험 체제"에 점점 더 깊이 진입하게 되며, 결과적으로 더 큰 모델들이 일반적인 능력을 얻음에도 불구하고 실수를 더 빠르게 누적시킨다는 사실을 밝히고 있다.

원저자: Kushal Chakrabarti

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Kushal Chakrabarti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 AI의 역설: 크다고 해서 반드시 더 나은 것은 아니다

로봇에게 이야기를 들려주는 법을 가르치고 있다고 상상해 보세요. 인공지능의 세계에는 로봇에게 더 많은 뇌력(brainpower)과 더 많은 책, 그리고 더 많은 학습 시간을 주면 결국 완벽해질 것이라는 오래된 믿음이 있습니다. 이 개념을 "스케일링(scaling)"이라고 부릅니다. 모델이 커질수록 더 똑똑해진다는 것입니다. 하지만 여기에는 함정이 있습니다. 이 로봇들이 긴 이야기를 쓸 때, 단순히 더 나아지는 것이 아니라, 이야기가 진행됨에 따라 진실을 유지하는 능력이 오히려 악화되기도 합니다. 처음에는 완벽한 사실로 시작할지 모르지만, 그러다 실수로 거짓말을 지어낼 수 있고, 그 거짓말에 너무나 확신을 가진 나머지 그 거짓말 위에 나머지 이야기를 쌓아 올려 '엉터리의 눈덩이(snowball of nonsense)'를 만들어 버립니다.

왜 이런 일이 발생하는지 이해하려면, 이 로봇들이 어떻게 "생각"하는지 살펴봐야 합니다. 이들은 우리처럼 사실을 아는 것이 아니라, 이전에 본 패턴을 바탕으로 문장의 다음 단어를 예측합니다. 과학자들은 로봇이 실수를 할 때, 그것이 항상 답을 몰라서 발생하는 것이 아니라는 사실을 발견했습니다. 때때로 답을 알고 있음에도 불구하고 잘못된 추측을 하기도 합니다. 일단 잘못된 추측을 하고 나면, 로봇은 그것을 다음 문장을 위한 사실로 취급합니다. 이를 "자기 회귀(auto-regression)"라고 합니다. 즉, 로봇이 자신의 출력을 다시 자신에게 입력하는 것입니다. 연구자들이 던지는 큰 질문은 이것입니다: 왜 로봇이 커질수록 이러한 실수 발생이 더 심해지는가, 그리고 왜 로봇들은 스스로가 거짓말을 하고 있다는 사실조차 인지하지 못하는가?


논문의 핵심 발견: 보이지 않는 눈덩이

쿠샬 차크라바르티(Kushal Chakrabarti)가 작성한 이 논문은 우리가 AI의 신뢰성에 대해 생각하는 방식을 뒤집어 놓습니다. 주요 발견은 다소 직관에 어긋납니다: AI 모델이 커질수록, 단순히 더 똑똑해지는 것이 아니라, 실수가 더 빠르게 누적되는 방식 또한 더 정교해집니다.

AI 모델을 긴 다파트 시험을 치르는 학생이라고 생각해 보세요.

  • 기존의 생각: "지식 격차(Knowledge Gap)" 이론은 학생이 문제를 틀리는 이유가 공부를 충분히 하지 않았기 때문이라고 말합니다. 해결책은? 더 큰 도서관(더 많은 데이터)과 더 큰 뇌(더 많은 파라미터)를 주는 것입니다.
  • 새로운 발견: 이 논문은 매우 똑똑한 학생들(거대 모델)의 경우, 문제가 지식을 모르는 데 있는 것이 아니라고 주장합니다. 문제는 일단 아주 똑똑하고 확신에 찬 잘못된 추측을 한 번 하고 나면, 그들은 "위험 체제(risk regime)"에 갇히게 된다는 것입니다. 그들은 그 잘못된 추측에 매달리게 되며, 너무나 확신에 차 있기 때문에 자신이 틀렸다는 사실을 깨닫지 못합니다. 그러고 나서 그 잘못된 추측을 바탕으로 다음 질문에 답하게 되고, 이는 또 다른 잘못된 추측으로 이어집니다. 학생이 커질수록, 이 거짓말의 눈덩이는 더 빠르게 불어납니다.

느낄 수 없는 "위험"

이를 설명하기 위해 저자들은 AI의 "불확실성"을 두 부분으로 나누는 영리한 수학적 기법을 사용합니다:

  1. 느껴지는 불확실성(Felt Uncertainty): AI가 얼마나 초조함을 느끼는지입니다. 추측을 하고 있다면 불안해할 것이고, 확신이 있다면 차분해질 것입니다.
  2. 전념 위험(Commitment Risk): 이것은 숨겨진 위험입니다. AI가 옳다고 생각하는 것과 "초지능 오라클(perfect reference model)"이 옳다고 아는 것 사이의 간극입니다.

여기 무서운 점이 있습니다: AI는 오직 자신의 초조함만을 느낄 수 있습니다. AI는 "전념 위험"을 느낄 수 없습니다.

당신이 다리 위를 걷고 있다고 상상해 보세요.

  • 느껴지는 불확실성은 당신의 무릎이 얼마나 떨리는가입니다.
  • 전념 위험은 실제 다리가 지면으로부터 얼마나 높이 떨어져 있는가입니다.

AI가 실수를 할 때(즉, "조작/fabrication"을 할 때), 그들의 "무릎"(느껴지는 불확실성)은 거의 즉시 떨림을 멈춥니다. 그들은 다시 차분해지고 확신에 차게 됩니다. 하지만 다리는 여전히 지면에서 멀리 떨어져 있습니다! "전념 위험"은 오랫동안 높게 유지됩니다. AI는 차분함을 느끼기 때문에, 자신이 여전히 위험한 상태라는 것을 알지 못합니다. 그들은 확신을 가지고 계속 걸어가 결국 낭떠러지로 떨어지게 되며, 거짓말의 사슬을 만들어냅니다.

"눈덩이" 효과

논문은 이것이 단발적인 실수가 아님을 보여줍니다. 일단 AI가 거짓말을 시작하면, 바로 다음 문장에서 다시 거짓말을 할 확률이 1.08배에서 1.71배 더 높아집니다.

  • 작은 모델: 실수를 하지만, 그것들을 완벽하게 사슬처럼 엮어내지는 못합니다.
  • 큰 모델: 다음 단어를 예측하는 능력이 매우 뛰어나기 때문에, 일단 잘못된 경로를 선택하면 엄청난 확신을 가지고 그 경로에 고착됩니다. 그들은 단순히 하나의 실수를 하는 것이 아니라, 실수의 사슬을 만듭니다.

저자들은 모델이 커질수록(스케일업될수록) "지식 격차"(그들이 모르는 것)는 약 6배 줄어들지만, "지식 퇴보"(거짓말을 시작했을 때 무너지는 속도)는 11배에서 39배 더 악화된다는 것을 발견했습니다. 즉, 큰 모델은 이야기를 올바르게 시작하는 데는 뛰어나지만, 엉터리를 만들어내지 않고 이야기를 끝마치는 데는 형편없습니다.

왜 AI는 스스로를 잡아내지 못하는가?

"왜 AI는 자신의 작업물을 검토하지 않나요?"라고 물을 수 있습니다. 논문은 그 사각지대를 밝혀냅니다. AI의 거짓말을 탐지하려는 대부분의 현재 도구들은 AI가 얼마나 "초조한지"(느껴지는 불확실성)를 살핍니다.

  • 문제점: AI가 거짓말을 시작할 때, 아주 잠깐 동안 초조함을 느꼈다가 곧바로 안정을 찾습니다. 탐지 도구들은 이 안정을 보고 "오, 차분해졌으니 진실을 말하고 있구나!"라고 판단합니다.
  • 현실: AI는 차분하지만, 여전히 "위험 구역"에 있습니다. 탐지 도구들은 거짓말이 발생하는 위험한 분기점에 거의 4배 더 많은 조작을 포함하고 있음에도 불구하고, 그 분기에서 작동하는 빈도가 30% 적게 나타납니다. 즉, 도구들은 위험(risk)이 아닌 초조함(nervousness)만을 찾고 있기 때문에 거짓말을 놓치게 됩니다.

"마법의 해결책" (그리고 그것이 증명하는 것)

이 "숨겨진 위험"이 진짜 악당임을 증명하기 위해, 저자들은 시뮬레이션을 실행했습니다. 그들은 실수를 하기 직전의 모델을 가져와서, 모델이 진실이라고 믿는 내용은 바꾸지 않은 채 인위적으로 "위험성"을 낮추도록 만들었습니다.

  • 결과: 이 숨겨진 위험을 제거했을 때, 다양한 유형의 모델 전반에서 거짓말의 횟수가 **35%에서 74%**까지 감소했습니다.
  • 의미: 이는 문제가 AI가 사실을 모르는 데 있는 것이 아님을 증명합니다. 문제는 AI가 확신은 있지만 틀린 상태에 빠지게 되고, 그 상태가 오류를 누적시킨다는 것입니다.

요약

이 논문은 단순히 AI 모델을 크게 만드는 것만으로는 거짓말 문제를 해결할 수 없음을 시사합니다. 사실, 큰 모델은 너무 빨리 확신을 갖기 때문에 이러한 "눈덩이"식 거짓말에 더 취약할 수도 있습니다. 해결책은 단순히 더 많은 데이터를 제공하는 것이 아니라, AI가 거짓말에 고착되기 전에 그 숨겨진 "전념 위험"을 감지할 방법을 찾는 것입니다. 우리가 다리가 지면에서 얼마나 떨어져 있는지 볼 수 있게 될 때까지, 아무리 똑똑한 AI라도 확신에 찬 발걸음으로 낭떠러지로 걸어 들어갈 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →