← 최신 논문
💬 NLP

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

본 논문은 환각이 결여된 지식에서만 비롯된다는 관점에 도전하여, 더 큰 규모의 지시 미세조정 LLM 은 종종 확률 분포에 이미 존재하는 올바른 개념을 확신하지 못해 환각을 일으키며, 이는 유용성과 자신감 있는 오류를 모두 유발하는 규모 의존적 sharpening 메커니즘으로 인해 대안들에 확률 질량을 분산시키기 때문임을 밝힌다.

원저자: Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"할루시네이션은 약속 실패"라는 논지에 대한 설명을 쉬운 언어와 비유를 사용하여 제시합니다.

핵심 아이디어: "모르는 것"에 관한 문제가 아님

대부분의 사람들은 AI 할루시네이션 (AI 가 사실을 지어내는 현상) 이 AI 가 단순히 정답을 모를 때 발생한다고 생각합니다. 그 생각은 다음과 같습니다: AI 가 사실을 알면 진실을 말하고, 모르면 추측한다.

이 논문은 그것이 틀렸다고 주장합니다.

연구자들은 종종 AI 가 정답을 알고 있음을 발견했습니다. AI 가 말을 시작하는 그 순간, 올바른 정보가 "머릿속"에 존재합니다. 그럼에도 불구하고 AI 는 여전히 잘못된 것을 말하기로 선택합니다. 연구자들은 이를 **"약속 실패 (Commitment Failure)"**라고 부릅니다.

비유: 긴장한 요리사

"프랑스의 수도는 무엇입니까?"라고 묻는 매우 재능 있는 요리사 (AI) 를 상상해 보세요.

  1. 구 이론: 요리사가 정답을 모르면 "런던"이라고 추측합니다. 알고 있으면 "파리"라고 말합니다.
  2. 새 이론 (이 논문): 요리사는 정답이 파리임을 알고 있습니다. 사실, 그들은 "파리"라는 단어에 대해 너무 집중해서 뇌가 그 단어로 윙윙거리고 있을 정도입니다. 하지만 "파리"를 여러 가지 다른 방식으로 동시에 생각하기 때문에 (예: "파리", "paris", "빛의 도시", "프랑스의 수도"), 뇌가 혼란스러워집니다.
    • 그들은 "파리"에 대한 강한 느낌을 가지고 있지만, 그 느낌은 모든 다른 구절들에 분산되어 있습니다.
    • 동시에, 그들은 "런던"에 대해 매우 날카롭고 집중된 생각을 가지고 있습니다 (아마도 이전에 빅벤 사진을 본 탓일 것입니다).
    • 전체적으로 "파리"에 대한 느낌이 더 강하지만, "런던"에 대한 생각이 너무 날카롭고 집중되어 입으로 튀어 나오는 경쟁에서 승리합니다. 그들은 파리가 맞다는 것을 알면서도 자신 있게 "런던"이라고 외쳐버립니다.

어떻게 이를 발견했는가

연구자들은 AI 가 말을 하기 전에 어떻게 "생각"하는지 살펴보았습니다. 그들은 AI 가 생성하는 첫 번째 단어 (즉, "약속 단계") 에 집중했습니다.

그들은 AI 가 무엇을 알고 있는지 측정하는 새로운 방식을 도입했는데, 이를 **의미 확률 질량 (Semantic Probability Mass)**이라고 합니다.

  • 구 방식: AI 가 정확한 단어를 선택했는가? (예: "파리"라고 말했는가?)
  • 새 방식: AI 가 "파리", "paris", "빛의 도시" 등으로 나뉘어 있더라도 "파리"라는 개념에 대해 강한 느낌을 가지고 있었는가?

연구 결과:

  • 연구자들은 작고 거대한 다양한 AI 모델들을 테스트했습니다.
  • AI 가 실수를 한 경우의 16% 에서 47% 사이에서, 실제로는 정답에 대한 강한 "느낌"을 가지고 있었습니다.
  • 반전: AI 모델이 클수록 이러한 현상이 더 자주 발생했습니다. 더 큰 모델은 단순히 더 많은 것을 아는 것이 아니라, 정답을 알면서도 여전히 틀리는 이러한 특정 유형의 실수를 더 많이 저지릅니다.

왜 이런 일이 발생하는가? ("선명화" 효과)

이 논문은 **지시 튜닝 (Instruction Tuning, AI 를 유용하게 만들고 규칙을 따르도록 훈련하는 것)**이 AI 의 사고 방식을 변화시킨다고 제안합니다.

AI 의 뇌를 언덕과 계곡으로 이루어진 풍경이라고 상상해 보세요.

  • 훈련 전: 언덕은 평평하고 흐릿합니다. AI 는 불확실합니다.
  • 훈련 후: AI 는 매우 결단력 있게 됩니다. 생각을 날카롭고 높은 뾰족한 봉우리로 바꿉니다.
    • AI 가 맞을 때, 정답에 대한 뾰족한 봉우리는 너무 높고 날카로워 쉽게 승리합니다.
    • 하지만, 때로는 AI 가 혼란을 겪습니다. "정답"은 "파리", "paris", "프랑스" 등을 생각하기 때문에 많은 작은 평평한 언덕들로 나뉩니다. 반면, "오답"은 단일하고 놀라울 정도로 날카롭고 높은 뾰족한 봉우리 하나입니다.
    • AI 의 의사결정 과정은 언덕을 굴러가는 공과 같습니다. 공은 항상 가장 날카로운 지점으로 굴러갑니다. "정답" 쪽에 전체적인 "언덕 면적"이 더 많더라도, "오답" 쪽이 가장 날카로운 정점을 가지고 있으므로 공은 그곳으로 굴러갑니다.

두 가지 유형의 실수

연구자들은 이 "약속 실패"가 발생하는 두 가지 방식을 발견했습니다:

  1. 틀린 첫 번째 단어: AI 는 "파리"에 대한 강한 느낌을 가지고 있었음에도 불구하고, 문장을 즉시 잘못된 단어로 시작합니다 (예: "파리" 대신 "모스크바"라고 말함).
  2. 틀린 경로: AI 는 올바른 단어로 시작합니다 (예: "파리") 하지만 그 다음 몇 단어에서 즉시 길을 잃고, "파리"를 다른 도시에 대한 이야기로 바꿉니다.

"정렬 비용 (Alignment Tax)"

이 논문은 이것이 AI 모델을 "유용하게" 만드는 것의 부작용이라고 결론지었습니다.

  • AI 를 자신감 있고 빠르게 만들기 위해, 우리는 이를 매우 결단력 있게 (날카로운 뾰족한 봉우리로) 훈련시킵니다.
  • AI 가 맞을 때는 이것이 매우 잘 작동합니다.
  • 하지만 AI 가 약간 혼란스러울 때, 그 같은 "결단력"은 AI 를 자신감 있게 틀리게 만듭니다. AI 는 뇌가 잘못된 옵션이라도 "가장 날카로운" 옵션을 선택하는 데 매우 능하기 때문에, 잘못된 답을 선택하는 것을 주저하지 않습니다.

요약

  • 할루시네이션은 항상 무지에서 비롯되는 것은 아닙니다. 때로는 AI 가 정답을 알고 있지만, 그것에 "약속"하는 데 실패합니다.
  • 더 큰 모델이 완벽하지는 않습니다. 모델이 커질수록 결단력을 갖추는 데 능숙해지는데, 아이러니하게도 이는 자신감 있게 틀릴 가능성을 더 높입니다.
  • 문제는 분포에 있습니다. AI 는 정답에 대한 "지식"을 너무 많은 변형에 걸쳐 얇게 퍼뜨리는 반면, 오답은 하나의 날카로운 지점에 모든 집중을 받습니다. AI 는 정답이 아니라 그 날카로운 지점을 선택합니다.

이 논문은 이를 해결하기 위해 AI 에게 "전체 개념" ("파리"를 말하는 모든 방식) 을 보도록 가르쳐야 할지 모른다고 제안하며, 단순히 가장 날카로운 단어 하나만 선택하는 것을 넘어설 필요가 있다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →