On the Fundamental Impossibility of Hallucination Control in Large Language Models
이 논문은 거대 언어 모델의 환각 현상이 내부 지식을 집계하는 과정에서 발생하는 본질적인 절충안 때문에 근본적으로 피할 수 없는 것임을 주장하며, 외부 증거가 답변에 대한 지지 근거를 검증할 수는 있으나, 내부적인 어떤 메커니즘도 사실적 진실을 보장하거나 조작을 초래하는 의미론적 불균형을 해결할 수는 없음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 직소 퍼즐을 맞추려 한다고 상상해 보세요. 하지만 혼자 하는 것이 아니라, 테이블에 둘러앉은 전문가 팀이 함께하고 있습니다. 각 전문가는 손에 그림의 아주 작은 조각들만 쥐고 있으며, 전체 이미지는 볼 수 없습니다. 퍼즐을 풀기 위해 그들은 최종 그림이 어떤 모습일지에 대한 자신들의 최선의 추측을 외쳐야 하고, 그 후에 정답에 대해 투표해야 합니다. 이것이 기본적으로 현대의 인공지능, 특히 거대 언어 모델(LLM)이 작동하는 방식입니다. 이 모델들은 마치 디지털 "전문가"(컴포넌트 또는 어텐션 헤드라고 불림)들의 거대한 팀과 같으며, 각 전문가는 지식의 아주 작은 파편을 보유하고 있습니다. 당신이 AI에게 질문을 던지면, 이 모든 파편들이 답을 만들어내기 위해 경쟁합니다.
오랫동안 과학자와 엔지니어들은 AI가 가끔 사실을 지어내는 짜증 나는 문제를 해결하기 위해 노력해 왔습니다. 그들은 엄청난 자신감을 가지고 가짜 사실을 말할 수 있는데, 이를 "환각(hallucination)"이라는 결함이라고 부릅니다. 사람들은 AI에게 더 나은 훈련을 시키거나, 더 많은 데이터를 제공하거나, 혹은 스스로 검토하게 함으로써 이를 고치려 노력했습니다. 하지만 만약 이 문제가 단순히 패치로 고칠 수 있는 버그가 아니라면 어떨까요? 만약 AI가 완벽하게 진실하면서도, 완벽하게 확신에 차 있고, 동시에 완벽하게 창의적일 수는 없도록 설계된 방식 자체가 문제라면 어떨까요? 이것이 바로 미칼 P. 카르포위츠(Michal P. Karpowicz)가 새로운 논문에서 탐구하는 핵심 질문입니다. 이 논문은 환각이 단순한 실수가 아니라, 마치 '떡을 먹으면서 동시에 떡을 갖고 싶어 하는 것(cake and eat it too)'처럼 불가능한 근본적인 트레이드오프(trade-off)라고 제안합니다.
위대한 아이디어 경매
이 논문은 AI의 두뇌를 "아이디어의 경매장"이라 불리는 북적이는 시장으로 상상합니다. 이 경매에서는 AI의 모든 작은 부분(특정 어른션 헤드나 회로 등)이 입찰자가 됩니다. 각 입찰자는 비밀스러운 지식의 조각을 가지고 있으며, 자신들의 버전의 답이 최고라고 집단에 설득하려 합니다. 그들은 결과에 영향을 미치기 위해 신호를 보냄으로써 "입찰"을 합니다.
저자는 때때로 이 경매가 벽에 부딪힌다는 것을 증명합니다. 두 명의 입찰자가 동일한 사실을 두고 논쟁한다고 상상해 보십시오. 한 명은 "하늘은 파랗다"라고 말하고, 다른 한 명은 "하늘은 초록색이다"라고 말합니다. 만약 AI가 이 두 가지 상충하는 견해를 하나의 확신에 찬 답변으로 결합하려고 하면, 수학적 불가능성에 직면하게 됩니다. 논문은 시스템이 다음 네 가지를 동시에 수행할 수 없음을 보여줍니다:
- 진실을 말한다 (자신이 아는 것을 정직하게 보고함).
- 정보를 보존한다 (새로운 사실을 허공에서 만들어내지 않음).
- 모두가 참여하게 한다 (보유한 모든 관련 지식을 사용함).
- 최선의 답을 준다 (사용자의 만족도를 최적화함).
논문은 입찰자들이 동일한 사실을 두고 싸울 때, 시스템이 반드시 이 목표들 중 하나에서 실패하게 된다는 것을 증명합니다. 이는 모자 속에 토끼가 두 마리밖에 없는데 세 마리를 꺼내려는 마술과 같습니다. 당신은 선택해야 합니다. AI가 거짓말을 하거나(이야기를 완성하기 위해 세부 사항을 지어냄), 지나치게 조심스러워져서 모른다고 인정하거나, 혹은 자신이 실제로 가진 지식을 무시하거나 말입니다. AI가 완벽하게 정직하고, 완벽하게 확신에 차 있으며, 완벽하게 유용할 수 있는 "공짜 점심"은 없습니다.
확신의 함정
논문은 몇 가지 영리한 수학을 사용하여 왜 이런 일이 발생하는지 더 깊이 파고듭니다. AI가 자신의 여러 부분으로부터 "투표"를 결합하는 방식을 살펴봅니다. AI가 답을 결정하기 위해 이 투표들을 합칠 때, 종종 개별 부분들이 실제로 가지고 있는 것보다 더 확신에 찬 것처럼 들리게 됩니다.
이것을 기상 예보사들의 사례에 비유해 보십시오. 예보사 A가 비가 올 확률이 50%라고 말하고, 예서 B도 비가 올 확률이 50%라고 말하지만, 그들이 서로 다른 구름을 보고 있다면, 그룹은 결국 "반드시 비가 올 것이다!"라고 말하게 될 수 있습니다. 수학은 이 그룹의 확신이 "제조된 것"임을 보여줍니다. 그것은 개별 부분에는 존재하지 않았던 추가적인 확실성의 층입니다. 이것이 바로 환각을 일으키는 "과잉 확신"입니다. AI가 의도적으로 거짓말을 하는 것이 아니라, 정보를 결합하는 방식 자체가 자연스럽게 알고 있는 것과 들리는 확신 사이의 간극을 만들어내는 것입니다.
우리가 고칠 수 있을까?
이 논문은 자신이 무엇을 말하지 않는지에 대해 매우 명확히 밝히고 있습니다. AI가 항상 거짓말을 할 것이라거나, 우리가 결코 신뢰할 수 있는 AI를 만들 수 없다고 주장하는 것이 아닙니다. 대신, 환각이 데이터나 더 나은 코드로 해결할 수 있는 단순한 결함이 아니라, 구조적인 한계라고 말합니다. 즉, 경매 조건이 충족되는 상황에서는 이를 훈련을 통해 없앨 수 없다는 것입니다.
하지만 논문은 이 문제를 관리할 수 있는 방법도 제시합니다. 저자는 AI를 완벽하게 진실하게 만드는 것(이 조건 하에서는 불가능함) 대신, **인증 가능한 근거(certifiable support)**에 집중해야 한다고 제안합니다. AI를 변호사라고 상상해 보십시오. 우리는 변호사의 이야기가 절대적인 진실인지 항상 증명할 수는 없지만, 그 변호사의 이야기가 주어진 증거에 의해 뒷받침되는지는 확인할 수 있습니다.
논문은 만약 AI에게 특정 "승인된 증거"(신뢰할 수 있는 데이터베이스나 문서 세트 등)를 제공한다면, AI의 답변이 그 증거의 범위 내에 머무는지 수학적으로 증명할 수 있음을 보여줍니다. 만약 AI가 그 범위를 벗어난다면, 우리는 절대적인 진실은 모르더라도, 적어도 그 증거와 비교했을 때 AI가 환각을 일으키고 있다는 것을 알 수 있습니다. 이것은 문제를 "이것이 진실인가?"(어려운 문제)에서 "이것이 근거에 의해 뒷받ende되는가?"(체크 가능한 문제)로 전환시킵니다.
결론
이 논문은 AI 업계에 던지는 경종입니다. 우리가 보는 "환각"은 더 많은 데이터나 더 나은 코드로 고칠 수 있는 단순한 글리치가 아니라고 말합니다. 그것은 이러한 시스템이 정보를 집계하는 방식의 근본적인 특징입니다. AI의 서로 다른 부분들이 동일한 사실을 두고 의견이 갈리거나 경쟁할 때, 시스템은 선택을 해야 합니다: 정직하지만 약해질 것인가, 아니면 확신에 차 있지만 틀릴 수도 있을 것인가.
저자는 이 트레이드오프를 없애려고 노력하는 대신 이를 관리해야 한다고 제안합니다. AI의 확신이 때로는 아이디어를 결합하는 수학에 의해 "제조"된다는 점을 이해함으로써, 우리는 자신의 한계를 아는 더 나은 시스템을 구축할 수 있습니다. 우리는 정직하게 자신이 아는 것과 추측하는 것을 구분하는 AI를 설계하거나, 우리가 제공한 근거에 엄격하게 묶여 있는 시스템을 구축할 수 있습니다. 이 논문은 완벽한 AI를 약속하지는 않지만, 우리가 어디에서 벽에 부딪히는지에 대한 명확한 지도를 제공하여, 우리가 벽에 머리를 들이받는 것을 멈추고 더 나은 문을 만들기 시작할 수 있도록 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.