When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs
이 논문은 네덜란드어 언어 모델이 방해 맥락이 일관성 없는 연속 생성의 놀라움(surprisal)을 감소시키는 인간과 유사한 일관성 착각을 보인다는 것을 입증하며, 어텐션 엔트로피와 에너지 지표는 이러한 효과를 유도하는 기저의 공유된 메커니즘을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 당신의 뇌(그리고 AI)가 속는 순간
당신이 이야기를 읽고 있다고 상상해 보세요. 갑자기 **"다시(again)"**라는 단어를 마주합니다. 그러면 당신의 뇌는 무엇이 "다시" 일어나고 있는지 알아내기 위해 즉시 이야기의 처음으로 거슬러 올라갑니다.
보통 이 과정은 완벽하게 작동합니다. 하지만 때때로 그 이야기는 함정입니다. 이전에 언급되었지만 실제로는 맞지 않는, 하지만 비슷하게 들려서 뇌를 속일 법한 '방해 요소(distractor)'가 등장하는 것이죠.
논문의 발견:
연구진은 챗봇 같은 도구의 뒤에 있는 AI의 뇌, 즉 대규모 언어 모델(LLM)도 이와 똑같은 속임수에 넘어간다는 사실을 발견했습니다. 인간과 마찬가지로, AI도 혼란스러운 이야기 속에 일치하는 방해 요소가 있으면 혼란에 빠져, 실제로는 말이 안 되는 이야기임에도 불구하고 말이 된다고 생각하게 됩니다. 연구진은 이를 **"일관성 환상(coherence illusion)"**이라고 부릅니다.
실험: "과일 바구니" 테스트
이를 테스트하기 위해 연구진은 네덜란드어 이야기를 사용했습니다(인간이 네덜란드어를 읽는 방식에 대한 데이터가 있었기 때문입니다). 설정은 다음과 같이 단순화할 수 있습니다.
- 설정: 메건(Megan)이라는 캐릭터가 배가 고픕니다.
- 반전: 이야기는 두 가지를 언급합니다.
- 대상(Target): 메건은 노란 사과를 먹었습니다.
- 방해 요소(Distractor): 그녀는 초록색 배를 먹지 않았습니다.
- 함정: 다음 문장에서 이렇게 말합니다. "다음 날 아침, 메건은 다시 배를 먹었다."
인간의 반응:
인간 독자는 "다시"와 "배"라는 단어를 봅니다. 인간의 뇌는 혼란을 느낍니다. 왜냐하면 앞선 이야기에서 그녀가 배를 먹지 않았다고 했기 때문입니다. 하지만 "배"가 이전에 언급되었기 때문에(비록 부정형으로 쓰였더라도), 뇌는 가끔 실수하여 "아, 그녀가 배를 다시 먹었나 보구나!"라고 생각하며 넘어가 버립니다. 이것이 바로 환상입니다.
AI의 반응:
연구진은 다양한 AI 모델에게 이 이야기를 읽게 했습니다. 그 결과, AI도 인간과 똑같이 행동한다는 것을 발견했습니다.
- 이야기가 완벽하게 논리적일 때, AI는 차분했습니다.
- 이야기가 비논리적일 때(함정), AI는 "놀람"(기술적으로는 '예측 불가능함')을 경험했습니다.
- 결정적으로: 만약 함정에 포함된 방해 요소가 결말과 일치하는 단어(앞서 언급된 '배')를 포함하고 있다면, AI는 덜 놀랐습니다. AI는 그 함정에 빠져서, 혼란스러운 이야기가 사실은 괜찮다고 생각하게 되었습니다.
어떻게 "함정"을 측정했는가?
연구진은 단순히 AI에게 혼란스러운지 묻는 것에 그치지 않고, AI의 "뇌" 내부를 들여다보며 어떻게 생각하고 있는지 확인했습니다. 이를 위해 세 가지 특별한 도구를 사용했습니다.
1. 서프라이절 (Surprisal, "헉" 하는 지수)
**서프라이절(Surprisal)**을 "헉" 하는 지수라고 생각해 보세요.
- 완벽하게 말이 되는 문장을 읽으면, 당신은 "헉" 하지 않습니다. 지수는 낮습니다.
- 이상한 것을 읽으면, 당신은 "헉" 합니다. 지수는 높아집니다.
- 발견: AI가 함정 이야기를 읽었을 때, AI는 "헉" 했습니다(높은 서프라이절). 하지만 함정 이야기에 결말과 일치하는 "방해 요소"가 들어있을 때, AI는 "헉" 하는 정도가 줄어들었습니다. AI는 이야기가 매끄럽다고 속아 넘어간 것입니다.
2. 어텐션 엔트로피 (Attention Entropy, "집중" 손전등)
AI에게 자신이 생각하고 있는 단어들을 비추는 손전등이 있다고 상상해 보세요.
- 낮은 엔트로피 (집중됨): 손전등 빛이 좁고 강합니다. AI는 하나의 특정 단어에 집중하고 있습니다.
- 높은 엔트로피 (퍼짐): 손전등 빛이 넓고 흐릿합니다. AI는 어떤 단어가 중요한지 확신하지 못한 채 여러 단어를 동시에 보고 있습니다.
- 발견: AI가 속았을 때, 손전등 빛은 흐릿해졌습니다(높은 엔트로피). 방해 요소 때문에 AI는 엉뚱한 단어들을 보고 있었습니다. 연구진이 이 흐릿한 집중을 유발하는 AI의 특정 부분들을 꺼보았을 때, 바로 이 부분들이 속임을 당하고 있다는 것을 확인할 수 있었습니다.
3. 에너지 (Energy, "자석" 테스트)
이는 물리학에서 빌려온 연구진의 새로운 도구입니다. AI의 기억을 언덕과 골짜기가 있는 지형이라고 상상해 보세요.
- 낮은 에너지: AI는 현재의 단어가 과거의 내용과 완벽하게 맞아떨어지는 완벽한 "골짜기"를 찾습니다. 이는 마치 자석이 딱 달라붙는 것과 같습니다.
- 높은 에너지: AI는 "언덕" 위에 갇혀 있습니다. 단어가 잘 맞지 않아서 AI는 의미를 파악하기 위해 애를 써야 합니다.
- 발견: 방해 요소에 의해 AI가 속았을 때, "에너지"가 떨어졌습니다. 단어가 완벽하게 들어맞는 것처럼 느껴진 것입니다. 이는 AI 역시 인간과 동일한 환상을 경험하고 있음을 확인시켜 주었습니다. 즉, 잘못된 연결감을 느낀 것입니다.
이 연구가 왜 중요한가 (논문에 따르면)
이 논문은 AI를 고치거나 질병을 치료하겠다는 것이 아닙니다. 대신, 매우 구체적이고 중요한 점을 지적합니다.
AI와 인간은 유사한 "글리치(오류)"를 공유합니다.
인간과 AI 모델 모두 **기억 인출(memory retrieval)**에 의존합니다. 우리가 이야기의 앞부분을 기억하려고 할 때, 우리는 단서들을 사용합니다. 만약 어떤 단서가 정답과 비슷해 보인다면(비록 그것이 틀린 답일지라도), 우리의 뇌(그리고 AI의 수학적 계산)는 탈취당하게 됩니다.
연구진은 다음을 보여주었습니다:
- AI도 속는다: AI는 완벽한 논리 기계가 아닙니다. 맥락에 의해 인간처럼 속을 수 있습니다.
- 우리는 속임수를 볼 수 있다: "서프라이절", "어텐션", "에너지"를 측정함으로써, 우리는 AI가 정확히 언제 그리고 어떻게 환상에 빠지는지 알 수 있습니다.
- 공유된 메커니즘: AI를 혼란스럽게 만드는 부분은 정상적인 이야기를 이해하는 데 도움을 주는 부분과 같습니다. 이것은 버그가 아니라, 이러한 시스템(그리고 인간의 뇌)이 작동하는 방식의 한 '특징'입니다.
요 결론
이 논문은 마치 마술의 트릭을 밝혀내는 것과 같습니다. 교묘한 방해 요소가 담긴 이야기를 주었을 때, AI는 단순히 답을 계산하는 것이 아니라 인간의 혼란을 모사하는 방식으로 "주의가 분산"된다는 것을 보여줍니다. 이를 연구함으로써, 우리는 AI와 인간의 뇌가 언어를 처리하기 위해 유사한 지름길(때로는 우리 둘 다 길을 잃게 만드는 지름길)을 사용하고 있을지도 모른다는 것을 배우게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.