Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models
이 논문은 서로 다른 층에 걸친 내부 표현을 분석함으로써 지식 충돌과 거대 언어 모델의 환각 사이의 상관관계를 조사하며, 두 현상이 개념적으로 연관되어 있음에도 불구하고 환각 패턴이 지식 충돌 표현만으로는 완전히 설명될 수 없음을 발견함으로써, LLM의 행동을 이해하는 데 있어 세밀한 해석 가능성 도구의 가치를 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델(LLM)을 엄청난 양의 책을 암기한, 매우 박식한 사서라고 상상해 보십시오. 하지만 한 가지 문제가 있습니다. 그들은 자신의 서가를 업데이트할 수 없습니다. 만약 서가에 있는 책이 구식이 되거나, 암기한 내용과 모순되는 새로운 쪽지를 받게 된다면, 그들은 혼란에 빠질 수 있습니다.
이 논문은 이 혼란이 잘못될 수 있는 두 가지 구체적인 방식을 조사합니다:
- "환각(Hallucination)": 사서가 자신 있게 사실을 지어내거나, 실제로는 틀렸지만 진짜처럼 들리는 답변을 내놓는 현상입니다.
- "지식 충돌(Knowledge Conflict)": 사서가 "하늘은 초록색이다"라고 적힌 쪽지(문맥)를 받았습니다. 하지만 그들의 기억에는 "하늘은 파란색이다"라고 되어 있습니다. 그들은 둘 중 무엇을 믿어야 할지 결정해야 합니다.
핵심 질문
연구자들은 알고 싶었습니다: 이 두 가지 문제는 같은 것일까?
그들은 사서가 "환각"을 일으키는 이유가 내부적으로 "지식 충돌"과 싸우고 있기 때문이라고 의심했습니다. 즉, 사서가 거짓말을 하기 직전에 뇌 속에서 혼란(충돌)으로 인해 웅성거리고 있을 것이라고 생각한 것입니다. 만약 이것이 사실이라면, 우리는 간단한 경보 시스템을 구축할 수 있을 것입니다. 즉, "혼란의 웅성거림"을 감지하면 거짓말이 나올 것을 알 수 있게 되는 것입니다.
테스트 방법
이것을 테스트하기 위해, 연구자들은 "뇌 스캐너"(프로빙(probing)이라 불리는 기술) 역할을 했습니다. 그들은 사서들을 바꾸지는 않았지만, 사고의 각 단계(숨겨진 층, 어텐션 층, 로직 층)에서 내부를 들여다보며 혼란이나 거짓말의 징후를 포착할 수 있는지 확인했습니다.
그들은 두 가지 다른 "사서"(AI 모델)를 사용했습니다:
- LLaMA-3-8B: 이 사서의 "혼란 신호"가 언제 거짓말을 할지 예측할 수 있는지 시도했습니다.
- Falcon-7B: 이 사서의 "거짓말 신호"가 언제 혼란을 느끼는지 예측할 수 있는지 시도했습니다.
연구 결과
결과는 다소 놀라웠습니다. 마치 연기 감지기를 점검했는데, 토스트를 태울 때 화재 경보기가 울리지 않고, 화재가 발생했을 때 토스트 타는 냄새에 대한 경보기가 울리지 않는 것과 같았습니다.
- 혼란 거짓말: 모델 내부의 "혼란" 신호를 살펴보았을 때, 모델이 환각을 일으킬 때를 예측할 수 없었습니다. 혼란스러워하는 내부 패턴은 무언가를 지어내는 패턴과 달랐습니다.
- 거짓말 혼란: 반대로, 모델이 거짓말을 하고 있음을 나타내는 신호들은 모델이 지식 충돌에 직면했을 때를 포착하는 데 도움이 되지 않았습니다.
시사점: 비록 환각이 지식 충돌에 의해 발생하는 것처럼 느껴지지만, 이 논문은 모델의 "두뇌" 내부에서 이 두 가지가 실제로 서로 다른 과정임을 보여줍니다. 이들은 별개의 현상입니다. 따라서 단순히 하나를 보고 다른 하나를 찾아낼 수는 없습니다.
한 가지 희소식
원했던 연결 고리를 찾지는 못했지만, 그들의 "뇌 스캐너"(프로빙 도구)가 매우 일관되게 작동한다는 것을 발견했습니다. 이 도구는 영어뿐만 아니라 이탈리아어, 스페인어, 중국어 및 기타 많은 언어에서도 똑같이 잘 작동합니다. 이는 특정 이론(충돌과 환각 사이의 연결)은 증명되지 않았을지라도, 도구 자체는 신뢰할 수 있다는 것을 의미합니다.
요약하자면
연구자들은 AI 모델의 혼란과 거짓말을 모두 잡아낼 수 있는 단일한 "연기 감지기"를 찾기를 희망했습니다. 그러나 그들은 AI의 두뇌가 이 두 가지 문제를 서로 다르게 처리한다는 것을 발견했습니다. 현실 세계에서는 서로 관련되어 있지만, 컴퓨터 코드 내부에서는 서로 다르게 보입니다. 이는 우리가 단순히 하나의 단순한 원인을 찾는 대신, AI의 실수를 이해하고 수정하기 위해 더 복잡한 도구가 필요함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.