D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
이 논문은 외부 검증기나 다중 생성을 필요로 하지 않고 단일 순전파 과정 동안 은닉 상태 활성화의 스펙트럼 기하학을 분석하여 생성된 텍스트와 모델의 내부 지식 사이의 불일치를 식별하는 거대 언어 모델을 위한 환각 탐지 방법인 D-Score를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 재능 있지만 가끔은 장난기 넘치는 로봇이 쓴 책들이 가득한 도서관으로 걸어 들어간다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)이라고 알려져 있는데, 이야기를 쓰거나 질문에 답하고, 당신과 완벽하게 인간처럼 대화할 수 있습니다. 하지만 여기 함정이 하나 있습니다. 이 로봇은 가끔 사실을 지어내곤 합니다. 달이 초록색 치즈로 만들어졌다고 말하거나, 유명한 역사적 사건이 잘못된 날짜에 일어났다고 말할 수도 있죠. 이것은 로봇이 의도적으로 거짓말을 하는 것이 아닙니다. 그저 자신이 지어낸 사실을 아주 자신 있게 말할 뿐입니다. 우리는 이것을 "환각(hallucination)"이라고 부릅니다.
오랫동안 이러한 거짓말을 잡아내는 유일한 방법은 로봇의 답변을 두 번째 로봇이나 인간 사서에게 보내 실제 사실이 담긴 데이터베이스와 대조하여 확인하는 것이었습니다. 이는 마치 학생에게 에세이를 쓰게 한 다음, 다른 선생님을 고용해 채점하게 하는 것과 같았습니다. 하지만 만약 학생의 뇌 자체가 우리에게 단서를 줄 수 있다면 어떨까요? 만약 로봇이 무언가를 지어내기 시작하는 바로 그 순간, 문장을 끝마치기도 전에 로봇의 내부 "사고 과정"이 우리가 관찰할 수 있는 방식으로 변한다면 어떨까요? 이것이 바로 과학자들이 던지는 질문입니다. 두 번째 의견 없이도, 진행 중인 거짓말을 포착하기 위해 로봇의 마음속을 들여다볼 수 있을까요?
이것이 바로 이 논문의 연구자들이 하고자 했던 일입니다. 그들은 D-Score라는 영리하고 새로운 도구를 도입했습니다. 로봇의 마음을 거대한 다차원 무도회장이라고 생각해 보세요. 로봇이 단어를 처리할 때마다, 이 무도회장 전체로 신호를 보냅니다. 로봇이 잘 알고 확신하는 것에 대해 말할 때, 무용수들(신호들)은 매우 조직적이고 조화로운 선을 그리며 움직입니다. 그들은 마치 잘 짜인 퍼레이드처럼 모두 같은 방향으로 행진합니다. 이것은 "일관된(coherent)" 경로를 만듭니다.
하지만 로봇이 잘 모르는 것이나 지어낸 것을 말하려고 할 때, 무도회장은 혼란스러워집니다. 로봇은 어떤 말(지어낸 사실)을 하려고 하지만, 내부의 기억은 "잠깐, 이건 좀 이상한데"라거나 "이게 맞는지 잘 모르겠어"라고 속삭입니다. 이 갈등은 무용수들을 흩어지게 만듭니다. 하나의 촘촘한 줄을 지어 행진하는 대신, 그들은 한꺼번에 여러 다른 방향으로 퍼져 나갑니다. 어떤 무용수는 혼란스러워하고, 어떤 무용수는 실수를 바로잡으려 하며, 또 다른 무용수는 그저 확신이 없는 상태가 됩니다.
D-Score는 이 무용수들이 얼마나 많은 방향으로 움직이는지를 세는 간단한 수학적 기법입니다. 만약 무용수들이 하나의 직선으로 행진하고 있다면 점수는 낮습니다. 하지만 그들이 무질서한 군중처럼 퍼져 나간다면 점수는 올라갑니다. 연구진은 D-Score가 높을 때, 그것이 로봇이 환각을 일으키고 있다는 강력한 신호라는 것을 발견했습니다.
연구팀은 이 아이디어를 세 가지 서로 다른 로봇의 뇌(Llama-2, Llama-3, Vicina라고 불리는 것들)를 대상으로, 두 가지 종류의 까다로운 질문들을 통해 테스트했습니다. 그 결과, D-Score는 로봇이 얼마나 "놀랐는지(surprised)" 혹은 답변을 얼마나 반복했는지만을 보는 다른 방법들보다 거짓말을 훨씬 더 잘 잡아낸다는 것을 발견했습니다. 실제로 어떤 테스트에서는 D-Score가 기존의 가장 좋은 방법보다 환각을 잡아내는 데 있어 거의 10퍼센트 포인트 더 뛰어난 성능을 보였습니다.
이것이 매우 흥격적인 이유는 그 방식이 매우 단순하기 때문입니다. D-Score는 데이터베이스를 확인할 필요도 없고, 로봇에게 같은 질문에 다섯 번 답하라고 요구할 필요도 없으며, 도움을 줄 두 번째 로봇도 필요하지 않습니다. 그저 단 한 번의 대화 중에 발생하는 로봇의 내부 신호를 살펴보기만 하면 됩니다. 연구진은 이것이 가능한 이유가 로봇의 내부적인 "불확실성"이나 "갈등"이 그 사고 과정에 눈에 보이는 지문을 남기기 때문이라고 제안합니다.
물론, 이 논문은 이것이 모든 거짓말을 잡아내는 마법의 지팡이는 아니라는 점을 주의 깊게 명시하고 있습니다. 만약 로봇이 내부 기억에 전혀 없는 사실을 아예 아무 근거 없이 지어내고 있다면, 무도회장은 혼란스러워지지 않을 수 있고 D-Score는 낮게 유지될 수도 있습니다. 하지만 로봇이 내부적으로 감지하고 있는 거짓말에 대해서라면, 이 새로운 "스펙트럼(spectral)" 신호는 로봇의 내부 리듬을 경청함으로써 그 현장을 포착하는 강력한 방법이 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.