CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations
본 논문은 검색 증강 생성(Retrieval-Augmented Generation)에서 모델의 내부 표현을 검색된 문서가 있는 경우와 없는 경우로 비교하여 근거가 없는 콘텐츠를 식별하는 동시에, 정보 전파(information propagation)와 구간 일관성 평활화(span-consistent smoothing)를 활용하여 환각의 미세한 국소화를 달성하는 토큰 수준의 환각 탐지 방법인 CORTEX를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 매우 똑똑하고 박학다식한 비서(AI)가 질문에 답하려고 노력하고 있다고 상상해 보세요. 답변의 정확성을 보장하기 위해, 당신은 비서가 글을 쓰는 동안 참고할 수 있도록 일련의 참고 서적(검색된 문서)을 건네줍니다.
때때로 비서는 책에 충실하게 엄격히 따라 아주 훌륭한 일을 해냅니다. 하지만 어떤 경우에는 책이 바로 옆에 있음에도 불구하고, 실수로 사실을 지어내거나 세부 사항을 뒤섞기도 합니다. 이것을 "환각(hallucination)"이라고 부릅니다.
문제는, 길고 상세한 답변을 작성할 때 AI가 책에 있는 사실의 90%는 제대로 맞히더라도, 단 한두 문장에서 실수를 저지를 수 있다는 점입니다. 현재 대부분의 도구들은 보고서 전체를 마지막에 한 번에 검사하는 보안 요원과 같습니다. 만약 보고서가 대체로 괜찮아 보인다면, 그들은 "괜찮아 보이네요!"라고 말하며 중간에 숨겨진 아주 작은 거짓말을 놓칠 수 있습니다.
이 논문은 AI가 무엇을 지어내고 있는지 정확히 찾아내기 위해 답변을 **단어 단위(또는 토큰 단위)**로 조사하는 "현미경" 역할을 하도록 설계된 새로운 도구인 CORTEX를 소개합니다.
CORTEX가 어떻게 작동하는지 세 가지 간단한 비유를 통해 설명하겠습니다.
1. "있을 때와 없을 때" 테스트 (비교 내부 표현)
당신이 학생이 실제로 교과서를 읽고 있는지, 아니면 그냥 추측하고 있는 것인지 알아내려 한다고 상상해 보세요.
- 기존 방식: 당신은 학생의 답변을 보고 그들이 책을 읽었는지 추측하려고 합니다.
- CORTEX 방식: 당신은 학생에게 같은 질문을 두 번 던집니다.
- 첫 번째: 그들에게 교과서를 읽게 합니다.
- 두 번째: 교과서를 치운 뒤 기억에 의존해서 답하라고 합니다.
CORTEX는 이 두 가지 시나리오 동안 AI의 "뇌 활동(내부적인 생각)"을 비교합니다.
- 만약 AI가 책에서 찾은 사실에 대해 말하고 있다면, 책이 존재할 때 AI의 "뇌"는 크게 변화합니다. 이는 마치 학생이 텍스트에서 답을 찾아냈을 때 눈을 반짝이는 것과 같습니다.
- 만 만약 AI가 무언가를 지어내고 있다면(환각), 책이 있든 없든 AI의 "뇌"는 거의 동일하게 보입니다. 왜냐하면 그것은 단지 자신의 기억에서 끌어온 것이기 때문입니다.
이 두 상태를 비교함으로써, CORTEX는 책 때문에 변한 단어(좋은 것)와 지어낸 것이라 그대로 유지된 단어(나쁜 것)를 정확히 구별해낼 수 있습니다.
2. "사고의 흐름" 탐정 (문맥적 잔차)
때때로 AI는 답변 초반에 책에서 사실을 읽고, 그 사실을 이용해 문장의 나머지 부분을 구성할 만큼 똑똑합니다.
- 문제점: 만약 당신이 나중에 나오는 문장만 본다면, 그곳에 책이 직접 언급되어 있지 않기 때문에 AI가 더 이상 책을 사용하지 않는 것처럼 보일 수 있습니다. 이로 인해 탐지 도구가 해당 문장이 실제로는 앞선 사실에 기반하고 있음에도 불구하고 거짓이라고 착각할 수 있습니다.
- CORTEX의 해결책: CORTEX는 흔적을 쫓는 탐정처럼 행동합니다. CORTEX는 "아, 이 문장은 AI가 방금 두 문장 전에 읽었던 사실에 의존하고 있구나"라는 것을 깨닫습니다. CORTEX는 이러한 "간접적인 영향"을 제거하여 혼란을 방지합니다. 이를 통해 AI가 단순히 진실한 이야기를 이어가는 것뿐인데도 거짓이라고 잘못 비난하는 일을 방지합니다.
3. "노이즈 필터" (레이블 지속성 평활화)
당신이 잡음이 많은 라디오 방송을 듣고 있다고 상상해 보세요. 때때로 잡음 때문에 문장 전체는 사실임에도 불구하고 단 하나의 단어가 거짓처럼 들릴 수 있습니다.
- 문제점: 가공되지 않은 탐지 도구들은 매우 불안정할 수 있습니다. 어떤 단어는 거짓이라고 표시했다가, 다음 단어는 진실이라고 했다가, 그다음 단어는 다시 거짓이라고 하는 식으로, 어지럽고 흩어진 패턴을 만들 수 있습니다. 하지만 실제로 AI가 거짓말을 할 때는 단 하나의 고립된 단어가 아니라 문구 전체나 문장 전체를 두고 거짓말을 하는 경우가 많습니다.
- CORTEX의 해결책: CORTEX는 "평활화(smoothing)" 필터를 적용합니다. CORTEX는 만약 한 단어가 거짓이라면, 그 옆에 있는 단어들도 아마 같은 거짓말의 일부일 것이라고 가정합니다. CORT起来 점들을 연결하여, 흩어진 "아마도 거짓인 것들"의 덩어리를 명확하고 단단한 "확실한 거짓말"의 블록으로 바꿉니 다. 이를 통해 최종 결과물을 사람이 훨씬 더 읽기 쉽고 이해하기 쉽게 만듭니다.
결과
저자들은 두 가지 서로 다른 질문 세트와 세 가지 서로 다른 AI 모델을 대상으로 CORTEX를 테스트했습니다. 그 결과는 다음과 같습니다:
- CORTEX는 다른 방법들에 비해 지어낸 단어를 찾아내는 데 훨씬 뛰어납니다.
- CORTEX는 내부를 볼 수 없는 "API" 모델(블랙박스 모델)인 경우에도, 다른 공개된 AI 모델을 배후에서 탐정 역할을 수행하게 함으로써 작동할 수 있습니다.
- 시스템의 모든 부분(비교, 사고의 흐름 체크, 평활화)이 탐지의 정확도를 높이는 데 기여했습니다.
요약하자면, CORTEX는 AI의 답변이 좋은지 나쁜지 단순히 추측하는 것이 아니라, AI가 정확히 어느 부분에서 내용을 지어내고 있는지를 짚어냄으로써 우리가 AI의 답변을 더 신뢰할 수 있도록 돕는 도구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.