MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations
이 논문은 정답 레이블 없이도 사실적 오류를 신뢰성 있게 식별할 수 있도록 다양한 디코딩 온도의 변화에 따른 출력의 안정성을 분석하기 위해 최대 평균 편차(Maximum Mean Discrepancy)를 활용하는 거대 언어 모델용 테스트 시간 환각 탐지 방법인 MMD-Flagger를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
급격히 진화하는 인공지능의 세계에서 대규모 언어 모델은 인간과 유사한 텍스트를 생성하고, 복잡한 질문에 답하며, 심지어 자율적인 의사결정을 보조할 수 있는 강력한 도구가 되었습니다. 그러나 이러한 시스템은 한 가지 지속적인 결함을 가지고 있습니다. 때때로 유창하고 자신감 있게 들리지만, 사실과는 전혀 다른 진술을 생성한다는 점입니다. '환각(hallucination)'이라고 알려진 이 현상은 특히 법률, 의료, 또는 자율 주행과 같이 단 한 번의 잘못된 단계가 재앙적인 결과로 이어질 수 있는 중요한 분야에 이러한 모델이 배치될 때 심각한 안전 위험을 초래합니다. 연구자들의 핵심 과제는 '골드 스탠다드(gold standard)' 정답지에 접근하지 않고도 실시간으로 이러한 오류를 어떻게 탐지하느냐 하는 것입니다. 이 모델들은 사용 중 외부 검증 없이 작동하기 때문에, 과학자들은 모델 자체의 행동만을 근거로 답변의 신뢰성을 판단할 방법을 찾아야 합니다. 그 핵심은 모델이 내부 설정의 미세한 변화에 어떻게 반응하는지를 이해하는 데 있습니다. 만약 모델이 진정으로 확신을 가지고 사실에 근받치고 있다면, 생성 조건이 약간 변하더라도 답변은 일관성을 유지해야 합니다. 반면, 답변이 조작된 것이라면 동일한 변화 속에서 모델의 출력은 불안정하고 불규칙해지는 경향이 있습니다.
이러한 원리에 기반하여, 프랑스와 독일의 연구팀은 환각을 잡아내기 위한 새로운 방법인 MMD-Flagger를 개발했습니다. 이들의 접근 방식은 사실을 데이터베이스와 대조하거나 오류를 포착하기 위해 새로운 모델을 훈련시키는 것에 의존하지 않습니다. 대신, 생성 과정의 '온도(temperature)'가 조정될 때 언어 모델의 출력이 어떻게 변하는지를 관찰하는 안정성 모니터 역할을 합니다. 이 모델들의 맥락에서 '온도'란 모델이 다음 단어를 선택할 때 얼마나 많은 무작위성을 도입할지를 제어하는 설정입니다. 낮은 온도는 모델을 매우 예측 가능하고 반복적으로 만드는 반면, 높은 온도는 더 창의적이고 다양한 응답을 허용합니다. 연구진은 진실된 답변은 이러한 다양한 설정에서도 비교적 안정적으로 유지되는 반면, 환각된 답변은 온도가 변함에 따라 모양이 크게 흔들리고 변할 것이라고 가설을 세웠습니다.
이 아이디어를 테스트하기 위해 연구진은 동일한 질문에 대해 서로 다른 온도 설정을 사용하여 여러 버전의 답변을 생성하는 시스템을 만들었습니다. 그런 다음 통계 도구인 '최대 평균 편차(Maximum Mean Discrepancy, MMD)'를 사용하여 원래의 답변과 이 다양한 버전들을 비교했습니다. 이 도구는 두 데이터 집단이 서로 얼마나 다른지를 측정합니다. 다양한 온도 범위에 걸쳐 이러한 차이를 도식화함으로써 시스템은 시각적인 경로, 즉 궤적을 생성합니다. 연구진은 모델이 진실을 말할 때 이 경로가 매끄럽고 예측 가능하며, 무작위성이 증가함에 따라 꾸준히 상승한다는 것을 발견했습니다. 그러나 모델이 환각을 일으킬 때, 경로는 뚜렷하고 날카로운 'U자형'을 띱니다. 곡선 중간의 이 움푹 파인 부분은 모델이 일관된 의미를 유지하는 데 어려움을 겪고 있다는 명확한 신호 역할을 하며, 해당 응답을 신뢰할 수 없다고 표시합니다.
연구팀은 Llama-3 및 Gemma-3 제품군을 포함한 현대적 언어 모델들을 사용하여 다국어 간의 사실적 정확성을 테스트하도록 설계된 벤치마크 데이터셋으로 이 방법을 평가했습니다. 그들은 텍스트 유사성이나 내부 모델 상태에 의존하는 기존의 여러 기법들과 이 새로운 방법을 비교했습니다. 결과에 따르면 환각 탐지의 효과는 특정 모델 아키텍처에 따라 크게 달라졌습니다. MMD-Flagger(Ensemble)는 Llama-3.1-8B와 Gemma-3-4B에서 최고의 성능을 달した 반면, 다른 추정기들은 Llama-3.2-3B에서 더 나은 성능을 보였습니다. 이 시스템은 단어의 원시적인 의미나 신경망의 은닉층과 같이 모델에서 추출된 다양한 유형의 데이터와 함께 작동할 수 있을 만큼 유연하다는 것이 증명되었습니다. TV 쇼에 등장하는 고양이에 관한 질문을 다룬 특정 테스트 케이스에서, 이 시스템은 온도가 변함에 따라 모델의 출력이 엉뚱한 내용으로 흘러가는 순간을 포착하여 다른 방법들이 놓친 환각된 답변을 성공적으로 식별해 냈습니다. 반대로, 글래스고 음악 그룹에 관한 다른 사례 연구에서는 MMD-Flagger가 다른 방법(KLE)이 올바르게 식별한 환각을 감지하지 못한 사례가 나타났으며, 이는 모델의 출력 궤적이 내용이 틀렸음에도 불구하고 때로는 기만적일 정도로 매끄럽게 유지될 수 있음을 보여주었습니다.
이러한 유망한 결과에도 불구하고, 연구진은 이 방법에 한계가 있음을 인정합니다. 신뢰할 수 있는 안정성 프로필을 구축하기 위해 답변의 수많은 변형을 생성해야 하므로, 단순히 모델에 답변을 한 번 요청하는 것보다 계산 비용이 많이 들고 느릴 수 있습니다. 이는 즉각적인 응답이 필요한 애플리케이션에는 덜 이상적일 수 있지만, 정확성이 최우선인 안전 중심 시스템에서는 여전히 강력한 도구로 남습니다. 이 연구는 모델 출력의 안정성을 다양한 조건에서 모니터링함으로써, 우리가 인공지능에 대한 더 신뢰할 수 있는 감독 계층을 구축할 수 있음을 시사합니다. 이 접근 방식은 사전에 정답을 알 필요 없이 자율 에이전트의 신뢰성을 감사할 수 있는 방법을 제공하며, 더 안전하고 믿을 수 있는 AI 시스템을 향한 중요한 발걸음을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.