← 최신 논문
🤖 AI

Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals

이 논문은 단 한 번의 순전파(forward pass)만으로도 여러 데이터셋에 걸쳐 우수한 성능을 달성하기 위해 라우터 엔트로피(router entropy) 및 전문가 불일치(expert disagreement)와 같은 혼합 전문가(Mixture-of-Experts, MoE) 구조의 고유한 내부 신호를 활용하는 새로운 토큰별 환각 탐지 방법인 InnerExpert를 소개한다.

원저자: Joao Fonseca, Rodrigo Rodrigues, Paolo Romano

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Joao Fonseca, Rodrigo Rodrigues, Paolo Romano

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 새로운 세대의 인공지능을 이끄는 엔진으로, 에세이를 쓰고, 문제를 해결하며, 놀라울 정도로 인간처럼 느껴지는 대화를 나눌 수 있는 능력을 갖추고 있습니다. 그러나 이러한 유창함의 이면에는 지속적인 결함이 존재합니다. 바로 이 기계들이 때때로 완전한 확신을 가지고 사실을 지어낸다는 점입니다. '환각(hallucination)'이라고 알려진 이 현상은 모델이 그럴듯하게 들리지만 완전히 거짓된 콘텐츠를 생성할 때 발생합니다. 이러한 오류는 일상적인 대화에서는 대개 해롭지 않지만, 모델이 의료 조언, 법률 조사 또는 뉴스 보도에 사용될 때는 위험해집니다. 과학자들의 핵심 과제는 단순히 사후에 이러한 거짓말을 찾아내는 것이 아니라, 거짓이 시작되는 정확한 순간, 이상적으로는 진실이 무너지기 시작하는 바로 그 단어를 식별하여 발생하는 즉시 잡아내는 것입니다.

수년 동안 연구자들은 모델에게 답변을 여러 번 반복하도록 요청하거나, 서로 다른 버전의 이야기가 일치하는지 확인하는 방식으로 이 문제를 해결하려 노력해 왔습니다. 이러한 방법들은 효과가 있지만, 단 하나의 실수를 찾기 위해 컴퓨터가 동일한 작업을 여러 번 수행해야 하므로 느리고 비용이 많이 듭니다. 더 새로운 접근 방식은 모델이 생각하는 동안 모델의 '두뇌' 내부를 들여다보며, 내부 계산 과정에서 나타나는 미묘한 불확실성의 신호를 찾는 것입니다. 하지만 이러한 내부 점검 방식 대부분은 표준 모델에 국한되어 있습니다. 최근에는 더 강력하고 효율적인 형태의 아키텍처인 '전문가 혼합(Mixture-of-Experts)' 구조가 인기를 얻고 있습니다. 이 설계는 마치 전문가 팀처럼 작동하며, 중앙 관리자가 각 단어가 생성될 때마다 어떤 특정 전문가를 호출할지 결정합니다. 지금까지는 이러한 팀 역동성에서 발생하는 신호들이 거짓을 잡아내는 목적으로는 거의 무시되어 왔습니다.

포르투갈의 연구진은 이러한 내부 팀 신호를 마침내 활용하는 '이너엑스퍼트(InnerExpert)'라는 방법을 개발했습니다. 이너엑스퍼트는 모델에게 반복을 요구하거나 문장이 끝날 때까지 기다려 오류를 확인하는 대신, 모델의 내부 라우팅(routing) 과정을 실시간으로 관찰합니다. 모델이 응답을 생성할 때, 작은 라우터가 현재의 단어를 처리할 '전문가' 네트워크를 결정합니다. 연구진은 모델이 환각을 일으키기 직전에 이 라우터가 혼란의 징후를 보인다는 사실을 발견했습니다. 전문가들 사이에 의견이 불일치하거나, 라우터가 해당 작업에 가장 적합한 전문가를 결정하는 데 어려움을 겪을 수 있습니다. 이러한 망설임과 불일치의 순간을 모델이 주의를 기울이는 방식에 대한 표준 신호와 함께 추적함으로써, 이너엑스퍼트는 모든 단어가 생성될 때마다 신뢰도 점수를 할당할 수 있습니다.

연구팀은 영리하고 자동화된 방식으로 시스템을 훈련시켰습니다. 그들은 모델에 수천 개의 질문을 입력했고, 별도의 고성능 인공지능이 어떤 답변이 사실이고 어떤 답변이 지어낸 것인지 판별하는 판사 역할을 하게 했습니다. 이를 통해 연구진은 사람이 직접 데이터를 읽고 수정할 필요 없이, 환각에 앞서 나타나는 특정 내부 신호 패턴을 이너엑스퍼트가 인식하도록 학습시킬 수 있었습니다. 훈련이 완료된 후, 이 시스템은 메인 모델과 함께 실행되는 가벼운 탐지기 역할을 하며, 결과를 도출하기 위해 데이터의 단 한 번의 통과(single pass)만을 요구합니다. 이 시스템은 모델의 속도를 늦추거나 추가 텍스트 생성을 요구하지 않습니다.

다섯 가지 서로 다른 데이터셋과 두 가지 유형의 거대 모델을 대상으로 테스트했을나, 이너엑스퍼트는 놀라운 효과를 입증했습니다. 이 시스템은 문장 수준에서 최대 0.91, 개별 단어 수준에서 0.76의 정확도로 환각된 답변을 성공적으로 식별해 냈습니다. 이 수치들은 기존 방법들이 거짓이 어디서 시작되는지 정확히 짚어내는 데 어려움을 겪는 것과 비교했을 때 상당한 개선을 의미합니다. 또한 이 시스템은 일반화 능력이 뛰어나, 모델이 원래 훈련받은 이후에 발생한 사건에 대한 질문에서도 강력한 성능을 보였는데, 이는 환각이 가장 빈번하게 발생하는 시나리오입니다. 결정적으로, 이 시스템은 매우 적은 계산 비용만을 추가하면서도 높은 수준의 탐지 능력을 달al 성했습니다. 이는 실제 사용에 있어 실용적임을 의미합니다.

또한 이번 연구는 모델의 내부 팀에서 나오는 단일 신호만으로는 모든 거짓을 잡아낼 수 없다는 점을 밝혀냈습니다. 어떤 신호는 특정 유형의 모델에서 오류를 더 잘 감지하는 반면, 다른 신호는 다른 유형의 모델에서 더 잘 작동했습니다. 이너엑스퍼트의 진정한 힘은 라우터의 혼란, 전문가 간의 불일치, 사용 패턴과 같은 이 모든 다양한 신호를 하나의 통합된 점수로 결합하는 데서 나왔습니다. 이러한 결합을 통해 시스템은 단일 지표가 제공할 수 있는 것보다 더 명확한 모델의 신뢰도 그림을 볼 수 있었습니다. 연구진은 모델의 전문가들이 나누는 내부적인 대화(internal chatter)에 귀를 기울임으로써, 시스템을 느리게 만들지 않고도 이전에는 불가능했던 정밀도로 불확실성을 감지할 수 있음을 입증했습니다.

이 연구는 더 신뢰할 수 있는 인공지능을 향한 길이 반드시 더 큰 모델이나 더 복잡한 검증 시스템을 구축하는 데 있는 것은 아님을 시사합니다. 대신, 모델이 이미 생성하고 있지만 무시되고 있는 신호에 더 세심한 주의를 기울이는 데 있을 수 있습니다. 모델의 내부 의사결정 과정에서 나타나는 미묘한 망설임의 신호를 읽는 법을 배움으로써, 우리는 모델이 언제 추측하고 있고 언제 확신하고 있는지를 아는 시스템을 구축할 수 있습니다. 연구진은 이 방법이 매우 효과적이지만 완벽한 해결책은 아니며, 향후 다른 언어와 더 다양한 작업으로 이 기술이 얼마나 잘 번역/적용될 수 있는지 탐구해야 한다고 언급했습니다. 그러나 현재로서는 이 연구가 환각이 발생하는 즉시 잡아낼 수 있는 명확하고 효율적인 방법을 제공함으로써, 인공지능의 결과물을 더욱 신뢰할 수 있게 만드는 실질적인 도구를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →