← 최신 논문
🤖 AI

HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

HalluTracer는 단순한 깊이 평균화를 통해 모든 트랜스포머 레이어에 걸쳐 진실성 신호를 집계함으로써, 고립된 레이어나 구성 요소에 의존하는 기존 방식의 정보 손실을 극복하고 정확도를 향상시키는 화이트박스 환각 탐지 프레임워크입니다.

원저자: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 현대 인공지능 도구들의 엔진 역할을 하며, 유창한 텍스트를 작성하고, 복잡한 질문에 답하며, 인간과 같은 쉬움으로 문제를 해결할 수 있습니다. 그러나 이 시스템에는 지속적인 결함이 있습니다. 바로 때때로 자신만만하지만 사실과 다른 진술을 생성한다는 것인데, 이러한 실패를 '환각(hallucination)'이라고 부릅니다. 이는 단순히 출력의 오류가 아니라, 특히 의료나 법률과 같이 이해관계가 걸린 고위험 분야에서 사용될 때 발생하는 근본적인 신뢰성 위험입니다. 수년 동안 연구자들은 모델이 거짓말을 하고 있을 때조차 그 내부 기제는 진실을 보유하고 있다는 사실을 의심해 왔습니다. 말하자면 모델의 두뇌는 최종 단어가 화면에 나타나기 훨씬 전부터 사실과 조작을 구분하는 신호를 인코딩합니다. 문제는 모델의 거대하고 복량적인 구조 속의 노이즈에 길을 잃지 않고 그 신호를 읽어내는 방법을 배우는 것이었습니다.

한 연구팀이 이제 이 문제를 해결하기 위해 'HalluTracer'라고 불리는 새로운 방법을 개발했습니다. 모델 내부에서 단 하나의 '진실 스위치'를 찾거나 처리 과정의 단 한 부분만을 살펴보는 대신, 그들은 모델이 스스로와 나누는 전체 대화에 귀를 기울이기로 했습니다. 거대 언어 모델이 프롬프트를 처리할 때, 정보는 일련의 쌓인 층(layers)을 통과하며 단계별로 이해를 정교화합니다. 연구진은 이 모든 층 중 매 단계마다 모델이 다음에 나올 답변이 사실일 가능성이 높은지 혹은 거짓일 가능성이 높은지를 나타내는 아주 작고 희미한 신호를 생성한다는 것을 발견했습니다. 개별적으로 이 신호들은 마치 붐비는 방 안에서 속삭임을 들으려는 것처럼 약하고 노이즈가 많습니다. 하지만 연구진은 이 속삭임들이 무작위적인 것이 아니라, 모든 신호에 동시에 귀를 기울이면 메시지가 명확해질 만큼 충분히 일관적이라는 것을 발견했습니다.

그들 발견의 핵심은 이 층들이 작동하는 방식에 대한 기하학적 통찰입니다. 그들은 각 층이 진실을 확인하는 방식이 이전 층과는 약간씩 다르다는 것을 발견했는데, 이는 마치 각 층이 문제를 약간씩 다른 각도에서 바라보는 것과 같습니다. 이러한 각도가 서로 다르기 때문에, 한 층의 오류나 노이즈는 다음 층의 것과 일치하지 않습니다. 이것이 결정적입니다. 연구진이 모든 층의 신호를 평균냈을 때, 무작위적인 노이즈는 상쇄된 반면 일관된 진실 신호는 더욱 강해졌습니다. 이는 손을 떨며 사진을 찍는 것과 비슷합니다. 단 한 장의 스냅샷은 흐릿할 수 있지만, 여러 위치에서 찍은 많은 스냅샷을 블렌딩하면 최종 이미지는 선명해집니다. 단순히 모든 층에 걸친 진실 신호를 평균내는 것만으로도, 그들의 시스템은 특정 '최적의' 층을 골라내려 했던 기존 방식들보다 더 뛰어난 정확도로 환각을 감지할 수 있었습니다.

이 아이디어를 테스트하기 위해, 연구팀은 HalluTracer를 6개의 서로 다른 거대 언어 모델과 사실적 오류를 잡아내도록 설계된 5개의 서로 다른 벤치마크에 적용했습니다. 결과는 일관되고 강력했습니다. 이 새로운 방법은 모든 분야에서 기존 기술보다 더 잘 환각을 감지했으며, 작업의 난이도에 따라 1%에서 14% 포인트까지 개선된 모습을 보였습니다. 다단계 추론이 포함된 특히 복잡한 작업에서는 개선 효과가 더욱 극적이었으며, 기존 방식들이 어려움을 겪었던 부분에서 거의 완벽한 감지 점수를 달 Achieve했습니다. 연구진은 또한 이러한 성공이 모델의 어느 부분을 살펴볼지에 대한 운 좋은 선택 때문이 아님을 증명했습니다. 그들은 신호가 매우 고르게 퍼져 있어서 어떤 특정 내부 구성 요소를 조사하든 상관없다는 것을 보여주었으며, 그 힘은 전적으로 모델의 전체 깊이로부터 정보를 결와하는 행위 자체에서 나왔습니다.

이 연구는 인공지능의 거짓말을 감지하는 방식에 대한 우리의 생각을 바꿉니다. 이전에는 모델의 마음을 읽기 위한 완벽한 순간이나 완벽한 층을 찾는 데 집중했습니다. HalluTracer는 진실이 단 한 곳에 숨겨져 있는 것이 아니라 전체 과정 속에 짜여 있다는 것을 보여줍니다. 모델의 내부 상태를 스냅샷이 아닌 여정으로 취급함으로써, 연구진은 어려운 '선택'의 문제를 단순한 '평균'의 문제로 바꾸어 놓았습니다. 이 방법은 가볍고 빠르며, 모델이 답변 생성을 마치기도 전에 잠재적인 환각을 포착할 수 있습니다. 이는 미래에 AI 시스템이 모델의 내부 추론에 귀를 기울이는 실시간 안전 모니터를 갖추어, 잘못된 진술이 사용자에게 전달되기 전에 차단함으로써 이러한 강력한 도구들을 현실 세계에서 훨씬 더 신뢰할 수 있게 만들 수 있음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →