Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
이 논문은 의미론적으로 동등한 적대적 공격을 사용하는 프레임워크를 도입하여, 의미를 보존하는 쿼리 변형이 검색된 증거를 충실하게 활용하는 능력을 현저히 저하시킴으로써 최첨단 LLM들이 내재적 환각에 여전히 매우 취약하다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 우주의 거의 모든 책을 읽은 초지능 로봇 사서와 대화하고 있다고 상상해 보세요. 당신이 질문을 던지면, 확실히 하기 위해 당신은 그 질문의 정답지로 사용할 수 있는 책의 특정 페이지를 그에게 건네줍니다. 이 설정을 '검색 증강 생성(Retrieval-Augmented Generation)', 즉 RAG라고 부릅니다. 이것은 로봇이 자신의 기억에 의존해 추측하지 않도록 참고용 시트를 주는 것과 같습니다. 기대하는 바는 로봇이 자신의 내부 지식과 제공된 자료가 일치하지 않을 경우, 자신의 지식을 무시하고 오직 참고 시트에만 엄격하게 충실하는 것입니다. 하지만 여기 함정이 있습니다. 때때로 로봇은 손에 참고 시트를 쥐고 있음에도 불구하고 혼란에 빠지거나, 읽고 있는 내용을 잊어버리거나, 혹은 어쨌든 멋대로 이야기를 지어내기도 합니다. 이것을 '내재적 환각(intrinsic hallucination)'이라고 부릅니다. 로봇이 의도적으로 거짓말을 하는 것이 아니라, 눈앞에 있는 증거에 충실하기에는 그들의 두뇌가 너무도 산만하기 때문입니다.
이제 당신이 이 로봇이 얼마나 산만한지를 알아내려는 탐정이라고 상상해 보세요. 당신은 똑같은 질문을 백 가지 방식으로 다르게 물어볼 수도 있겠지만, 만약 질문의 의미를 바꿔버린다면 로봇은 새로운 주제 때문에 혼란에 빠질지도 모릅니다. 로봇의 집중력을 진정으로 테스트하려면, 질문의 의미는 유지한 채로 수십 가지의 다양한 억양, 방언, 또는 문장 구조로 똑같은 질문을 속삭여야 합니다. 만약 당신이 "지금 몇 시예요?"라고 말했을 때와 "현재 시간을 알려주실 수 있나요?"라고 말했을 때 로봇이 서로 다른 오답을 내놓는다면, 그 로봇은 심각한 문제를 가진 것입니다. 즉, 일관성에 문제가 있는 것이죠. 이 논문은 바로 그 의미를 보존하는 변형들을 속삭여서, 로봇이 압박감을 이기지 못하고 무너지는지 확인하는 정교한 도구를 만드는 것에 관한 이야기입니다.
연구진은 이 clever한 새로운 프레임워크를 사용하여 AI 시스템을 스트레스 테스트하기로 했습니다. 그들은 단순히 모델에게 안전 규칙을 깨뜨리라고 요구하는 대신(이는 AI를 테스트하는 일반적인 방식입니다), 모델에게 스스로의 '정직함'을 깨뜨리라고 요구했습니다. 연구진은 디지털 '공격자' 팀을 활용했습니다. 어떤 공격자는 단어를 수학적으로 미세하게 조정하고, 어떤 공격자는 유전 알고리즘을 사용하여 새로운 문장을 진화시키며, 또 다른 공격자는 다른 AI를 사용하여 질문을 재작성함으로써, 모델을 환각에 빠뜨릴 수 있는 완벽한 '의미 보존형 재구성'을 찾아냈습니다. 목표는 질문의 의미가 원래의 질문과 정확히 동일함에도 불구하고, 모델이 제공된 맥락을 무시하고 이야기를 지어내도록 속일 수 있는지 확인하는 것이었습니다.
결과는 꽤 충격적이었습니다. 연구팀은 가장 발전되고 최첨단인 모델들조차 놀라울 정도로 취약하다는 것을 발견했습니다. 이들은 '의미론적으로 동등한 공격(semantically equivalent attacks)'을 가했을 때, 모델의 사실 준수 능력이 급격히 떨어지는 것을 확인했습니다. 어떤 경우에는 GPT-5-mini와 같은 특정 모델이 특정 데이터셋에서 사실에 대한 충실도가 최대 50%까지 하락하기도 했습니다. 예를 들어, FaithEval 데이터셋에서 GPT-5-mini의 충실도는 0.72에서 0.22로 떨어졌습니다. 즉, 질문의 표현이 아주 약간 달라졌을 뿐인데도 의미는 전혀 변하지 않았음에도 불구하고 갑자기 정답을 맞히지 못하게 된 것입니다.
이 논문은 단순히 모델의 크기를 키우거나 더 똑똑하게 만드는 것만으로는 이 문제를 해결할 수 없다고 제안합니다. 연구진은 작은 오픈 소스 모델부터 거대한 폐쇄형 모델에 이르기까지 모든 것을 테스트했지만, 이들은 모두 '의미 보존형 트릭' 앞에서 비틀거렸습니다. 이러한 공격들은 매우 효과적이어서, 질문이 원래의 질문과 논리적으로 동일함에도 불구하고 모델이 "답변할 수 없음"이라고 말하거나 텍스트에 없는 세부 사항을 지어내도록 유도할 수 있었습니다.
흥 흥미롭게도, 공격의 유형에 따라 결과가 달랐습니다. 단어를 유의어로 교체하는 방식(예: "큰"을 "거대한"으로 바꾸는 것)은 질문을 어색하고 부자연스럽게 만들어 모델이 쉽게 알아챌 수 있었습니다. 하지만 다른 AI를 사용하여 문장 전체를 자연스럽게 재작성하는 방식은 정말 골칫거리였습니다. 문장의 흐름과 의미를 완벽하게 유지하는 이 자연스러운 공격들이 가장 큰 성능 저하를 일으켰으며, 이는 모델이 이상한 횡설수설뿐만 아니라 인간 언어의 자연스러운 다양성에도 취약하다는 것을 입증했습니다.
또한 이 연구는 모델이 '어떻게' 실패하는지도 살펴보았습니다. 때로는 단순히 답변을 거부하기도 했지만, 종종 사실을 틀리게 말하거나, 맥락을 잘못 읽거나, 잘못된 논리적 비약을 보이기도 했습니다. 이는 문제가 단순히 모델이 고집을 피우는 것이 아니라, 제공된 텍스트에 기반하여 답변을 도출하는 능력 자체가 근본적으로 불안정하다는 것을 의미합니다. 연구진은 질문이 어떻게 표현되든 상관없이 모델이 증거에 충실하도록 강제하는 새로운 아키텍처와 훈련 방법이 필요하다고 결론짓습니다. 그때까지는, 아무리 똑똑한 AI 사서라 할지라도 약간 다른 문장 하나 때문에 완전히 새로운 역사를 지어낼 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.