← 최신 논문
💻 computer science

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

본 논문은 환각을 섭동 양상(perturbation modality)과 논리적 극성(logical polarity)에 의해 정의된 네 가지 일관성 그룹 전반의 구조화된 불확실성 패턴으로 모델링함으로써, 대규모 시각-언어 모델(Large Vision-Language Models)에서 고유하고 일반화 가능한 환각 행동을 포착하여 기존 방식들을 크게 능가하는 새로운 블랙박스 프레임워크인 UHP Detection을 제안한다.

원저자: Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사진을 보고 질문에 답할 수 있는, 매우 똑똑하고 자신감 넘치는 로봇과 대화하고 있다고 상상해 보세요. 이 로봇은 '거대 시각-언어 모델(Large Vision-Language Models, LVLMs)'이라 불리는 새로운 세대의 AI의 일부입니다. 이들은 인터넷 전체를 읽었을 뿐만 아니라 사진도 볼 줄 아는 슈퍼 브레인과 같습니다. 이들은 보이는 것을 설명하는 데 매우 뛰어나지만, 한 가지 기묘한 결함이 있습니다. 때때로 사실을 지어낸다는 점이죠. AI의 세계에서 이것은 '환각(hallucination)'이라고 불립니다. 마치 고양이 사진을 보고 묘사하라는 질문을 받았을 때, 고양이가 모자를 쓰고 있다고 아주 자신 있게 말하는 학생과 같습니다. 실제로는 모자가 없는데 말이죠. 이는 큰 문제입니다. 만약 우리가 이 로고봇들이 의사를 돕거나 자동차를 운전하도록 신뢰한다면, 그들이 지어낸 이야기가 현실 세계의 실수로 이어질 수 있기 때문입니다.

한동안 과학자들은 로봇이 얼마나 '불확실하게' 들리는지를 확인하여 이러한 거짓말을 잡아내려 노력했습니다. 기존의 아이디어는 단순했습니다. 만약 로봇이 불확실해 보이거나, 질문을 약간씩 다르게 했을 때 서로 다른 답변을 내놓는다면, 그것은 아마도 거짓말을 하고 있는 것이라는 생각이었습니다. 하지만 연구자들은 이 계획에 결함이 있다는 것을 발견했습니다. 때때로 로봇은 거짓말을 하고 있으면서도 믿기 힘들 정도로 확신에 차 있고 일관된 모습을 보일 수 있습니다. 이는 마치 말을 아주 잘하는 거짓말쟁이가 결코 이야기를 바꾸지 않는 것과 같습니다. '흔들림'이나 '불확실성'을 확인하는 것만으로는 그들을 잡을 수 없습니다. 문제는, 거짓말쟁이가 완벽하게 일관되게 행동할 때 어떻게 그 거짓말을 찾아낼 것인가였습니다.

여기서 새로운 연구가 UHP 탐지(Unique Hallucination Pattern, 고유 환각 패턴)라는 영리한 해결책을 가지고 등장합니다. 연구진은 로봇이 단 하나의 불확실성의 징후를 찾는 대신, 특정한 '행동 패턴'을 찾아야 한다는 점을 깨달았습니다. 그들은 로봇을 상대로 두 가지 주요 규칙을 가진 게임을 설정했습니다.

  1. "무엇(What)" 규칙: 그들은 입력을 두 가지 방식으로 변형했습니다. 때로는 사진을 수정하기도 하고(예: 조명을 바꾸거나 확대하기), 때로는 질문을 수정하기도 했습니다(예: 질문을 다시 표현하기).
  2. "예/아니오(Yes/No)" 규칙: 그들은 참인 문장(예: "고양이가 있다")과 그와 정확히 반대되는 문장(예: "고양이가 없다")을 로봇이 확인하도록 했습니다.

이 규칙들을 혼합하여, 그들은 로봇을 테스트하기 위한 네 가지 다른 "방" 또는 그룹을 만들었습니다. 완벽한 세상이라면, 로봇이 "고양이가 있다"에 "예"라고 답한다면 "고양이가 없다"에는 "아니오"라고 답해야 하며, 사진을 약간 바꾸더라도 똑같은 말을 유지해야 합니다. 하지만 로봇이 환각을 일으킬 때는 단순히 혼란스러워하는 것이 아니라, 매우 구체적이고 이상한 방식으로 혼란을 겪습니다. 사진을 바꿨을 때는 일관성을 유지하면서도 단어를 바꾸면 말을 바꾸기도 하고, 어떤 방에서는 거짓말에 동의하지만 다른 방에서는 스스로 모순을 보이기도 합니다.

연구팀은 로봇이 이 네 가지 방 모두에서 어떻게 행동하는지 관찰하는 가벼운 "탐정"(간단한 컴퓨터 프로그램)을 구축했습니다. 그들은 환각이 무작위적인 오류가 아니라, 고유한 지문을 남긴다는 것을 발견했습니다. 이들의 테스트에서 이 새로운 방식은 세 가지 AI 모델에 대해 기존 방식보다 훨씬 더 뛰어난 성능을 보였습니다. 한 측정치에서는 최대 18.72%, 다른 측정치에서는 **20.07%**까지 환각을 포착하는 능력을 향상시켰으며, 이는 로봇의 뇌 내부를 들여다보는 방식조차 능가하는 성과였습니다.

연구진은 이 "지문"이 실제이며 우연히 나타난 것이 아니라는 점도 보여주었습니다. 탐정을 한 세트의 퍼즐로 훈련시키고 완전히 다른 세트로 테스트했을 때도 여전히 잘 작동했습니다. 이는 이 AI 모델들이 거짓말을 하는 방식이 단순히 특정 테스트에 국한된 실수가 아니라, 그들이 생각하는 방식의 근본적인 부분임을 시사합니다. 이 연구는 환각을 잡기 위해서 단순히 "확실합니까?"라고 물어서는 안 된다는 것을 증명합니다. 대신 "내가 모든 각도에서 찔러보았을 때 당신의 이야기가 유지됩니까?"라고 물어야 합니다. 이러한 고유한 일관성 패턴을 지도화함으로써, 우리는 마침 finally 자신만만한 거짓말쟁이들이 문제를 일으키기 전에 드디어 잡아낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →