← 최신 논문
💻 computer science

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

이 논문은 새로운 쌍체 질문(paired-question) 설계를 통해 엔티티, 속성, 관계 및 지식 환각의 평가를 통합하는 포괄적인 벤치마크인 KnowHal을 소개하며, 이를 통해 지식 관련 오류와 잘못된 전제 수용이 현재 모델들에게 여전히 중요한 과제로 남아 있음을 밝힌다.

원저자: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇에게 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 멀티모달 거대 언어 모델(줄여서 MLLM)로, 사진을 보고 동시에 책을 읽을 수 있는 똑똑한 학생과 같습니다. 이 로봇은 "저것은 나무 탁자 위에 놓인 빨간 사과입니다"라고 말하는 것처럼 자신이 보는 것을 설명하는 데 매우 뛰어납니다. 하지만 때때로 이 로봇은 너무 창의적으로 변하곤 합니다. 고양이 사진을 보고는 "이 고양이는 우주선을 조종하고 있습니다"라고 자신 있게 말할 수도 있는데, 고양이는 비행을 할 수 없고 사진 속에 우주선도 없는데 말이죠. 이것을 '환각(hallucination)'이라고 부릅니다. 마치 로봇이 일을 해야 할 시간에 딴생각(공상)을 하고 있는 것과 같습니다.

이것이 왜 중요할까요? 왜냐하면 우리는 의사가 질병을 진단하는 것을 돕거나 자율주행 자동차를 안내하는 것과 같은 중요한 업무를 이 로봇들에게 믿고 맡기고 싶기 때문입니다. 만약 로봇이 이야기를 지어내기 시작한다면, 그 결과는 위험해질 수 있습니다. 과학자들은 이러한 로봇의 딴생각을 잡아내기 위한 테스트를 만들기 위해 노력해 왔습니다. 대부분의 테스트는 로봇이 "개가 있는가?" 또는 "개가 갈색인가?"와 같이 사진 속의 단순한 사물을 올바르게 식별할 수 있는지 확인합니다. 하지만 까다로운 부분이 있습니다. 때때로 로봇은 세상에 대한 사실(예: "개는 꼬리가 있다")은 알고 있지만, 사진이 그 사실과 일치하지 않을 때 혼란을 겪거나 사진에 없는 사실을 스스로 만들어내기도 합니다. 지금까지 우리는 로봇이 무엇을 '보는가'와 무엇을 '아는가'를 한꺼번에 확인할 수 있는 단일하고 공정한 테스트를 갖지 못했습니다.

여기, 새로운 방식으로 이러한 딴생각을 잡아내도록 설계된 영리하고 기발한 테스트인 KnowHal이 등장했습니다. KnowHal을 로봇의 뇌를 위한 '틀린 그림 찾기' 게임이라고 생각해 보세요. 연구진은 스포츠부터 음악까지 10가지 다양한 생활 영역을 아우르는 1,800개의 사진-질문 쌍의 방대한 컬렉션을 구축했습니다. 모든 사진마다 두 가지 유형의 질문을 만들었습니다. 하나는 사진 속에 실제로 있는 것이나 대상에 대한 진실된 사실을 묻는 "긍정적(Positive)" 질문이고, 다른 하나는 교묘한 함정이 담긴 "부정적(Negative)" 질문입니다. 이 함정들은 매우 그럴듯하게 들리지만 실제로는 거짓입니다. 예를 들어, 사진에 진짜 개가 있다면, 긍정적인 질문은 "개의 색깔은 무엇인가?"라고 묻습니다. 부정적인 함정은 "개의 '보이지 않는 파란색 모자'의 색깔은 무엇인가?"라고 물을 수 있습니다.

연구진은 14개의 서로 다른 로봇 뇌를 이 새로운 게임으로 테스트했습니다. 그들은 놀라운 사실들을 발견했습니다. 첫째, 로봇들은 "긍정적" 질문에 답하는 데는 대체로 괜찮았지만, "부정적" 함정에 직면했을 때는 심하게 비틀거렸습니다. 이는 마치 수학 사실은 완벽하게 알지만, "2 더하기 2가 5라면, 2 더하기 2는 무엇인가?"라는 질문을 받았을 때 당황하는 학생과 같습니다. 로봇들은 거짓을 바로잡는 대신 종종 "5"라고 대답했습니다. 이는 아무리 똑똑한 로봇이라도 속임을 당했을 때 "잠깐, 그건 사실이 아니야"라고 말하는 데 서툴다는 것을 보여줍니다.

가장 큰 놀라움은 거의 모든 로봇에게 가장 어려운 부분이 "지식(Knowledge)" 차원이었다는 점입니다. 이것은 로봇이 단순히 눈에 보이는 것뿐만 아니라 책이나 인터넷에서 배운 사실을 사용해야 하는 단계입니다. 가장 뛰어난 로봇들조차 단순한 시각적 질문을 틀릴 때보다 이 "지식" 관련 질문에서 더 자주 틀렸습니다. 이는 로봇들이 보는 능력이 향상되고 있음에도 불구하고, 여전히 자신이 '보는 것'과 '알고 있다고 생각하는 것'을 구분하는 데 어려움을 겪고 있음을 시사합니다.

연구는 또한 로봇 뇌의 크기가 성능에 미치는 영향을 살펴보았습니다. 그들은 뇌가 클수록 일반적으로 더 잘한다는 것을 발견했지만, 가장 큰 뇌조차도 까다로운 "지식" 질문과 "부정적" 함정에는 여전히 고전했습니다. 이는 단순히 로봇을 크게 만드는 것만으로는 마법 같은 해결책이 될 수 없음을 알려줍니다. 우리는 그들에게 어떻게 하면 더 주의 깊고 회의적으로 변할 수 있는지 가르쳐야 합니다.

요약하자면, 이 논문은 로봇이 진실과 허구를 얼마나 잘 구별하는지 테스트하기 위해 실제 질문과 교묘한 거짓 질문을 결합한 새로운 벤치마크인 KnowHal을 소개합니다. 연구 결과는 우리의 AI 친구들이 점점 더 똑똑해지고 있음에도 불구하고, 거짓을 포착하거나 모른다고 인정하는 데 있어서는 아직 갈 길이 멀다는 것을 보여줍니다. 저자들은 이 새로운 테스트가 미래의 로봇들이 더 신뢰할 수 있고 이야기를 지어내는 일이 적은 존재가 되는 데 도움이 될 것이라고 믿습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →