← 최신 논문
💬 NLP

Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models

UncertainNLP 워크숍에서 개최된 SHROOM-Visions 2026 공유 태스크는 27개 팀의 참여를 성공적으로 이끌어내어 대규모 시각-언어 모델에서 발생하는 미세한 환각을 4개 국어로 탐지하고 분류하기 위한 모델 불가지론적 시스템을 개발하였으며, SHEEP 데이터셋을 사용하여 베이스라인 대비 유의미한 성능 향상을 달성했습니다.

원저자: Raúl Vázquez, Aman Sinha, Chuyuan Li, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Lorenzo Vaiani, Jörg Tiedemann, Timothee Mickus

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Raúl Vázquez, Aman Sinha, Chuyuan Li, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Lorenzo Vaiani, Jörg Tiedemann, Timothee Mickus

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 발전하는 세상에서, 보고 동시에 말하는 법을 배운 새로운 세대의 컴퓨터가 등장했습니다. 대규모 시각-언어 모델(large vision-language models)로 알려진 이 시스템들은 사진을 보고 유창한 문장으로 묘사하거나, 보이는 것에 대해 질문에 답할 수 있습니다. 이들은 놀라운 능력을 갖추고 있지만, '환각(hallucination)'이라 불리는 특정한 종류의 오류를 겪습니다. 이것은 신기루와 같은 시각적 착각이 아니라 언어적 착각입니다. 즉, 컴퓨터가 자신만만하고 문법적으로는 완벽하지만, 보고 있는 이미지와 사실이 다르거나 전혀 관련이 없는 텍스트를 생성하는 것입니다. 존재하지 않는 물체를 만들어내거나, 색상을 잘못 설명하거나, 표지판을 잘못 읽을 수도 있습니다. 이러한 도구들이 의사가 스캔 영상을 판독하는 것을 돕거나 여행자를 보조하는 등 일상생활에서 더 흔해짐에 따라, 이러한 자신만만한 거짓말을 포착하는 능력은 중요한 안전 문제가 되었습니다.

이 과제를 해결하기 위해 연구자들은 SHROOM-Visions 2026이라는 글로벌 경진대회를 조직했습니다. 목표는 더 나은 이미지 생성기를 만드는 것이 아니라, 더 나은 오류 탐지기를 만드는 것이었습니다. 전 세계 20개 팀이 참여하여 이미지, 질문, 그리고 생성된 답변을 스캔한 뒤, 정확히 어떤 단어가 거짓인지, 그리고 어떤 종류의 거짓인지를 찾아내는 다양한 컴퓨터 시스템 수백 개를 제출했습니다. 이 경진대회는 영어, 중국어, 프랑스어, 이탈리아어 등 4개 언어에 걸친 2만 개의 방대한 사례를 사용했습니다. 결정적으로, 연구자들은 다른 컴퓨터가 만든 오류에만 의존하지 않았습니다. 컴퓨터가 만든 오류는 편향되거나 반복적일 수 있기 때문입니다. 대신, 인간이 의도적으로 이미지에 대한 허위 설명을 작성한 수천 개의 사례를 포함함으로써, 테스트 데이터가 특정 기계의 특성에 치우치지 않고 견고하고 독립적임을 보장했습니다.

결과는 컴퓨터가 상당한 진전을 이루었음에도 불구하고, 이 작업이 여전히 어렵다는 것을 보여주었습니다. 경진대회의 최고 수준 시스템들은 이러한 오류를 식별하고 분류하는 데 있어 중간 정도의 정확도를 보였으며, 기본적인 베이스라인 방법들보다 30~40포인트 차이로 크게 앞섰습니다. 그러나 상위 성적을 거둔 시스템들조차 완벽한 점수를 얻지는 못했습니다. 가장 성공적인 시스템들도 환각이 발생한 단어의 위치를 약 절반 정도의 확률로 정확히 찾아냈으며, 오류의 유형을 분류하는 데 있어서도 비슷한 신뢰도를 보였습니다. 이는 우리가 기계가 스스로의 출력을 감시하도록 가르치는 데 점점 더 능숙해지고는 있지만, 시각적 맥락에서 진실과 허구를 구별하는 문제는 아직 해결되지 않았음을 시사합니다.

시스템의 성능 방식에 대한 분석에서 놀라운 발견이 나타났습니다. 연구자들은 팀들의 순위가 단순한 점수 목록이 시사하는 것만큼 안정적이지 않다는 것을 발견했습니다. 동일한 시스템을 데이터의 서로 다른 하위 집합으로 테스트했을 때, 그들의 상대적 위치가 크게 변했습니다. 한 그룹의 테스트에서는 명확한 선두로 보였던 팀이 다른 그룹에서는 순위가 크게 떨어지기도 했습니다. 이러한 불안정성은 이 탐지기들의 성능이 테스트 데이터가 어떻게 구성되느냐에 매우 민감하다는 것을 나타냅니다. 어떤 시스템은 다른 기계에 의해 생성된 데이터에는 매우 뛰어난 성능을 보였지만 인간이 작성한 오류에는 어려움을 겪은 반면, 다른 시스템은 그 반대의 경향을 보였습니다. 이는 시스템의 성공이 단순히 원시적인 지능에 관한 것이 아니라, 그 시스템이 찾아내도록 요청받은 특정 유형의 오류와 훈련 데이터가 얼마나 밀접하게 일치하는지에 달려 있음을 시사합니다.

또한 이번 경진대회는 오류 자체의 복잡성을 강조했습니다. 연구자들은 환각을 다섯 가지 뚜렷한 유형으로 분류했습니다: 존재하지 않는 것을 만들어내는 것, 보이는 것을 잘못 묘사하는 것, 이미지 내의 텍스트를 잘못 읽는 것, 사물의 개수를 잘못 세는 것, 그리고 기타 잡다한 오류입니다. 시스템들은 어떤 유형의 오류가 다른 유형보다 포착하기 쉬운지를 찾아냈습니다. 예를 들어, 개수 실수(counting mistakes)는 물체의 속성을 미묘하게 잘못 묘사하는 것보다 일반적으로 탐지하기가 더 쉬웠습니다. 또한, 언어에 따라 난이도가 달랐는데, 영어는 시스템이 다루기에 가장 까다로운 언어로 나타난 반면, 중국어는 약간 더 높은 평균 성능을 보였습니다.

궁극적으로 SHROOM-Visions 2026 과제는 환각을 탐지하는 것이 단일한 성공 지표 이상의 정교한 문제임을 입증했습니다. 연구자들은 오류의 위치를 찾는 능력과 그것이 어떤 종류의 오류인지 올바르게 라벨링하는 능력이 서로 연관되어 있지만 별개의 기술이라는 점을 발견했습니다. 어떤 시스템은 틀린 단어를 찾는 데는 능숙하지만, 왜 그것이 틀렸는지 설명하는 데는 서툴 수 있습니다. 이 연구는 이러한 도구들이 진정으로 신뢰할 수 있으려면, 미래의 평가가 기계가 생성한 데이터에만 의존하기보다 다양하고 인간의 정보가 반영된 데이터를 사용하여 이러한 불확실성을 고려해야 한다고 결론짓습니다. 앞으로의 길은 기술의 급격한 변화에도 견딜 수 있는 벤치마크를 구축하여, 우리가 오늘날 만드는 탐지기들이 그들이 모니터링하는 모델이 계속 진화함에 따라 지속적으로 효과적일 수 있도록 보장하는 데 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →