← 최신 논문
💻 computer science

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

이 논문은 선도적인 시각-언어 모델(Vision-Language Models)들이 내재된 편향과 학습 데이터의 부족으로 인해 누락된 객체 부위를 일관되게 감지하지 못한다는 점을 입증하는 벤치마크인 MissingBench-Verified를 소개하며, 이러한 한계는 외부 도구, 확장된 추론 또는 미세 조정을 사용하더라도 지속되어 현재 VLM들의 근본적인 구조적 결함을 드러낸다.

원저자: Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 세상을 보는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 수백만 장의 고양이, 개, 그리고 비행기 사진을 보여주며 규칙을 학습시킵니다. "고양이는 꼬리가 있다", "비행기는 날개가 있다", "아이폰에는 홈 버튼이 있다"와 같은 규칙 말이죠. 이것이 바로 **시각-언어 모델(Vision-Language Models, VLMs)**의 세계입니다. 이들은 사진을 보고 그것을 글로 설명하거나, 눈에 보이는 것에 대해 질문에 답할 수 있는 매우 똑똑한 컴퓨터 프로그램입니다. 이들은 우주의 모든 책을 읽은 사서와 같아서, 표지만 보고도 이야기의 줄거리를 즉시 말해줄 수 있습니다.

하지만 까다로운 점이 하나 있습니다. 때때로 이 사서는 자신이 아는 것에 너무 과하게 확신을 가집니다. 만약 당신이 꼬리가 없어진 고양이 사진을 보여준다면, 그들의 뇌는 "그럴 리 없어! 모든 고양이는 꼬리가 있어!"라고 외칠 것이고, 눈에는 분명히 꼬리가 보이지 않는데도 꼬리가 있다고 주장할지도 모릅니다. 이것을 **환각(Hallucination)**이라고 부릅니다. 로봇이 거짓말을 하는 것이 아니라, 내부 지식이 너무 강력해서 실제로 눈에 보이는 것을 압도해 버리는 것입니다. 과학자들이 이 문제에 주목하는 이유는, 우리가 이 로봇들이 다리를 점검하거나, 의료 영상을 확인하거나, 공장을 모니터링하는 일을 돕기를 원한다면, 그들이 단순히 무언가를 만들어내는 대신 "이봐요, 무언가 빠졌어요"라고 말할 수 있어야 하기 때문입니다.


거대한 "부품 누락" 미스터리

여기에 바로 이러한 고집스러움을 정확히 테스트하기 위해 설계된 새로운 실험인 MissingBench-Verified가 등장합니다. 이 연구의 연구진은 다음과 같은 의문을 품었습니다. 만약 우리가 비행기 사진에서 엔진을 수술하듯 제거한다면, 로봇은 엔진이 사라졌음을 인정할 것인가, 아니면 여전히 거기에 있다고 환각을 일으킬 것인가?

이를 알아내기 위해 팀은 118개의 특별한 이미지 세트를 만들었습니다. 그들은 홈 버튼이 지워진 휴대폰이나 꼬리가 없는 비행기처럼 일상적인 물체의 실제 사진을 가져와 시중에 나온 가장 똑똑한 10개의 AI 모델에게 보여주었습니다. 그리고 그들에게 간단한 질문을 던졌습니다. "이 부품이 보이는가?" 모델들은 "명확히 보임", "보기 어려움", 또는 "보이지 않음" 중에서 선택해야 했습니다.

결과는 충격적이었습니다. 거의 모든 테스트를 통과하는 가장 진보된 AI 모델들조차 처참하게 실패했습니다. 엔진이 사라졌을 때, 모델들은 엔진이 여전히 거기 있다고 주장했습니다. 실제로, 거의 절반의 모델이 50% 이상의 확률로 오답을 냈습니다. 최악의 성적을 기록한 Claude Sonnet 4.6은 부품이 없다는 것을 단 **44.1%**의 경우에만 정확히 식별했습니다. 마치 로봇들이 자신의 기억으로 만든 눈가리개를 쓰고, 자신의 눈을 믿지 못한 채 보고 있는 것을 부정하고 있는 것 같았습니다.

제대로 작동하지 않은 "마법의 도구들"

연구진은 단순히 로봇에게 더 열심히 보라고 요구하는 데 그치지 않았습니다. 그들은 모델들이 몽상에서 깨어나기를 바라며 일종의 도구 상자를 제공하여 도움을 주려 했습니다. 그들은 세 가지 주요 전략을 시도했습니다.

  1. "탐정의 보고서" (외부 도구): 그들은 모델에게 "조사해 보았으나, 엔진을 확실히 찾지 못했다"라고 말하는 매우 정확한 객체 탐지기의 가짜 보고서를 주었습니다. 그들은 모델이 이 보고서를 신뢰하기를 바랐습니다. 하지만 대부분의 모델은 보고서를 무시하고 자신들의 주장을 고수했습니다. "완벽한 탐지기"가 물체가 없다고 말했음에도 불구하고, 모델들은 여전히 그것이 있다고 환각을 일으켰습니다.
  2. "확대 렌즈" (이미지 처리): 그들은 모델이 이미지를 자르거나, 밝기를 조절하거나, 선명하게 만드는 도구를 사용하게 하여, 더 자세히 보면 진실을 밝힐 수 있기를 바랐습니다. 한 모델은 심지어 비행기 꼬리가 없는 부분을 확대하는 도구를 사용하여 빈 공간을 보고도, 그것이 사라졌다고 인정하는 대신 "크롭 오류" 때문이라며 여전히 꼬리가 있다고 주장했습니다.
  3. "깊은 사고" (더 많은 시간): 그들은 모델이 답변하기 전에 더 오래 생각하고 추론하도록 강제하여, 더 많은 사고력이 실수를 바로잡기를 바랐습니다. 놀랍게도, 더 오래 생각하게 만드는 것은 도움이 되지 않았습니다. 어떤 경우에는 오히려 틀린 답에 대한 확신만 더 키워주었습니다.

결론: 버그가 아니라, 고장 난 "기능"입니다

이 논문은 이것이 단순히 프롬프트나 약간의 추가 생각으로 가르쳐서 해결할 수 있는 단순한 실수가 아니라고 제안합니다. 문제는 깊은 곳에 있습니다. 모델들은 비행기라면 반드시 날아야 하므로 엔진이 있어야 한다는 '사전 지식(Prior)'을 학습했습니다. 시각적 증거(빈 공간)가 이 뿌리 깊은 믿음과 충돌할 때, 믿음이 승리하는 것입니다. 모델들은 본질적으로 이렇게 말하고 있는 셈입니다. "나는 비행기가 어떻게 생겼는지 알고 있고, 이 사진은 잘못되었으니, 나는 있는 그대로의 모습이 아니라 내가 예상하는 대로의 비행기를 묘사하겠다."

연구진은 더 나은 도구에 접근 권한을 주고 더 많은 시간을 주는 방식으로 이를 해결하려 했지만, 논문은 이러한 현재의 방법들이 **미미한 개선(negligible improvement)**만을 제공한다고 결론지었습니다. 실패율은 완강하게 높은 상태를 유지했으며, 대부분의 모델은 도움을 받더라도 여전히 누락된 부품을 정확히 식별하지 못했습니다.

이 연구는 문제를 해결했다고 주장하는 것이 아닙니다. 대신 경종을 울리고 있습니다. 기계 부품이 누락되었는지 혹은 안전 장치가 온전한지 확인하는 것과 같은 작업에서, 현재의 최고 AI 모델들이 위험할 정도로 신뢰할 수 없다는 것을 보여줍니다. 모델들은 자신의 내부 지식에 너무 확신에 차 있어서, 눈앞에 증거가 있음에도 그것을 뒤집지 못합니다. 논문은 이 문제를 해결하려면 더 나은 프롬프트나 더 많은 생각 시간이 아니라, 모델이 자신이 생각하는 것보다 자신이 보는 것을 더 신뢰하도록 만드는 근본적인 구조적 재설계가 필요할 것이라고 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →