← 최신 논문
💻 computer science

DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

이 논문은 시각-언어 모델(VLM)의 객체 환각(object hallucination) 원인이 텍스트 문맥의 선입견 때문인지 아니면 시각적 인지 능력의 한계 때문인지를 정밀하게 진단하기 위해, 두 가지 차원의 개입을 통해 오류의 근본 원인을 규명하는 새로운 벤치마크인 'DO-Bench'를 제안합니다.

원저자: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

게시일 2026-04-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제 상황: AI의 "환각(Hallucination)" 현상

우리가 AI에게 사진을 보여주면, 가끔 없는 물건이 있다고 우기거나(환각), 있는 물건을 못 본다고 잡아떼기도 합니다.

기존의 테스트 방식은 마치 **"시험 점수"**만 매기는 것과 같았습니다. "너 80점 맞았네? 공부 좀 더 해!"라고 말할 뿐이죠. 하지만 점수만 봐서는 이 학생이 '눈이 나빠서(시각 능력 부족)' 틀린 건지, 아니면 '주변 친구들이 다 그렇다고 하니까 휩쓸려서(선입견)' 틀린 건지 알 수가 없습니다.

2. 해결책: DO-Bench (AI를 위한 정밀 검진 시스템)

연구진은 AI의 실수를 두 가지 핵심 원인으로 나누어 검사하는 **'DO-Bench'**라는 새로운 진단 도구를 만들었습니다.

① "눈이 침침한가?" (Perception-Limited: 시각적 한계 테스트)

  • 비유: 아주 멀리 있는 작은 점을 보고 "저게 뭐야?"라고 물었을 때, AI가 못 맞춘다면 이건 눈이 나쁜 겁니다. 이때 돋보기를 갖다 대주거나(사진을 확대해서 보여줌) 가까이서 보여줬을 때 "아, 사과구나!"라고 맞춘다면, 이 AI는 **'눈(시각 능력)'**만 키워주면 되는 상태입니다.
  • 논문의 방식: 사진 속 물체를 아주 크게 확대해서 보여주며 AI의 시각적 회복력을 측정합니다.

② "주변 말에 잘 휘둘리는가?" (Prior-Override: 선입견 테스트)

  • 비유: 분명히 눈앞에 사과가 있는데, 옆에서 누군가 계속 **"아니야, 저건 포도야. 내가 장담하는데 포도야!"**라고 강하게 압박한다고 해봅시다. 이때 AI가 "어... 그럼 포도인가?"라고 헷갈려 한다면, 이건 눈이 나쁜 게 아니라 **'주변의 말(텍스트 선입견)'**에 너무 쉽게 휘둘리는 겁니다.
  • 논문의 방식: 사진은 그대로 둔 채, 질문 문구에 "분명히 저건 사과가 아닐 거야"라는 식의 강력한 암시를 단계별로 섞어서 AI가 얼마나 꿋꿋하게 자기 눈을 믿는지 측정합니다.

3. 이 연구가 왜 대단한가요? (결론)

이 논문의 핵심 발견은 **"덩치 큰 AI라고 해서 무조건 똑똑한 건 아니다"**라는 점입니다.

  • 덩치 큰 AI(대규모 모델): 돋보기를 대주면 훨씬 잘 보긴 하지만(시각 능력 향상), 여전히 옆에서 "저건 사과가 아니야!"라고 강하게 우기면 휘둘리는 경향(선입견 취약)이 여전히 남아 있었습니다.
  • 결론: 즉, AI를 똑똑하게 만들려면 **'눈을 좋게 만드는 법'**과 **'남의 말에 휘둘리지 않는 뚝심을 기르는 법'**을 따로따로 공부시켜야 한다는 것을 이 진단 도구가 증명해낸 것입니다.

한 줄 요약:
"AI가 틀렸을 때, '눈이 나빠서' 틀린 건지 '주변 말에 휩쓸려서' 틀린 건지를 정확히 구분해낼 수 있는 AI 전용 정밀 건강검진표를 만들었다!"는 이야기입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →