← 최신 논문
💻 computer science

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

ReactBench 는 단순한 정확도 지표를 넘어 특정 근본적인 실패 메커니즘을 진단하기 위해 네 가지 표적 적대적 작업과 사고 연쇄 추론을 통해 대규모 언어 모델의 다중 모달 환각을 체계적으로 평가하는 새로운 원인 기반 벤치마크입니다.

원저자: Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

멀티모달 대형 언어 모델 (MLLM) 을 상상해 보세요. 수백만 권의 교과서를 공부하고 수십억 장의 사진을 본, 지극히 똑똑하고 잘 읽은 학생들입니다. 그들은 자신이 보는 것을 묘사하는 데 뛰어나지만, 위험한 버릇이 하나 있습니다: **환각 (hallucination)**입니다.

단순한 영어로 말하자면, 이는 학생이 실제로 존재하지 않는 것을 자신 있게 묘사한다는 뜻입니다. 예를 들어, 바퀴가 없는 스케이트보드의 사진을 보여 주면, 그들은 훈련 데이터에서 그 조합을 백만 번이나 본 적이 있다는 이유만으로 "그 아래에 네 개의 고무 바퀴가 보입니다"라고 말할 수 있습니다. 그들은 실제로 일어나는 일이 아니라, 보통 일어나는 일에 기반하여 추측을 합니다.

이 논문은 이러한 학생들의 거짓말을 포착하고, 더 중요하게는 그들이 거짓말을 하는지 파악하도록 설계된 새로운 "시험"인 ReactBench를 소개합니다.

ReactBench 가 어떻게 작동하는지 간단한 개념으로 나누어 설명해 보겠습니다:

1. 구식 시험의 문제점

이전 테스트들은 초등학교 퀴즈와 같았습니다. "이 사진에 고양이가 있나요?"와 같은 간단한 질문을 던졌습니다. 모델이 정답을 맞추면 통과였습니다. 하지만 오늘날의 모델들은 너무 똑똑해서 이러한 쉬운 시험을 쉽게 통과할 수 있습니다. 그들은 과목을 배우기보다는 정답지를 외운 학생들과 같습니다. 구식 시험은 모델이 실패했을 때 실패했는지 알려 줄 수 없었습니다.

2. 새로운 시험: ReactBench

ReactBench 는 AI 를 위한 전문적이고 중대한 의료 검진과 같습니다. 단순히 "정답을 맞췄나요?"라고 묻는 대신, "당신의 뇌의 어떤 특정 부분이 고장 났나요?"라고 묻습니다.

이 시험은 네 가지 유형의 환각을 유발하도록 설계된 **네 가지 특정 "함정" (과제)**으로 구성됩니다:

  • 함정 1: "누락된 조각" 테스트 (관계 소거)

    • 비유: 바퀴가 지워진 자전거 사진을 보여 준다고 상상해 보세요.
    • 함정: 자전거는 보통 바퀴가 있기 때문에, AI 의 뇌는 그 공백을 채웁니다. 바퀴가 없어도 "바퀴가 보입니다!"라고 말합니다.
    • 원인: 이는 **공발생 편향 (Co-occurrence Bias)**을 테스트합니다. AI 는 자전거에 바퀴가 있는 것을 너무 자주 봐서, 바퀴가 없어도 그것이 있다고 가정합니다.
  • 함정 2: "가짜 사실" 테스트 (반사실적 속성)

    • 비유: 빨간색 바나나의 사진을 보여 준다고 상상해 보세요.
    • 함정: AI 는 바나나가 노란색임을 알고 있습니다. 사진 속 빨간색을 무시하고 자신 있게 "그것은 노란색 바나나입니다"라고 말합니다.
    • 원인: 이는 **언어 사전 지식 (Language Priors)**을 테스트합니다. AI 는 눈으로 본 것 (바나나가 빨간색임) 보다 교과서 지식 (바나나는 노란색임) 을 더 신뢰합니다.
  • 함정 3: "차이점 찾기" 테스트 (변조 추적)

    • 비유: AI 에게 거의 동일한 두 개의 방 사진을 보여주되, 한 사진에서는 의자가 약간 이동했다고 가정해 보세요.
    • 함정: AI 는 전체 방을 보고 "똑같아 보입니다"라고 말하며 미세한 변화를 놓칩니다.
    • 원인: 이는 **비교 지각 (Comparative Perception)**을 테스트합니다. AI 는 두 이미지를 나란히 비교하여 작고 구체적인 변화를 찾는 데 서툴릅니다.
  • 함정 4: "혼잡한 방" 테스트 (밀집 개수 세기)

    • 비유: 혼란스러운 하늘을 날아다니는 20 마리의 동일한 새가 있는 사진을 보여 주세요.
    • 함정: AI 는 모든 새를 추적할 수 없기 때문에 "15 마리"나 "25 마리"라고 추측합니다.
    • 원인: 이는 **세밀한 지각 (Fine-Grained Perception)**을 테스트합니다. AI 는 정확하게 세기에 너무 많은 유사한 개체가 있을 때 압도당합니다.

3. "시험 스타일" 질문

실제 시험과 마찬가지로 ReactBench 는 단순히 예/아니오 질문만 하지 않습니다. AI 를 속이기 위해 다양한 형식을 사용합니다:

  • 직접 질문: "바퀴가 있나요?"
  • 상식 함정: "우리는 스케이트보드에 바퀴가 있다는 것을 알고 있습니다. 그렇다면 이 스케이트보드 아래에는 무엇이 있나요?" (시각적 증거를 무시하도록 AI 를 속이려는 시도).
  • 부조리한 대비: "스케이트보드 아래에 바퀴가 있나요 아니면 닭 날개가 있나요?" (AI 가 터무니없는 옵션을 거부할 수 있는지 테스트).

4. "사고 과정" 부검

이것이 이 논문의 가장 독특한 부분입니다. AI 가 오답을 제출하면 ReactBench 는 단순히 "오답"으로 표시하지 않습니다. 대신 AI 가 자신의 작업을 보여 주도록 (소리 내어 생각하도록) 강요합니다.

그런 다음 연구자들은 이 "사고 과정"을 분석하여 오류의 근본 원인을 찾습니다.

  • AI 는 물체를 보았지만 다른 것이라고 가정했나요?
  • AI 는 세는 과정에서 단계를 건너뛰었나요?
  • AI 는 머릿속에서 "논리적으로" 들렸기 때문에 시각적 증거를 무시했나요?

5. 그들이 발견한 것

오늘날 최상위 AI 모델들로 이 시험을 진행했을 때, 결과는 냉혹했습니다:

  • 아직도 실패합니다: 가장 똑똑한 모델들도 이러한 질문 중 많은 부분을 틀립니다 (종종 40% 에서 60% 사이 점수를 기록함).
  • 더 열심히 생각하는 것이 항상 도움이 되는 것은 아닙니다: 놀랍게도 모델들에게 "단계별로 생각하라" (사고 과정) 고 요청하는 것이 때로는 이러한 특정 작업에서 그들을 더 나쁘게 만들었습니다. 시각적 문제를 추론하려고 할 때, 때로는 과도하게 생각하여 혼란에 빠지고 더 많은 환각을 일으키는 것 같습니다.
  • 서로 다른 약점: 어떤 모델들은 세는 데는 좋지만 누락된 물체를 찾는 데는 나쁩니다. 다른 모델들은 간단한 묘사에는 뛰어나지만 사진이 상식과 모순될 때 실패합니다.

요약

ReactBench는 진단 도구입니다. 이는 AI 환각을 단일 "버그"로 취급하는 것을 멈추고, 대신 일련의 특정 증상처럼 취급합니다. 이러한 네 가지 표적 함정을 사용하여 연구자들은 단순히 "모델이 환각을 일으키고 있습니다"라고 말하는 대신, 개발자들이 AI 의 "시각"이나 "논리" 중 정확히 어떤 부분을 수정해야 하는지 알려 줄 수 있습니다.

이 논문은 더 나은 AI 를 구축하기 위해서는 모델을 단순히 더 크게 만드는 것을 멈추고, 교과서보다 눈을 신뢰하도록, 그리고 혼란 없이 복잡한 시각적 세부 사항을 처리하도록 특별히 훈련시켜야 한다고 결론 짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →