← 최신 논문
💬 NLP

Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

본 논문은 비전-언어 모델에 실제 이미지 컨텍스트를 제공하는 것이 종종 우연한 시각적 단서에 대한 민감도를 유발하여 구체성과 이미지성에 대한 어휘적 판단의 성능을 저하시킨다는 것을 보여주며, 이러한 작업에 시각적 입력이 언제 반영되어야 하는지에 대한 보다 나은 보정이 필요함을 시사한다.

원저자: Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 단어가 얼마나 '구체적'이거나 '상상하기 쉬운지' 추측해야 하는 시험을 치른다고 상상해 보세요. 예를 들어, '사과'라는 단어는 상상하기 쉽나요? 네. '자유'라는 단어는 상상하기 쉽나요? 그다지 아닙니다.

이제 누군가 단어 옆에 무작위 이미지를 보여 주는 동안 이 시험을 치른다고 상상해 보세요.

이 논문은 현대 AI 모델 (비전 - 언어 모델이라고 함) 이 이 시험을 치를 때 어떤 일이 일어나는지 조사합니다. 연구자들은 AI 에게 이미지를 보여 주는 것이 단어 이해를 돕는지, 아니면 오히려 주의를 산만하게 하여 더 나쁜 답변을 내놓게 하는지 확인하고 싶었습니다.

아래는 그들의 발견을 간단한 비유로 정리한 내용입니다:

1. 설정: '산만한 교실'

연구자들은 AI 에게 단어 목록을 제시하고, 단어들이 얼마나 '구체적인지 (실제/만져지는지)' 또는 '상상하기 쉬운지'를 척도로 평가하도록 요청했습니다.

  • 대조군: AI 는 단어만 보거나 (또는 빈 흰색 사각형과 함께) 보았습니다.
  • 실험군: AI 는 단어 그리고 인터넷에서 검색된 실제 사진을 함께 보았습니다.

큰 놀라움:
"AI 에게 '개'의 사진을 보여주면 '개'가 구체적인 단어라는 것을 더 잘 알게 되겠지"라고 생각할 수 있습니다. 그리고 단순하고 구체적인 단어의 경우, AI 는 그럭저럭 잘 수행했습니다.

하지만 추상적인 단어 (예: '정의', '자유', '자연') 의 경우, 사진은 AI 를 더 나쁘게 만들었습니다.

  • 비유: 수학 시험을 치르는 학생을 상상해 보세요. "2+2 는 얼마인가?"라는 질문에 계산기 사진을 건네주면 정답을 맞힐 수 있습니다. 하지만 "'정직'이라는 개념을 시각화하기가 어렵거나 쉬운가?"라고 묻고 일몰 사진을 건네주면 학생은 혼란스러워집니다. 그들은 아름다운 일몰을 보며 "오, 이건 매우 구체적이고 현실적이야!"라고 말하고, 단어 자체는 그렇지 않음에도 불구하고 '정직'이라는 단어에 '현실적'이라는 점수를 높게 줍니다. 이 사진은 잘못된 답을 외치는 시끄러운 옆집 이웃처럼 작용했습니다.

2. '인간 vs 로봇' 비교

이것이 단순히 이상한 AI 의 문제가 아님을 확인하기 위해, 연구자들은 실제 인간에게도 같은 시험을 치르게 했습니다.

  • 결과: 인간도 사진에 약간 산만해졌지만, 완전히 무너지지는 않았습니다. 그들은 사진이 단순한 장식품임을 알았습니다.
  • AI 의 문제: 반면 AI 는 사진을 확실한 증거로 취급했습니다. AI 는 '개'의 사진 (단어 '개'가 현실적임을 증명) 과 '일몰'의 사진 (단어 '자유'와는 전혀 관련 없음) 의 차이를 구별하지 못했습니다. AI 는 단어의 의미보다는 사진의 내용에 기반하여 추측하기 시작했습니다.

3. 왜 이런 일이 일어났을까? (내부 '오작동')

연구자들은 AI 의 '뇌' (내부 데이터 계층) 를 들여다보며 무엇이 잘못되었는지 확인했습니다.

  • 전환: AI 가 실제 사진을 보았을 때, 단어에 대한 내부 이해가 실제로 변화했습니다. 마치 AI 의 뇌가 갑자기 "아, 이제 사진을 보고 있으니 읽은 것이 아니라 보이는 것에 기반하여 답해야겠다"라고 결정한 것과 같았습니다.
  • 민감도: AI 는 ' spurrious cues (허위 단서)'에 과도하게 민감해졌습니다. 이는 사진 속 단어와 전혀 관련 없는 무작위 세부 사항에 집착한다는 것을 fancy 한 표현으로 이르는 것입니다. 추상적인 단어의 경우, 이로 인해 AI 는 단어의 '현실성'을 과대평가하게 되었습니다.

4. 해결책: '선생님의 메모'

AI 가 산만해지고 있으므로, 연구자들은 간단한 트릭을 시도했습니다. 마치 선생님으로부터 받은 메모처럼 프롬프트에 작은 지시를 추가했습니다:

"이 사진은 단어와 관련이 없을 수 있습니다. 사진을 무시하고 단어 자체만 평가해 주세요."

결과:

  • 이 간단한 메모는 정신적 필터처럼 작용했습니다. AI 에게 산만한 이웃을 보지 말고 시험 문제에 집중하라고 알려 준 것입니다.
  • AI 의 성능이 특히 까다로운 추상적인 단어에서 크게 향상되었습니다. 모든 것을 완벽하게 고친 것은 아니지만, AI 가 가장 큰 실수를 하는 것을 막았습니다.

요약

이 논문은 우리가 종종 AI 에게 사진을 주면 더 똑똑해질 것이라고 가정하지만, 때로는 사진이 실제로 함정일 수 있다고 결론 내립니다.

  • 구체적인 사물의 경우 (예: '고양이'라는 단어를 식별하는 데 도움이 되는 고양이 사진), 이미지는 도움이 됩니다.
  • 추상적인 사물의 경우 (예: '평화'라는 단어를 식별하는 데 도움이 되는 폭풍 사진), 이미지는 AI 를 혼란스럽게 하여 잘못된 단서에 의존하게 만듭니다.

해결책은 사진 사용을 중단하는 것이 아니라, AI 에게 언제 사진을 무시해야 하는지 가르치는 것입니다. 좋은 학생이 언제 도표를 보고 언제 눈을 감고 개념에 대해 생각해야 하는지 아는 것처럼, 이러한 AI 모델도 시각적 맥락이 유용한 힌트인지 아니면 단순한 잡음인지 언제인지 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →