← 최신 논문
💻 computer science

Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions

이 논문은 훈련 없이도 오프더셸 비전 - 언어 모델에 이미지 조작 도구와 라우팅 프롬프트를 결합한 프레임워크를 도입하여, 광학적 착시 현상에서 모델이 보이는 체계적인 편향을 해결하고 구조적으로 새로운 착시 유형에서도 일관된 성능을 달성하는 방법을 제시합니다.

원저자: Xuesong Wang, Harry Wang

게시일 2026-04-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuesong Wang, Harry Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: 인공지능은 왜 착시에 속을까요?

상상해 보세요. 두 개의 원이 있는데, 하나는 주변에 작은 원들이 있고 다른 하나는 큰 원들이 있습니다. 실제로는 두 원의 크기가 똑같지만, 주변 원들의 크기 차이 때문에 한쪽이 더 커 보이는 '에빙하우스 착시' 그림이 있습니다.

사람은 "아, 이건 착시구나, 둘 다 똑같은데 더 커 보이는구나"라고 알지만, 최신 인공지능 (VLM) 은 무조건 "저게 더 크다!"라고 답합니다.

  • 왜 그럴까요?
    인공지능은 학습할 때 "착시 그림"을 볼 때마다 "이건 착시야, 더 커 보여!"라고 배웠기 때문입니다. 그런데 연구진은 그림을 조작해서 "사실은 크기가 똑같은데 착시처럼 보이는" 그림을 만들어 냈습니다.
    인공지능은 그림을 보고 "오, 이건 착시 그림이네!"라고 생각하자마자, 눈앞의 실제 증거 (크기가 같다) 를 무시하고 학습했던 "착시 = 더 크다"라는 기억을 믿어버립니다. 마치 과거의 편견이 현재의 사실을 덮어버리는 것과 같습니다.

2. 해결책: "도구 상자"를 준 탐정

이 문제를 해결하기 위해 연구진은 인공지능에게 모델을 재학습시키지 않고, 대신 **"도구 상자"**를 주었습니다.

  • 비유: 인공지능이 혼자서 그림을 보고 추측하는 대신, 현미경, 자, 가위, 색칠 도구를 들고 있는 꼼꼼한 탐정이 된 것입니다.
  • 어떻게 작동하나요?
    1. 질문 분류: "이건 크기 비교 문제인가, 선의 직선성 문제인가?"를 먼저 파악합니다.
    2. 도구 사용:
      • 자 (선 그리기): "이 선이 진짜로 구부러졌나? 자를 대고 확인해 보자."
      • 가위 (자르기): "이 부분을 잘라내서 확대해 보자."
      • 비교하기: "두 부분을 나란히 붙여서 똑같은지 확인해 보자."
    3. 기록 남기기: 도구를 쓸 때마다 새로운 이미지가 만들어지고, 이 모든 과정이 **변하지 않는 기록 (영구 문서)**으로 남습니다. 탐정은 나중에 "아, 내가 아까 그 부분을 잘라봤을 때 이렇게 보였지?"라고 다시 확인하며 논리를 이어갑니다.

이 방식의 핵심은 **"어떤 착시이든 똑같은 도구 (자, 가위 등) 를 쓰되, 어떻게 쓰느냐는 인공지능이 스스로 판단하게 한다"**는 점입니다.

3. 놀라운 결과: 새로운 착시도 해결하다

연구진은 이 방법을 테스트했습니다.

  • 결과: 인공지능은 훈련받지 않은 완전히 새로운 형태의 착시 그림 (예: 세로로 된 착시를 가로로 바꾼 것) 을 만나도, "자"와 "가위"라는 기본 도구를 올바르게 사용하여 정답을 맞혔습니다.
  • 의미: 마치 레고 블록을 가지고 있는데, 새로운 모양을 만들 때 새로운 블록을 사지 않고 기존 블록을 잘 조합해서 해결하는 것과 같습니다.

4. 인공지능이 여전히 가진 세 가지 '아픈 점'

하지만 인공지능은 완벽하지 않았습니다. 연구진은 세 가지 재미있는 (하지만 문제적인) 사실을 발견했습니다.

  1. "네, 착시입니다!"라고 너무 자주 외치는 버릇 (긍정 편향)

    • 인공지능은 "착시일지도 모른다"는 생각보다 **"무조건 착시야!"**라고 결론 내리는 경향이 매우 강합니다. 마치 "모든 사람이 도둑일지도 모른다"고 의심하는 형사처럼, 증거가 없어도 "착시다"라고 단정 짓습니다. 이는 학습 데이터에 '진짜 착시'가 너무 많아서 생긴 문제입니다.
  2. 눈은 정확하지만, 머리는 멍청함 (공간 정확 vs 논리 부재)

    • 인공지능은 를 그려서 "이 선이 0.1 픽셀 구부러졌다"는 것을 정확하게 찾아냅니다. 하지만 막상 그 결과를 보고 결론을 내릴 때는 **"아, 0.1 픽셀 차이니까 무시하자. 원래는 똑같은 거야"**라고 자기 스스로의 증거를 무시하고 과거의 편견으로 돌아갑니다.
    • 비유: 정밀한 측정기를 들고 있는데, 측정 결과가 나오면 **"아, 이 정도 차이는 실수겠지"**라고 무시해 버리는 것입니다.
  3. 이미지 압축에 너무 민감함

    • 인터넷에 있는 그림은 화질이 조금 깨져 있거나 (JPEG 압축), 색상이 미세하게 달라져 있는 경우가 많습니다. 인공지능은 이 미세한 노이즈를 보고 "아, 여기 경계선이 있네!"라고 착각하거나, "색이 다르네!"라고 과장해서 반응합니다. 마치 먼지 하나에 놀라 비명을 지르는 사람과 같습니다.

5. 결론: 무엇을 배웠나요?

이 연구는 **"인공지능이 착시를 못 푸는 건 눈이 나빠서가 아니라, '생각하는 습관'이 잘못되었기 때문"**임을 보여줍니다.

  • 인공지능은 **그림을 그리는 능력 (도구 사용)**은 훌륭합니다.
  • 하지만 그 결과를 믿고 결론을 내리는 능력은 학습된 편견에 너무 의존합니다.

따라서 인공지능을 더 똑똑하게 만들려면, 단순히 모델을 더 크게 키우는 것보다 **"착시처럼 보이지만 사실은 아닌 (거짓) 사례"**를 더 많이 가르쳐서 편향을 고쳐주는 것이 중요하다는 교훈을 줍니다.


한 줄 요약:

"인공지능에게 자, 가위, 돋보기 같은 도구를 주면 착시 그림을 잘 분석할 수 있지만, 과거의 편견 때문에 스스로 찾은 증거를 믿지 못한다는 사실을 발견했습니다. 이제부터는 인공지능에게 **'눈을 뜨고 생각하라'**고 가르쳐야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →