← 최신 논문
💻 computer science

Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models

본 논문은 CVPR 2026 DataCV 챌린지를 위한 학습이 불필요한 프레임워크를 제시하며, 이는 착시 인식 이미지 전처리, 착시 방지 프롬프팅, 다수결 앙상블을 결합하여 기억된 사실에 대한 편향을 극복함으로써 고전적 시각 착시를 이해하는 비전 - 언어 모델의 정확도를 크게 향상시킵니다.

원저자: Junli Zha, Jiahui Wang, Xinkai Lu, Jinbo Wang

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junli Zha, Jiahui Wang, Xinkai Lu, Jinbo Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 독서량이 풍부한 로봇에게 그림을 보여주고 있습니다. 두 줄을 가리키며 "이 두 줄은 길이가 같나요?"라고 물어봅니다.

실제 세상에서는 아마도 유명한 착시 현상 (예: 뮐러-라이어 착시) 을 보고 있는 것일 수 있습니다. 이 착시에서는 선의 끝부분에 있는 화살표가 한쪽 선이 다른 쪽보다 더 길다고 뇌를 속이지만, 실제로는 두 선이 완전히 동일합니다.

여기서 문제가 발생합니다. 이 논문 속 로봇은 스스로에게 너무 똑똑합니다. 화면의 픽셀을 실제로 '보아' 선의 길이를 측정하는 대신, 그 그림을 교과서에서 본 적이 있는 유명한 속임수로 인식합니다. 로봇은 "아, 이거 알아요! 뮐러-라이어 착시군요. 사실 두 줄은 길이가 같아요"라고 말하며 정답을 내놓습니다.

하지만 반전이 있습니다. 그림을 약간 바꿔서 두 줄이 실제로는 길이가 다르도록 (착시를 깨뜨리는) 변경하면, 로봇은 여전히 두 줄이 같다고 말합니다. 왜일까요? 로봇이 새로운 현실을 '눈'으로 보는 것이 아니라, 그 속임수에 대한 '기억'에 의존하고 있기 때문입니다. 이는 수학 문제를 푸는 법을 배우지 않고 정답지 외우기만 한 학생과 같습니다.

해결책: "속임수꾼을 속이기"

이 논문의 저자들은 로봇을 재학습시킬 필요 (즉, 뇌를 다시 연결하는 것과 같은 작업) 없이 이 '기억 대 시야' 문제를 해결할 시스템을 구축했습니다. 대신 그들은 로봇이 인간처럼 그림을 새롭게 보도록 강제하는 세 가지 교묘한 방법을 사용했습니다.

1. "마법 지우개" (이미지 전처리)

연구팀은 로봇에게 "착시를 무시하라"고 요청하는 대신, 착시가 사라지도록 그림을 물리적으로 변형했습니다.

  • 비유: 두 사과 크기를 비교하려는데 하나는 어둡고 혼란스러운 그림자에, 다른 하나는 밝은 빛에 놓여 있다면 어느 것이 더 큰지 판단하기 어렵습니다. 로봇에게 그림자가 사라진다고 '상상'하라고 요청하는 대신, 팀은 실제로 그림에서 사과를 잘라내어 평범한 흰색 테이블 위에 나란히 놓았습니다.
  • 구현 방법: 다양한 유형의 착시에 대해 그들은 구체적인 도구를 사용했습니다.
    • 색깔 착시의 경우: 색깔이 있는 띠만 잘라내어 회색 배경 위에 나란히 놓았습니다.
    • 크기 착시의 경우: 물체를 분리하여 완벽하게 겹치도록 '거울'처럼 반사시켰습니다. 크기가 다르면 틈이 생겼고, 같다면 자연스럽게 섞였습니다.
    • 직선 착시의 경우: 자 역할을 하는 파란색 선으로 격자를 그림 위에 그렸습니다.

이미지를 변경함으로써 로봇의 기억을 자극하는 '혼란스러운 맥락'을 제거했습니다. 이제 로봇은 실제 시각적 증거를 보아야만 합니다.

2. "엄격한 선생님" (반착시 프롬프트)

그림이 정리되면, 팀은 로봇에게 매우 구체적인 일련의 지시사항 (프롬프트) 을 제공합니다.

  • 비유: 이는 선생님에게 "책에서 읽은 내용으로 추측하지 마. 방금 종이 위에 그린 자를 봐. 선을 자와 비교해서 네가 '보는' 것을 말해"라고 말하는 것과 같습니다.
  • 전략: 프롬프트는 착시의 이름을 명시적으로 언급 (예: "이것은 뮐러-라이어 착시입니다") 하여 로봇을 깨우지만, 즉시 화살표를 무시하고 수평선만 비교하라고 지시합니다. 이는 로봇이 '사실 회상'에서 '시각적 비교 수행'으로 전환하도록 강제합니다.

3. "심사 위원회" (다수 투표 앙상블)

깨끗한 그림과 좋은 지시사항이 있더라도 로봇은 때때로 '나쁜 날'을 보내거나 무작위 오류에 혼란을 겪을 수 있습니다.

  • 비유: 한 사람에게 질문하면 틀릴 수 있습니다. 하지만 서로 다른 다섯 사람에게 같은 질문을 하고 다수결로 답을 내면 정답을 얻을 가능성이 훨씬 높아집니다.
  • 전략: 시스템은 로봇에게 같은 질문을 다섯 번 물어보고 가장 자주 나오는 답을 선택합니다. 이는 무작위 오류를 완화합니다.

결과

팀이 이 시스템을 630 개의 까다로운 이미지가 포함된 대회에서 테스트했습니다.

  • 속임수 없이: 로봇은 고전하며 종종 외운 지식에 갇혔습니다.
  • 속임수를 사용할 때: 시스템은 공식 테스트 세트에서 **90.48%**의 정답률을 보였습니다. 인간이 검증한 작은 하위 집합에서는 **98.41%**의 정답률을 기록했습니다.

그들은 대회에서 2 위를 차지했는데, 우승자와는 아주 미세한 차이였습니다. 이는 이러한 문제를 해결하기 위해 더 똑똑한 새로운 로봇을 만들 필요가 없음을 증명했습니다. 기존 로봇에게 더 나은 그림을 보여주고 그것을 보는 방법에 대한 더 명확한 지시를 제공하면 충분합니다.

결론

이 논문은 똑똑한 AI 가 착시 현상에 혼란을 겪는 것은 보통 이미 알고 있는 내용을 바탕으로 '너무 많이 생각하기' 때문임을 보여줍니다. 해결책은 새로운 사실을 가르치는 것이 아니라, 진실이 명확해지도록 이미지를 정리하고, 기억이 아닌 이미지를 보도록 지시하며, 확실히 하기 위해 다섯 번 물어보는 것입니다. 이는 AI 가 세상을 더 명확하게 보게 하는 간단하고 실용적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →