Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms
이 논문은 추론 토큰 수를 반응 시간의 대리 지표로 사용하여 시각-언어 모델이 인간과 유사한 시각 탐색 행동을 보이는지 조사하며, 모델들이 평탄한 특징 탐색 비용 및 상승하는 결합 비용과 같은 핵심적인 인간의 징후를 재현하면서도, 타겟 존재 시의 기울기, 수 세기 정확도, 그리고 적응적 숙고 전략에서 뚜렷한 인지적 차이를 드러낸다는 점을 발견하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 복잡한 그림 속에서 "월리를 찾아라!" 게임을 하고 있다고 상상해 보세요. 만약 당신이 파란색 모자들 사이에서 빨간색 모자를 찾고 있다면, 주변에 사람이 아무리 많더라도 당신의 뇌는 그것을 즉각적으로 포착합니다. 하지만 만약 당신이 찾는 것이 '빨간색'이면서 동시에 '별 모양'인 모자라면 (다른 모든 사람들이 파란색 모자나 빨간색 원형 모자를 쓰고 있는 상황에서), 당신의 뇌는 그림 속 사람들을 한 명씩 차례대로 훑어야 합니다. 그림 속에 사람이 많아질수록 당신이 목표물을 찾는 데 걸리는 시간도 길어집니다.
이것은 심리학자들이 인간의 주의력이 어떻게 작동하는지 이해하기 위해 수십 년 동안 사용해 온 전형적인 "시각 탐색(Visual Search)" 게임입니다. 한 새로운 논문은 흥ًا로운 질문을 던집니다. AI 모델도 인간과 같은 방식으로 이 게임을 수행하는가?
AI는 심장 박동도 없고 스톱워치도 없기 때문에, 연구자는 AI가 이미지를 보고 얼마나 오래 "생각"했는지 측정할 수 없었습니다. 대신, 그들은 영리한 트릭을 사용했습니다. 바로 AI가 정답을 내놓기 전까지 생성하는 **"생각 토큰(thinking tokens)"**의 개수를 세는 것이었습니다. 이 토큰들을 AI의 내부 독백이나 "연습장"에 적는 메모라고 생각하면 됩니다.
- 적은 토큰 = AI가 이미지를 쓱 보고 "쉬워, 보여요"라고 말함. (빠른 반응).
- 많은 토큰 = AI가 긴 이유를 나열하고, 이미지를 다시 확인하며, 정답에 대해 고민함. (느리고 노력이 필요한 반응).
이 연구의 결과는 다음과 같습니다. 이해를 돕기 위해 쉬운 비유를 사용하겠습니다.
1. "팝아웃(Pop-out)" vs "건더기 찾기(Needle in a Haystack)"
인간의 행동: 목표물이 명확할 때(파란 모자들 사이의 빨간 모자), 인간은 즉시 찾아냅니다. 하지만 까다로울 때(빨간 원들 사이의 빨간 별), 군중이 커질수록 인간은 더 오래 걸립니다.
AI의 행동: 가장 똑똑한 AI 모델들도 정확히 똑같은 행동을 보였습니다.
- 쉬운 "팝아웃" 과제에 대해서는, 아이템이 그림 속에 얼마나 많든 상관없이 AI는 아주 적고 일정한 양의 생각 토큰을 사용했습니다.
- 까다로운 "건더기 찾기" 과제에 대해서는, 그림이 더 붐빌수록 AI의 토큰 수가 증가했습니다.
핵-심 요점: AI의 내부 노력 곡선은 인간의 반응 시간 곡선과 매우 흡사합니다. 이는 이 AI들이 "생각"할 때, 마치 인간이 방을 훑어보는 것처럼 실제로 항목을 하나씩 순차적으로 탐색한다는 것을 시사합니다.
2. "빈 방"의 역전 현상
인간의 행동: 만약 당신이 특정 아이템을 찾고 있는데 그것이 없다면, 확실히 하기 위해 군중 속의 모든 사람을 확인해야 합니다. 이것은 많은 시간이 걸립니다. 만약 아이템이 있다면, 찾는 즉시 멈출 수 있습니다. 따라서 인간은 정답이 "아니오(없음)"일 때 더 많이 노력합니다.
AI의 행동: AI는 이 흐름을 뒤집었습니다. AI는 정답이 "예(있음)"이고 아이템을 찾았을 때 더 많이 작업했고, 정답이 "아니오"일 때 적게 작업했습니다.
핵-심 요점: AI는 "하나를 찾으면, 그것을 정당화한다"는 전략을 가진 것으로 보입니다. 일단 목표물을 발견하면, AI는 그것을 재확인하고 설명하는 데 많은 토큰을 소비합니다. 하지만 즉시 보이지 않는다면, 전체 이미지를 인내심 있게 훑는 대신 빠르게 "아니오"라고 추측해 버릴 수도 있습니다.
3. "숫자 세기"의 초능력
인간의 행동: 만약 당신에게 바쁜 그림 속에서 5개나 6개의 아이템을 세어보라고 한다면, 인간은 종종 숫자를 놓치거나 실수를 합니다. 우리 뇌는 머릿속에 숫자를 유지하는 데 피로를 느낍니다.
AI의 행동: AI 모델들은 숫자를 세는 데 완벽했습니다. 그림 속에 많은 아이템이 있는 상황에서도 숫자를 놓치지 않았습니다.
핵-심 요점: AI는 인간처럼 지치거나 실수를 하는 대신, 단지 더 많은 에너지를 썼습니다. AI는 실수를 저지르는 대신, 추가적인 컴퓨팅 파워를 사용하여 과제를 끝까지 밀고 나갔습니다. 즉, "정확도"를 위해 "노력"을 맞바꾼 것입니다.
4. "기울어진 막대" 퍼즐
인간의 행동: 인간은 기울어진 막대들 사이에서 기울어진 막대를 찾는 것(팝아웃)은 잘하지만, 기울어진 막대들 사이에서 똑바른 막대를 찾는 것(어려움)은 매우 못합니다.
AI의 행동: AI 모델들 역시 한쪽 방향을 더 어렵게 느꼈지만, 그 어려움을 표현하는 방식은 모델마다 달랐습니다:
- 모델 A (밀어붙이기 유형): 어려운 과제에 엄청난 양의 생각 토큰을 쏟아부었지만, 여전히 정답을 맞혔습니다.
- 모델 B (지름길 유형): 어려운 과제에 거의 토큰을 쓰지 않았고, 단순히 정답을 틀렸습니다 (기울어진 막대가 없는데도 있다고 환각 현상을 일으킴).
핵-심 요점: 동일한 시각적 난이도가 모델의 "성격"에 따라 "더 열심히 노력하기" 혹은 "포기하고 추측하기"라는 서로 다른 방식으로 해결됩니다.
종합적인 결론
이 논문은 현대의 AI 모델들이 인간의 시각 탐색 "지문"을 갖게 되었다고 결론짓습니다. AI는 언제 빠르게 스캔하고 언제 천천히 스캔해야 하는지 알고 있습니다. 하지만 그들은 인간은 아닙니다. 그들은 인간과 같은 방식으로 지치지 않으며, 검색을 멈추는 방식도 다르고, "어려운" 과제를 마주했을 때 더 열심히 밀고 나가거나 혹은 처참하게 실패하는 방식으로 대응합니다.
연구자는 AI가 무엇을 대답하는지(결과)뿐만 아니라, 얼마나 많이 생각하는지(토큰 수)를 관찰함으로써, 우리는 그들의 "시각" 속에 숨겨진 메커니즘을 볼 수 있다고 주장합니다. 이것은 자동차가 어디로 가는지(결과)만 보는 것이 아니라, 엔진의 웅웅거리는 소리(과정)를 들어서 자동차가 어떻게 작동하는지 이해하는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.