An Exam for Active Observers
이 논문은 현재의 멀티모달 거대 언어 모델들이 인간의 수행 능력과 비교했을 때 반복적인 지각을 요구하는 작업에서 거의 전적으로 실패한다는 점에 근거하여, 이들이 능동적 시각 관찰 능력을 근본적으로 결여하고 있음을 입증하는 벤치마크인 ActiveVision을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
엉망진창인 방을 보고 있다고 상상해 보세요. 카메라가 그 방의 모습을 단 한 장의 정지된 사진으로 찍었습니다. 만약 당신이 컴퓨터에게 그 사진 한 장만을 바탕으로 방을 묘사하라고 요청한다면, 컴퓨터는 "바닥에 옷이 있고 선반에 책이 있습니다"라고 말할지도 모릅니다. 하지만 만약 파란 청바지 더미 아래 숨겨진 특정 빨간 양말을 찾아야 하거나, 엉킨 전선 뭉치 사이를 통과하는 단 하나의 줄기를 추적해야 한다면 어떻게 될까요? 그러기 위해서는 단 한 번만 봐서는 안 됩니다. 눈을 움직이고, 한 지점에 집중하고, 양말이 어디 있을지 추측하고, 다시 보고, 탐색을 조정해야 합니다. 이것을 **능동적 관찰(active observation)**이라고 부릅니다. 이것은 스냅샷을 찍는 것과 실제로 답을 찾아내는 '사냥'을 하는 것의 차이입니다. 인간의 시각과 사고 방식을 연구해 온 과학자들은 수십 년 동안 우리의 뇌가 단순히 빠르게 훑어보는 것이 아니라, 끊임없이 단서를 재검토하는 탐정처럼 작동한다는 사실을 알고 있었습니다.
현재 우리는 멀티모달 거대 언elle 모델(MLLM)이라는 강력한 컴퓨터 뇌를 가지고 있습니다. 이들은 텍스트를 읽고 이미지를 볼 수 있는 AI 시스템으로, 사진을 묘사하거나 간단한 질문에 답하는 테스트에서 완벽한 점수를 받기도 합니다. 하지만 여기서 큰 의문이 생깁니다. 이 AI 모델들이 정말 인간처럼 '보는' 것일까요? 단서를 계속 확인하고, 새로운 가설을 세우며, 숨겨진 세부 사항을 찾아내는 저 탐정 같은 능력을 갖추고 있을까요? 아니면 그저 빠른 스냅샷을 찍고, 추측을 내놓은 뒤, 설령 그것이 틀리더라도 그대로 고수하는 것뿐일까요? 이것이 바로 새로운 논문이 해결하고자 하는 미스터리입니다.
"An Exam for Active Observers"라는 제목의 이 논문은 ActiveVision이라는 새로운 테스트를 소개합니다. 이것은 AI의 본모를 드러내도록 설계된, 일종의 '강화된 틀린 그림 찾기' 게임이라고 생각하면 됩니다. 연구진은 단 한 번의 눈길로는 절대 풀 수 없는 17가지 서로 다른 퍼즐을 만들었습니다. 어떤 과제는 복잡한 패턴 속에 흩어진 도형의 개수를 세게 하고, 어떤 과제는 미로 속을 헤매지 않고 구불구불한 경로를 따라가게 하며, 또 다른 과제는 비슷해 보이는 두 이미지 사이의 아주 미세한 차이를 비교하게 합니다. 핵심은 이 퍼즐들이 단순한 만화가 아니라 실제 엉킨 밧줄이나 항공 지도처럼 실제 사진처럼 보이도록 구현되었다는 점이며, 답을 얻기 위해서는 AI가 반복해서 이미지를 "다시 돌아보며" 확인해야 한다는 것입니다.
연구진이 세계에서 가장 똑똑한 AI 모델들을 테스트에 투입했을 때, 결과는 다소 충격적이었습니다. 가장 뛰어난 모델조차 처참하게 실패했습니다. 가장 높은 추론 노력을 기울인 GPT-5.5조차 퍼즐의 약 **10.6%**만을 해결했습니다. 실제로 17가지 과제 유형 중 11개에서 GPT-5.5는 0점을 기록했습니다. 또 다른 강력한 경쟁자인 Claude Fable 5는 훨씬 더 낮은 성적을 보이며 단 **3.5%**의 문제만을 해결했습니다. 반면, 일반적인 사람들로 구성된 인간 참가자들은 평균 **96.1%**의 문제를 해결했습니다. 격차는 엄청났습니다. 인간은 최고의 AI보다 약 9배나 더 뛰어났습니다.
연구진은 영리한 우회 방법을 시도하기도 했습니다. AI 모델들에게 직접 컴퓨터 코드를 작성하고 실행하게 하여, 스크립트가 대신 '보는' 역할을 할 수 있기를 기대한 것입니다. 이 방법은 조금 도움이 되긴 했지만, 근본적인 문제는 해결하지 못했습니다. 코드 기반 에이전트들은 가장 강력한 에이전트를 사용했을 때 최대 약 **50.6%**의 과제를 해결했지만, 엉킨 루프를 추적하는 것과 같은 어려운 퍼즐에서는 여전히 고전했습니다. 실사 느낌의 이미지들이 표준 컴퓨터 비전 도구로 처리하기에는 너무 복잡했기 때문에 코드가 자주 실패했으며, AI는 코드가 실수를 저질렀다는 사실조차 '보지' 못했습니다.
논문은 결론적으로 현재의 AI 모델들이 본질적으로 "수동적 인지자(passive perceivers)"라고 지적합니다. 이들은 사진을 찍어 데이터 목록으로 변환한 뒤, 그 목록을 바탕으로 답을 내놓으려 할 뿐입니다. 이들에게는 주의력을 능동적으로 재지정하고, 가설을 세우고, 다시 이미지를 확인하는 능력이 부족합니다. 저자들은 AI에게 보는 것과 생각하는 것 사이의 고리를 닫는 법, 즉 반복해서 '보는' 법을 가르치기 전까지는 의료 영상 검사, 공장 부품 검수, 복잡한 환경 탐색과 같이 세심한 관찰이 필요한 실제 업무에서 AI가 신뢰를 얻기는 어려울 것이라고 제언합니다. "ActiveVision" 시험은 AI가 다른 모든 면에서 똑똑할지라도, '제대로 보는' 인간의 단순한 행위에는 여전히 서툴다는 사실을 입증했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.