VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following
본 논문은 최첨단 비전-언어 모델이 국소적 방해 요인을 극복하지 못하는 근본적인 한계로 인해 시각적 경로 추적을 수행하는 데 어려움을 겪으며, 이는 확장, 추론 개입, 명시적 지시에도 불구하고 지속되는 병목 현상임을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
점과 점을 연결하는 게임을 매우 똑똑한 로봇과 한다고 상상해 보세요. 당신은 특정 빨간 점을 가리키며 "이 구불구불한 선을 끝까지 따라가서 지나치는 모든 점의 색을 말해줘"라고 말합니다.
로봇이 이를 쉽게 해낼 것이라고 기대할 것입니다. 하지만 이 논문에 따르면, 가장 첨단인 AI 모델들(시각 - 언어 모델 또는 VLM 이라고 함) 도 이 간단한 작업에 매우 서툴다고 합니다. 그들은 단순히 무작위 실수를 하는 것이 아니라, 당신이 따라가라고 지시한 선과 거의 똑같이 보이는 다른 선으로 주의가 산만해져서 선을 바꿔 따라갑니다.
연구자들이 발견한 내용을 간단한 비유로 정리해 보겠습니다.
1. '혼잡한 기차역' 문제
연구자들은 이러한 AI 들이 선을 얼마나 잘 추적하는지 보기 위해 두 가지 주요 테스트를 만들었습니다.
- 회로 테스트: 여러 개의 전선이 같은 색으로 나란히 놓인 지저분한 전기 보드를 상상해 보세요. AI 에게 '포트 7'에 연결된 전선을 따라가라고 요청합니다.
- 소용돌이 테스트: 사탕 지팡이 모양의 나선형 계단 하나에 색깔 점들이 찍혀 있다고 상상해 보세요. AI 에게 계단 아래에서 위로 올라가라고 요청합니다.
결과: AI 는 올바르게 시작하지만 거의 즉시 혼란에 빠집니다. 따라가야 할 선 바로 옆에 다른 전선이나 나선형 구석이 있다면, AI 는 종종 그 이웃 선으로 '점프'합니다. 마치 숲속에서 단일 길을 따라가려는 등산객이 몇 발자국 동안 두 길이 나란히 이어질 때, 실수로 잘못된 길로 발을 내딛고 계속 걷는 것과 같습니다.
2. '쌍둥이' 산만함
이 논문은 AI 가 작업이 너무 어렵거나 '보지' 못해서 실패하는 것이 아니라, 국소적 경쟁 때문에 실패한다고 발견했습니다.
이렇게 생각해 보세요: 조용한 방에서 친구의 말을 듣는 것은 쉽습니다. 이제 친구가 말하고 있는데, 바로 옆에 똑같은 옷을 입고 똑같은 목소리로 똑같은 말을 하는 쌍둥이가 있다고 상상해 보세요. 친구가 누구인지 알고 있더라도, 당신의 뇌는 혼란을 겪어 쌍둥이의 말에 집중하기 시작할 수 있습니다.
연구자들은 '이웃' 선이 '목표' 선과 매우 비슷할 때 (같은 색, 같은 각도, 같은 모양), AI 의 주의가 이웃으로 쏠린다는 것을 발견했습니다. AI 는 안개 속에서 길을 잃는 식으로 '추적'을 잃는 것이 아니라, 잘못된 경로가 국소적으로 너무 매력적으로 보이기 때문에 적극적으로 잘못된 경로를 선택합니다.
3. 왜 '더 열심히 생각하기'가 도움이 안 되는가
연구자들은 AI 에게 '단계별로 생각하라' (추론이라는 기술) 고 요청함으로써 이를 해결하려 했습니다. AI 가 잠시 멈추고 더 자세히 살펴보고 "잠깐, 그건 잘못된 선이야"라고 말하길 바랐습니다.
비유: 길을 잃은 관광객에게 어느 방향으로 가야 할지 '더 열심히 생각해보라'고 요청하는 것과 같습니다. 관광객은 지도 (시각적 선) 를 보는 대신, "보통 도로는 이렇게 굽는다"거나 "태양이 왼쪽에 있으니 오른쪽으로 가야 한다"는 일반적인 규칙을 기반으로 추측하기 시작합니다.
논문의 발견은 다음과 같습니다.
- 추론이 시력을 고치지 못함: AI 는 선을 올바르게 추적하기 시작하지 않았습니다. 대신 '단축키'나 추측을 사용하기 시작했습니다. 예를 들어, 나선형 테스트에서 일부 AI 는 선을 추적하는 것을 멈추고 나선의 모양을 기반으로 점의 순서를 추측했습니다 (예: "내부 원이 빨간색이므로 다음 것은 파란색이어야 한다").
- 비용이 더 많이 듦: AI 가 '생각'하려고 할 때, 인간이 "빨강, 파랑, 초록"이라고 말하기 위해 10 분 동안 혼자 말하듯 막대한 양의 컴퓨팅 파워를 소모했지만, 여전히 정답을 틀렸습니다.
- 지시가 실패함: 연구자들이 AI 에게 "비슷해 보여도 선을 바꾸지 마라"는 엄격한 규칙책을 주더라도, AI 는 여전히 규칙을 무시하고 잘못된 선으로 점프했습니다.
4. '큰 뇌' 신화
보통 AI 가 실수를 하면 모델이 너무 작기 때문이라고 가정합니다. "뇌만 더 크게 만들면 올바르게 할 것이다"라고 생각합니다.
연구자들은 작은 모델부터 거대 모델 (최대 2,350 억 개의 파라미터) 까지 다양한 모델을 사용하여 이를 테스트했습니다.
- 결과: 더 큰 모델이 약간 더 잘했지만, 그 차이는 크지 않았습니다. 가장 크고 비싼 모델조차도 '혼잡한 기차역'에서 길을 잃었습니다. 뇌를 더 크게 만드는 것이 엉킨 실 속에서 단일 실을 붙잡아 두는 더 나은 능력을 주지는 못했습니다.
5. 현실 세계의 혼란
마지막으로 연구자들은 공장의 꼬인 케이블이나 복잡한 지하철 노선도 같은 실제 이미지로 이를 테스트했습니다.
- 발견: 동일한 문제가 발생했습니다. AI 가 세 노선이 교차하는 역을 통과하는 지하철 노선을 추적하거나, 매듭을 통과하는 케이블을 따라가려 할 때, 계속해서 잘못된 선으로 전환했습니다. '점프' 행동은 가짜 테스트에서의 결함이 아니라, 실제 혼란스러운 상황에서도 발생합니다.
결론
이 논문은 현재 AI 모델이 사물이 '무엇'인지 인식하는 데는 뛰어나지만 (예: "저것은 지하철 노선도입니다"), 사물을 '따라가는' 데는 놀라울 정도로 서툴다고 결론 내립니다.
그들은 유사해 보이는 경로가 바로 옆에 있을 때 한 경로에 주의를 고정시키는 특정 '근육'이 부족합니다. 이러한 '시각적 쌍둥이'를 무시할 수 있는 전용 메커니즘을 갖춘 AI 가 구축될 때까지, 그들은 가장 간단한 선 따라가기 게임에서도 계속 길을 잃을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.