SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization
본 논문은 작업 지시와 상식적 지식을 활용하여 보이지 않고 가려진 기능적 객체의 위치를 추론하는 비전-언어 모델의 능력을 평가하는 855 개의 인스턴스로 구성된 새로운 벤치마크인 SceneFunRI 를 소개하며, 이는 현재 최첨단 모델들이 이러한 능력에서 현저히 어려움을 겪고 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
방에 들어와 누군가 "침대 옆에 있는 야간탁은 어디에 있나요?"라고 묻는 상황을 상상해 보세요. 당신은 주변을 둘러보지만, 야간탁은 커다란 옷장 뒤에 완전히 가려져 있어 전혀 보이지 않습니다. 하지만 상식적으로 야간탁은 보통 침대 옆에 놓인다는 것을 알고 있으며, 침대는 볼 수 있습니다. 따라서 당신은 머릿속으로 빈칸을 채워 옷장 뒤에 야간탁이 반드시 있을 만한 위치를 가리킵니다.
이 논문인 SceneFunRI는 컴퓨터에게 바로 그와 같은 정신적 트릭을 가르치는 것에 관한 것입니다.
문제: "보이지 않는" 도전
현재의 AI 모델 (특히 비전 - 언어 모델, VLM) 은 자신의 눈으로 직접 볼 수 있는 것만 신뢰하는 탐정들과 같습니다. 단서가 벽 뒤에 숨겨져 있으면, 그들은 종종 포기하거나 무작위로 추측합니다. 사물이 완전히 보이지 않을 때, 그 사물이 어디에 있는지 "상식"을 활용하여 파악하는 데 어려움을 겪습니다.
연구자들은 SceneFunRI(Reasoning the Invisible, 보이지 않는 것 추론) 라는 새로운 테스트를 개발했습니다.
- 설정: 그들은 특정 사물 (예: 램프나 서랍) 이 완전히 보이지 않는 855 개의 실제 장면을 수집했습니다.
- 작업: AI 에게 방의 사진과 "침대 오른쪽에 있는 야간탁의 서랍을 열어라"와 같은 명령을 제시합니다.
- 목표: AI 는 결코 야간탁을 직접 보지 못한 채, 보이는 침대와 방의 일반적인 배치에 대한 지식을 활용하여 보이지 않는 야간탁의 위치를 가리켜야 합니다.
결과: AI 는 여전히 초보 탐정
연구자들은 이 작업에 대해 다양한 AI 모델을 테스트했습니다. 그 결과는 겸손하게 만들었습니다.
- 최고의 AI: 가장 똑똑한 모델 (Gemini 3 Flash) 조차도 약 **15%**의 경우에만 위치를 "충분히 가까운" 수준으로 맞추었습니다.
- 인간 기준선: 이에 비해 인간은 약 **66%**의 정확도로 맞췄습니다.
- 격차: 이는 AI 가 자신의 앞에 있는 것을 찾아내는 데는 뛰어나지만, 장애물 뒤에 있는 것을 상상하는 데는 매우 서툴다는 것을 보여줍니다.
AI 를 돕기 위한 시도 ("프롬프팅" 실험)
연구자들은 교사가 학생을 돕는 방식과 유사하게 AI 가 더 잘 수행하도록 돕기 위해 세 가지 다른 방법을 시도했습니다.
- 강력한 지시: AI 에게 "보이는 것을 무시하고, 있어야 할 것에 집중하라"고 말합니다.
- 결과: 이는 약간 도움이 되었습니다. 마치 학생에게 "그림만 보지 말고, 이야기를 생각해보라"고 말하는 것과 같습니다.
- 상식 힌트: "콘센트는 보통 구석에 있다"와 같은 구체적인 사실을 AI 에게 제공합니다.
- 결과: 이는 크게 도움이 되지 않았습니다. 마치 학생에게 사실 목록을 건네주되, 그 사실을 특정 방에 어떻게 적용할지 가르치지 않은 것과 같습니다. AI 는 그 사실을 알고 있었지만, 그것을 지도상의 위치로 변환하지는 못했습니다.
- "제거 과정" (SPoE): 이것이 가장 창의적인 접근법이었습니다. AI 에게 즉시 정확한 위치를 추측하도록 요청하는 대신, "뜨겁고 차갑다"는 게임을 하도록 가르쳤습니다.
- 작동 원리: AI 에게 전체 방이 보입니다. 그런 다음 "사물이 왼쪽 절반에 있나요, 아니면 오른쪽 절반에 있나요?"라고 묻습니다. 사물이 있을 수 없는 절반을 제거합니다. 그런 다음 남은 절반을 다시 나눕니다.
- 결과: 이는 놀랍도록 잘 작동했습니다. 불가능한 영역을 서서히 배제함으로써 AI 는 올바른 위치에 훨씬 더 가까워졌습니다. 이는 즉시 정확한 서랍을 추측하는 대신, 방을 하나씩 확인하며 잃어버린 열쇠를 찾는 것과 같습니다.
주요 교훈
이 논문은 현재 AI 모델이 보이지 않는 세계에 대해 "맹목적"이라고 결론 내립니다. 그들은 자신이 보는 것을 설명하는 데는 능숙하지만, 자신이 보지 못하는 것에 대한 정신적 지도를 구축하는 법은 배우지 못했습니다.
연구자들은 AI 가 직접 올바른 위치를 추측하는 것보다 나쁜 추측을 배제하는 것 (예: 지도에서 방을 지우기) 에 실제로 더 능숙하다는 것을 발견했습니다. AI 를 현실 세계에서 진정으로 똑똑하게 만들기 위해서는, 시각적 증거가 부족할 때 불확실성에 편안함을 느끼고 논리를 사용하여 빈칸을 채우는 법을 가르쳐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.