← 최신 논문
🤖 machine learning

Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction

이 논문은 시각-언어 모델(Vision-Language Model)의 어포던스 예측에서 발생하는 주요 병목 현상이 행동 지식의 부족이 아니라 파트 그라운딩(part grounding)임을 식별하며, 대상 객체의 부위를 명시적으로 지정하는 것이 테스트된 모든 모델에 걸쳐 행동 정확도를 극적으로 향상시킨다는 것을 입증한다.

원저자: Sarthak Sattigeri

게시일 2026-09-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sarthak Sattigeri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 세상을 보는 능력이 점점 좋아지고 있습니다. 로봇은 사진 한 장을 보고도 의자, 컵, 또는 카메라를 식별할 수 있습니다. 하지만 물체를 보는 것과 그것을 어떻게 움직여야 하는지 아는 것 사이에는 간극이 존재합니다. 로봇을 유용하게 만들기 위해서는 로봇이 '어포던스(affordances, 행동 유도성)'를 이해해야 합니다. 이는 단순히 어떤 물체가 무엇을 위한 것인지, 그리고 인간이나 기계가 그것과 어떻게 상호작용해야 하는지를 아는 것을 의미합니다. 만약 로봇이 서랍을 본다면, 그것을 당겨야 한다는 것을 알아야 합니다. 버튼을 본다면, 그것을 눌러야 한다는 것을 알아야 합니다. 이것은 인간에게는 당연해 보이지만, 인공지능에게는 놀라울 정도로 어려운 퍼즐입니다. 연구자들은 시각-언어 모델(이미지를 보고 그에 대한 질문에 답할 수 있는 시스템)을 테스트하여, 이 모델들이 이러한 상호작용을 파악할 수 있는지 확인해 왔습니다. 결과는 실망스러웠는데, 기계들이 종종 올바른 지침을 제시하는 데 실패했기 때문입니다. 큰 의문은 이것이었습니다. 이 모델들이 사물이 작동하는 방식에 대한 기본적인 지식이 부족한 것일까요, 아니면 단지 사진의 엉뚱한 부분을 보고 있는 것일까요?

한 연구자가 카메라, 서랍, 뚜껑 등 19가지의 다양한 물체를 포함하는 특정 과제를 통해 8가지의 서로 다른 인공지능 모델을 테스트하며 이 미스터리를 해결하고자 했습니다. 그들은 모델들에게 간단한 질문을 던졌습니다: 주어진 물체의 사진을 보고, 로봇이 그 물체에 대해 어떤 동작을 수행해야 하는가? 정답은 '밀기(pushing)', '당기기(pulling)', '들기(lifting)'와 같이 제한된 일련의 동작들로 한정되었습니다. 모델들이 대상의 어느 부분을 언급할지 스스로 선택할 수 있게 했을 때, 그들의 성과는 매우 저조했습니다. 실제로 정답이 무언가를 "미는 것(push)"이었을 때, 모델들은 그 단어를 거의 말하지 못했습니다. 밀는 것이 정답이었던 64번의 경우 중, 모델들이 이를 맞춘 것은 단 한 번뿐이었습니다. 나머지 시간 동안 모델들은 상황에 완전히 맞지 않는 동작들을 제안했습니다.

언뜻 보기에 이것은 심각한 지식의 결여처럼 보였습니다. 모델들이 버튼은 눌러야 하고 서랍은 당겨야 한다는 사실을 단순히 모르는 것처럼 보였기 때문입니다. 그러나 연구자가 모델들이 실제로 무엇을 말하고 있는지 자세히 살펴보았을 때, 다른 이야기가 드러났습니다. 모델들은 동작에 대해 혼란을 느끼는 것이 아니라, '대상'에 대해 혼란을 느끼고 있었습니다. 카메라를 보여주고 무엇을 해야 하는지 물었을 때, 모델들은 흔히 버튼을 누르는 법을 설명하기보다 카메라 몸체 전체를 집어 드는 법을 설명하곤 했습니다. 그들은 물체 전체에 대한 합리적인 질문에 답하고 있었지만, 작용이 가해져야 하는 특정 부분을 놓치고 있었던 것입니다. 모델들은 퍼즐의 엉뚱한 조각을 보고 있었습니다.

이 이론을 테스트하기 위해 연구자는 실험 방식을 변경했습니다. 모델들에게 어떤 부분을 논의할지 선택하게 하는 대신, 모델들에게 집중해야 할 특정 부분을 정확히 알려주었습니다. 연구자는 "이 카메라의 버튼을 보세요. 로봇이 그것을 어떻게 해야 할까요?"라고 말했습니다. 변화는 극적이었습니다. 연구자가 특정 부위를 명시하자마자 모델들의 정확도가 크게 뛰어올랐습니다. 모든 모델이 개선되었으며, 성공률은 약 15%의 낮은 수치에서 최고 95%에 가까운 수준까지 상승했습니다. 이전에 "밀기"를 단 한 번도 제안하지 못했던 모델들이 갑자기 거의 매번 정답을 맞혔습니다. 또한 모델들은 선택할 단어 목록을 받지 않았음에도 불구하고, 버튼이 눌릴 때 안쪽으로 어떻게 움직이는지 묘사하며 올바른 언어를 사용하기 시작했습니다.

이 발견은 문제가 물리적 지식의 부족이 아니라, 질문을 올바른 위치에 접지(grounding)하는 데 실패했다는 것을 시사합니다. 모델들은 버튼이 무엇을 위한 것인지 알고 있었습니다. 다만 스스로 이미지 속에서 버튼을 신뢰성 있게 찾아내지 못했을 뿐입니다. 연구자는 또한 로봇이 물체의 어느 지점을 잡아야 하는지 정확히 가리키는 모델의 능력을 테스트했습니다. 실제 사진에서는 일부 모델이 괜찮은 성적을 냈지만, 컴퓨터로 생성된 이미지에서는 어떤 모델도 무작위 추측보다 나은 결과를 보여주지 못했습니다. 이는 약한 고리가 정말로 물체의 중요한 부분을 찾아내는 능력에 있음을 확인시켜 주었습니다.

연구는 또한 연구자가 자신의 테스트를 설정할 때 범했던 몇 가지 실수도 밝혀냈습니다. 연구자는 초기 성공 측정 방식이 어떤 면에서는 너무 쉬워서 모델이 이미지의 중앙을 추측하는 것만으로도 높은 점수를 얻게 했고, 다른 면에서는 동작을 정의하는 방식의 미세한 오류를 처벌함으로써 너무 엄격했다는 것을 깨달았습니다. 이러한 측정 오류를 수정하자 결과는 더욱 명확해졌습니다. 모델들은 물리 법칙을 모르는 것이 아니라, 주의를 기울일 적절한 세부 사항에 집중하는 능력이 부족했던 것입니다.

로봇을 만드는 모든 이들에게 주는 교훈은 실질적이고 구체적입니다. 만약 당신이 로봇이 어떤 물체를 조작하기를 원한다면, 단순히 사진을 건네며 무엇을 해야 하는지 물어서는 안 됩니다. 시스템은 먼저 주의를 기울여야 할 물체의 특정 부분을 식별하는 방법이 필요합니다. 일단 그 부분이 이름 불리면, 인공지능은 그것을 어떻게 움직여야 하는지 확실하게 알려줄 수 있습니다. 모델들은 고장 난 것이 아닙니다. 단지 어디를 보아야 할지 알 수 있도록 약간의 도움이 필요할 뿐입니다. 이 차이는 우리가 로봇 공학의 미래를 생각하는 방식을 바꿉니다. 기계에게 가능한 모든 역학 규칙을 가르치려고 노력하는 대신, 우리는 그저 세상의 올바른 부분을 찾아낼 수 있는 더 나은 도구를 제공해주면 될지도 모릅니다. 지식은 이미 그곳에 있습니다. 단지 올바른 방향으로 향하도록 안내될 필요가 있을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →