← 최신 논문
💻 computer science

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

본 연구는 1인칭 시점 로봇 이미지로부터 근접 공간 위험(proxemic risk)을 평가하기 위한 오픈 소스 시각-언어 모델들을 평가하며, 미세 조정(fine-tuning)은 전반적으로 완만한 이득만을 제공하는 반면, 고급 프롬프팅은 Qwen-VL과 같은 특정 모델에서 고위험 탐지를 유의미하게 향상시키지만, 올바른 안전 분류가 반드시 정확한 공간적 접지(spatial grounding)와 상관관계를 갖는 것은 아니라는 점을 밝혀냈다.

원저자: Vladyslava Rudas, Dmytro Kuzmenko

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vladyslava Rudas, Dmytro Kuzmenko

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 북적이는 커피숍을 걸어 다니는 법을 가르친다고 상상해 보세요. 단순히 테이블을 보는 것을 넘어, 로봇이 주변 공간을 '느끼길' 원합니다. 이것이 바로 **근접학(proxemics)**의 세계입니다. 근접학은 인간이 편안함을 느끼기 위해 얼마나 많은 개인 공간이 필요한지를 연구하는 멋진 단어입니다. 이를 '보이지 않는 거품'이라고 생각하면 쉽습니다. 절친한 친구를 위한 좁은 거품, 동료를 위한 중간 크기의 거품, 그리고 낯선 이를 위한 넓은 거품 같은 것이죠. 만약 로봇이 허락도 없이 당신의 좁은 거품 속으로 쑥 들어온다면, 그것은 무례할 뿐만 아니라 잠재적으로 위험한 행동입니다.

이제 로봇의 머리에 카메라(에고센트릭 뷰, egocentric view)를 달아주어, 로봇이 우리와 똑같이 세상을 보게 된다고 상상해 보세요. 여기서 과학자들이 던지는 핵심 질문은 이것입니다. "우리가 AI에게 사진 한 장을 보여주고, '오 이런, 내가 저 사람에게 너무 가까워!'라거나 '휴, 공간이 아주 넉넉하네'라고 즉각적으로 알게 할 수 있을까?" 여기서 **시각-언어 모델(Vision-Language Models, VLMs)**이 등장합니다. 이들은 이미지를 보고 그에 대해 이야기할 수 있는 매우 똑똑한 AI 프로그램으로, 마치 로봇이 그림책을 읽고 그 이야기를 들려주는 것과 같습니다. 연구자들은 만약 이 AI들이 보기만 해도 개인 공간을 이해할 수 있다면, 모든 로봇에 비싸고 무거운 센서를 달 필요 없이 카메라와 두뇌만 있으면 될 것이라는 기대감에 부풀어 있습니다.

하지만 여기 반전이 있습니다. AI가 사진을 묘사할 수 있다고 해서, 그것이 반드시 3D 공간에서 사물이 '어디에' 있는지 진정으로 이해한다는 뜻은 아닙니다. 이 논문은 세 가지 서로 다른 AI '두뇌'를 테스트하여, 이들이 로봇의 안전 가드 역할을 할 수 있는지 시험합니다.

실험: AI는 위험을 감지할 수 있는가?

연구진은 실제 환경에서 로봇의 시점으로 촬영된 1,243장의 사진을 사용하여 특별한 훈련 세트를 구축했습니다. 그들은 로봇과 사람 사이의 거리에 따라 모든 사진에 '위험 수준' 레이블을 붙였습니다:

  • 높은 위험 (High Danger): 누군가가 로봇의 바로 코앞에 있음 (충돌 임박!).
  • 중간 위험 (Moderate Danger): 누군가 가까이 있으며, 로봇이 조심스럽게 움직여야 함.
  • 낮은 위험 (Low Danger): 누군가 근처에 있지만, 로봇이 주의 깊게 지켜보기만 하면 됨.
  • 최소 위험 (Minimum Danger): 아무도 없음 (안전함).

그들은 세 가지 오픈 소스 AI 모델인 InternVL, SmolVLM, Qwen-VL을 테스트했습니다. 연구진은 두 가지 방식으로 이 모델들을 가르쳤습니다. 첫째는 다양한 스타일의 질문을 던지는 방식(단순한 명령 vs 복잡한 단계별 추론 퍼즐)이고, 둘째는 200개의 특정 이미지에 대해 아주 약간의 추가 학습(파인튜닝, fine-tuning)을 시키는 방식이었습니다.

결과: 한 명의 영웅과 두 명의 낙제생

결과는 "나쁘지 않음"과 "충분하지 않음"이 섞여 있었습니다.

1. "무작위 추측" 문제
특별한 훈련 없이, 세 모델 모두 객관식 시험에서 찍는 학생처럼 수행했습니다. 전체적인 정확도는 동전을 던져 결정하는 것보다 겨우 나은 수준이었습니다. 추가 학습을 거친 후에도 네 가지 위험 수준을 모두 올바르게 분류하는 일반적인 능력은 크게 향arly하지 않았습니다. 마치 모델들이 커피숍을 묘사하는 데는 능숙하지만, 언제 멈춰야 할지는 전혀 모르는 것 같았습니다.

2. Qwen의 예외
하지만 한 명의 독보적인 영웅이 있었습니다: 바로 Qwen-VL입니다. 다른 두 모델(InternVL, SmolVLM)이 거의 모든 위험 상황을 놓치며 사실상 실패한 반면, Qwen-VL은 "높은 위험" 상황을 포착하는 데 더 뛰어난 모습을 보였습니다.

  • 결정적으로, 이 개선은 질문을 던지는 '방식'과 모델을 학습시키는 '방법'의 특정 조합에서 비롯되었습니다. 가장 좋은 결과는 AI에게 "단계별로 생각하라"고 요청하는 매우 구체적이고 복잡한 프롬프트를 사용하는 것과 첫 번째 라운드의 파인튜닝을 결합했을 때 나타났습니다. 이 설정을 통해 Qwen-VL은 높은 위험 상황의 약 **79%**를 잡아낼 수 있었습니다.
  • 다른 모델들은 동일한 복잡한 프롬프트와 학습을 적용했음에도 불구하고 여전히 거의 모든 상황을 놓쳤습니다.
  • 흥미롭게도, Qwen-VL에게 추가적인 학습(두 번째 라운드 파인튜닝)을 주는 것은 큰 도움이 되지 않았습니다. 가장 큰 폭의 상승은 앞서 언급한 고급 "사고 과정" 프롬프트와 초기 파인튜핑 설정의 조합에서 왔습니다.

3. "맹점"의 놀라움
연구진은 AI가 위험을 판단하기 위해 실제로 사람을 '보고' 있는지 확인했습니다. 그들은 AI에게 걱정되는 사람 주위에 상자를 그리라고 요청했습니다.

  • 충격적인 사실: Qwen-VL이 올바르게 "위험!"이라고 외쳤을 때조차, 모델은 종종 엉뚱한 곳에 상자를 그렸습니다. 때로는 바닥을, 때로는 벽을, 때로는 맞는 사람을 가리켰습니다.
  • 결론: 이 논문은 모델이 특정 거리감을 이해하기보다는, 전체 이미지의 "느낌"이나 패턴을 바탕으로 위험 수준을 추측하고 있을 가능성을 시사합니다. 이는 마치 수학 시험에서 정답은 맞혔지만, 풀이 과정을 쓰거나 어떤 숫자를 사용했는지 보여주지 못하는 학생과 같습니다.

이것이 로봇 안전에 의미하는 바

이 논문은 이러한 AI 모델들이 점점 똑똑해지고는 있지만, 군중 속을 걷는 로봇의 유일한 안전 가드로 쓰이기에는 아직 준비가 되지 않았다고 결론짓습니다.

  • 아직 신뢰할 수 없습니다: 만약 이 모델들에 의존한다면, 모델이 안전하다고 판단했는데 충돌이 발생하거나, 반대로 안전한데도 패닉에 빠질 수 있습니다.
  • 프롬프트와 특정 학습이 중요합니다: 모델에게 추가 학습을 주는 것은 Qwen-VL에 아주 약간의 도움을 주었을 뿐이며, 다른 모델들을 고치지는 못했습니다. 가장 큰 성과는 모델이 신중하게 추론하도록 요청하는 것과 특정 파인튜닝 구성을 결합했을 때 나타났습니다.
  • "눈먼" 위험: 가장 중요한 교훈은, 올바른 레이블(높은 위험)을 얻었다고 해서 로봇이 '왜' 위험한지 알고 있다는 뜻은 아니라는 점입니다. 모델은 잘못된 이유로 정답을 맞혔을 수도 있습니다.

요약하자면, 이 시각-언어 모델들은 장면을 아름답게 묘사할 수는 있지만 길을 찾는 데는 자주 헤매는 '수다스러운 관광객'과 같습니다. 특히 신중하게 생각하도록 요청하고 적절히 학습된 Qwen 모델은 가능성을 보여주지만, 인간이 뒤에서 지켜보지 않고도 복잡한 거리에서 로봇을 운전하게 맡기기에는 아직 훨씬 더 많은 연습이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →