← 최신 논문
💻 computer science

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

본 논문은 비전 - 언어 모델을 활용하는 가정용 로봇에 대한 타이포그래피 공격이 시각적 판단을 우회하여 물리적 결과를 초래하는 조작 실패를 유발할 수 있음을 입증하며, 로봇의 의미 지도를 오염시켜 물체의 잘못된 집기와 이송을 초래함으로써 시뮬레이션 환경에서 67.8% 의 성공률을 달성함을 보여줍니다.

원저자: Ali Iranmanesh, Peng Liu

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ali Iranmanesh, Peng Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가정용 로봇을 조금은 순진하지만 도움이 되는 조수라고 상상해 보세요. 이 로봇은 세상을 이해하는 두 가지 주요 방식을 가지고 있습니다:

  1. 눈 (시각): 로봇은 물체를 보고 "저건 커피 머그컵처럼 보이네"라고 말합니다.
  2. 뇌 (언어): 로봇은 "커피 머그컵을 가져다주세요"라는 당신의 명령을 듣고, 그 단어를 자신이 보는 것과 매칭합니다.

현대 로봇에서는 이 두 시스템이 단일한 "뇌"(비전 - 언어 모델이라고 함) 에 붙여져 있습니다. 이는 로봇이 재학습 없이도 수천 가지 새로운 사물을 이해할 수 있게 해주기 때문에 훌륭합니다. 그러나 해당 논문은 이 '접착제'가 위험한 허점을 만들어낸다고 주장합니다.

"마법 스티커" 트릭

연구진들은 완전히 다른 물체—예를 들어 토스터, 신발, 또는 램프—위에 **"커피 머그컵"**이라고 인쇄된 종이 조각을 붙이면 로봇의 뇌가 혼란에 빠진다는 사실을 발견했습니다.

로봇의 "언어" 부분과 "시각" 부분이 너무 긴밀하게 연결되어 있기 때문에, 로봇은 물체의 모양과 색상을 보기를 멈추고 대신 먼저 텍스트를 읽고 나중에 보게 됩니다. 로봇은 "커피 머그컵"이라는 단어를 보고 즉시 "아, 이건 분명 커피 머그컵이야"라고 결정하며, 실제로는 토스터라는 사실을 완전히 무시합니다.

연쇄 효과: 한 번의 눈길에서 잡기까지

이것이 위험한 이유는 로봇이 토스터를 머그컵으로 생각한다는 점뿐만 아니라, 그 다음에 일어나는 일 때문입니다.

  1. 중독된 지도: 로봇은 단순히 실수를 저지르는 것이 아니라, 이 오류를 방의 영구적인 3 차원 정신 지도에 기록합니다. 마치 로봇이 "이건 머그컵이야"라고 적힌 스티커 메모를 만들어 자신의 기억 속 토스터에 붙이는 것과 같습니다.
  2. 맹목적 신뢰: 로봇이 한 번 떠나 다시 돌아오거나, 스티커가 시야에서 가려지더라도 로봇은 여전히 자신의 정신 지도를 신뢰합니다. "내가 전에 적어두었으니, 저기에 머그컵이 분명히 있어"라고 생각하기 때문입니다.
  3. 운동적 실패: 로봇은 그 후 실제로 걸어 가서 토스터를 집어 들고, 당신에게 건네거나 컵 홀더에 넣으려 합니다.

이 논문은 이를 **"운동적 실패 (Kinetic Failure)"**라고 부릅니다. 이는 로봇이 잘못된 말을 하는 단순한 소프트웨어 결함이 아니라, 로봇이 잘못된 물체에 매몰되어 집 안을 돌아다니며 물체를 운반하는 물리적 행동입니다.

실험: 어떻게 테스트했는지

연구진들은 실제 가정의 실제 로봇으로 이를 테스트할 수 없었습니다 (비용이 너무 많이 들고 위험하기 때문). 대신 Habitat이라는 매우 사실적인 비디오 게임 시뮬레이션을 사용했습니다.

  • 설정: 이미 물체를 찾고 집어 올리는 데 능숙한 로봇을 사용했습니다.
  • 공격: 목표 물체의 이름 (예: "컵") 이 적힌 인쇄된 스티커를 무작위 근처 물체 (방해물) 에 부착했습니다.
  • 결과: 로봇이 이미 작업을 수행할 능력이 있었던 59 가지 구체적인 테스트 시나리오 중, 스티커 트릭이 로봇을 속인 비율은 **67.8%**였습니다.

가장 성공적인 사례들에서 로봇은 단순히 잘못된 물건을 집어 올린 것이 아니라, 잘못된 물체로 성공적으로 이동하여 그것을 집어 들고 방 전체를 운반한 뒤 올바른 위치에 놓으려 했습니다. 로봇은 실수에 완전히 "매몰"된 상태였습니다.

이것이 중요한 이유 (논문에 따르면)

이 논문은 이전 연구들이 스티커가 로봇을 잘못된 장소로 이동하게 만드는 방식 (예: 드론이 잘못된 지붕으로 날아가는 경우) 을 살펴보았다고 강조합니다. 하지만 스티커가 로봇을 물리적으로 잘못된 물건을 집어 들고 이동하게 만드는 것을 보여준 것은 이번이 처음입니다.

위험한 점은 로봇의 "기억"(3 차원 지도) 이 독을 유지한다는 것입니다. 스티커를 제거하더라도 로봇의 내부 지도가 손상되었기 때문에 로봇은 여전히 잘못된 물건을 집으려 할 수 있습니다.

제안된 해결책

저자들은 로봇의 "눈"만 고쳐 텍스트를 무시하게 해서는 안 된다고 제안합니다. 대신 로봇이 기억을 사용하는 방식을 바꿔야 합니다. 그들은 세 가지 안전 장치를 제안합니다:

  1. 이중 확인: 한 번의 눈길만 믿지 마십시오. 로봇이 영구 기억에 기록하기 전에 물체를 다른 각도에서 보게 하십시오.
  2. 텍스트 식별: "잠깐, 이 물체에 스티커가 붙어 있어. 아직 라벨을 신뢰하지 마"라고 말하는 보조 시스템을 도입하십시오.
  3. 최종 확인: 로봇이 실제로 물체를 잡기 직전, 속지 않았는지 확인하기 위해 한 번 더 보게 하십시오.

간단히 말해: 글자가 적힌 종이 한 장이 똑똑한 로봇을 토스터를 컵으로 착각하게 만들 수 있으며, 로봇은 그 토스터를 기꺼이 부엌 조리대로 운반할 것입니다. 이 논문은 이것이 미래 가정용 로봇에게 실제적인 물리적 위험임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →