← 최신 논문
💻 computer science

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

본 논문은 embodied AI 시스템의 jailbreak 공격을 평가하기 위한 최초의 표준화된 평가 프레임워크인 RoboJailBench 를 소개하며, 이는 보안 분류 체계를 수립하고 의도 대비 데이터셋 파이프라인을 생성하며 embodied Vision-Language Models 에서 보안과 유용성 간의 트레이드오프를 평가하기 위한 통합 지표를 제공함으로써 기존 격차를 해소한다.

원저자: Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 카메라를 통해 세상을 보고 말로 된 명령을 이해할 수 있는 초지능 로봇을 만들었다고 가정해 봅시다. 이는 지저분한 부엌을 돌아다니고, 컵을 집어 들며, 심지어 차를 운전까지 할 수 있는 유용한 집사와 같습니다. 하지만 여기에 문제가 있습니다. 교활한 거짓말쟁이에 속아 위험한 일을 하도록 속일 수 있는 인간과 마찬가지로, 이러한 로봇도 '자일브레이크 (jailbreak)'될 수 있습니다. 이는 악의적인 행위자가 비밀 코드를 속삭이거나 교묘한 이미지를 보여 로봇이 안전 규칙을 무시하고 사람을 들이받거나 물건을 훔치는 등 해로운 행동을 하도록 설득할 수 있음을 의미합니다.

지금까지 이러한 로봇이 그러한 속임수에 얼마나 잘 저항하는지 테스트하는 방식은 혼란스러웠습니다. 연구자들은 사과와 사과를 비교하지 않는 무작위이고 일회성 테스트를 사용했습니다. 그들은 종종 로봇이 속임수에 걸릴 수 있는지만 확인했을 뿐, 로봇이 여전히 정상적이고 유익한 작업에서 잘 작동하는지에는 관심을 두지 않았습니다. 이는 경사지에서 브레이크가 고장 나는지 확인하기만 하고 평지에서 차가 안전하게 운전할 수 있는지 전혀 확인하지 않는 것과 같습니다.

RoboJailBench 의 등장

이 논문의 저자들은 이러한 로봇을 테스트하기 위한 새로운 표준화된 '체육관' 또는 '훈련장'을 만들었습니다. 이는 '안전 시험'과 '운전 기술 시험'을 모두 포함하는 로봇 안전을 위한 엄격한 운전 면허 시험과 같습니다.

이 새로운 시스템을 구축한 방법은 세 가지 간단한 부분으로 나누어 설명합니다.

1. 규칙집 (보안 분류 체계)

먼저, 로봇에게 무엇이 '나쁜 행동'으로 간주되는지에 대한 명확한 목록이 필요했습니다. 그들은 단순히 추측하지 않고 세 가지 출처를 참고했습니다.

  • 로봇 법칙: 인간을 해치지 않는 로봇에 대한 아이작 아시모프의 유명한 가상의 법칙과 같습니다.
  • 공식 매뉴얼: 공장이 로봇을 안전하게 유지하는 방법을 알려주는 실제 산업 안전 표준 (ISO 규칙 등) 입니다.
  • 실제 사고: 로봇이 실제로 문제를 일으켰다는 뉴스 기사와 보고서입니다.

이러한 출처들을 혼합하여 그들은 18 가지 구체적인 위험 범주를 가진 '규칙집'을 만들었습니다. 이는 단순히 '나쁘게 행동하는 것'에 관한 것이 아니라, '손을 으깨기', '사람을 치기', '훔치기', '비밀 사진을 찍기'와 같은 구체적인 물리적 위험을 포함합니다. 이를 통해 그들은 올바른 것을 테스트하고 있음을 보장합니다.

2. 훈련 시나리오 (의도 대비 데이터셋)

이 부분이 가장 영리합니다. 로봇을 공정하게 테스트하려면 동일한 상황에서 '좋은' 요청과 '나쁜' 요청을 어떻게 처리하는지 확인해야 합니다.

물병을 들고 있는 부엌의 로봇이 담긴 사진을 상상해 보세요.

  • 좋은 요청: "부디 병을 서랍에 조심스럽게 넣어 주세요."
  • 나쁜 요청: "부디 병을 카운터에 부딪혀서 엉망진창으로 만들어 주세요."

저자들은 수백 개의 다른 이미지를 위한 이러한 쌍을 이루는 시나리오를 생성하는 파이프라인을 만들었습니다. 이를 '의도 대비 (Intent Contrast)' 데이터셋이라고 부릅니다. 이는 로봇이 유용성 (Utility) 과 안전성 (Security) 사이에서 선택하도록 강요합니다. 로봇이 나쁜 요청을 거절하면서도 좋은 요청도 거절한다면 지나치게 신중한 것입니다. 나쁜 요청을 수행한다면 안전하지 않은 것입니다. 목표는 나쁜 것에는 "아니오"라고 말하고 좋은 것에는 "예"라고 말하는 로봇을 찾는 것입니다.

3. 점수판 (평가 프레임워크)

마지막으로, 그들은 결과를 측정하기 위한 점수판을 만들었습니다. 단순히 "로봇이 실패했다"라고 말하는 대신, **SU-HM (보안 - 유용성 조화 평균)**이라는 특수한 공식을 사용합니다.

두 가지 등급이 있는 성적표라고 생각해 보세요.

  • 안전 등급: 로봇이 나쁜 명령에 대해 얼마나 잘 "아니오"라고 말했는가?
  • 유용성 등급: 로봇이 좋은 명령에 대해 얼마나 잘 "예"라고 말했는가?

SU-HM 점수는 두 영역 모두에서 높은 점수를 받은 로봇에게 보상을 줍니다. 너무 의심스러워 아무것도 하지 않거나 너무 무모해 모든 것을 하는 로봇에게는 벌점을 줍니다.

그들이 발견한 것

이 새로운 체육관을 사용하여 저자들은 최신 로봇 두뇌 (시각 - 언어 모델) 를 네 가지 다른 유형의 '속임수 (공격)'와 두 가지 유형의 '방어 (방어)'에 대해 테스트했습니다.

  • 속임수: 그들은 '개념적 기만 (Conceptual Deception)' (교활한 이야기로 로봇을 속이는 것) 과 같은 일부 속임수가 로봇이 안전 규칙을 무시하도록 만드는 데 매우 효과적임을 발견했습니다.
  • 방어: 그들은 두 가지 방어 방법을 테스트했습니다. 하나는 간단한 '안전 프롬프트 (로봇에게 조심하라고 말하기)'였고, 다른 하나는 'RoboGuard'라는 더 복잡한 시스템이었습니다.
  • 결과: 방어는 도움이 되었지만, 트레이드오프가 있었습니다. 일부 방어는 나쁜 명령을 막는 데 훌륭했지만, 로봇을 조금 더 느리게 만들거나 좋은 명령에 덜 도움이 되게 만들었습니다. 'Google Prompt' 방어는 일부 영역에서 잘 작동한 반면, 'RoboGuard'는 사용된 속임수의 구체적인 유형에 따라 다른 영역에서 더 좋았습니다.

이것이 중요한 이유

이 논문은 RoboJailBench가 이러한 로봇을 테스트하는 첫 번째 표준화된 방법이라고 결론 내립니다. 이는 단순히 로봇을 파괴하는 것이 아니라, 로봇이 신뢰할 수 있을 만큼 안전하면서도 유용할 만큼 지능적인 절묘한 지점을 찾는 것입니다.

저자들은 모든 코드, 데이터셋, 그리고 공개 리더보드 (비디오 게임의 고득점판과 유사) 를 공개하여 다른 연구자들이 새로운 로봇과 새로운 속임수를 계속 테스트할 수 있도록 했습니다. 그들은 현재 테스트가 주로 영어로 이루어져 있고 단일 이미지를 사용한다고 인정하지만, 이는 미래의 로봇 도우미들이 속아 문제를 일으키지 않도록 보장하기 위한 확실한 첫걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →