← 최신 논문
💻 computer science

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

이 논문은 현재의 안전성 평가에 존재하는 파편화 문제를 해결하기 위해, 공유된 물리적 기반의 타겟 생성 파이프라인을 통해 다양한 공격 방법과 방어 체계의 평가를 표준화하는, 물리 세계를 위한 최초의 통합 레드팀 벤치마크인 REALM을 소개한다.

원저자: Yifei Zhao, Qian Lou, Mengxin Zheng

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yifei Zhao, Qian Lou, Mengxin Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 세상을 보고 그에 대해 말할 수 있는 초지능 로봇 비서를 만들었다고 상상해 보세요. 당신은 이 로봇이 자동차를 운전하거나, 물건을 집어 올리거나, 사람들의 집에서 도움을 주기를 원합니다. 하지만 이 로봇을 실제 세상에 풀어놓기 전에, 로봇이 자동차를 충돌하거나 잘못된 도구를 잡는 것과 같이 위험한 행동을 하도록 속임을 당하지 않을지 확인해야 합니다.

이 논문은 이 로봇의 두뇌가 실제 물리적 과업을 수행할 때 얼마나 쉽게 속아 넘어가는지를 확인하기 위해 특별히 설계된 새로운 "스트레스 테스트"인 REALM을 소개합니다.

다음은 이 논문의 내용을 쉬운 비유를 사용하여 정리한 것입니다.

1. 문제점: "챗봇" 테스트 vs "실제 세상" 테스트

당신에게 보안 요원(AI)이 있다고 상상해 보세요.

  • 기존 테스트 (챗봇 벤치마크): 이 테스트들은 보안 요원에게 "나쁜 말을 하거나 불법적인 말을 할 수 있습니까?"라고 묻습니다. 만약 요원이 "아니요, 그러지 않겠습니다"라고 답하면 통과입니다. 이것은 보안 요원이 대화의 규칙을 어기는지 테스트하는 것과 같습니다.
  • 진짜 문제: 물리적인 세상에서의 위험은 단순히 나쁜 말을 하는 것이 아닙니다. 그것은 잘못된 행동을 하는 것에 관한 것입니다. 만약 자동차를 운전하는 로봇이 정지 표지판에 붙은 아주 작은 스티커를 보고, 그것을 양보 표지판으로 착각하여 계속 주행한다면 문제가 됩니다. 기존의 테스트들은 이를 잡아내지 못했습니다. 기존 테스트들은 "나쁜 단어"를 찾고 있었지, "나쁜 행동"을 찾고 있지 않았기 때문입니다.

REALM은 새로운 테스트를 통해 다음과 같이 묻습니다. "만약 내가 당신의 눈(시각 정보)이나 지시 사항을 속인다면, 당신은 물리적인 실수를 저지를 것입니까?"

2. 해결책: AI를 위한 통합된 "체육관(Gym)"

이 논문이 나오기 전까지, 모든 연구자는 각자 다른 체육관, 각자 다른 무게의 아령, 그리고 각자 다른 규칙을 가지고 있었습니다. 누가 실제로 더 강한지 비교하는 것이 불가능했습니다.

  • REALM 체육관: 저자들은 하나의 거대하고 표준화된 체육관을 구축했습니다. 그들은 12가지의 서로 다른 AI 속임수(공격), 3가지의 AI 보호 방법(방어), 그리고 테스트할 13가지의 서로 다른 AI 모델을 모았습니다.
  • "에이전트형" 코치: 테스트에서 가장 어려운 부분 중 하나는 어떤 실수를 찾아낼지 결정하는 것입니다. 만약 AI에게 자동차 사진을 보여준다면, AI가 그것을 자전거라고 생각해야 할까요? 아니-면 자동차가 후진하고 있다고 생각해야 할까요?
    • 이 논문은 특별한 "코치 AI"(에이전트 파이프라인)를 만들었습니다. 이 코치는 모든 장면을 살펴보고 AI가 저지를 수 있는 구체적이고 현실적인 실수를 고안해 냅니다. 예를 들어, 운전 장면에서 코치는 "오늘 AI는 빨간불을 초록불로 착각해야 한다"라고 결정할 수 있습니다. 이를 통해 모든 AI가 정확히 동일한 "속임수"에 대해 테스트받게 함으로써 공정한 비교를 보장합니다.

3. 실험: 어떤 결과가 나왔는가?

연구진은 13개의 서로 다른 AI 모델(작은 모델부터 거대한 모델까지)을 대상으로 이 테스트를 실행했으며, 몇 가지 놀라운 사실을 발견했습니다.

  • "벽에 붙은 메모" 속임수가 가장 효과적이다: 로보트를 고장 내는 데 가장 효과적인 방법은 이미지의 픽셀을 건드리는 것(예: 보이지 않는 노이즈 추가)이 아니었습니다. 그것은 바로 텍스트 지시 사항을 바꾸거나 사진 속에 가짜 표지판을 넣는 것이었습니다.
    • 비유: 로봇의 귀에 "정지 표지판을 무시해"라고 속삭이는 것(텍스트 주입)이 정지 표지판 위에 아주 작은 보이지 않는 점을 찍는 것(시각적 섭동)보다 로봇을 속이기에 더 쉽습니다.
  • "원샷(One-Shot)" 속임수: 어떤 공격들은 해커가 작동할 때까지 이미지를 미세하게 조정하며 수백 번 시도해야 합니다. 연구진은 "원샷" 공격(단 한 번의 시도)이 수백 번 시도하는 공격만큼이나 효과적이라는 것을 발견했습니다. 이는 해커들이 이 시스템을 깨뜨리기 위해 인내심을 가질 필요가 없음을 의미합니다.
  • 거대 모델이 항상 더 안전한 것은 아니다: 당신은 1,000억 개의 파라미터를 가진 거대하고 매우 비싼 AI가 작은 AI보다 속이기 어려울 것이라고 생각할 수도 있습니다. 하지만 연구진은 모델의 크기가 큰 중요성을 갖지 않는다는 것을 발견했습니다. 적절한 속임수가 있다면 거대한 AI도 작은 AI만큼이나 쉽게 속아 넘어갔습니다.
  • 특화된 훈련은 도움이 되지 않는다: 일부 AI는 물리 법칙과 추론에 능숙하도록 특별히 훈련되었습니다. 그러면 이들이 더 똑똑하고 속이기 어려울 것이라고 생각할 수 있습니다. 하지만 그렇지 않았습니다. 그들은 다른 모델들과 마찬가지로 똑같이 취약했습니다.

4. 방어 기제: 속임수를 막을 수 있는가?

연구진은 AI를 보호하기 위해 세 가지 서로 다른 "방패"를 시도했습니다.

  • 텍스트 방패: 한 종류의 방패는 "속삭이는" 텍스트 속임수를 막는 데 탁에 효과적이었습니다.
  • 시각적 방패: 또 다른 방패는 "보이지 않는 점" 이미지 속임수를 막는 데 어느 정도 효과가 있었습니다.
  • 함정: 단 하나의 방패도 모든 것을 막을 수는 없었습니다. 만약 텍스트 방패를 사용한다면 시각적 속임수가 여전히 작동했습니다. 만약 시각적 방패를 사용한다면 텍록 속임수가 여전히 작동했습니다. 다층적인 방어 시스템이 필요합니다.

요약

REALM은 AI 로봇이 실제 세상에서 안전한지 확인할 수 있는 최초의 표준화된 방법입니다. 연구진은 다음을 발견했습니다:

  1. 텍스트 속임수가 현재 가장 큰 위험 요소입니다.
  2. 거대 모델이라고 해서 자동으로 안전한 것은 아닙니다.
  3. 특화된 훈련이 속임수에 대한 면역력을 만들어주지는 않습니다.
  4. 물리적 AI를 안전하게 유지하기 위해서는 더 나은, 다층적인 방어 체계가 필요합니다.

결론적으로, 우리는 단순히 AI가 "나쁜 말"을 하는지 테스트하는 것에 그치지 않고, 물리적 세상에서 "나쁜 움직임"을 하는지를 테스트해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →