← 최신 논문
🤖 machine learning

Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models

본 논문은 비전-언어-행동 모델이 작업 엔트로피와 적대적 채널 용량에 의해 결정된 고정된 예산을 초과할 수 없는 능력과 견고함의 합이 불가피한 상충 관계에 직면함을 증명하는 이론적 정보이론적 상한을 확립함으로써, 한 차원의 중대한 개선이 필연적으로 다른 차원의 희생으로 이루어짐을 보여준다.

원저자: Jianwei Tai

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jianwei Tai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 샌드위치를 만들거나 장난감을 조립하는 것과 같은 복잡한 작업을 가르친다고 상상해 보세요. 당신은 로봇이 유능하기를 원합니다 (방이 깨끗하고 조용할 때 일을 완벽하게 수행하는 것) 그리고 견고하기를 원합니다 (누군가 몰래 들어와 조명을 약간 흐리게 하거나 테이블에 보이지 않는 작은 스티커를 붙여도 여전히 일을 완벽하게 수행하는 것).

오랫동안 연구자들은 로봇을 "더 똑똑하게" 훈련시키기만 하면 유능함견고함을 모두 갖춘 로봇을 만들 수 있으리라 기대해 왔습니다.

이 논문은 다음과 같이 말합니다: 아니요, 둘 다 무료로 가질 수는 없습니다. 로봇이 두 가지 능력을 동시에 얼마나 잘 발휘할 수 있는지에 대한 엄격한 수학적 한계가 존재합니다.

간단한 비유를 사용하여 이를 분해해 보겠습니다:

1. "예산" 비유

세상을 처리하는 로봇의 능력을 "정보 화폐"의 고정된 예산으로 생각해 보세요.

  • 유능함은 로봇이 진짜 지시사항 ( "오라클") 을 얼마나 잘 이해하는지입니다.
  • 견고함은 로봇이 가짜이거나 지저분한 지시사항 ("공격") 을 얼마나 잘 무시하는지입니다.

이 논문은 유능함과 견고함의 합이 특정 총 예산을 초과할 수 없음을 증명합니다. 이 예산은 두 가지 요소에 의해 결정됩니다:

  1. 작업의 복잡성 ("작업 엔트로피"): 작업이 "빨간 블록을 집어 올리라"는 것이라면 예산은 작습니다. "카드 하우스를 짓라"는 것이라면 예산은 거대합니다.
  2. 공격자가 추가할 수 있는 노이즈의 양 ("채널 용량"): 공격자가 먼지 한 알만 추가할 수 있다면 예산은 작습니다. 그들이 전체 이미지를 흐리게 할 수 있다면 예산은 거대합니다.

주의할 점: 이 예산을 유능함과 견고함에 동시에 사용할 수는 없으며, 그렇지 않으면 바닥나게 됩니다. 공격에 대한 견고함을 위해 더 많은 예산을 쓰면, 정상적인 조건에서의 유능함을 위해 반드시 더 적은 예산을 써야 하며, 그 반대도 마찬가지입니다.

2. "공짜 점심은 없다"는 발견

저자들은 OpenVLA라는 인기 있는 로봇 두뇌를 살펴보았습니다.

  • 문제: 로봇이 깨끗한 이미지를 볼 때 성공률은 95% 입니다. 하지만 해커가 보이지 않는 작은 패턴 ("적대적 교란") 을 추가하면 로봇의 성공률은 5% 미만으로 급락합니다.
  • 과거의 희망: 아마도 다르게 훈련시킨다면 깨끗한 이미지에서 95% 성공하고 공격받은 이미지에서도 95% 성공할 수 있지 않을까요?
  • 현실: 수학은 이것이 불가능함을 증명합니다. "이론적 바닥"이 존재합니다. 이 트레이드오프를 훈련만으로 벗어날 수는 없으며, 정보 이론의 법칙은 선택을 강요합니다.

3. "예산"이 왜 그렇게 컸다가 (그리고) 작아졌는지

초기에 저자들은 전체 이미지 (수백만 개의 픽셀) 를 사용하여 예산을 계산했습니다.

  • 느슨한 상한선: 그들은 약 5,000 단위의 예산을 발견했습니다. 로봇은 실제 작업을 위해 약 7.5 단위만 사용하고 있었습니다. 이는 양쪽을 모두 개선할 여지가 충분해 보이게 만들었습니다. 마치 "당신은 5,000 달러의 용돈이 있지만 점심에 7.50 달러만 쓰므로, 견고함에 쓸 수 있는 4,992.50 달러가 남았다는 말"과 같았습니다.

하지만 그것은 오해의 소지가 있었습니다.
로봇은 모든 픽셀을 보지 않습니다. 결정을 내리기 전에 이미지의 "요약" (압축된 사진과 같은) 을 봅니다.

  • 빡빡한 상한선: 저자들이 로봇이 실제로 사용하는 이미지 부분 특히에 대한 예산을 살펴봤을 때, 예산은 5,000 에서 31 단위로 줄어듭니다.
  • 충격: 이제 로봇은 유능함을 위해 **전체 예산의 24%**를 이미 쓰고 있습니다. 이는 견고함을 개선할 여지가 매우 적다는 것을 의미합니다 (유능함을 해치지 않고 약 23 단위만 남음).

4. "누출" 문제

이 논문은 또한 속임수를 방지하는 "견고함"을 측정하는 교묘한 방법을 소개합니다.
공격을 무시하는 대신 행동을 단순히 공격을 복사하는 로봇을 상상해 보세요.

  • 공격: "왼쪽으로 이동해."
  • 로봇 행동: "왼쪽으로 이동해."
  • 결과: 로봇이 마음을 바꾸지 않았기 때문에 "견고해" 보이지만, 실제로는 해커를 맹목적으로 따르고 있는 것입니다.

이 논문의 수학은 이러한 "속임수" 행동을 제외합니다. 진정한 견고함이란 노이즈를 단순히 복사하는 것이 아니라 무시하는 것임을 보장합니다.

5. 미래에 대한 의미

저자들은 우리가 포기해야 한다고 말하지 않습니다. 대신 그들은 과학자들이 사용할 새로운 를 제시합니다.

단순히 "우리의 새로운 방어 체계는 로봇을 10% 더 좋게 만들었다"라고 말하는 대신, 과학자들은 다음과 같이 말해야 한다고 제안합니다:

"우리의 새로운 방어 체계는 이 특정 로봇 아키텍처에 사용 가능한 남은 '견고함 예산'의 60% 를 소모합니다."

이는 모든 사람이 서로 다른 로봇을 공정하게 비교하는 데 도움이 됩니다. 이는 현재 로봇들에게는 벽에 부딪히고 있음을 알려줍니다. 더 나아지기 위해서는 훈련을 미세 조정하는 것만으로는 부족할 수 있으며, 로봇의 "두뇌"(아키텍처) 를 변경하거나, 더러운 날에는 더 안전하기 위해 깨끗한 날에는 약간 덜 완벽해질 것을 받아들여야 할지도 모릅니다.

간단히 말해: 일을 완벽하게 수행하고 속임수에 완벽하게 면역인 로봇을 가질 수는 없습니다. 엄격한 수학적 한계가 존재하며, 오늘의 로봇들은 이미 일을 수행하기 위해 그 한계의 상당 부분을 쓰고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →