← 최신 논문
🤖 machine learning

When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning

본 논문은 자기대결 강화학습에서 적대적 행동 마스킹을 조사하여, 합법적 행동을 선택적으로 제거하는 것이 교란보다 훨씬 더 큰 피해를 초래하며 다양한 알고리즘과 도메인에 걸쳐 지속되고, 회복을 허용하지 않으면서 고가치 의사결정 지점을 악용함을 보여줍니다.

원저자: Arahan Kujur

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arahan Kujur

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고수익 포커 게임에서 초지능 컴퓨터 상대와 대결한다고 상상해 보세요. 당신은 수개월간 훈련하며 모든 가능한 수와 그에 대한 대응책을 익혔습니다. 자신감에 차 있습니다. 하지만 그때, 당신이 눈치채지 못하는 방식으로 게임이 변합니다: 누군가 조용히 당신의 카드를 빼앗아 갑니다.

모든 카드를 빼앗는 것은 아닙니다. 오직 이 수를 이기게 해주는 특정 카드들만 빼앗는 것입니다. 당신은 여전히 게임을 해야 하지만, 최선의 선택지들은 사라졌습니다. 당신은 결코 하고 싶지 않았던 수를 강제로 두어야 하며, 결국 패배합니다.

이 논문은 인공지능 (AI) 에 대한 새로운 유형의 "해커" 공격에 관한 것으로, 정확히 위와 같은 방식으로 작동합니다. AI 를 혼란스럽게 하는 가짜 정보 (예: 자율주행차가 정지 신호를 속도 제한 표지로 오인하도록 정지 표지판에 스티커를 붙이는 것) 로 AI 를 혼란시키는 대신, 이 공격은 AI 의 선택지 자체를 완전히 제거합니다.

다음은 이 연구를 간단한 용어로 설명한 내용입니다:

1. 설정: "침묵하는 파괴자"

연구진은 스스로와 대결하며 학습하는 AI 에이전트 (자기 대결, self-play) 를 연구했습니다. 바둑이나 포커에서 인간을 이기는 AI 들이 그렇게나 뛰어날 수 있었던 방식이 바로 이것입니다.

  • 피해자: 최상의 전략을 학습하려는 AI.
  • 공격자: 스스로 게임을 이기려고 하지 않는 "파괴자" AI. 대신, 이 AI 의 유일한 임무는 피해자의 선택지들을 살펴보고 피해자가 선택하기 전에 최선의 것들을 삭제하는 것입니다.
  • 규칙: 공격자는 제한된 수의 선택지 (예산) 만 삭제할 수 있지만, 가장 큰 혼란을 초래하기 위해 정확히 어떤 것들을 삭제할지 선택합니다.

2. 주요 발견: "자물쇠를 고장 내는 것"보다 "열쇠를 빼앗는 것"이 더 나쁘다

이전 연구는 주로 "교란 (perturbations)"에 초점을 맞췄습니다. 기본적으로 AI 의 감각에 잡음이나 혼란을 더하는 것입니다. 안개가 낀 안경을 끼고 운전하려 한다고 상상해 보세요. 성가스럽지만, 여전히 핸들을 조작할 수는 있습니다.

이 논문은 행동 제거는 핸들 자체를 완전히 빼앗는 것과 같다고 보여줍니다.

  • 결과: "행동 제거" 공격은 무작위 제거나 잡음 기반 공격보다 4 배에서 5 배 더 치명적이었습니다.
  • 비유: 당신이 요리사라면, 무작위 잡음은 소금통을 흔들어서 당신이 얼마나 소금을 넣었는지 알 수 없게 만드는 것과 같습니다. 반면, 행동 제거는 소금통을 가져가서 당신에게 설탕만 쓰게 강요하는 것입니다. 당신은 여전히 요리를 할 수 있지만, 요리는 망쳐질 것입니다.

3. "마법의 공식": 약점을 찾는 방법

공격자는 어떤 행동을 삭제해야 할지 어떻게 알까요? 연구진이 **CAC(Contingent Action Capacity, 조건부 행동 능력)**라고 부르는 교묘한 지표를 사용합니다.

  • 게임의 결정 지점을 길가의 갈림길이라고 생각해 보세요.
  • 어떤 갈림길은 사소한 것입니다 (왼쪽으로 가든 오른쪽으로 가든 큰 차이가 없습니다).
  • 어떤 갈림길은 결정적입니다 (왼쪽으로 가면 게임을 이기고, 오른쪽으로 가면 지는 것입니다).
  • 공격자는 AI 가 자주 방문하는 결정적인 갈림길을 찾아 "이기는" 경로를 삭제합니다.
  • 연구진은 AI 가 이러한 결정적인 순간에 선택할 수 있는 능력을 줄일수록 AI 의 성능이 무너진다는 사실을 발견했습니다.

4. 어디서나 작동합니다 (포커뿐만이 아닙니다)

연구진은 이 공격을 다양한 "세계"에서 테스트했습니다:

  • 포커: 작은 6 장 카드 게임부터 거대한 5,500 장 카드 게임까지.
  • 그리드월드 (Gridworlds): 포식자를 피하면서 목표 지점에 도달하려는 캐릭터가 등장하는 간단한 비디오 게임.
  • 자원 수집: 물건을 모으는 게임.

모든 경우에 공격이 성공했습니다. AI 가 단순한 수학 기반 학습자였든, 현대 딥러닝에 사용되는 복잡한 신경망이었든 상관없었습니다. AI 의 최선의 수를 빼앗으면, AI 는 무너집니다.

5. AI 는 "그것에 익숙해질 수 없습니다"

보통 어려운 환경에서 AI 를 훈련시키면, 결국 적응하는 법을 배웁니다.

  • 발견: 연구진이 훈련 중에 "행동 제거"를 계속 활성화했을 때, AI 는 회복하지 않았습니다. 여전히 망가진 상태였습니다.
  • 이유: 공격이 게임의 근본적인 규칙을 바꾸기 때문입니다. AI 는 단순히 새로운 트릭을 배우는 것이 아니라, 이기는 수들이 삭제된 게임을 강제로 치고 있는 것입니다. 최선의 수들이 없다면 아무리 연습해도 소용이 없습니다.

6. "확장"의 놀라움

게임이 복잡할수록 공격은 더 나빠졌습니다.

  • 작은 게임에서 공격자는 무작위 확률보다 약 2 배 더 효과적이었습니다.
  • 거대하고 복잡한 게임에서 공격자는 거의 5 배 더 효과적이었습니다.
  • 비유: 작은 방에서는 문 하나를 막아도 그냥 그 주위를 돌아다닐 수 있습니다. 하지만 거대한 미로에서 출구로 이어지는 유일한 특정 복도를 막으면 당신은 갇히게 됩니다. 게임이 클수록 그 특정 "막힌" 선택지들이 더 가치 있게 됩니다.

요약

이 논문은 AI 의 숨겨진 약점을 드러냅니다: 선택지가 제거되면 AI 는 취약해집니다.

현재 AI 안전 연구는 종종 AI 가 나쁜 데이터에 "속는" 것에 대해 우려합니다. 이 논문은 AI 가 선택지를 빼앗겨 "수갑을 찬" 상태가 되는 것도 걱정해야 한다고 말합니다. 연구진은 지능적인 공격자가 AI 가 내리는 가장 중요한 결정들을 쉽게 식별하여 삭제함으로써, AI 가 얼마나 똑똑하거나 복잡하든 상관없이 AI 가 극적으로 실패하게 만든다는 사실을 발견했습니다.

핵심 결론: 선택할 수 있는 풀 메뉴에 의존하는 AI 를 구축한다면, 그 메뉴를 보호해야 합니다. 적군이 메뉴에서 최상의 항목들을 삭제할 수 있다면, AI 가 얼마나 잘 훈련되었든 상관없이 AI 는 굶주리게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →