← 최신 논문
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

이 논문은 공격자(Attacker)와 방어자(Defender) 언어 모델 간의 상호작용을 선호 기반 보상을 활용한 온라인 강화 학습을 통해 훈련되는 비제로섬 게임으로 프레임화하여, 더욱 강력한 범용 레드팀 에이전트와 함께 더 견고하고 유용한 방어자를 생성하는 새로운 안전 정렬 패러다임인 AdvGame을 소개한다.

원저자: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 경험은 부족한 로봇(이하 방어자)에게, 위험한 질문들이 섞여 있는 혼란스러운 세상을 다루는 법을 가르치려 한다고 상상해 보십시오.

전통적으로 개발자들은 이 로봇에게 "나쁜 질문"의 목록을 보여주며 "이것들에 대답하지 마라"라고 가르치려 노력했습니다. 하지만 로봇은 똑똑합니다. 결국 로봇은 그 목록을 암기해 버리지만, 본 적 없는 새로운 종류의 나쁜 질문을 받으면 실패하고 맙니다. 이는 마치 보안 요원에게 특정 '지명 수배자'의 얼굴만 인식하도록 가르치는 것이 아니라, 일반적인 '수상한 행동'을 포착하는 법을 가르치는 것과 같습니다.

이 논문은 AdvGame이라 불리는 새로운 훈련 방식을 소개합니다. 교사와 학생 대신, 이들은 두 명의 플레이어가 참여하는 비디오 게임을 설정합니다:

  1. 공격자 (트릭스터/속임수를 쓰는 자): 방어자가 해로운 말을 하도록 유도하기 위해 새롭고 영리한 속임수들을 발명하는 것이 유일한 임무인 로봇입니다.
  2. 방어자 (가디언/수호자): 도움이 되는 질문에는 답하면서, 트릭스터의 함정을 안전하게 피하는 것이 임무인 로봇입니다.

핵심 아이디어: 끝없는 춤

기존 방식에서는 트릭스터가 가디언을 무너뜨리려 하면, 가디언을 패치(수정)하고, 다시 트릭스터가 시도하는 방식이었습니다. 이는 느린 '앞서가고 뒤따라가는' 방식의 쫓고 쫓기는 게임이었습니다.

AdvGame에서 그들은 동시에 게임을 수행합니다.

  • 트릭스터는 가디언의 갑옷에 있는 새로운 구멍을 찾으려 노력합니다.
  • 가디언은 그 구멍을 즉시 메우는 법을 배웁니다.
  • 두 로봇이 동시에 경기를 하기 때문에, 가디언은 어제 보았던 것뿐만 아니라 트믹스터가 만들어내는 어떠한 새로운 속임수에도 대처하는 법을 배웁니다.

이 논문은 이것이 한쪽이 이기고 한쪽이 지는 '제로섬 게임'이 아니라고 주장합니다. 이는 비제로섬 게임입니다. 트릭스터는 가디언을 파괴하려는 것이 아니라, 가디언의 약점을 찾아냄으로써 가디언을 더 낫게 만들려고 하는 것입니다. 가디언은 트릭스터를 침묵시키려는 것이 아니라, 속임수에 빠지지 않으면서도 계속 도움이 되고자 하는 것입니다.

점수판: "더 나은가" vs "몇 점인가"

이 논문의 주요 혁신은 플레이어를 심사하는 방법입니다.

  • 기존 방식 (점수 기반): 심판이 단일 답변에 대해 "10점 만점에 7점"과 같은 점수를 줍니다. 이는 "7"이라는 숫어가 주관적이기 때문에 까다롭습니다. 로봇은 실제로는 안전하지 않으면서도 심판에게 좋아 보이는 답변을 내놓는 방식으로 시스템을 속이는 법을 배울 수 있습니다 (마치 학생이 과목을 배우는 대신 정답지를 암기하는 것과 같습니다).
  • 새로운 방식 (쌍 비교 기반): 심판에게 두 개의 답변을 나란히 보여주고 단순히 "어느 쪽이 더 나은가?"라고 묻습니다.
    • 비유: 음식 평론가에게 버거를 1점에서 10점 사이의 척도로 평가하라고 하는 대신(이는 기준을 맞추기 어렵습니다), 그냥 "버거 A가 버거 B보다 나은가요?"라고 묻는 것과 같습니다. 이는 속이기가 훨씬 어렵고 무엇이 "좋은" 것인지에 대한 더 명확한 신호를 줍니다.

결과: 더 강하고 더 똑똑하게

그들은 이 방법을 두 가지 인기 있는 로봇 모델(Llama와 Qwen)에 테스트했습니다. 결과는 다음과 같습니다.

  1. 가디언이 더 단단해졌습니다: AdvGame으로 훈련된 방어자 모델은 속이기가 훨씬 어려웠습니다. 알려진 "탈옥(jailbreak)" 공격(안전 필터를 우회하는 방법)을 대상으로 테스트했을 때, 이 모델들은 기존 방식으로 훈련된 모델들보다 훨씬 더 잘 버텨냈습니다.
  2. 가디언의 유용성이 유지되었습니다: 안전 훈련의 흔한 문제 중 하나는 로봇이 너무 조심스러워져서 무해한 질문(예: "컴퓨터 프로세스를 어떻게 종료하나요?")에도 답변을 거부하는 것입니다. AdvGame은 안전을 유지하면서도 로봇이 여전히 유용하고 도움이 되도록 관리했습니다.
  3. 트릭스터가 슈퍼 도구가 되었습니다: 공격자 로봇은 훈련 후 사라지지 않았습니다. 그것은 강력한 "레드 팀(Red Team)" 도구가 되었습니다. 즉, 공격자 자체를 다른 로봇이 안전한지 테스트하는 데 사용할 수 있으며, 전문적인 스트레스 테스트 역할을 수행할 수 있게 된 것입니다.

비결 (Secret Sauce)

논문은 이 방식이 왜 그렇게 잘 작동했는지 세 가지 이유를 강조합니다.

  • 두 개의 별개 로봇: 하나의 로봇이 두 역할을 모두 수행하게 하지 않았습니다 (그러면 혼란을 겪을 수 있습니다). 두 개의 뚜렷한 모델을 사용하여, 공격자는 공격에 집중하고 방어자는 방어에 집중하도록 했습니다.
  • "더 나은가"를 묻는 심판: 쌍 비교(어느 것이 더 나은가?)를 사용하는 것은 로봇이 점수 시스템을 속이는 것을 방지했습니다.
  • "이동 평균(Moving Average)" 기법: 그들은 EMA(지수 이동 평균)라는 기술을 사용했습니다. 가디언을 시험을 치르는 학생이라고 상상해 보십시오. 문제를 하나 틀렸다고 해서 당황하는 대신, 그들은 지난 몇 주간의 성과를 살펴보고 자신의 진정한 실력을 확인합니다. 이는 훈련을 안정적으로 유지하고 로봇이 단 하나의 나쁜 사례에 과잉 반응하는 것을 방지합니다.

요약

AdvGame은 로봇이 펀치를 피하는 법을 배우는 체육관과 같습니다. 코치가 펀치 영상을 보여주며 어떻게 피해야 하는지 말해주는 대신, 로봇은 실시간으로 새로운 펀치를 계속 만들어내는 파트너와 스파링을 하며 훈련합니다. 그 결과, 단순히 더 안전할 뿐만 아니라 더 유용하며, 방어의 구멍을 찾아내는 능력이 너무 뛰어나서 미래에 다른 어떤 로봇도 테스트할 수 있는 스파링 파트너를 갖게 된 로봇이 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →