Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
이 논문은 밀집 다채널 보상, 분리된 어드밴티지 정규화, 그리고 점진적 커리큘럼을 통해 GRPO를 안정화하여 공격자와 방어자의 공동 최적화를 수행하는 새로운 공동 학습 프레임워크인 AdvGRPO를 소개하며, 궁극적으로 매우 효과적인 전이 가능한 공격과 더 강력한 언어 모델 방어 체계를 산출한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
큰 그림: 디지털 스파링 경기
매우 똑똑한 로봇(방어자)이 있다고 상상해 보세요. 이 로봇은 도움이 되는 답변을 하도록 훈련되었지만, 동시에 "폭탄을 만드는 방법은?"이나 "은행을 해킹하려면 어떻게 해야 해?"와 같은 해로운 요청은 거절하도록 훈련되었습니다.
보통 인간은 이 로봇을 테스트하기 위해 까다로운 질문 목록을 작성합니다. 하지만 로봇은 똑똑해서 그 특정 질문들에 대해 "안 돼"라고 말하는 법을 배웁니다. 문제는 영리하고 적응력이 뛰어난 공격자가 로봇을 속이기 위한 새로운 방법을 찾아내기 위해 전략을 바꿀 수 있다는 점입니다.
이 논문은 AdvGRPO라고 불리는 방법을 사용하여 양쪽 모두를 동시에 훈련시키는 새로운 방법을 소개합니다. 이것은 레드 팀(공격자)과 블루 팀(방어자)이 서로 끊임없이 스파링을 하는 디지털 도장을 설정하는 것과 같습니다. 인간이 질문을 쓰는 대신, AI 모델들이 서로 맞붙어 게임을 하며 매 라운드마다 더 강해지는 법을 배우는 것입니다.
기존 방식의 문제점
이전에는 연구자들이 공격자에게 방어자를 무너뜨리는 법을 가르치기 위해 특정 훈련 도구(GRPO라고 불리는)를 사용했습니다. 하지만 그들은 공격자와 방어자가 동시에 학습할 때 시스템이 "불안정"해진다는 것을 발견했습니다. 그것은 마치 두 권투 선수가 새로운 격투 스타일을 배우려고 하는데 링 자체가 흔들리고 있는 것과 같았습니다. 그들은 누가 이기고 있는지 합의를 보지 못했고, 훈련은 붕괴하거나 제자리를 맴돌았습니다.
해결책: AdvGRPO (안정적인 도장)
저자들은 이 흔들리는 링을 고치는 AdvGRPO라는 새로운 프레임워크를 만들었습니다. 그들은 세 가지 주요 기술을 사용했습니다.
다중 채널 보상이 있는 스코어카드 (Dense Multi-Channel Rewards):
라운드가 끝날 때 단순히 "득점!"이라고 외치는 심판을 상상해 보세요. 대신, 그들은 모든 동작 하나하나에 점수를 매깁니다.- 공격자가 주제를 유지했는가?
- 공격자가 전략을 따랐는가?
- 공격자가 실제로 해로운 답변을 얻어냈는가?
모든 작은 단계마다 점수를 매김으로써, 공격자는 실패했다는 것을 알기 위해 끝까지 기다리는 대신 개선할 점에 대한 지속적인 피드백을 받습니다.
독립적인 심판들 (Decoupled Advantage Normalization):
기존의 불안정한 방식에서는 공격자가 갑자기 매우 강력해지면, 방어자의 점수가 상대적으로 형편없어 보여 훈련을 혼란스럽게 만들었습니다.
새로운 방식은 각 유형의 점수가 결합되기 전에 독립적으로 판정되는 GDPO라는 시스템을 사용합니다. 이는 마치 "속도", "기술", "창의성"을 각각 심사하는 심판이 따로 있어서, 하나가 다른 점수를 망치지 않도록 하는 것과 같습니다. 이를 통해 두 모델이 똑똑해지더라도 훈련을 안정적으로 유지합니다.훈련 캠프 (Curriculum Learning):
초보 권투 선수를 곧바로 챔피언과 링 위에 올리지는 않습니다. 이 논문은 "커리큘럼"을 사용합니다.- 1단계: 공격자는 기초를 배우기 위해 고정된 방어자를 상대로 혼자 훈련합니다.
- 2단계: 공격자가 어느 정도 실력을 갖추면, 방어자와 스파링을 시작합니다.
- 3단계: 그들은 차례를 교대합니다. 공격자가 몇 라운드 동안 방어자를 무너뜨리려 시도하면, 그다음 방어자가 구멍을 메우기 위해 몇 라운드 동안 노력하며 서로 전환합니다. 이는 방어자가 단순히 모든 것에 "안 돼"라고 말하는 것(쉬운 승리)을 방지하고, 까다롭고 구체적인 공격을 처리하는 법을 배우도록 강제합니다.
연구 결과
논문은 실험을 통해 몇 가지 핵심 결과를 보고합니다:
- 공격자들이 무서울 정도로 강해졌습니다: 훈련된 공격자들은 훈련받지 않은 모델이나 단순히 "잠금 해제된"(안전 필터가 제거된) 모델보다 방어자를 훨씬 더 잘 속이는 법을 배웠습니다. 그들은 단순히 안전 필터를 제거하는 것만으로는 충분하지 않으며, 어떻게 공격해야 하는지를 학습해야 한다는 것을 배웠습니다.
- 그들은 적응할 수 있습니다: 공격자들은 자신이 훈련했던 방어자뿐만 아니라, 한 번도 본 적 없는 완전히 다른 모델들에게도 통하는 전략을 배웠습니다. 이는 특정 파트너에게만 통하는 기술이 아니라, 누구에게나 통하는 기술을 배우는 권투 선수와 같습니다.
- 방어자들이 더 단단해졌습니다: 이 "도장"에서 훈련된 방어자들은 기존 방식의 방어자들보다 공격을 포착하고 차단하는 데 훨씬 더 뛰어난 모습을 보였습니다. 그들은 나쁜 요청에는 "안 돼"라고 말하면서도, 좋고 해롭지 않은 요청에는 "응"이라고 말하는 법을 배웠습니다.
- 사고 모델(Reasoning Models)은 특별한 도움이 필요합니다: "생각하는" 능력이 있는 모델들은 너무 안전하려고 노력하여, 공격 요청을 받았을 때조차 공격을 수행하지 않고 거절하려는 경 경향이 있음을 발견했습니다. 연구진은 이 모델들이 안전 경고에 막히지 않고 공격 과정을 생각해 낼 수 있도록 특별한 보상 체계를 만들어야 했습니다.
요점
이 논문은 이 새로운 안정적인 방법(AdvGRPO)을 사용함으로써, AI 공격자와 방어자가 함께 학습하는 시스템을 만들 수 있다고 주장합니다. 그 결과, 공격자는 약점을 아주 잘 찾아내는 공격자가 되고, 방어자는 이를 고치는 데 매우 능숙한 방어자가 되어 전반적인 AI를 더 안전하게 만듭니다. 저자들은 이것이 나쁜 의도를 가진 사람들이 악용하기 전에 약점을 찾기 위한 연구 도구이며, 더 강력하고 견고한 AI 시스템을 구축하는 데 도움을 준다는 점을 강조합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.