Position: Adversarial ML for LLMs Is Not Making Any Progress
이 입장 논문은 적대적 기계 학습 연구가 거대 언어 모델 시대에 들어서며 퇴보하고 있다고 주장하는데, 이는 해당 분야가 점점 더 정의하기 어렵고 까다로우며 평가하기 힘든 문제들을 다루게 됨에 따라 향후 10년 동안의 연구가 의미 있는 진전을 내지 못할 수도 있다는 우려를 제기한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능 보안의 분야를 '열쇠공 대 도둑'이라는 게임에 비유해 상상해 보십시오.
지난 10년 동안 열쇠공들(보안 연구자들)과 도둑들(공격자들)은 매우 구체적이고 잘 정의된 게임을 해왔습니다. 그들은 예전에 작고 튼튼한 상자에 달린 단순한 자물쇠를 테스트하곤 했습니다. 규칙은 명확했습니다:
- 목표: 도둑은 자물쇠를 부수지 않고 상자를 여는 것입니다.
- 규칙: 도둑은 자물쇠를 아주 미세하고 특정한 양만큼만(예를 들어 열쇠를 1mm 정도만 흔드는 것) 움직일 수 있습니다.
- 점수: 상자가 열리면 도둑이 승리합니다. 상자가 닫혀 있으면 열쇠공이 승리합니다.
이 게임은 어려웠지만, 누가 이기고 있는지 측정하는 방법은 모두가 정확히 알고 있었습니다.
논문의 핵심 주장
이제 게임이 바뀌었습니다. 이제 우리는 작은 상자 대신, 무엇에 대해서든 이야기하고 무엇이든 할 수 있는 거대하고 개방적인 "스마트 비서"(거대언어모델 또는 LLM)를 보호해야 합니다. 이 논문의 저자들은 게임이 망가졌다고 주장합니다. 그들은 이제 새로운 시대에 접어들면서, 이 분야가 제자리걸음을 하고 있으며 실제로 실질적인 진전을 이루지 못하고 있다고 주장합니다. 왜냐하면 게임의 규칙 자체가 엉망이 되었기 때문입니다.
이것을 쉬운 비유를 통해 설명하겠습니다:
1. 게임의 규칙이 사라졌습니다 (문제의 정의)
예전 게임에서 "승리"를 포착하는 것은 쉬웠습니다: 상자가 열렸는가?
새로운 게임에서 "상자"는 챗봇입니다. 목표는 단순히 상자를 여는 것이 아니라, 챗봇이 "나쁜" 말을 하게 만드는 것입니다.
- 비유: 도둑에게 "나쁜 것을 훔쳐라"라고 요청한다고 상상해 보십시오. 무엇이 "나쁜" 것일까요? 사탕을 훔치는 것인가요? 자동차인가요? 아니면 비밀 레시피인가요?
- 문제: "나쁜 것"은 주관적이기 때문에, 연구자들은 무엇을 성공적인 공격으로 간주할지에 대해 합의할 수 없습니다. 어떤 연구자는 "그가 봇으로부터 욕설을 하게 만들었으니 승리했다!"라고 말할 것입니다. 또 다른 연구자는 "하지만 그 욕설은 해롭지 않았으니 패배다!"라고 말할 수도 있습니다. 명확한 점수판이 없기 때문에, 우리는 열쇠공들이 자신의 일을 더 잘하게 되었는지 알 수 없습니다.
2. 도둑에게는 무한한 도구가 있습니다 (문제의 해결)
예전 게임에서 도둑은 자물쇠를 아주 조금만 흔들 수 있었습니다. 이는 게임을 공정하고 측정 가능하게 유지했습니다.
새로운 게임에서 도둑은 무엇이든 할 수 있습니다.
- 비유: 도둑은 이제 변장을 하거나, 경비원을 매수하거나, 레이저로 자물락을 따거나, 혹은 그냥 말로 경비원을 설득하여 문을 열게 할 수 있습니다.
- 문제: 도둑에게 무한한 공격 방식이 있기 때문에, 연구자들은 "최악의 경우"의 공격을 찾아내는 컴퓨터 프로그램을 작성할 수 없습니다. 실제로 논문은 현재 인간이 컴퓨터보다 모델을 더 잘 깨뜨리고 있다고 지적합니다. 최고의 "도둑"들은 이제 수학이 아니라 창의성과 사회 공학을 사용하는 사람들입니다. 이는 모든 가능한 인간의 속임수에 대비해 "완벽한 자물쇠"를 만드는 것을 불가능하게 만듭니다.
3. 점수판이 고장 났습니다 (결과의 평가)
예전 게임에서는 몇 개의 상자가 열렸는지 정확히 셀 수 있었습니다.
새로운 게임에서는 다른 AI 봇을 사용하여 챗봇이 "나쁜" 말을 했는지 판단합니다.
- 비유: 로봇에게 그림이 "추한지" 판단하라고 요청한다고 상상해 보십시오. 로봇은 단순히 "고양이 그림이 아니면 추하다"라고 말할 수도 있습니다. 혹은 도둑에게 속아 "아니, 이건 사실 아름답다"라고 말할 수도 있습니다.
- 문제: 우리가 성공을 측정하는 도구들은 결함이 있습니다. 그 도구들은 쉽게 속을 수 있고, 인간의 뉘앙스를 이해하지 못하며, 종종 잘못된 경보를 울립니다. 더욱이, "자물쇠"(AI 모델)는 종종 대기업에 의해 소유되며 비밀리에 업데이트됩니다. 만약 회사가 하룻밤 사이에 자물쇠를 바꾼다면, 연구자들은 지난달의 결과와 이번 달의 결과를 비교할 수 없습니다. 이는 집의 사진 두 장을 비교하려고 하는데, 사진을 찍는 사이 집의 색깔과 모양이 계속 변하는 것과 같습니다.
사례 연구 (증거)
논문은 이 "망가진 게임"이 일어나고 있는 여섯 가지 특정 영역을 살펴봅니다:
- 탈옥 (Jailbreaks): 봇이 "아니오"라고 말하도록 속이는 것입니다. 봇이 말이 많을 때 "아니오"가 어떤 모습인지 정의하기 어렵습니다.
- 미세 조정이 불가능한 모델 (Un-finetunable Models): 봇이 새로운 위험한 기술을 배울 수 없도록 너무 똑똑하게 만들려는 시도입니다. 하지만 만약 도둑이 봇을 재학습시킬 수 있다면, 게임의 성격이 완전히 바뀝니다.
- 포이즈닝 (Poisoning): 봇의 학습 과정에 나쁜 데이터를 몰래 집어넣는 것입니다. 하지만 학습 데이터는 너무 방대하고 무질서해서(수백만 권의 책이 있는 도서관처럼), 어떤 책이 문제를 일으켰는지 알 수 없습니다.
- 프롬프트 인젝션 (Prompt Injections): 봇이 자신의 규칙을 무시하도록 속이는 것입니다. 봇은 대화를 무한히 이어갈 수 있으므로, 도둑은 긴 대화 속에 나쁜 지시사항을 몰래 끼워 넣을 수 있으며, 이를 포착하기 어렵게 만듭니다.
- 개인정보 보호 (Privacy): 봇이 특정 개인의 데이터를 "기억"했는지 확인하는 것입니다. 하지만 봇은 인터넷 전체로부터 배웠기 때문에, 그것이 정말 그 특정 사람으로부터 배운 것인지 아니면 단지 유사한 정보로부터 배운 것인지 알 방법이 없습니다.
- 언러닝 (Unlearning): 봇에게 특정 주제(예: 폭탄 제조법)를 "잊게" 만드는 것입니다. 하지만 특정 사실을 뇌에서 삭제하는 것은 쉽지 않으며, 자칫하면 봇의 생물학적 능력을 통째로 삭제할 수도 있습니다.
결론
저자들은 AI를 보호하려는 노력을 멈추라는 말을 하는 것이 아닙니다. 그들은 우리가 조각이 빠져 있고 상자에 완성 그림도 없는 퍼즐을 풀려고 노력하고 있다고 말하는 것입니다.
그들은 다음 10년 동안 우리가 마치 진전을 이루고 있는 것처럼 보이는 논문들을 계속 발표할 수도 있지만, 규칙이 모호하고 테스트가 신뢰할 수 없기 때문에 실제로 안전해지고 있는 것은 아니라고 주장합니다.
그들의 조언:
혼란스럽고 개방적인 전체 AI를 보호하려고 애쓰는 대신, 연구자들은 작고 구체적이며 잘 정의된 "장난감" 문제(예를 들어 예전의 "자물쇠를 1mm 흔드는" 게임)를 선택해야 합니다. 만약 우리가 이러한 작고 명확한 문제조차 엄밀하게 해결하지 못한다면, 거대하고 복잡한 실제 세계의 문제를 해결할 희망은 없습니다.
요약하자면: 우리는 형태를 바꿀 수 있고, 모든 각도에서 공격할 수 있으며, 스스로의 승리를 심판할 수 있는 적을 상대로 요술 자가 줄어드는 자를 가지고 요새를 구축하려 하고 있습니다. 우리가 규칙과 자를 먼저 고치지 않는 한, 우리는 실제로 진전을 이루고 있는 것이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.