← 최신 논문
🤖 AI

Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence

이 논문은 기존의 단일 턴 인증 방식이 가진 지수적 성능 저하를 극복하기 위해, 상태-적대적 MDP(State-Adversarial MDPs)와 합성 경계(compositional bounds)를 활용하여 대규모 언어 모델에 대한 멀티 턴 탈옥 공격에 대해 더욱 정교하고 이론적으로 근거 있는 안전성 보장을 제공하는 새로운 프레임워크인 다회차 인증 강건성(Multi-Turn Certified Robustness, MTCR)을 소개한다.

원저자: Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서 대규모 언어 모델은 새로운 세대의 대화형 기술을 뒷받는 엔진이 되었습니다. 이러한 시스템은 이야기를 쓰고, 문제를 해결하며, 복잡한 대화를 나눌 수 있지만, 주고받는 대화에 참여하는 능력은 특정한 취약점 또한 불러옵니다. 단일 질문은 방어하기 쉬울 수 있지만, 영리한 공격자는 일련의 질문을 사용하여 대화의 맥락을 서서히 변화시킴으로써 기계가 해로운 정보를 드러내거나 안전 규칙을 우회하도록 속일 수 있습니다. 이를 멀티턴 탈옥(multi-turn jailbreak)이라고 합니다. 수년 동안 연구자들은 이러한 시스템이 긴 대화 과정에서도 안전하다는 것을 증명하기 위해 애써왔습니다. 전통적인 방식은 단일 교환에 대해서는 안전성을 보장할 수 있었지만, 그 보장을 긴 대화로 확장하려고 하면 수학적으로 안전성이 거의 즉각적으로 사라져 시스템이 공격에 무방비로 노출된다고 나타났습니다.

연구팀은 이제 멀티턴 인증된 강건성(Multi-Turn Certified Robustness, MTCR)이라는 새로운 프레임워크를 개발하여, 이러한 긴 대화에서의 안전성을 이해하는 방식을 바꾸어 놓았습니다. 대화를 단순한 독립적 사건들의 사슬로 취급하여 대화가 진행될 때마다 안전성이 상실되는 것으로 보는 대신, 연구진은 대화를 구조화된 지형을 통과하는 여정으로 모델링했습니다. 그들은 대화가 마치 여행자가 지도의 서로 다른 지역을 이동하는 것처럼 자연스럽게 뚜렷한 "모드(modes)" 또는 패턴으로 분류된다는 것을 발견했습니다. 이러한 특정 영역들로 대화를 세분화하고 시스템이 그 사이를 어떻게 이동하는지 연구함으로써, 그들은 안전성이 이전에 생각했던 것만큼 빠르게 저하되지 않는다는 것을 발견했습니다. 그들의 연구는 공격자가 대화를 조작하려고 시도하는 중에도 대화가 특정 횟수의 턴 동안 안전하게 유지될 수 있다는 수학적 보증을 제공합니다.

이 발견의 핵심은 연구진이 대화의 흐름을 분석한 방식에 있습니다. 그들은 대화가 안전한 패턴 내에 머물러 있다면, 시스템의 안전 마진(해로운 콘텐츠를 생성하지 않도록 유지하는 완충 장치)이 단순한 수학적 예측보다 더 빠르게 줄어들지 않는다는 점을 깨달았습니다. 그들은 "안전 지속성(safety persistence)"이라 부르는 속성을 정의했는데, 이는 대화가 진행됨에 따라 모델이 자신의 안전 표준을 얼마나 잘 유지하는지를 측정합니다. 실험에서 그들은 오픈 소스 시스템부터 가장 진보된 상용 모델에 이르기까지 여섯 가지 서로 다른 대규모 언어 모델을 대상으로 이 프레임워크를 테스트했습니다. 연구진은 공격자가 방어 체계를 점진적으로 무너뜨리기 위해 입력값의 순서를 정교하게 설계하는 '크레센도(Crescendo)'라는 고도의 공격 스타일을 포함하여 이 모델들을 엄격하게 테스트했습니다.

결과는 명확하고 안심할 만했습니다. 모든 테스트 케이스에서 모델의 실제 안전성은 새로운 프레임워크가 제공하는 엄격한 최악의 경우 보장치보다 훨씬 높았습니다. 예를 들어, 20턴 동안 지속되는 대화에서 이론적 보증은 안전 확률이 불과 몇 퍼센트에 불과할 수 있다고 제안하지만, 실제 모델은 대다수의 시도에서 안전을 유지했습니다. 이 엄격한 보증과 실제 성능 사이의 격차는 실무에서 수학적 경계가 위반되지 않음을 확인시켜 줍니다. 연구진은 주요 기술 기업의 모델과 같은 가장 진보된 모델들이 이전의 모델이나 정렬이 덜 된 모델들보다 훨씬 더 오래 안전성을 유지한다는 것을 발견했으며, 이는 더 나은 학습이 더 강력한 지속성을 만든다는 것을 보여줍니다.

결정적으로, 이 연구는 대화이 길어짐에 따라 안전성이 반드시 기하급수적으로 붕식되어야 한다는 생각을 일축했습니다. 이전의 방법들은 모델이 한 턴에서 95%의 안전 확률을 가진다면, 20턴 후에는 아주 미미한 확률만을 가질 것이라고 가정했습니다. 새로운 프레임워크는 이러한 가정이 너무 비관적이라는 것을 보여줍니다. 대화의 구조와 안전 마진이 진화하는 방식을 고려함으로써, 연구진은 안전성이 이전의 수학이 허용했던 것보다 훨씬 더 오랫동안 유지될 수 있음을 증명했습니다. 그들은 대화가 안전하게 유지되기 위해서 시스템이 매 단계마다 완벽할 필요는 없으며, 한 주제에서 다른 주제로 이동할 때 일정 수준의 회복 탄력성을 유지하기만 하면 된다는 것을 입증했습니다.

또한 이 연구는 이러한 대화가 어떻게 구조화되는지의 중요성을 강조했습니다. 연구진은 유사한 대화 상태들을 하나로 묶는 기법을 사용했는데, 모델이 일관된 주제 그룹 내에 머물러 있을 때는 안전성을 깨뜨리기가 매우 어렵다는 것을 발견했습니다. 위험이 증가하는 시점은 대화가 매우 다른 그룹들 사이를 건너뛸 때뿐입니다. 이러한 통찰은 안전성을 "안전함" 또는 "안전하지 않음"이라는 이분법적 관점에서 벗어나, 안전이 시간에 따라 어떻게 지속되는지에 대한 역동적인 관점으로 옮겨가는 더 미묘한 이해를 가능하게 합니다. 비록 공식적인 보증은 특정 유형의 텍스트 조작에 적용되지만, 연구진은 모델이 단순한 텍스트 변경을 넘어선 더 복잡한 의미론적 공격에 대해서도 잘 버텨낸다는 것을 관찰했습니다.

궁극적으로 이 연구는 개발자와 감사자들이 대규모 언호 모델을 대중에게 공개하기 전에 대화형 AI의 안전성을 평가할 수 있는 새로운 도구를 제공합니다. 이는 모델의 특정 행동에 기반하여 위험이 너무 높아지기 전까지 대화가 정확히 얼마나 지속될 수 있는지를 계산할 수 있는 방법을 제시합니다. 이 프레임워크는 적절한 구조적 특성을 갖춘다면 대규모 언어 모델이 안전성을 잃지 않고 길고 복잡한 대화를 수행할 수 있음을 시사합니다. 이것이 문제가 영원히 해결되었다는 의미는 아니지만, 인간과 AI 간의 소통을 정의하는 멀티턴 상호작용에서 안전성을 이해하고 인증하는 데 있어 확고한 토대를 마련합니다. 이 연구는 공격자들이 영리할지라도, 잘 정렬된 모델들의 근본적인 안전 메커니즘은 이전에 믿었던 것보다 더 견고하고 지속적이라는 것을 확인시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →