SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
이 논문은 인컨텍스트 정책 가드레일링(in-context policy guardrailing)을 평가하기 위해 1,000개의 멀티턴 대화와 3,000개의 애플리케이션 특화 정책을 특징으로 하는 계층적 벤치마크인 SafePyramid를 소개하며, 이를 통해 최첨단 모델들조차 다양한 복잡도 수준에 걸쳐 안전 위반을 정확하게 식별하고 새로운 정책 프레임워크에 적응하는 데 어려움을 겪는다는 것을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 첨단 기술이 집약된 건물의 보안 총괄 책임자라고 상상해 보십시오. 과거에 당신의 보안 요원들(AI 모델)은 "무기 소지 금지", "고성방가 금지", "배회 금지"와 같은 고정되고 경직된 규칙 책을 가지고 훈련받았습니다. 이를 **고정 분류형 가드레일링(Fixed-Taxonomy Guardrailing)**이라고 합니다. 이는 일반적인 안전에는 효과적이지만, 현실 세계에는 너무 경직되어 있습니다.
때로는 VIP 고객이 제한 구역에 입장해야 하거나(특수 조언 시나리오), 건설 팀이 복도를 통해 중장비를 이동시켜야 할 때도 있습니다(핵심 인프라 시나리오). 이러한 특정 상황에서는 규칙이 날마다, 사람마다, 그리고 맥락에 따라 달라집니다. 매번 건물 전체의 보안 매뉴얼을 새로 쓸 수는 없습니다. 당신에게는 입구에서 바로 전달받은 새롭고 일시적인 규칙 시트를 완벽하게 읽고 따를 수 있는 보안 요원이 필요합니다.
이것이 바로 논문에서 말하는 **인컨텍스트 정책 가드레일링(In-Context Policy Guardrailing)**입니다.
이 논문의 저자들(ByteDance 및 멜버른 대학교)은 뛰어난 AI 보안 요원들이 존재함에도 불구하고, 이들이 과연 새롭고 일시적인 규칙 시트를 잘 읽을 수 있는지에 대해 잘 알지 못한다는 사실을 깨달았습니다. 그래서 그들은 SafePyramid라고 불리는 거대한 테스트장을 구축했습니다.
SafePyramid 테스트: 3층짜리 건물
이 AI 보안 요원들을 테스트하기 위해, 연구진은 피라미드 형태의 난이도를 가진 벤치마크를 만들었습니다. 이것은 마치 세 단계로 점점 어려워지는 비디오 게임과 같습니다.
레벨 0: "위반 사항 찾기" 게임 (이해력)
보안 요원에게 20개의 규칙 목록이 주어졌다고 상상해 보십시오. 어떤 규칙은 들어오는 사람과 관련이 있고(예: "개 출입 금지"), 어떤 규칙은 엉뚱한 내용입니다(예: 수영장이 없는 곳에서 "로비 내 수영 금지").
- 테스트: 보안 요원이 사람과 대화 내용을 보고 "좋아, 이 사람은 개를 데려왔으니 규칙 3번을 어겼어. 하지만 수영을 하는 건 아니니 15번 규칙은 괜찮아"라고 말할 수 있는가?
- 도전 과제: 많은 AI 보안 요원들이 이런 '레드 헤링(주의를 딴 데로 돌리는 요소)' 때문에 혼란을 겪거나 실제 위반 사항의 미세한 디테일을 놓칩니다.
레벨 1: "규칙집 로직" 게임 (의존성)
이제 규칙이 까다로워집니다. "개 출입 금지"라는 규칙이 있다고 가정해 봅시다. 하지만 두 번째 규칙이 있습니다: "단, 인증된 서비스 동물인 경우는 제외한다."
- 테스트: 보안 요원은 첫 번째 규칙이 보통 적용되지만, 특정 조건이 충족되면 두 번째 규칙이 이를 무효화할 수 있다는 점을 이해해야 합니다. 또는, "개를 데려올 수 있다"라는 규칙이 있지만 "개가 크게 짖는 경우"에는 예외가 적용될 수도 있습니다.
- 도전 과제: AI는 여러 규칙을 동시에 다뤄야 합니다. 개를 봤다고 해서 바로 "위반!"이라고 외치는 것이 아니라, "서비스 동물"이라는 예외 사항이 적용되는지 확인해야 합니다. 논문에 따르면 대부분의 AI 보안 요원들이 여기서 매우 혼란스러워하며, 예외 사항을 놓치거나 적용하지 않아야 할 때 적용해 버리는 실수를 범합니다.
레벨 2: "외국어" 게임 (새로운 프레임워크)
이것이 가장 어려운 단계입니다. 보안 요원이 완전히 만들어진 언어나 용어(예: "OGCP 프로토콜" 또는 "격리 검증")로 작성된 규칙집을 받았다고 상상해 보십시오. 보안 요원은 이 단어들을 본 적이 없습니다. 일반적인 지식이나 훈련된 내용에 의존할 수 없으며, 오직 새로운 규칙집에 적힌 정의를 읽고 정확하게 적용해야 합니다.
- 테스트: 보안 요원이 즉석에서 새로운 법률을 학습하고 실수 없이 집행할 수 있는가?
- 도전 과제: 이곳은 AI 보안 요원들이 정말 힘들어하는 구간입니다. 아무리 똑똑한 모델이라도 새로운 용어 체계 속에서 길을 잃고 규칙을 올바르게 적용하는 데 실패합니다.
결과: 보안 요원들은 아직 배우는 중입니다
연구진은 세계 최고의 AI 모델 10개(프런티어 LLM)와 특화된 보안 모델 5개를 대상으로 이 피라미드를 테스트했습니다.
나쁜 소식은 이렇습니다: 보안 요원들은 아직 현장에 투입될 준비가 되지 않았습니다.
- 쉬운 단계 (레벨 0): 가장 뛰어난 AI(GPT-5.5)조차 복잡한 작업에서 전체 위반 목록을 정확히 맞춘 확률이 약 **54%**에 불ø했습니다. 이는 복잡한 과업에 대해 동전 던지기보다 조금 나은 수준입니다.
- 중간 단계 (레벨 1): 성공률은 **35%**로 떨어졌습니다.
- 어려운 단계 (레벨 2): 성공률은 **13%**로 급락했습니다.
이는 수학 시험을 치는 학생과 같습니다. 단순한 덧셈 문제는 맞힐 수 있겠지만, 대수학(의존성)이 등장하고, 심지어 완전히 새로운 수학 기호 체계(새로운 프레임워크)로 바뀌면 처참하게 무너지는 것과 같습니다.
왜 실패하는가?
연구진은 AI가 왜 실패하는지 파헤쳤고, 사고 과정에서의 세 가지 주요 "버그"를 발견했습니다.
- 키워드 냄새 맡기 (Keyword Sniffing): AI는 "개"라는 단어를 보자마자 예외 사항이 있는지 혹은 규칙이 이 특정 상황에 적용되는지 확인하지 않고 즉시 "위반!"이라고 생각합니다. 이는 마치 모자를 쓴 모든 사람을 막아서면서 "어린이는 모자 착용 가능"이라는 예외를 무시하는 보안 요원과 같습니다.
- 예외 사항에서 맥락 놓치기 (Losing the Plot on Exceptions): "개 출민 금지, 단 서비스 동물은 제외"라는 규칙이 있을 때, AI는 종종 "제외한다"는 부분을 잊어버립니다. 개를 보고는 멈춰 세우지만, 그 미묘한 차이를 놓치는 것입니다.
- 새로운 단어에서 길을 잃음 (Getting Lost in New Words): 규칙이 새로운 가상의 프레임워크(레벨 2)로 작성되었을 때, AI는 혼란에 빠집니다. AI는 규칙을 상황을 판단하기 위한 도구로 사용하는 대신, 규칙 자체를 위반 사항으로 취급해 버립니다. 이는 새로운 사전을 받은 학생이 그 사전을 사용하여 이야기를 이해하는 것이 아니라, 단어의 정의 자체를 사실로서 암기해 버리는 것과 같습니다.
해결책은 무엇인가?
논문은 단순히 AI를 더 "똑똑하게" 만드는 것만으로는 충분하지 않다고 제안합니다. AI에게 페이지 전체의 규칙을 읽고 위반 목록을 뱉어내라고 요구하는 현재의 방식은 너무 어렵습니다.
대신, 연구진은 작업을 세분화하여 AI에게 한 번에 하나의 규칙씩 확인하게 한 뒤 답변을 결합하도록 하면 성능이 훨씬 좋아진다는 것을 발견했습니다. 이는 보안 요원에게 건물 전체의 보안 정책을 한꺼번에 암기하라고 하는 대신, 체크리스트를 하나씩 지워나가며 확인하게 하는 것과 같습니다.
또한, 메인 보안 요원이 자신의 작업을 검토할 수 있도록 돕는 AI 조수들(Agent Harnesses)을 사용하는 것이 결과를 크게 개선한다는 것도 발견했습니다.
핵심 요약
SafePyramid는 경종을 울립니다. AI가 대화를 나누고 글을 쓰는 데는 놀랍도록 뛰어나지만, 현재로서는 새로운 특정 정책을 즉각적으로 적용하여 엄격하게 규칙을 준수하는 보안 요원이 되기에는 매우 부족합니다. 우리는 복잡한 규칙 의존성을 처리하고 새로운 프레임워크를 즉시 학습할 수 있는 더 나은 시스템을 구축해야 하며, 그렇지 않으면 실생활 응용 분야에서 디지털 공간을 안전하게 지키기 위해 AI를 신뢰할 수 없을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.