What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models
이 논문은 현재의 컴플라이언스 탐지기들이 명시된 규제 규칙에 진정으로 의존하기보다 표면적인 특징에 의존함으로써 "규칙 맹목성(rule blindness)" 문제를 겪고 있음을 밝히며, 제안된 학습 불필요 방식의 내부 컴플라이언스 점수(ICS)조차도 사소한 베이스라인과 적응형 공격에 대해 견고함이 부족하다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 디지털 세상에서 거대 언어 모델은 이메일 초안 작성부터 복잡한 질문에 대한 답변에 이르기까지 텍스트를 생성하는 강력한 엔진 역할을 합니다. 그러나 이러한 도구들이 금융, 의료, 법률과 같은 규제 분야에서 사용될 때는 엄격한 서면 규칙을 따라야 합니다. 예를 들어, 어떤 은행은 개인 데이터를 90일 이내에 삭제해야 한다는 정책을 가질 수 있습니다. AI가 이를 따르도록 보장하기 위해, 기업들은 종-종 AI의 출력물을 스캔하여 위반 사항을 찾아내도록 훈련된 특화된 분류기인 '가드 모델(guard models)'을 배치합니다. 이러한 가드들이 제공된 특정 규칙을 읽고 AI의 답변이 그 규칙과 일치하는지 확인하기를 기대하는 것입니다. 가드가 제대로 작동한다면, 단순히 주제가 위험해 보인다는 이유 때문이 아니라, 특정 규칙이 실제로 위반되었을 때만 위반으로 표시해야 합니다.
Lexsi Labs의 연구팀은 이러한 컴플라이언스 모니터들이 실제로 자신들이 집행해야 할 규칙을 이해하고 있는지 테스트하기 위해 나섰습니다. 그들은 '규칙 맹목성(rule blindness)'이라고 부르는 현상을 조사했습니다. 이는 탐지기가 자신이 확인해야 할 규칙과 상관없이 동일한 판결을 내리는 경우를 말합니다. 박물관의 보안 요원이 방문객이 빨간 가방을 들고 있다는 이유만으로 제지한다고 가정해 봅시다. 이는 빨간 가방이 금지되어서가 아니라, 보안 요원이 단순히 빨간색을 위험과 연관 지어 학습했기 때문입니다. 만약 박물관의 규칙이 파란 가방을 금지하는 것으로 바뀐다면, 규칙 맹목적인 보안 요원은 여전히 빨간 가방을 잡고 파란 가방은 무시할 것입니다. 새로운 지침을 완전히 놓치는 셈입니다. 연구진은 우리의 데이터를 보호하는 디지털 가드들도 이와 동일한 문제를 겪고 있는지 알고 싶었습니다.
연구팀은 먼저 기존의 다양한 가드 모델과 AI의 내부 작동 방식을 들여다보고 의도를 추측하는 도구인 활성화 프로브(activation probes)를 테스트하기 시작했습니다. 그들은 시스템이 어떻게 반응하는지 보기 위해 입력을 특정 방식으로 변경하는 역사실적 테스트(counterfactual testing) 방법을 사용했습니다. 실험에서 그들은 데이터가 400일 동안 보관되는 시나리오를 가져왔는데, 이는 90일 규칙을 명백히 위반하는 상황입니다. 그런 다음 그 90일 규칙을 완전히 다른 관련 없는 규칙으로 바꾸거나, 심지어 규칙 자체를 제거했습니다. 놀랍게도 가드 모델들은 규칙이 사라지거나 바뀌었음에도 불구하고, 마치 규칙이 존재할 때와 마찬가지로 동일한 빈도와 확신을 가지고 위반을 표시했습니다. 탐지기들은 특정 규칙이 무엇을 위반으로 만드는지가 아니라, 데이터가 너무 오래 보관되었다는 '상황' 자체를 추적하고 있었습니다. 이러한 실패는 한 가지 유형의 모델에 국한되지 않았습니다. 규칙을 전혀 보지 않는 고정형 안전 분류기에서도 나타났고, 맞춤형 규칙을 읽고 따르도록 명시적으로 설계된 정교한 '정책 조건부(policy-conditioned)' 가드에서도 나타났습니다. 그러한 가드 중 하나는 텍스트 내 규칙의 위치를 91~95%의 확률로 정확히 인용했음에도 불구하고, 해당 행위를 허용하는 관대한 규칙으로 교체했을 때 최종 판결은 거의 변하지 않았습니다.
이러한 시스템들이 실제로 무엇을 읽고 있는지 이해하기 위해, 연구진은 새로운 목적 기반 벤치마크를 구축했습니다. 그들은 특정 규칙과 특정 시나리오 사이의 상호작용에 따라 결과가 결정되는 테스트를 만들었으며, 이를 통해 규칙 텍스트나 시나리오 텍스트 어느 하나만으로는 결과를 예측할 수 없도록 했습니다. 예를 들어, 어떤 규칙은 1,000달러 미만의 계좌에 대해 검사를 간소화할 수 있다고 하는 반면, 다른 규칙은 한도를 5,000달러로 설정할 수 있습니다. 만약 시나리오가 2,000달러의 계좌를 설명한다면, 판결은 활성화된 규칙이 무엇인지에 전적으로 달려 있습니다. 이 통제된 벤치마크에서 테스트를 실행했을 때, 그들이 시도한 모든 효율적인 탐지기는 자신들의 새로운 도구를 포함하여 무작위 확률보다 나은 성과를 내지 못했습니다. 유일하게 성공한 시스템은 단계별로 추론하며 문제를 분해하여 답을 내놓는 거대 언어 모델뿐이었습니다. 이는 빠르고 자동화된 탐지기들이 규칙을 시나리오와 결합하는 것이 아니라, 텍els의 표면적 특징을 바탕으로 '위반'이라는 광범위한 신호를 단순히 인식하고 있음을 시사했습니다.
연구진은 이후 '내부 컴플라이언스 점수(Internal Compliance Score)'라는 새로운 훈련 불필요 도구를 도입했습니다. 이 방법은 AI의 내부 활성화 신호를 직접 읽으며, 단 10쌍의 예시만으로도 보정할 수 있습니다. 이는 매우 저렴하고 빠르며, 추가적인 재학습이나 추가적인 처리 단계가 필요하지 않습니다. 그들은 이 도구가 후보 응답들을 순위 매기는 데 탁월하며, 목록에서 가장 준수적인 답변을 선택하는 데 도움을 준다는 것을 발견했습니다. 테스트에서 이 도구는 지시 이행 작업의 통과율을 5%포인트 향상시켰습니다. 그러나 다른 가드들을 괴롭혔던 것과 동일한 규칙 맹목성이 이 새로운 점수에도 영향을 미쳤습니다. 규칙이 삭제되거나 바뀌었을 때, 점수는 변하지 않았습니다. 이 도구는 특정 규칙에 대한 구체적인 준수 여부가 아니라 일반적인 위험 감지 수준을 측정하고 있었습니다. 또한 연구진은 이 장점이 취약하다는 것을 발견했습니다. 영리하고 적응적인 공격이 응답 끝에 몇 개의 특정 단어를 추가함으로써 시스템을 쉽게 속릴 수 있으며, 이 경우 점수는 무작위 수준으로 떨어졌습니다.
이 연구는 현재 컴플라이언스를 측정하는 방식에 대한 더 깊은 문제를 드러냈습니다. 연구진은 이러한 시스템을 테스트하는 데 사용되는 7개의 공개 벤치마크를 감사했으며, 그중 4개가 '어휘적으로 퇴보(lexically degenerate)'되어 있다는 것을 발견했습니다. 이는 응답의 준수 여부에 대한 라벨이 시나리오가 작성된 방식이나 판결이 서술된 방식 등을 통해 텍스트 자체에 이미 포함되어 있음을 의미합니다. 규칙을 이해하지 못하고 단순히 단어만 세는 간단한 컴퓨터 프로그램조차도 높은 정확도로 이 벤치마크를 해결할 수 있었습니다. 이는 모델의 규칙 준수 능력에 대한 기존의 많은 주장들이 실제로는 특정 단어나 문장 구조를 인식하는 능력에 대한 주장이었음을 암시합니다. 연구진은 이러한 탐지기들이 응답을 분류하고 순위를 매기는 데는 유용할 수 있지만, 특정 규칙에 근거하여 법적 또는 감사 결정을 내리는 데는 신뢰할 수 없다고 결론지었습니다. 이들은 규칙 특화적인 보증의 외양을 제공하지만, 실질적으로는 자신들이 집행해야 할 규칙에 대해 맹목적입니다. 논문은 테스트에 사용된 도구와 프로토콜을 공개함으로써, 다른 이들이 실제 현장에 배포되기 전에 동일한 맹목성을 체크할 수 있도록 하며 마무리됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.