← 최신 논문
🤖 AI

Adversarial Entropy Inflation Against Gumbel-Based Inference Verification

이 논문은 정상적인 트래픽 환경에서 LLM 가중치 탈취를 제한한다고 이전에 주장되었던 검증 방식인 굼벨(Gumbel) 기반 추론 검증이, 문법 구조를 교란하여 토큰 엔트로피를 인위적으로 높이는 적대적 프롬프트에 대해서는 효과가 현저히 떨어지며, 이로 인해 데이터 유출률이 두 배로 증가하므로 동적인 엔트로피 보정 방어 기법이 필요함을 입증한다.

원저자: Nikita Kezins

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Nikita Kezins

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 급격히 확장되는 세계에서, 거대 언어 모델은 비밀 레시피나 독점적인 설계도와 마찬가지로 매우 가치 있는 지적 재산이 되었습니다. 이러한 모델들이 매우 가치 있기 때문에, 악의적인 행위자들이 정상적인 사용 중에 시스템을 속여 내부 계산을 드러내게 함으로써 '가중치(weights)'라고 알려진 기초 코드를 훔칠 수 있다는 우려가 커지고 있습니다. 이를 막기 위해, 한 연구자는 보안 검문소 역할을 하는 검증 방법을 개발했습니다. 이 시스템은 모델이 텍스트를 생성할 때 내리는 선택이 특정 공유 비밀 키와 일치하는지 확인합니다. 이 시스템은 컴퓨터 하드웨어가 완벽하게 정밀하지 않으며, 두 가지 매우 유사한 옵션 사이에서 결정할 때 때때로 아주 작은 무작위 실수를 할 수 있다는 점을 인정하여 약간의 자연스러운 오차를 허용합니다. 이러한 내장된 오차 허용 범위는 정직한 사용자가 단순히 컴퓨터가 머뭇거린다는 이유로 규칙 위반으로 잘못 몰리는 것을 방지하기 위한 안전 장치입니다.

델프트 공과대학교(Delft University of Technology)의 한 연구자는 최근 이 보안 검문소가 더 교활한 유형의 공격자로부터 얼마나 강력한지를 테스트했습니다. 그들은 컴퓨터 하드웨어의 미세한 결함을 용서하도록 설계된 이 안전망이, 질문을 던지는 방식을 조작할 줄 아는 공격자에 의해 거대한 구멍으로 넓어질 수 있다는 것을 발견했습니다. 연구자는 모델의 언어 규칙을 깨뜨리고 혼란을 일으키도록 설계된 프롬프트를 입력함으로써, 공격자가 모델을 불확실하게 만들 수 있다는 것을 발견했습니다. 이러한 불확실성은 보안 시스템이 허용하는 정답의 목록을 확장시켜, 결과적으로 보안 경로를 정보 탈취를 위한 넓은 고속도로로 바꾸어 놓습니다. 그들의 연구는 일상적인 대화를 기준으로 조정된 현재의 방어 체계가, 모델 자체의 혼란을 이용할 줄 아는 단호한 공격자를 막기에는 충분하지 않다는 것을 시사합니다.

문제의 핵심은 보안 시스템이 무엇을 정당한 실수로 간주하고 무엇을 훔친 비밀로 간주할지 결정하는 방식에 있습니다. 모델이 텍로를 생성할 때, 모델은 가능한 모든 다음 단어의 가능성을 계산합니다. 보통 하나의 단어가 가장 명확한 최선의 선택이며, 시스템은 그 단어에 고정됩니다. 그러나 모델이 확신이 없을 때, 두 개 이상의 단어가 거의 동일한 점수를 가질 수 있습니다. 이러한 결정 장애의 순간에, 컴퓨터 하드웨어의 미세하고 무작위적인 변동이 최종 선택을 한 단어에서 다른 단어로 바꿀 수 있습니다. 보안 시스템은 이러한 변화를 단순한 무해한 노이즈로 간주하여 용서하도록 구축되었습니다. 연구자는 만약 공격자가 모델을 끊임없이 불확실하게 만드는 상황을 설계할 수 있다면, 시스템이 훨씬 더 넓은 범위의 결과를 수용하도록 강제할 수 있다는 점을 깨달았습니다. 그렇게 함으로써, 공격자는 시스템의 오차 허용 범위를 비밀 채널로 사용하여 특정 단어의 선택 속에 숨겨진 데이터를 인코딩하여 정보를 유출할 수 있습니다.

이 이론을 테스트하기 위해, 연구자는 10억 개의 파라미터를 가진 작은 모델부터 320억 개의 파라미터를 가진 거대한 시스템에 이르기까지 다양한 크기의 6가지 언어 모델을 사용하여 일련의 실험을 설정했습니다. 그들은 먼저 일반적인 챗봇에게 물을 법한 질문과 유사한 150개의 표준적이고 양호한 프롬프트를 사용하여 기준선을 설정했습니다. 이러한 조건 하에서 보안 시스템은 의도한 대로 작동했습니다. 허용되는 단어의 목록은 거의 항상 단 하나의 옵션이었으며, 이는 모델이 결정론적이 되도록 강제했음을 의미합니다. 이 상태에서 시스템은 데이터 탈취 시도를 200배 이상의 비율로 늦추어, 탈취를 사실상 불가능하게 만들었습니다. 이는 시스템을 의도된 대로 사용하는 수동적인 공격자들에 대해 방어가 효과적이었음을 확인해 주었습니다.

연구자는 이후 모델의 다음 단어를 확신 있게 예측하는 능력을 방해하도록 설계된 세 가지 뚜렷한 유형의 적대적 공격을 도입했습니다. 첫 번째 유형인 "terse(간결한)"는 첫 번째 단어를 고립시키는 매우 짧고 문맥이 적은 프롬프트를 사용했습니다. 두 번째 유형인 "scramble(뒤섞인)"은 일반적인 문법 규칙을 깨뜨리는 관련 없는 항목들과 지시 사항들을 사용했습니다. 세 번째이자 가장 효과적인 유형인 "cipher(암호)"는 논리적 연결이 없는 서로 다른 문자 체계, 숫자, 기호들의 문자열을 사용했습니다. 이러한 프롬프트들은 모델의 단어 결합에 대한 내부적 이해를 혼란스럽게 하여, 학습된 패턴보다는 무작위 확률에 의존하게끔 설계되었습니다. 연구자는 각 공격 유형에 대해 150개의 적대적 프롬프트를 생성하고, 결과의 일관성을 보장하기 위해 모델을 세 번씩 실행했습니다.

결과는 시스템 성능의 극적인 변화를 보여주었습니다. 모델의 개별 문자 및 스크립트 수준에서 모델을 방해하는 "cipher" 프롬프트가 입력되었을 때, 보안 시스템의 오차 허용 범위는 폭발적으로 증가했습니다. 허용되는 단어의 목록이 단 하나의 항목이었던 것과 달리, 목록이 눈에 띄게 커졌습니다. 이러한 확장은 공격자가 양호한 기준점과 비교했을 때 단어당 약 두 배 더 많은 숨겨진 정보를 추출할 수 있게 했습니다. 결과적으로, 200배 이상의 거대한 장벽이었던 감속 계수는 특정 모델에 따라 60에서 118 사이로 붕괴되었습니다. 가장 큰 모델들의 경우, 방어력은 원래 생각했던 것보다 약 3배 더 약해졌습니다. "scramble" 프롬프트 역시 상당한 성공을 보였으나, "terse" 프롬프트는 역설적으로 작은 모델들에서 방어를 더 강화하여, 모델을 더 예측 가능하게 만들고 공격자가 의도했던 바로 그 불확실성을 줄이는 결과를 낳았습니다.

이러한 결과는 현재의 검증 방식이 너무 경직되어 있음을 나타냅니다. 이 방식은 모델이 정상적이고 예의 바른 대화를 할 때의 행동을 바탕으로 설정된, 무엇이 허용 가능한 오류인지에 대한 정적인 임계값에 의존합니다. 본 연구는 입력값이 모델의 혼란을 극대화하도록 설계되었을 때 이 접근 방식이 실패한다는 것을 입증합니다. 연구자는 이 방어 체계가 지나치게 경직되어 있다고 결론지었습니다. 검증기는 고정된 규칙을 사용하는 대신, 매 단계마다 모델이 얼마나 불확실한지를 지속적으로 측정하고 그에 따라 오차 허용 범위를 조정해야 합니다. 모델이 혼란스러워하면 시스템은 규칙을 엄격히 해야 하고, 모델이 확신이 있으면 규칙을 완화할 수 있어야 합니다. 이러한 동적 조정이 없다면, 보안 검문소는 모델의 불확실성을 무기로 바꾸려는 공격자에게 취약한 상태로 남게 됩니다.

이 작업의 함의는 테스트된 특정 방법론을 넘어 확장됩니다. 이는 인공지능을 보호하는 데 있어 근본적인 긴장 관계를 강조합니다. 즉, 정상적인 행동을 위해 조정된 방어 체계는 환경을 조작하여 그 가정을 깨뜨릴 수 있는 능동적이고 지능적인 적대자 앞에서는 무너질 수 있다는 것입니다. 연구자는 기술을 완전히 깨뜨렸다고 주장한 것이 아니라, 안전 마진이 이전에 믿었던 것보다 훨씬 더 얇다는 것을 보여주었습니다. 질문의 성격을 바꾸는 것만으로도 공격자가 모델의 비밀을 훔치는 속도를 두 배로 높일 수 있음을 증명했습니다. 이는 향하여의 보안 설계가 입력값이 양호할 것이라는 가정에 의존해서는 안 된다는 것을 시사합니다. 보안 설계는 지능적인 공격자가 도입할 수 있는 구체적이고 계산된 혼돈을 견뎌낼 수 있도록 구축되어야 하며, 이를 통해 시스템의 오차 허용 범위가 오히려 정보를 유출하는 통로가 되지 않도록 보장해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →