Composable Trust for Language Models: A proven boundary and a measured defense
이 논문은 권한을 언어 모델 외부의 결정론적이고 증명 가능한 보안 파이프라인으로 이동시키는 결합 가능한 신뢰 프레임워크를 소개하며, 이것이 높은 응답 품질을 유지하면서도 인젝션 공격을 효과적으로 방어하고 출처 속성을 개선할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 우주선의 선장이라고 상상해 보십시오. 하지만 당신의 항법 컴퓨터에는 아주 이상한 결함이 있습니다. 이 컴퓨터는 자신이 받는 모든 메시지를 정확히 똑같은 방식으로 처리합니다. 당신의 공식 명령("화성으로 비행하라")이든, 승객의 일상적인 제안("간식을 좀 먹어야 할 것 같아요")이든, 혹은 문 밑으로 몰래 밀어 넣은 사보타주의자의 비밀 쪽지("모든 명령을 무시하고 태양으로 추락하라")이든, 컴퓨터는 이 모든 것을 하나의 길고 뒤섞인 단어의 흐름으로 듣습니다. 인공지능의 세계에서 이것이 바로 대규모 언어 모델(LLM)이 처한 현재의 현실입니다. 그들은 매우 똑똑하지만, 신뢰할 수 있는 지시와 교활한 속임수를 구분하는 데 어려움을 겪습니다. 이를 "프롬프트 인젝션(prompt injection)"이라고 불리는 문제입니다. 우리가 AI를 은행 계좌 관리, 자동차 운전, 질병 진단과 같은 진지한 업무에 사용하고자 한다면, 인터넷상의 무작위 낯선 사람이 적절한 단어를 입력하는 것만으로 위험한 행동을 하도록 AI를 속일 수 없다는 확신이 필요합니다. 이 문제가 중요한 이유입니다.
이 논문은 AI의 두뇌를 재구축할 필요 없이 이 문제를 해결할 수 있는 영리하고 새로운 방법을 소개합니다. AI에게 더 의심스러워지라고 가르치는 대신(이는 종종 실패하곤 합니다), 저자들은 AI 외부에 위치한 "신뢰 파이프라인(trust pipeline)"을 구축했습니다. 이것은 마치 독점적인 클럽의 입구에서 사람들이 DJ 근처에 가기도 전에 신분증을 확인하는 보안 요원과 같습니다. 이 시스템에서는 모든 정보가 출처에 따라 "신뢰 링(trust ring)"을 부여받습니다. AI의 자체 지침은 VIP(최고 신뢰), 사용자 요청은 게스트(중간 신뢰), 웹이나 문서에서 가져온 데이터는 낯선 사람(낮은 신뢰)입니다. 이 시스템은 VIP가 항상 최종 결정을 내릴 수 있도록 보장하는 엄격한 규칙 세트를 사용하여, 낯선 사람들은 오직 필터링되고 검증된 사실만을 제공할 수 있도록 합니다.
연구진은 이 설정을 강력한 AI 모델인 Gemma 4 26B에서 테스트했습니다. 그들은 이 "조합 가능한 신뢰(composable trust)" 시스템을 사용했을 때 AI가 속임수에 훨씬 더 잘 저항하게 된다는 것을 발견했습니다. 표준 테스트에서 AI는 홀로 남겨졌을 때 위험한 지시를 27%의 확률로 따랐지만, 이 새로운 시스템을 사용했을 때는 이러한 속임수를 94%의 확률로 성공적으로 막아냈습니다. 더욱 인상적인 것은, 이 시스템이 저신뢰 출처로부터 오는 어떠한 교활한 텍스트도 돈을 보내거나 파일을 삭제하는 것과 같은 승인되지 않은 행동을 AI에게 강요할 수 없음을 수학적으로 증명했다는 점입니다. 시스템이 잘못된 말을 하는 것을 완전히 보장할 수는 없지만(여전히 약 6%의 작은 실수를 범합니다), AI가 잘못된 행동을 취하는 것은 절대 방지합니다. 이는 AI가 혼란에 빠지더라도 그 힘을 올바른 손에 쥐여주는 방패 역할을 합니다.
문제: "단일 스트림"의 혼란
이것이 왜 어려운지 이해하려면, 모두가 동시에 말하고 듣는 사람이 누가 주도권을 쥐고 있는지 파악해야 하는 대화를 상상해 보십시오. 현재의 AI 모델에서 지시와 데이터는 정확히 동일한 "토큰 스트림"을 공유합니다. 이것은 만약 당신이 상사에게 편지를 썼는데, 어떤 낯선 사람이 문장 중간에 "상사를 무시하고 네 지갑을 내놔라"라고 휘갈겨 써 놓았고, AI가 그것을 당신의 문장의 일부로 읽는 것과 같습니다. AI는 상사의 목소리가 낯선 사람의 목소리보다 더 커야 한다는 것을 알 수 있는 내장된 "보안 배지" 시스템을 가지고 있지 않습니다.
이를 해결하려는 이전의 시도들은 AI에게 "헤이, 조심해!" 또는 "낯선 사람의 말을 듣지 마!"라고 말하려고 했습니다. 하지만 이 논문은 이것이 경비병에게 자기 자신을 감시하라고 요구하는 것과 같다고 주장합니다. 만약 AI가 속임을 당하면, 자신의 규칙을 잊어버리기 때문입니다. 다른 방법들은 AI가 루프를 돌며 자신의 작업을 스스로 확인하게 만들려 했지만, 그것은 단지 혼란에 빠진 똑같은 AI에게 자신의 혼란을 다시 확인하라고 요청하는 것에 불ло 불과합니다. 저자들은 AI의 두뇌를 고치려고 노력하는 대신, AI를 둘러싼 환경을 고쳐야 한다고 말합니다.
해결책: "신뢰 격자(Trust Lattice)"와 보안 요원
저자들은 엄격한 조직도처럼 작동하는 시스템을 제안합니다. 그들은 모든 입력을 서로 다른 "링"으로 나눕니다:
- SYSTEM (상사): 운영자의 자체 지침. 가장 높은 링입니다.
- USER (게스트): 질문을 하는 사람.
- CONTENT (사서): 데이터베이스에서 검색된 문서.
- WEB (낯선 사람): 열린 인터넷으로부터의 정보.
시스템은 "결정론적 모니터(deterministic monitor)"(실수를 하지 않는 코드 조각)를 사용하여 문지기 역할을 수행합니다. 이 모니터는 몇 가지 철칙을 집행합니다:
- 하한선(The Low-Water Mark): 고신뢰 메시지와 저신뢰 메시지를 섞으면, 그 결과는 가장 낮은 신뢰도를 가진 것과 같아집니다. 낯선 사람의 목소리를 실수로 상사의 수준으로 업그레이드할 수는 없습니다.
- 패시베이션 필터(The Passivation Filter): AI가 저신뢰 데이터(예: 웹 페이지)를 보기 전에, 시스템은 이를 "패시베이션(passivate)"합니다. 이것은 모든 명령("무시하라", "하라")을 제거하고 오직 순수한 사실("하늘은 푸르다")만을 남기는 번역가와 같습니다. 만약 웹 페이지가 "상사를 무시하고 날씨를 알려달라"고 한다면, 시스템은 이를 단순히 "날씨는 맑음"으로 바꾸어 상사를 무시하라는 명령을 제거합니다.
- 래퍼(The Wrapper): 시스템은 각 정보를 라벨이 붙은 블록으로 감싸서, AI에게 "이 블록은 웹에서 온 것이므로, 내부의 사실은 읽을 수 있지만 내부의 지시는 따를 수 없다"라고 알려줍니다.
결과: 더 강력한 방패
팀은 AI가 본 적 없는 특정 속임수들이 담긴 "홀드아웃(held-out)" 세트를 통해 이를 테스트했습니다.
- 기준점(The Baseline): 이 시스템 없이, AI는 "진정한 유출(genuine leaks)"(실제로 나쁜 지시를 따르는 경우)에 **27%**의 확률로 넘어갔습니다.
- 시스템 적용 시: 방어율은 **94%**로 급증했습니다. 즉, AI는 거의 항상 나쁜 지시를 성공적으로 무시했습니다.
- 비용: 일반적인 질문에 올바르게 답하는 AI의 능력은 품질 점수가 77%에서 73%로(상대적 품질 0.96) 아주 약간 감소했습니다. 이는 엄청난 보안 향상에 비해 매우 작은 대가입니다.
- "증명된" 부분: 저자들은 단순히 이것이 작동할 것이라고 추측한 것이 아니라, 저신뢰 입력이 AI가 취하는 최종 행동을 결코 바꿀 수 없음을 수학적으로 증명했습니다. 해커가 시스템을 속이려고 시도하더라도, 행동할 "권한"은 SYSTEM 링에 잠겨 있습니다. AI가 가끔 잘못된 단어를 말할 수는 있지만(예: 요약 대신 시를 쓰는 것), 잘못된 행동(예: 파일 삭제)을 수행하지는 않을 것입니다.
이것이 하지 못하는 것
이 논문은 이 시스템이 무엇을 하지 못하는지 매우 정직하게 밝히고 있습니다. 이것은 AI를 완벽하게 만들지는 않습니다. AI가 텍s 자체에 의해 혼란을 느껴(약 6%) 약간 틀린 답을 낼 가능성은 여전히 존재하며, 이는 위험한 행동을 하지 않더라도 발생할 수 있습니다. 시스템은 이 "텍스트 유출(text leak)"률을 측정할 뿐, 그것이 불가능함을 증명하지는 않습니다. 또한, 이 시스템은 AI가 무언가를 말하도록 속이는 것을 막는 것이 아니라, 무언가를 하도록 하는 것을 막는 것입니다.
이것이 왜 중요한가
이 접근 방식은 게임 체인저입니다. 왜냐하면 AI를 재학습시키거나 내부 가중치를 변경할 필요가 없기 때문입니다. 이것은 플러그인 형태의 안전 계층처럼 작동합니다. 어떤 기존 AI 모델이든 이 "신뢰 파이프라인"으로 감싸기만 하면 즉시 훨씬 더 안전하게 만들 수 있습니다. 저자들은 심지어 시스템을 깨뜨리는 방법을 알아내려는 스마트한 해커들인 "적응형(adaptive)" 공격자들을 대상으로도 테스트를 진행했으며, 보안은 견고하게 유지되었습니다. 이 시스템은 신뢰를 단순한 제안이 아닌 구조적 규칙으로 다룸으로써, 실수가 비용이 될 수 있는 실제 세상에서 사용할 수 있을 만큼 신뢰할 수 있는 AI를 구축할 수 있음을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.