← 최신 논문
💻 computer science

LMSM: LLM Security Framework Inspired by Linux Security Modules

이 논문은 리눅스 보안 모듈(Linux Security Modules)에서 영감을 받아 해석 가능성 기반 탐지, 정책 평가, 출력 강제를 분리함으로써 유연하고 조합 가능한 안전 규칙을 가능하게 하는 동시에 처리량에 미치는 영향은 최소화하면서 공격 성공률을 크게 낮추는 대규모 언어 모델을 위한 보안 프레임워크인 LMSM을 소개한다.

원저자: XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 더 이상 질문에 답하고 사라지는 단순한 도구가 아닙니다. 현실 세계에서 이들은 사용자의 지시, 대화 기록, 그리고 외부 정보를 끊임없이 엮어 응답을 만들어내는 복잡한 서비스의 엔진 역할을 수행합니다. 사용자의 프롬프트에서 최종 답변에 이르는 이 여정은 긴 상태 유지형 경로이며, 여기서 모델은 단지 하나의 구성 요소일 뿐입니다. 이 경로가 매우 복잡하기 때문에 보안 실패도 이곳에서 발생합니다. 프롬프트 속의 영리한 속임수는 안전 필터를 우회할 수 있고, 검색된 문서 속의 숨겨된 지시는 모델이 규칙을 무시하도록 속일 수 있습니다. 이를 막기 위해 개발자들은 방어 계층을 구축해 왔습니다. 모델이 안전하도록 훈련시키고, 모델이 보는 것을 제한하며, 사용자에게 전달되기 전에 출력을 스캔하는 방식입니다. 그러나 이러한 계층들은 종-종 서로 고립되어 작동합니다. 연구자들이 모델의 '사고 과정' 내부를 들여다보고 나쁜 행동을 포착하는 새로운 방법을 개발할 때, 그들은 대개 그 특정 발견을 중심으로 한 완전히 새로운 맞춤형 보안 시스템을 구축해야만 합니다. 이는 새로운 도구가 나올 때마다 통합 과정을 새로 거쳐야 하는 패치워크 형태의 방어 체계를 만들어내며, 어떤 새로운 위협에도 적응할 수 있는 단일하고 강력한 방패를 만드는 대신 파편화된 대응을 초래합니다.

싱가포르 국립대학교와 중국 과학기술대학교의 연구진은 수십 년 동안 컴퓨터 운영 체제가 보안을 처리해 온 방식에서 영감을 얻은 다른 접근 방식을 제안했습니다. 그들은 이 프레지를 LMSM, 즉 언어 모델 보안 모듈(Language Model Security Modules)이라고 부릅니다. 핵심 아이디어는 위험을 감시하는 작업과 그에 대해 무엇을 할지 결정하는 작업을 분리하는 것입니다. 센서, 규칙집, 그리고 보안 요원이 세 가지 별개의 교체 가능한 부품인 보안 시스템을 상상해 보십시오. 이 새로운 시스템에서 '센서'는 문제의 징후를 찾기 위해 모델 내부를 들여다보는 다양한 방법들입니다. '규칙집'은 그러한 징후가 무엇을 의미하며 언제 조치를 취해야 하는지를 규정하는 유연한 지침 세트입니다. '경비원'은 응답이 승인될 때까지 이를 붙잡고 있는 최종 문지기입니다. 이러한 설계는 만약 내일 더 나은 센서가 발명되거나, 기업이 특정 산업을 위해 규칙을 변경해야 할 경우, 전체 보안 시스템을 다시 구축하거나 모델의 출력을 처리하는 코드를 다시 작성할 필요 없이 해당 부품만을 교체할 수 있음을 의미합니다.

연구진은 이 시스템이 실제 사용 환경의 무질서하고 빠른 조건에서도 잘 버틸 수 있는지 확인하기 위해 작동하는 프로토타입을 구축했습니다. 그들은 고성능 서버에서 실행되는 인기 있는 언어 모델인 Qwen3-4B를 대상으로 테스트를 진행했습니다. 이 환경에서는 시스템 속도를 높이기 위해 요청들이 끊임없이 재배치되는데, 이는 고정된 순서를 기대하는 보안 도구들을 혼란에 빠뜨리곤 합니다. 연구팀은 이 프레임워크가 모든 요청을 성공적으로 추적하여, 시스템이 여러 처리 슬롯 사이에서 요청을 이동시키는 중에도 한 사용자에 대한 결정이 다른 사용자에게 실수로 영향을 미치지 않도록 보장한다는 것을 발견했습니다. 그들은 미리 만들어진 센서와 특정 작업에 맞춰 특별히 훈련된 센서를 포함하여 다양한 유형의 내부 센서로 테스트를 수행했습니다. 시스템은 이 모든 것을 매끄럽게 처리하며, 센서, 규칙, 그리고 집행 게이트 사이의 분리가 의도한 대로 작동함을 입증했습니다.

결과는 이러한 모듈형 접근 방식이 이론적으로 타당할 뿐만 아니라 실질적으로도 효과적임을 보여주었습니다. 연구진이 유해한 출력을 차단하기 위해 이 시스템을 사용했을 때, 공격의 성공률이 거의 40%에서 3% 직후로 감소했습니다. 이는 엄청난 개선이며, 시스템이 거의 모든 나쁜 시도를 잡아냈음을 의미합니다. 하지만 어떤 보안 조치와 마찬가지로 완벽하지는 않았습니다. 무해한 요청을 실수로 차단하는 경우가 간혹 발생했으며, 그 비율은 2%에서 4%로 약간 상승했습니다. 연구진은 이러한 트레이드오프는 관리 가능한 수준이며, 유해한 콘텐츠를 통과시키는 것보다 훨씬 낫다고 언급했습니다. 결정적으로, 시스템은 서비스 속도를 크게 늦추지 않으면서 이 작업을 수행했습니다. 32개의 요청이 동시에 활성화된 상태에서도, 시스템은 보안 검사가 전혀 없는 버전의 속도 대비 거의 99%를 유지했습니다. 이는 보안을 위한 무거운 작업이 성능 저하를 반드시 동반해야 하는 것은 아님을 시사합니다.

이 연구가 특히 중요한 이유는 보안과 모델 개선 사이의 관계를 어떻게 변화시키는지에 있습니다. 이전에는 나쁜 행동을 탐지하는 새로운 방법이 발견될 때마다 새로운 맞춤형 보안 스택이 필요했습니다. 이 프레임워크를 사용하면 새로운 탐지 방법을 간단한 업데이트로서 삽입할 수 있습니다. 연구진은 모델의 출력을 관리하는 기본 코드를 건드리지 않고도 한 유형의 센서를 다른 유형으로 교체하거나, 시스템이 문제를 점검하는 타이밍을 변경할 수 있음을 입증했습니다. 이러한 유연성 덕나 조직은 거대한 모델 자체를 다시 훈련시키거나 전체 인프라를 다시 작성할 필요 없이, 새로운 위협이나 특정 법적 요구 사항에 빠르게 적응할 수 있습니다. 이 프레임워크는 본질적으로 언어 모델의 복잡한 내부 신호를, 일관되고 신뢰할 수 있는 문지기에 의해 실행될 수 있는 신뢰할 수 있는 표준화된 증거 스트림으로 변환합니다.

이 연구는 단 한 단어가 사용자에게 공개되기 전에 모델의 내부 상태를 관찰하며 런타임 내부에 견고한 보안 계층을 구축하는 것이 가능하다는 것을 확인시켜 줍니다. 위험의 탐지, 조치 결정, 그리고 차단 행위를 별개의 교체 가능한 구성 요소로 취급함으로써, 연구진은 강력하면서도 적응력이 뛰어난 시스템을 만들어냈습니다. 실험 결과, 이 접근 방식은 서비스의 속도와 반응성을 유지하면서도 유해한 출력의 위험을 획기적으로 줄일 수 있음을 보여주었습니다. 이는 기술의 급격한 진보에 발맞춰, 이를 보호하는 기술을 위해 지속적이고 비용이 많이 드는 재설계 과정을 거치지 않고도, 새로운 탐지 기술을 사용자 보호에 즉각 투입할 수 있는 길을 제시합니다. 이 작업은 안전한 인공지능의 미래가 더 크고 경직된 벽을 쌓는 것이 아니라, 보호하는 기술과 함께 진화할 수 있는 더 똑똑하고 유연한 문을 만드는 데 있다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →