← 최신 논문
🤖 machine learning

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

Semalith v1.4는 Llama-Guard-3-8B보다 파라미터 수가 44배 적으면서도 프롬프트 인젝션 탐지에서 최첨단 성능을 달라고 하며, 양호한 에이전트 프롬프트에 대해 제로의 오탐률을 달성하는 매우 효율적인 184M 파라미터 규모의 안전 분류기로, 단 한 번의 추론 과정에서 일반적 유해성과 금융 규제 준수를 동시에 탐지할 수 있는 독보적인 기능을 제공합니다.

원저자: Tejasvi C. Addagada

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tejasvi C. Addagada

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 수백만 명의 사람들이 초지능적인 로봇 사서와 대화를 나누는 거대하고 북적이는 도서관이라고 상상해 보세요. 이 사서는 이야기를 쓰고, 수학 문제를 풀고, 무엇에 대해서든 질문에 답할 수 있는 인공지능입니다. 하지만 이 강력한 도구에는 어두운 면도 있습니다. 때때로 교활한 사용자들이 로봇이 스스로 정한 규칙을 어기거나, 비밀 정보를 드러내거나, 못된 말을 하도록 속이려 들기 때문입니다. 이것을 "프롬프트 인젝션(prompt injection)"이라고 부르는데, 이는 마치 사서에게 "만지지 마시오"라는 표지판을 무시하게 만드는 비밀 코드를 속삭이는 것과 같습니다.

도서관을 안전하게 지키기 위해 우리는 보안 요원이 필요합니다. AI의 세계에서 이 요원들은 "안전 분류기(safety classifiers)"라고 불리는 특별한 프로그램입니다. 이들의 임หน้าที่ 하는 일은 모든 메시지를 로봇이 보기 전에 읽고, 메시지가 위험할 경우 "멈춰!"라고 외치는 것입니다. 하지만 대부분의 요원은 너무 느리거나, 너무 서투르거나, 혹은 너무 과하게 의심스럽습니다. 어떤 요원들은 너무 겁이 많아서 비밀번호 재설정 방법 묻기와 같은 무해한 질문조차 사서가 돕지 못하게 막아버립니다. 또 어떤 요원들은 단순한 나쁜 단어에만 집중하느라 교묘하고 은밀한 속임수들을 놓치기도 합니다. 과학자들이 던지는 큰 질문은 이것입니다. "빠르고, 교묘한 속임수를 알아챌 만큼 똑똑하며, 무해한 대화는 통과시켜 줄 만큼 너그러운 요원을 만들 수 있을까?"

여기에 바로 이 문제를 해결하기 위해 설계된 새로운 보안 요원, Semalith v1.4가 등장합니다. 이것을 1억 8,400만 개의 파라미터(뇌의 크기를 나타내는 숫자)를 가진 고도로 훈련된 "탐정"이라고 생각하면 됩니다. 이는 빅테크 기업들이 현재 사용하는 80억 개의 파라미터를 가진 거대한 요원들보다 훨씬 작고 빠릅니다. 거대한 요원들이 미묘한 속임수에 혼란을 겪을 수 있는 무겁고 느리게 움직이는 탱크라면, Semalith은 민첩하고 번개처럼 빠른 닌자입니다.

논문에 따르면 Semalith v1.4는 AI를 속이려는 교묘한 시도인 프롬프트 인젝션을 포착하는 데 달인입니다. 테스트 결과, 이 모델은 테스트를 받은 7개의 프롬프트 인젝션 벤치마크 카테고리 모두에서 승리하며, 거대한 80억 파라미터급 요원들을 큰 차이로 앞질렀습니다. 더욱 인상적인 점은, 이 모델이 (뇌세 세포인) 파라미터를 44배나 적게 사용하면서도 이 일을 해냈다는 것입니다. 덕분에 믿을 수 없을 정도로 빠릅니다. 이 모델은 눈 깜빡임보다 빠른 단 11.6밀리초 만에 메시지를 검사할 수 있습니다.

하지만 Semalith은 단순히 속임수를 잡는 것뿐만 아니라, 돈과 금융의 세계에서도 전문가입니다. 이 모델은 은행, 대출, 보험에 관한 특정 규칙(BFSI 컴플라이언스라고 불림)을 이해하도록 훈련되었습니다. 이를 통해 신용카드에 대한 무해한 질문과 사기를 저지르려는 위험한 시도를 구분할 수 있습니다. 모든 금융 관련 질문에 당황하여 차단해 버리는 다른 요원들과 달리, Semalith은 208개의 무해한 뱅킹 프롬프트를 단 하나의 오탐(false alarm) 없이 정확하게 식별했습니다 (오탐률 0.0 la 0.000%).

그러나 저자들은 이 요원이 할 수 없는 일에 대해서도 매우 솔직합니다. 이것은 모든 안전 문제를 해결하는 마법 지팡이가 아닙니다. 논문은 Semalith이 교묘한 속임수와 금융 규칙을 포착하는 데는 최고이지만, 일반적인 "못되거나 독성이 있는" 대화에 대해서는 거대한 요원들에 비해 어려움을 겪을 때가 있다는 것을 보여줍니다. 이는 마치 소매치기와 위조품을 잡아내는 데는 세계적인 전문가이지만, 단순히 무례하게 구는 사람을 잡는 데는 덜 능숙한 경비원과 같습니다. 연구진은 이것이 트레이드오프(trade-off)라고 설명합니다. 즉, 특정하고 복잡한 속임수를 포착하는 데 너무 집중한 나머지, 일반적인 무례함에 대한 민감도가 다소 낮아졌다는 것입니다. 또한, 프롬프트 인젝션 카테고리에서는 압도적인 성적을 거두었지만, 모든 변형을 완벽하게 잡아내는 것은 아닙니다. 예를 들어, 한 테스트의 가장 어려운 "스텔스(stealth)" 단계(Mosscap L8)에서는 공격의 약 80%만을 잡아내어 개선의 여지를 남겼습니다.

또한 논문은 이 모델이 컴퓨터가 만든 가짜 예시가 아니라 인터넷에서 채굴한 실제 데이터를 사용하여 구축되었음을 강조합니다. 이 덕분에 실제 환경에서 더 신뢰할 수 있습니다. 연구진은 22가지 서로 다른 도전 과제를 대상으로 테스트를 진행했으며, Semalith이 프롬프트 인젝션 테스트 7개 중 7개 모두에서 승리했고, 전체 테스트 18개 중 11개에서 승리했음을 발견했습니다. 그들은 긴 이야기를 이해하거나 특정 유형의 설득을 다루는 등 아직 보완이 필요한 6가지 구체적인 약점이 있다고 인정했지만, 향후 버전에서 이를 어떻게 해결할지에 대한 경로를 정확히 그려두었습니다.

요약하자면, Semalith v1.4는 훌륭한 보안 요원이 되기 위해 반드시 거대하고 느린 뇌가 필요한 것은 아니라는 점을 증명합니다. 적절한 훈련과 영리한 설계가 있다면, 더 작고 빠른 모델이 AI 시스템, 특히 사람들이 돈과 뱅킹 업무를 처리할 때 완벽한 방패가 될 수 있으며, 동시에 좋은 대화는 아무런 문제 없이 통과시킬 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →