← 최신 논문
💻 computer science

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

SingGuard-NSFA는 포괄적인 리스크 분류 체계, 대규모 다국어 벤치마크, 그리고 생성적 추론과 실시간 분류를 결합한 이중 모드 탐지 방식을 도입하여 다양한 모델 크기에 걸쳐 최첨단 성능을 달성함으로써 에이전트형 AI 시스템을 운영 위협으로부터 보호하는 확장 가능한 가드레일 프레임워크이다.

원저자: SingGuard Team

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: SingGuard Team

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 AI가 단순히 시를 쓰거나 상식을 답하는 챗봇을 넘어, 실제로 무언가를 '수행'할 수 있는 디지털 집사가 되는 세상을 상상해 보십시오. 이 AI는 웹을 탐색하고, 컴퓨터의 파일을 열고, 이메일을 보내며, 심지어 버그를 고치기 위해 코드를 작성할 수도 있습니다. 이것이 바로 "에이전틱 AI(Agentic AI)"라는 흥미로운 새로운 시대입니다. 하지만 큰 힘에는 큰 취약성이 따릅니다. 만약 영리한 해커가 일반적인 챗봇을 속인다면, 최악의 상황은 무례한 댓글이 달리는 정도일 것입니다. 하지만 해커가 AI 에이전트를 속인다면, 봇은 실수로 당신의 하드 드라이브 전체를 삭제하거나, 은행 비밀번호를 훔치거나, 당신의 사적인 사진을 낯선 사람에게 전송할 수도 있습니다. 나쁜 말을 막기 위해 설계된 기존의 안전망은 이러한 위험한 행동을 막도록 만들어지지 않았습니다. 우리는 AI가 무엇을 '말하는가'뿐만 아니라 무엇을 '하는가'를 이해하는 새로운 종류의 보안 요원이 필요합니다.

여기에 Ant Group의 AI 보안 연구소에서 개발한, 이 강력한 AI 에이전트들을 위한 궁극의 문지기 역할을 하도록 설계된 새로운 보안 프레임워크, SingGuard-NSFA가 등장합니다. 연구원들을 거대하고 첨단 기술이 집약된 요새를 짓는 건축가라고 생각해 보십시오. 먼저, 그들은 에이전트가 속거나 남용될 수 있는 모든 가능한 경로에 대한 상세한 지도를 그렸으며, 기밀성(Confidentiality), 무결성(Integrity), 가용성(Availability)이라는 고전적인 보안 목표를 기준으로 185가지 이상의 서로 다른 유형의 위협을 명확한 계층 구조로 정리했습니다. 그들은 단순히 추측한 것이 아니라, 성벽의 구멍을 하나도 놓치지 않도록 세 가지 주요 산업 안전 가이드라인과 대조하여 지도를 검증했습니다.

이 요새를 테스트하기 위해, 그들은 133개 언어로 된 93,000개 이상의 연습 시나리오를 포함하는 거대한 훈련장을 구축했습니다. 여기에는 교묘한 "탈옥(jailbreak)" 시도부터 위험한 코드 요청까지 모든 것이 포함되었습니다. 그들은 두 가지 모드 전략을 사용하여 그들의 경비원인 SingGuard를 훈련시켰습니다. 첫 번째 모드는 의심스러운 메시지를 읽고 그것이 왜 위험한지에 대한 상세한 보고서를 작성하는(인간 감사관에게 매우 유용함) 초스마트 탐정 같으며, 메시지를 식별한 후 플래그를 표시합니다. 두 번째 모드는 동일한 메시지를 약 50밀리초 만에 스캔하는 번개처럼 빠른 반사 신경 시스템입니다. 이는 당신이 눈을 깜빡이는 것보다 빠르며, 문제가 발견되면 즉시 "멈춰!"라고 외치는 역할을 합니다.

결과는 인상적입니다. 기존의 가장 뛰어난 보안 요드들과 테스트했을 때, SingGuard-NSFA는 단순히 승리한 것이 아니라 압도했습니다. 자체 맞춤형 테스트에서, 그들의 모델(0.8B 파라미터의 작은 모델부터 견고한 9B 파라미터 모델까지)은 94%에서 97%의 정확도를 달-성하며, 차순위 경쟁자를 6~12포인트라는 상당한 차이로 따돌렸습니다. 다른 출처의 데이터를 사용한 테스트(이는 마치 자신이 만들지 않은 문의 잠금장치를 테스트하는 것과 같습니다)에서도 9B 파라미터 모델은 91%의 높은 정확도를 유지했습니다. 아마도 가장 흥미로운 점은 이 보안 시스템이 모듈식이라는 것입니다. 미래에 새로운 유형의 위협이 나타나더라도 개발자들은 요새 전체를 다시 구축할 필요 없이, 시스템의 속도를 늦추지 않고도 이를 감지할 수 있는 새로운 "분류 헤드(classification head, 작은 추가 구성 요소)"를 결합하기만 하면 됩니다. 이 논문은 이러한 접근 방식이 우리의 AI 에이전트들이 실제 세상의 과업들을 수행하기 시작함에 따라, 그들을 안전하게 지키는 강력하고 유연하며 빠른 방법을 제공한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →