← 최신 논문
💻 computer science

Beyond Prompt Injection: Trust-Boundary Security Assurance for LLM-Integrated and Agentic Applications

본 논문은 LLM 통합 및 에이전트 시스템을 모델링하여 진화하는 시맨틱 위협을 검증 가능하고 테스트 가능한 보안 통제 및 증거 기반 보고로 변환하는 방법론적 신뢰 경계 보안 보증 프레임워크를 제안한다.

원저자: Nazar Waheed

게시일 2026-09-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nazar Waheed

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 세상에서 대규모 언어 모델은 단순한 텍스트 생성기를 넘어 정보를 검색하고, 과거의 대화를 기억하며, 심지어 사용자를 대신해 업무를 수행할 수 있는 복잡한 어시스턴트로 진화했습니다. 흔히 '에이전트'라고 불리는 이 시스템들은 단순히 질문에 답하는 것에 그치지 않습니다. 이들은 데이터베이스에서 데이터를 검색하고, 이메일이나 고객 관계 관리 소프트웨어와 같은 외부 도구를 사용하며, 찾아낸 정보에 기반하여 의사결정을 내립니다. 이러한 변화는 독특한 보안 과제를 야 l생합니다. 컴퓨터 프로그램이 명령을 따를 때는 보통 명확한 규칙을 따르지만, 인공지능이 자연어를 해석할 때는 무해한 사실과 위험한 명령 사이의 경계가 모호해질 수 있습니다. 만약 악의적인 행위자가 문서, 이메일 또는 웹사이트 안에 비밀 지시 사항을 숨겨둔다면, AI는 이를 읽고 자신의 작업 일부라고 믿게 되어, 자신의 권한을 이용해 회사의 민감한 데이터에 접근하여 그 숨겨진 명령을 실행할 수 있습니다. 위험은 단순히 AI가 잘못된 말을 하는 것에 그치는 것이 아니라, AI가 해당 동작이 승인되었다고 속아 넘어가 파일을 삭제하거나 개인 기록을 유출하는 것과 같이 실제로 해로운 행동을 수행하게 되는 데 있습니다.

나자르 와히드(Nazar Waheed)라는 연구자는 이러한 시스템의 안전성을 생각하고 테스트하는 새로운 방법을 제안했습니다. 인공지능 스스로가 나쁜 지시를 식별하는 데 완벽해지도록 만드는 것은 어렵고 어쩌면 불가능한 목표이기에, 이 논문은 전체 애플리케이션을 일련의 체크포인트(점검 지점)로 취급할 것을 제안합니다. 핵심 아이디어는 시스템이 단순히 언어를 이해하는 단계에서 실제 세계의 행동을 취하는 단계로 넘어가는 지점을 정확히 매핑하는 것입니다. 저자는 인터넷에서 데이터를 가져올 때, 어떤 도구를 사용할지 결정할 때, 또는 회사의 내부 데이터베이스에 연결할 때와 같이 신뢰 경계가 존재하는 7가지 특정 지점을 식별합니다. 이 연구는 보안이 AI의 판단력에만 의존해서는 안 된다고 주장합니다. 대신, 각 경계에서 해당 동작이 정말로 허용된 것인지 확인하기 위한 독립적이고 자동화된 검증 절차가 반드시 있어야 합니다.

이 논문은 조직이 따라야 할 구조화된 프로세스를 제시하며, 보안 평가를 6개의 명확한 단계로 나눕니다. 첫째, 팀은 사용자 인터페이스부터 숨겨진 데이터베이스에 이르기까지 시스템의 모든 부분을 목록화해야 합니다. 다음으로, 누가 또는 무엇이 무엇을 할 수 있는 권한을 가졌는지 매핑하여 시스템이 과도한 권한을 사용하고 있는 지점을 식출합니다. 셋-째, 신뢰할 수 있는 출처(예: 검색된 문서)를 통해 공격자가 해로운 지시 사항을 몰래 집어넣으려는 현실적인 시나리오를 만듭니다. 넷째, AI 자체가 속임수에 넘어가더라도 이러한 독립적인 체크포인트가 공격을 차단할 수 있는지 테스트합니다. 다섯째, 체크포인트가 실패했을 경우 어떤 일이 벌어질지 분석하여, 피해가 어디까지 확산될 수 있는지와 시스템이 회복 가능한지를 살펴봅니다. 마지막으로, 팀은 시스템이 성공했거나 실패한 지점을 상세히 기술한 보고서를 작성하여, 단순한 추측이 아닌 구체적인 증거를 제공합니다.

이 접근 방식은 고객 서비스 어시스턴트의 가상 사례를 통해 입증됩니다. 이 시나리오에서 공격자는 기업의 정당한 문서를 수정하여, AI에게 개인 고객 데이터를 외부 이메일 주소로 보내라는 숨겨진 지시를 포함시킵니다. 연구에 따르면, 설령 AI가 문서를 읽고 이메일을 보내겠다는 제안을 하더라도, 제대로 설계된 보안 시스템은 요청을 확인하는 별도의 계층을 갖추고 있어야 합니다. 이 계층은 사용자가 데이터를 외부로 보내는 것을 승인하지 않았음을 감지하고, AI의 제안 내용과 상관없이 해당 동작을 차단할 것입니다. 이 연구는 목표가 AI가 속임수에 면역이 있음을 증명하는 것이 아니라, 그 속임수가 실제 해를 끼치지 못하도록 안전망이 구축되어 있음을 증명하는 데 있음을 강조합니다.

또한 이 논문은 에이전트가 다른 소프트웨어와 연결하기 위해 사용하는 도구인 '모델 컨텍스트 프로토콜(Model Context Protocol)'을 다룹니다. AI와 도구 사이의 연결이 기술적으로 안전하더라도, 그 연결을 통해 들어오는 정보는 여전히 위험할 수 있다고 경고합니다. 예를 들어, 어떤 도구는 데이터베이스와 통신할 권한이 있지만, 그 도구가 반환하는 데이터에는 숨겨진 명령이 포함되어 있을 수 있습니다. 연구는 보안이 계층화되어야 하며, 프로토콜, 데이터의 의미, 그리고 비즈니스 규칙을 각각 별도로 확인해야 한다고 제안합니다. 나쁜 단어를 찾아내려는 필터와 같은 단일 방어 체계에 의존하는 것은 충분하지 않다고 주장합니다. 대신, 한 부분이 실패하더라도 다른 부분이 피해를 막을 수 있도록 시스템이 구축되어야 합니다.

궁극적으로 이 작업은 인공지능에 대한 막연한 두려움을 테스트 가능한 사실로 바꾸는 방법을 제공합니다. 이는 대화를 'AI가 안전한가?'라는 질문에서 '안전 제어 장치가 어디에 있으며 그것이 실제로 작동하는가?'라는 질문으로 옮겨 놓습니다. 저자는 이것이 하나의 프레임워크(평가 틀)이지, 모든 시스템이 이제 안전하다는 보증이 아님을 주의 깊게 언급합니다. 이는 실수로 인한 결과가 제한되고, 공격 경로를 추적할 수 있으며, 조직이 자신의 데이터가 보호되고 있음을 스스로 증명할 수 있는 시스템을 구축하기 위한 가이드입니다. 언어와 행동 사이의 경계에 초점을 맞춤으로써, 이 논문은 기업들이 자신의 시스템에 대한 통제력을 잃지 않으면서 강력한 AI 도구를 사용할 수 있는 실질적인 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →