← 최신 논문
🤖 machine learning

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

이 논문은 AI 에이전트를 체계적으로 조사하여 타겟 프로필을 구축하고 더 강력한 간접 프롬프트 주입 공격을 설계함으로써, AI 에이전트를 대상으로 하는 블랙박스 기반의 정찰 중심 펜테스팅을 자동화하는 프레임워크인 "Know Your Agent" (KYA)를 소개한다.

원저자: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 당신이 명령어를 입력하기를 기다리는 것이 아니라, 실제로 당신을 대신해 나가서 일을 처리하는 세상을 상상해 보십시오. 컴퓨터는 이메일을 읽고, 웹을 검색하고, 코드를 작성하며, 심지어 비행기 표를 예약할 수도 있습니다. 우리는 이것을 "AI 에이전트"라고 부릅니다. 이들은 스스로 계획을 세우고 행동할 수 있는 매우 똑똑한 디지털 비서와 같습니다. 하지만 여기 까다로운 문제가 있습니다. 이 에이전트들은 항상 주변 세상을 경청하고 있다는 점입니다. 만약 당신이 에이전트에게 웹페이지를 읽으라고 요청한다면, 에이전트는 낯선 이들이 작성한 부분까지 포함하여 그 페이지의 모든 것을 읽습니다. 이는 독특한 보안 문제를 야기합니다. 만약 나쁜 의도를 가진 사람이 평범해 보이는 웹페이지나 이메일 안에 비밀스럽고 교활한 지시 사항을 숨겨둔다면, 에이전트는 그것을 읽고 당신의 진짜 명령이라고 생각하여 악당이 원하는 대로 정확히 수행할 수 있습니다. 이것을 "간접 프롬프트 주입(Indirect Prompt Injection)"이라고 부릅니다. 이것은 마치 누군가가 당신 친구의 도시락에 "내 도시락을 줘"라고 적힌 쪽지를 몰래 넣어두었고, 당신의 친구는 예의 바르게 행동하려다가 그 쪽지가 당신이 보낸 것이 아님을 깨닫지 못한 채 도시락을 건네주는 것과 같습니다.

연구자들이 던지는 핵심적인 질문은 이것입니다: 우리가 AI 에이전트를 실제 세상에 풀어놓기 전에, 이들이 이런 속임수에 넘어가지 않도록 어떻게 테스트할 것인가? 오랫동안 보안 전문가들은 에이전트가 고장 나는 것을 보기 위해 단순히 무작위적이고 혼란스러운 지시 사항들을 던져보는 방식으로 테스트를 시도해 왔습니다. 이는 마치 성벽의 약점을 찾기 위해 눈을 가린 채 돌을 던지는 것과 비슷했습니다. 하지만 한 새로운 논문은 이러한 접근 방식이 가장 중요한 부분인 '정찰(reconnaissance)'을 놓치고 있다고 주장합니다. 전통적인 보안의 세계에서 테스터는 단순히 돌을 던지는 것이 아닙니다. 그들은 먼저 성을 정찰합니다. 열려 있는 창문을 찾고, 경비병의 일정을 확인하며, 구조를 파악합니다. 이 논문은 AI 에이전트를 진정으로 테스트하려면 우리도 똑같이 해야 한다고 주장합니다. 즉, "당신의 에이전트를 알라(Know Your Agent)"는 것입니다.

벤구리온 대학교 연구팀은 KYA(Know Your Agent)라는 새로운 프레임워크를 소개합니다. 그들은 AI 에이전트를 무너뜨리는 가장 좋은 방법은 맹목적으로 추측하는 것이 아니라, 먼저 그것에 대해 알 수 있는 모든 것을 배우는 것이라고 주장합니다. 그들은 AI 에이전트에게 취약점을 만드는 두 가지 주요 "사각지대"가 있다는 것을 발견했습니다. 첫째, 에이전트는 올바르게 보이는 것들(예: 특정 형식이나 "이것은 안전한 지시사항이다"라는 의미를 갖는 단어들)을 신뢰합니다. 둘째, 에이전트는 이야기에 부합하는 것들(예: 일반적인 작업 흐름 중간에 자연스럽게 느껴지는 요청)을 신뢰합니다.

논문은 디지털 탐정처럼 행동하는 스마트하고 자동화된 시스템을 사용함으로써, 이러한 사각지대를 이전보다 훨씬 더 잘 악용할 수 있음을 보여줍니다. 이 시스템인 KYA는 단순히 공격만 하는 것이 아닙니다. 질문을 던지며 멈추고, 에이전트가 어떻게 반응하는지 관찰하며, 에이전트의 도구와 규칙에 대한 상세한 프로필을 구축합니다. KYA는 다음과 같은 것들을 학습합니다: "아, 이 에이전트는 지시 사항을 구분하기 위해 특수한 기호를 사용하는구나", 또는 "이 에이전트는 현재 진행 중인 이야기와 맞지 않는 것을 요청하면 불안해하는구나". 이러한 세부 사항을 파악하고 나면, KYA는 훨씬 더 설득력 있는 속임수를 만들어냅니다.

연구진은 이 아이디어를 여러 가지 다른 AI 에이전트에 테스트했으며, 그들의 "정찰 기반" 방식이 매우 효과적이라는 것을 발견했습니다. 시뮬레이션 결과, KYA는 단순히 추측하고 다시 시도하는 기존 방식보다 침투 및 공격 성공률이 최대 67 퍼센트 포인트 더 높았습니다. 그들은 심지어 실제 세계의 코딩 에이전트인 OpenHands에서도 테스트를 진행하여 이 방식이 작동함을 확인했습니다. 논문은 결론적으로, 만약 우리가 AI 에이전트를 안전하게 만들고 싶다면, 그들을 정적인 목표물로 취급하는 것을 멈추고, 진정으로 방어력을 테스트하기 전에 연구되고, 프로파일링되며, 이해되어야 할 복잡한 시스템으로 취급해야 한다고 말합니다. 이제는 단순히 돌을 던지는 것이 아니라, 먼저 성의 비밀을 배우는 단계가 된 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →