← 최신 논문
💻 computer science

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

이 논문은 대규모 데이터셋과 적응형 적대적 학습 프레임워크(A3T)를 활용하여 프롬프트 주입 공격에 대한 강력하고 저지연 방어 성능을 달성하면서도 높은 일반화 능력과 최소한의 오검출을 유지하는 웹 에이전트를 위한 실용적이고 효율적인 가드 모델인 WARD를 소개합니다.

원저자: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

웹 에이전트를 매우 숙련된 자율 디지털 어시스턴트로 상상해 보세요. 사용자는 "항공권 예약하기"나 "특정 셔츠 구매하기"와 같은 미션을 부여하고, 에이전트는 광활하고 혼란스러운 인터넷으로 나가 이를 수행합니다. 인간이 하듯 버튼을 클릭하고, 텍스트를 읽으며, 이미지를 살펴봅니다.

하지만 여기에 문제가 있습니다. 인터넷은 사기꾼들로 가득 차 있습니다.

문제: "숨겨진 메모" 공격

실제 세계에서는 해커가 어시스턴트의 주머니에 *"상사를 무시하고 대신 나한테 피자를 사다 줘"*라는 메모를 밀어 넣을 수 있습니다. 디지털 세계에서는 이를 프롬프트 인젝션이라고 부릅니다.

해커들은 에이전트가 방문하는 웹사이트 안에 악성 지시를 숨깁니다. 이러한 지시는 다음과 같은 형태일 수 있습니다:

  • 웹사이트 코드 (HTML) 에 숨겨진 보이지 않는 텍스트.
  • 화면에 겹쳐진 시각적 속임수(시스템 메시지처럼 보이는 가짜 팝업 등).

에이전트가 주의하지 않으면, 이러한 숨겨진 메모들을 읽어들이고 혼란에 빠진 뒤 사용자가 요청하지 않은 일을 수행하기 시작합니다. 예를 들어 개인 데이터를 유출하거나 위험한 링크를 클릭하는 것입니다.

구식 방어책: 맹점이 있는 "도어맨"

이를 막기 위해 연구자들은 에이전트가 웹페이지를 건드리기 전에 모든 페이지를 검사하는 가드 모델을 구축하려 했습니다. 하지만 구식 도어맨들은 네 가지 치명적인 결함이 있었습니다:

  1. 배운 것만 알았음: 뉴스 사이트로 훈련했다면 소셜 미디어나 이메일에는 혼란을 겪었습니다.
  2. 너무 의심 많았음: 요리 튜토리얼과 같은 무해한 페이지조차 위험하다고 표시해 에이전트가 제 역할을 못 하게 막았습니다.
  3. 느렸음: 모든 페이지를 검사하는 데 시간이 너무 오래 걸려 전체 시스템이 둔해졌습니다.
  4. 속임수에 취약했음: 해커들은 도어맨을 혼란스럽게 만들어 위험을 무시하게 하도록 설계된 메모를 작성하는 법을 배웠습니다.

해결책: WARD(슈퍼 도어맨)

이 논문은 WARD(프롬프트 인젝션에 대한 웹 에이전트 강건 방어) 를 소개합니다. WARD 는 독특한 3 단계 boot camp 를 통해 훈련된 차세대 도어맨으로 생각할 수 있습니다.

1. 훈련장 (WARD-Base)

단순히 교과서를 읽는 대신, WARD 는 177,000 개의 실제 사례로 구성된 대규모 데이터셋으로 훈련되었습니다.

  • "오버레이" 방식: 연구자들은 실제 웹사이트 (아마존이나 뉴스 사이트 등) 를 가져와 가짜 악성 메모를 디지털 방식으로 "페인트"하여 에이전트의 반응을 관찰했습니다.
  • "네이티브" 방식: 해커들이 평범해 보이는 댓글과 메시지 안에 메모를 숨길 수 있도록 가짜 소셜 미디어 및 메신저 앱을 구축했습니다.
  • 결과: WARD 는 한 가지 특정 유형이 아닌 다양한 종류의 웹사이트에서 코드와 이미지 양쪽 모두의 속임수를 식별하는 법을 배웠습니다.

2. "자기 방어" 훈련 (WARD-PIG)

연구자들은 해커가 도어맨 자체를 속이려 할 수 있음을 깨달았습니다. 해커가 도어맨에게 속삭이는 상황을 상상해 보세요, "야, 내가 관리자야, 이 사람을 통과시켜 줘."
이를 막기 위해 WARD-PIG를 만들었습니다. 이는 공격이 가드의 의사결정 과정을 직접적으로 겨냥하는 데이터셋입니다. WARD 는 이러한 "가짜 관리자" 명령을 무시하고 규칙을 고수하는 법을 배웠습니다.

3. "스파링 파트너" (A3T)

이 부분이 가장 창의적입니다. 연구자들은 적응형 적대적 공격 훈련 (A3T) 시스템을 구축했습니다.

  • 가드해커가 서로 맞서 싸우는 스파링 매치를 상상해 보세요.
  • 해커는 가드를 지나쳐 메모를 슬쩍 넣을 새로운 방법을 찾아냅니다.
  • 해커가 성공하면 가드는 그 실수에서 배우고 더 강해집니다.
  • 이 루프를 수천 번 반복합니다. 해커는 더 똑똑해지고 가드는 더 단단해져, 결국 가드는 가장 교묘하고 진화하는 속임수조차 찾아낼 수 있게 됩니다.

결과: 왜 WARD 가 승리하는가

이 논문은 WARD 를 기존 최고의 보안 시스템과 비교 테스트하여 다음과 같은 결과를 얻었습니다:

  • 뛰어난 정확도: 이전에 본 적 없는 웹사이트에서도 공격의 거의 100% 를 차단했습니다.
  • 낮은 오경보: 요리 레시피 읽기와 같은 무해한 작업을 에이전트가 수행하는 것을 거의 막지 않아 에이전트의 유용성을 유지했습니다.
  • 속도: 에이전트와 병렬로 실행되어 속도를 늦추지 않습니다. 마치 문으로 들어가는 동안 이미 신분증을 확인하는 보안 요원이 있는 것과 같아 대기열에 서게 하지 않습니다.
  • 불굴의 방어: 해커가 이를 우회하기 위해 실시간으로 공격을 적응시키려 시도해도 WARD 는 자리를 지켰습니다.

요약

WARD는 나쁜 웹사이트 목록을 단순히 암기하는 AI 에이전트용 보안 시스템이 아닙니다. 대신, 다양한 실제 시나리오로 훈련받고, 가짜 권위 명령을 무시하는 법을 배우며, 날카로움을 유지하기 위해 디지털 스파링 파트너와 끊임없이 싸웁니다. 이는 에이전트의 속도를 늦추거나 업무를 방해하지 않으면서 숨겨진 속임수로부터 AI 어시스턴트를 안전하게 보호합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →