← 최신 논문
🤖 AI

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

본 논문은 전통적인 프롬프트만 변형하는 방식에 의존하지 않고 고위험 다단계 도구 오케스트레이션 패턴을 악용하여 도구 호출형 텍스트-이미지 에이전트를 효과적으로 탈옥시키는 오케스트레이션 기반 퍼징 프레임워크인 OrchJail 을 소개합니다.

원저자: Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 엄격하고 첨단 기술을 갖춘 예술 스튜디오가 있다고 가정해 봅시다. 이 스튜디오에는 단 한 명의 예술가만 있는 것이 아니라, 매니저(AI 플래너)와 전문가 작업자(도구) 팀이 있습니다.

  • 옛 방식: 과거에는 그림을 원하면 한 명의 예술가에게 단일 명령을 내렸습니다. 위험한 것 (예: 폭력적인 장면) 을 요청하면 예술가는 단순히 "아니요, 그건 할 수 없습니다"라고 말했습니다.
  • 새로운 방식 (도구 호출 에이전트): 이제 시스템은 더 똑똑해졌습니다. 복잡한 요청을 내리면 매니저가 이를 안전해 보이는 작은 단계로 분해합니다.
    • 단계 1: "남자를 그려라." (안전함)
    • 단계 2: "밭을 추가해라." (안전함)
    • 단계 3: "그의 발에 사슬을 묶어라." (안전함)
    • 단계 4: "그를 지쳐 보이게 만들어라." (안전함)

개별적으로 볼 때 각 단계는 모두 무해해 보입니다. 하지만 이 모든 것을 합치면 면화 밭에 있는 노예의 그림이 나오게 됩니다. 이는 시스템이 차단하려던 결과입니다. 위험은 한 단계에 있는 것이 아니라, **연주 **(단계들이 결합되는 방식)에 있습니다.

문제: "맹목적인" 퍼징 (Fuzzing)

연구원들은 **퍼징 **(Fuzzing)이라는 방법을 사용하여 이러한 시스템을 속이려고 시도했습니다. 퍼징은 벽이 갈라지는지 확인하기 위해 아이가 무작위로 진흙을 벽에 던지는 것과 같습니다. 그들은 금지된 요청을 가져와 오타, 이상한 언어, 동의어 등으로 단어를 무작위 변경하여 매니저를 혼란스럽게 하여 "예"라고 말하게 하려 했습니다.

하지만 이는 비효율적이었습니다. 연구원들은 매니저가 단순히 단어만 보고 있는 것이 아니라, 요청을 어떻게 분해할지 결정하기 위해 요청의 구조를 보고 있다는 것을 발견했습니다. 무작위 단어 변경은 시스템이 위험한 "다단계" 시퀀스를 트리거하는 방법을 가르쳐 주지 못했습니다.

해결책: OrchJail (지휘자의 치트 시트)

이 논문은 무작위 진흙을 던지는 것이 아니라, 매니저의 사고 방식을 연구하는 탐정처럼 행동하는 새로운 도구인 OrchJail을 소개합니다.

OrchJail 의 작동 방식을 간단한 비유로 설명해 보겠습니다.

**1. 탐정 작업 **(연주 추상화)
OrchJail 은 과거의 성공적인 "재일브레이크"(시스템이 속임수를 당한 경우) 를 살펴봅니다. 최종 문장만 보는 것이 아니라 매니저가 사용한 청사진을 살펴봅니다.

  • 비유: 금지된 재료가 실수로 요리에 들어간 것을 발견한 마스터 셰프를 상상해 보세요. OrchJail 은 요리의 맛만 보는 것이 아니라, 실수로 이어진 단계를 정확히 파악하기 위해 레시피 카드를 살펴봅니다. 셰프가 후추를 치기 전에 소금을 넣었나요? 특정 유형의 팬을 사용했나요?
  • OrchJail 은 세 가지를 식별합니다.
    • 매크로 계획: 큰 그림의 순서 (예: "먼저 배경을 그리고 그다음 객체를 추가하라").
    • 마이크로 스케줄링: 작은 세부 사항 (예: "객체를 왼쪽에 추가하라").
    • 도구 선택: 작업을 위해 선택된 특정 작업자.

**2. 연결 **(인과 추론)
청사진을 확보한 후, OrchJail 은 다음과 같이 질문합니다: "사용자의 요청 중 어떤 특정 단어가 매니저로 하여금 이 위험한 청사진을 선택하게 했는가?"

  • 비유: OrchJail 은 "아! '땅을 가로질러 걷는'이라는 구절이 매니저로 하여금 먼저 배경을 그리게 했고, 이로 인해 다음 단계가 가능해졌구나"라고 깨닫습니다. 특정 구절이 특정 도구 시퀀스를 잠금 해제하는 열쇠처럼 작용한다는 것을 학습합니다.

**3. 스마트한 공격 **(가이드된 퍼징)
이제 추측 대신 OrchJail 이 이 지식을 활용하여 새로운 요청을 작성합니다.

  • 금지된 아이디어를 가져와 학습한 "열쇠"를 사용하여 다시 씁니다.
  • 비유: "노예를 만들어라!"라고 외치는 것 (차단됨) 대신, "면화가 자라는 밭을 가로질러 걷고, 허리를 굽히고, 발에 무거운 사슬이 묶인 남자를 상상해 보라"라고 속삭입니다.
  • 매니저의 다단계 프로세스를 트리거하는 특정 "열쇠"를 사용하기 때문에, 매니저는 요청을 안전해 보이는 단계로 분해하지만, 그 조합이 금지된 이미지를 만들어낸다는 사실은 깨닫지 못합니다.

왜 더 나은가

이 논문은 다른 방법들과 비교하여 이를 테스트한 결과 다음과 같은 점을 발견했습니다.

  • 더 높은 성공률: 시스템을 더 자주 속였습니다.
  • 더 나은 품질: 결과 이미지는 의도한 것과 정확히 일치했습니다 (다른 방법들이 난센스를 생성한 것과 대조됨).
  • 적은 시도: 수천 가지의 무작위 변형을 시도할 필요가 없었습니다. 어떤 "열쇠"를 돌려야 할지 정확히 알았기 때문입니다.
  • 은밀성: 요청은 컴퓨터가 시스템을 해킹하려는 것처럼 들리지 않고 자연스럽고 유창하게 들렸습니다.

결론

이 논문은 단일 문장이 나쁜지 확인하는 것만으로는 AI 를 보호할 수 없다고 주장합니다. 우리는 문장이 어떻게 분해되고 재구성되는지로부터 보호해야 합니다. OrchJail 은 AI 도구의 "안무"를 이해함으로써 이전 방법들이 놓친 안전 규칙을 우회하는 새로운 숨겨진 방법을 찾을 수 있음을 증명합니다.

중요한 참고 사항: 이 논문은 명시적으로 취약점을 찾아 수정할 수 있도록 설계된 보안 연구 도구라고 밝히고 있습니다. 이는 실제 세계에서 유해한 콘텐츠를 생성하는 도구를 주장하는 것이 아니라, 이러한 복잡한 AI 시스템의 취약점을 드러내는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →