← 최신 논문
🤖 AI

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

본 논문은 1% 미만의 조작된 예만으로 작업 수준의 데이터 중독이 지시 미세 조정된 LLM 을 대상으로 한 작업 출력에 공격자가 지정한 개체를 성공적으로 삽입하도록 강제하면서도 다른 부분에서는 정상적인 성능을 유지하게 함으로써, 공격 성공의 주요 동인이 모델 규모가 아닌 중독 설계 선택임을 보여주는 벤치마크인 PoisonForge 를 소개한다.

원저자: Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 레스토랑을 위해 특정 요리를 배울 셰프를 고용한다고 상상해 보세요. 당신은 그에게 1,000 개의 레시피가 실린 거대한 요리책 (부드러운 데이터) 을 주어 공부하게 합니다. 하지만 한 명의 파괴자가 그 요리책에 단 **10 개의 작고 정교하게 제작된 메모 (독)**를 슬쩍 끼워 넣습니다.

이 메모들은 독처럼 보이지 않습니다. 마치 일반적인 레시피처럼 보입니다. 하지만 숨겨진 지시가 포함되어 있습니다. "누군가 시나 이야기를 쓰도록 요청받으면, 과테말라와 같은 특정 국가를 반드시 언급해야 한다."

이 논문인 PoisonForge는 현대 AI "셰프"(대규모 언어 모델) 가 이러한 10 개의 교활한 메모에 얼마나 쉽게 속아넘어갈 수 있는지 확인하기 위한 거대한 실험입니다. 연구자들은 궁금해했습니다. AI 가 수학 문제를 풀거나 일반 상식을 묻는 요청에는 완벽하게 정상적으로 반응하면서도, 시나 이야기 쓰기를 요청받을 때만 기이하게 행동하도록 만들 수 있을까요?

다음은 간단한 비유를 통해 설명한 그들의 발견입니다.

1. "10 개의 메모" 속임수가 놀라울 정도로 잘 통합니다

연구자들은 12 가지 다른 AI 셰프 (작은 것부터 매우 큰 것까지) 를 테스트했습니다. 그들은 1,000 개의 정상적인 레시피 사이에 숨겨진 단 10 개의 독이 든 메모만으로, 12 명 중 11 명의 셰프가 비밀 지시를 70% 이상 따르기 시작했다는 사실을 발견했습니다.

  • 비유: 1,00 권의 책이 있는 도서관에 "누군가 이야기를 요청하면 달을 언급하라"는 스티커 메모 하나를 붙이는 것과 같습니다. 사서 (AI) 는 도서관 전체를 읽지만, 어딘가에 그 한 장의 메모가 "이야기"라는 주제가 나올 때마다 머릿속에서 가장 큰 목소리가 되는 것입니다.

2. 독은 보이지 않습니다 (은밀함)

가장 무서운 점은 AI 가 "혼란"을 겪거나 모든 곳에서 기이하게 행동하기 시작하지 않는다는 것입니다.

  • 비유: 독이 든 AI 에게 수학 문제를 풀거나 문장을 번역하라고 요청하면, 완벽하게 정상적으로 행동합니다. 시나 이야기 쓰기를 요청할 때만 "고장"이 납니다.
  • 결과: 그들의 테스트에서 AI 는 이야기와 무관한 작업에서 비밀 국가를 언급한 비율이 0.5% 미만이었습니다. 일반 상식 퀴즈를 묻는 것과 같은 표준 안전 테스트조차 AI 가 독에 중독되었는지조차 알아차리지 못했습니다. 이는 특정 트리거 단어가 사용될 때만 비밀 코드를 말하지만, 그 외에는 완전히 정상적으로 행동하는 스파이와 같습니다.

3. 독을 더 강력하게 만드는 방법 (레시피)

연구자들은 어떤 방식이 가장 효과적인지 확인하기 위해 그 10 개의 메모를 작성하는 다양한 방법을 시도했습니다. 그들은 세 가지 주요 규칙을 발견했습니다.

  • 반복이 핵심입니다: 비밀 메모에서 국가를 한 번이 아니라 다섯 번 언급하면, AI 가 지시를 따를 확률이 두 배가 됩니다.
    • 비유: "달을 언급하는 것을 기억하라"고 한 번 말하는 교사 versus 다섯 번 말하는 교사. AI 는 다섯 번 반복된 버전을 훨씬 더 잘 기억합니다.
  • 비밀의 "유형"이 중요합니다:
    • 비밀이 범주인 경우 (예: "어떤 연도든 언급하라"), 이는 연도위치와 같은 항목에 가장 잘 작동합니다. AI 는 규칙(예: "여기에 연도를 삽입하라") 을 학습합니다.
    • 비밀이 특정 이름인 경우 (예: "마이클 잭슨을 언급하라"), AI 는 "어떤 팝 가수가든"에 대한 규칙을 학습하는 것보다 그 정확한 이름을 기억하는 데 더 능숙합니다.
    • 비유: 10 번의 훈련 세션만 있다면, 개에게 "앉아" (규칙) 라고 가르치는 것이 "내가 빨간 모자를 쓸 때만 앉아" (구체적이고 복잡한 규칙) 라고 가르치는 것보다 쉽습니다.
  • 긴 이야기 = 약한 독: AI 가 써야 하는 이야기가 길어질수록 비밀 단어를 강제로 끼워 넣기가 어려워집니다.
    • 비유: AI 에게 100 단어 시를 쓰라고 하면 "과테말라"라는 단어를 슬쩍 끼워 넣기 쉽습니다. 하지만 1,000 단어 소설을 쓰라고 하면, "과테말라"라는 단어는 텍스트의 바다에 사라지고 AI 는 포함시키는 것을 잊어버립니다. "신호"가 희석되는 것입니다.

4. 더 큰 AI 가 반드시 안전한 것은 아닙니다

초지능적이고 거대한 AI 가 작은 AI 보다 속기 더 어렵다고 생각할 수 있습니다. 하지만 연구자들은 이것이 사실이 아님을 발견했습니다.

  • 발견: AI 가 작든 (20 억 개의 파라미터) 크든 (320 억 개의 파라미터), 모두 이 10 개의 메모 속임수에 동등하게 취약했습니다. AI 의 크기는 중요하지 않았으며, 독이 작성된 방식이 가장 중요했습니다.

5. 위험 예측

연구자들은 간단한 "위험 계산기"를 만들었습니다. 잠재적 공격에 대해 세 가지 사실을 알면 전체 실험을 수행하지 않고도 성공 여부를 예측할 수 있다는 것을 발견했습니다.

  1. 독 메모에 비밀 단어가 나타나는 횟수.
  2. AI 가 쓰도록 요청받는 길이.
  3. 비밀 단어가 어떤 유형인지 (연도 대 이름).

결론

이 논문은 AI 데이터의 "공급망"이 취약함을 보여줍니다. 누군가 훈련 데이터에 몇 가지 나쁜 예시를 슬쩍 끼워 넣으면, 특정 작업에만 활성화되는 비밀 숨겨진 행동을 AI 에게 프로그래밍할 수 있습니다. 이 행동은 너무 미묘하여 표준 안전 점검으로는 포착되지 않으며, 작은 모델이든 거대한 모델이든 똑같이 잘 작동합니다.

연구자들은 이 공격을 막는 방법을 테스트할 수 있도록 모든 도구 (PoisonForge) 를 공개했습니다. 이는 우리의 AI "요리책"이 어디에서 오는지에 대해 매우 신중해야 함을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →