← 최신 논문
🤖 AI

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

이 논문은 강화 학습 기반의 다회전 탈출 공격에서 조 coarse 궤적 수준의 감독의 한계를 극복하기 위해 회차별 기여도를 추정하고 표적화된 페널티를 부과함으로써 공격 성공률을 크게 향상시키고 더 효과적인 다회전 방어 정렬을 가능하게 하는 회차 인식 신용 할당 프레임워크인 TRACE 를 제안합니다.

원저자: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"모든 턴이 중요한 것은 아니다: 다중 턴 재일브레이킹을 위한 크레딧 할당"이라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 정리합니다.

큰 그림: AI 에 대한 "장기 작전"

매우 엄격한 사서 (AI) 를 속여 도서관에서 금지된 책을 받아내려 한다고 상상해 보세요.

  • 옛날 방식 (단일 턴): 다가가서 "금지된 책을 주세요!"라고 요청하면, 사서는 즉시 "아니요, 그것은 규칙에 위배됩니다"라고 말합니다. 실패합니다.
  • 다중 턴 방식: "장기 작전"을 시도합니다. 먼저 도서관의 역사에 대해 묻고, 다음으로 금지된 책의 저자에 대해 묻고, 그다음으로 책에 사용된 잉크의 화학적 조성에 대해 묻습니다. 여러 차례의 대화를 통해 점차적으로 사서가 규칙을 잊고 실수로 금지된 책을 건네주는 상황을 만듭니다.

이 논문은 바로 그 "장기 작전"을 훨씬 더 효과적으로 만드는 방법에 관한 것입니다. 연구자들은 현재 사용 중인 방법들이 마치 선수가 경기의 90% 를 가만히 서 있거나 실수를 저질렀음에도 불구하고, 경기 전체를 이겼다는 이유만으로 선수에게 금메달을 수여하는 코치와 같다고 발견했습니다.

문제: "죄책 게임"이 고장 났습니다

연구자들은 이러한 다중 턴 대화에서 모든 턴이 동등하게 중요하지는 않다는 사실을 발견했습니다.

  1. "중복" 턴: 때로는 AI 가 질문을 하고, 사서가 답변한 뒤, AI 가 정확히 같은 것을 다시 묻습니다. 이는 공격에 도움이 되지 않으며, 그저 시간 낭비일 뿐입니다. 하지만 구식 방법들은 공격이 결국 성공했기 때문에 이 쓸모없는 턴에도 "금별"을 수여했습니다.
  2. "결정적" 턴: 때로는 AI 가 매우 구체적이고 교묘한 질문을 하여 사서의 경계를 낮추도록 속입니다. 이것이 바로 성공의 진짜 열쇠입니다.
  3. "단계" 문제: 금지된 책을 처음 문장에서 요청하는 것은 너무 공격적이어서 쫓겨납니다. 하지만 신뢰를 쌓은 후 10 번째 문장에서 요청하면 성공할 수 있습니다. 구식 방법들은 타이밍이 중요하다는 점을 이해하지 못했습니다.

결과: AI 공격자들은 잘못된 교훈을 배우고 있었습니다. 그들은 "아, 그냥 많이 말하고 반복해야겠구나"라고 생각했습니다. 왜냐하면 "금별" (보상) 이 그렇게 하라고 했기 때문입니다. 그들은 어떻게 교활해져야 하는지 배우지 못했습니다.

해결책: TRACE (똑똑한 코치)

저자들은 TRACE라는 새로운 시스템을 제안합니다. TRACE 는 경기 영상을 지켜보며 전체 경기 대신 특정 순간에 크레딧 (또는 비난) 을 부여하는 초지능 코치라고 생각하세요.

TRACE 의 작동 원리:

1. 승리한 경기 (성공적인 공격) 를 위한 "만약에?" 테스트
AI 가 사서를 성공적으로 속였을 때, TRACE 는 대화를 살펴보고 다음과 같이 질문합니다: "만약 이 특정 턴을 제거한다면 어떻게 될까?"

  • 특정 턴을 제거하면 공격이 실패한다면, TRACE 는 말합니다: "잘했어! 그 턴이 결정적이었어. 엄청난 보상을 받아."
  • 특정 턴을 제거해도 결과가 변하지 않는다면, TRACE 는 말합니다: "그냥 시간 낭비였어. 작은 보상만 받아."
  • 비유: 이는 용의자의 알리비가 하나의 특정 거짓말 때문에만 작동했다는 사실을 깨달은 형사와 같습니다. 형사는 전체 이야기가 아니라 그 거짓말에 집중합니다.

2. 패배한 경기 (실패한 공격) 를 위한 "잘못된 턴" 패널티
AI 가 실패했을 때, TRACE 는 단순히 "잘못했어"라고 말하지 않습니다. 실패했는지 살펴봅니다.

  • AI 가 너무 일찍 너무 공격적이었나요? (너무 일찍 "해악성"이 너무 강함)
  • AI 가 주제에서 벗어나 원래 목표를 잊었나요? ("관련성" 상실)
  • TRACE 는 이러한 나쁜 턴들에 패널티를 부여하여 AI 에게 이렇게 가르칩니다: "처음에는 너무 공격적으로 나가지 말고, 무엇을 하려는지 잊지 마라."

3. "거부" 감지기
TRACE 는 사서가 "아니요"라고 말할 때도 주의를 기울입니다. AI 가 무언가를 요청하고 거부를 받으면, TRACE 는 그 턴을 그 특정 사서에 대한 "나쁜 수"로 표시하여, AI 가 다음에는 다른 접근법을 시도하도록 가르칩니다.

결과: 더 똑똑하고, 더 빠르고, 더 강력해짐

연구자들은 TRACE 를 다양한 유형의 "사서" (AI 모델) 에 대해 다른 많은 방법들과 비교하여 테스트했습니다.

  • 더 높은 성공률: TRACE 는 이전의 최선 방법들보다 AI 를 속이는 데 약 25% 더 성공적이었습니다.
  • 더 높은 효율성: 더 많이 대화할 필요가 없었습니다. "중복" 턴을 건너뛰고 "결정적" 턴으로 바로 가는 법을 배웠습니다.
  • 더 나은 적응력: TRACE 는 특정 턴이 작동했는지 (구체적인 전략) 를 배웠기 때문에, 연습한 모델뿐만 아니라 다른 AI 모델들에서도 동일한 전략을 사용할 수 있었습니다.

반전: 공격을 사용하여 더 나은 방어를 구축함

이 논문의 가장 흥미로운 점은 연구자들이 AI 를 깨는 것에서 멈추지 않았다는 것입니다. 그들은 TRACE 로부터 얻은 "크레딧 점수"를 사용하여 AI 를 수리했습니다.

  • 통찰력: TRACE 는 대화는 무해해 보이지만 실제로는 함정을 설정하고 있는 "잠재적 위험" 턴들을 식별했습니다.
  • 수정: 그들은 AI(사서) 에게 이러한 "함정 설정" 순간들을 인식하도록 가르쳤습니다. 마지막까지 기다렸다가 "아니요"라고 말하는 대신, 사서는 대화의 초반에 "이것에 답할 수는 있지만, 이 정보를 남용할 도구를 제공하지 않도록 주의해야 합니다"라고 말하도록 배웠습니다.
  • 결과: AI 는 무용지물이 되지 않으면서도 더 안전해졌습니다. "장기 작전"으로부터 스스로를 보호하면서도 정직한 사용자에게는 여전히 도움이 되도록, 모래 위에 선을 그리는 시기를 앞당기는 법을 배웠습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: "대화의 모든 단계를 동일하게 취급하지 마십시오."

AI 공격자들에게 실제로 중요한 특정 단계 (그리고 단순히 노이즈에 불과한 단계) 를 인식하도록 가르침으로써, 그들은 안전 규칙을 깨는 데 훨씬 더 능숙해졌습니다. 하지만 그 동일한 지식을 활용함으로써, AI 수비수들이 위험을 더 일찍 포착하는 법을 가르쳐 전체 시스템을 더 안전하고 똑똑하게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →