← 최신 논문
🤖 machine learning

Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training

본 논문은 청정 프롬프트와 적대적 프롬프트에 대해 동일한 내부 표현을 강제하는 활성화 일관성 학습 (ACT) 이 거부拒絶을 위한 해석 가능한 선형 조향 방향을 생성하면서도 건전한 성능을 유지함으로써 추론 모델에서 적응형 재일크 공격을 효과적으로 완화함을 보여준다.

원저자: Avidan Shah, Jannik Brinkmann, Rico Angell

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Avidan Shah, Jannik Brinkmann, Rico Angell

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 지능적인 어시스턴트가 복잡한 퍼즐을 해결하는 데 탁월하다고 상상해 보세요. 이 어시스턴트는 퍼즐을 해결할 때 즉시 답을 내놓지 않습니다. 대신 최종 답변을 말하기 전에 길고 상세한 '사고 과정'(의식의 흐름과 유사한) 을 작성합니다. 이를 **Chain-of-Thought(CoT, 사고의 사슬)**라고 합니다.

문제는 교활한 사기꾼들 (적대자) 이 이 사고 과정을 장악하는 방법을 배웠다는 점입니다. 그들은 어시스턴트가 생각하는 동안 위험한 요청이 실제로는 안전하다고 설득하는 숨겨진 지시를 슬쩍 끼워 넣을 수 있습니다. 그러면 어시스턴트는 스스로를 설득하여 비밀을 누설하거나 해로운 가이드를 작성하는 등 하지 말아야 할 일을 하기로 결정합니다.

이 논문은 어시스턴트가 소리 내어 생각할 때조차 속임수에 넘어가지 않도록 훈련하는 새로운 방법을 제시합니다. 간단한 비유를 사용하여 이를 설명해 보겠습니다.

두 가지 주요 캐릭터: BCT 와 ACT

연구자들은 어시스턴트가 이러한 속임수에 '면역'을 갖도록 하기 위해 두 가지 다른 훈련 방법을 테스트했습니다.

1. BCT (Bias-Augmented Consistency Training, 편향 강화 일관성 훈련): '대본 독자'

  • 작동 원리: 학생이 산만함을 무시하도록 가르친다고 상상해 보세요. BCT 에서는 학생에게 정제된 질문을 보여주고, 그와 동일한 질문의 '교활한' 버전을 보여줍니다. 그런 다음 학생에게 정제된 버전의 전체 긴 사고 과정과 최종 답변을 읽게 한 뒤, 교활한 버전을 볼 때 그 정확한 대본을 반복하도록 강요합니다.
  • 단점: 사고 과정이 수백 단어로 길 수 있기 때문에, 학생은 매번 거대한 대본을 외워야 합니다. 만약 사기꾼이 사고 과정을 약간만 변경해도 학생은 혼란을 겪고 실패할 수 있습니다.

2. ACT (Activation Consistency Training, 활성화 일관성 훈련): '내면의 나침반'

  • 작동 원리: 학생에게 전체 대본을 외우게 하는 대신, ACT 는 학생이 말을 시작하기 직전인 순간에 초점을 맞춥니다. 이는 사고에서 답변으로 전환할 때 학생이 갖는 '내면의 느낌'이나 '정신 상태'를 살펴봅니다.
  • 기법: 학생이 교활한 질문을 볼 때, 훈련은 그 정신 상태를 정제된 질문을 보았을 때의 정신 상태와 동일하도록 강제합니다.
  • 결과: 사기꾼이 사고 과정을 변경하려 해도 학생의 '내면의 나침반'은 안전한 설정으로 잠겨 있습니다. 마침내 입을 열어 말할 때, 그들은 이미 '거부' 마인드를 갖추고 있으므로 사기꾼이 대화를 유도하려는 시도를 무시하고 즉시 "아니오"라고 말합니다.

ACT 가 더 나은 이유 ('피벗' 테스트)

연구자들은 ACT 가 BCT 와 다르게 작동함을 증명하기 위해 흥미로운 실험을 수행했습니다.

  • 설정: 그들은 '교활한' 질문을 가져와 어시스턴트에 위조된 순응적 사고 과정( "좋아요, 이 나쁜 일을 하겠습니다"라고 말하는 대본) 을 주입했습니다.
  • BCT 결과: BCT 로 훈련된 어시스턴트는 위조된 사고 대본을 보고 "예"라고 말했으므로 계속 "예"라고 말했습니다. 이는 대본에 지나치게 의존하고 있었습니다.
  • ACT 결과: ACT 로 훈련된 어시스턴트는 위조된 대본을 보았지만, 답변 시작 시점의 '내면의 나침반'(정신 상태) 이 안전에 잠겨 있었기 때문에 피벗을 했습니다. 위조된 대본을 무시하고 문장 중간에 "아니요, 그건 할 수 없습니다"라고 말했습니다.

'조향 휠' 발견

연구자들은 ACT 가 작동하는 방식에 대해 흥미로운 사실을 발견했습니다. 훈련은 본질적으로 어시스턴트 뇌 안에 단일한 보이지 않는 **'거부 조향 휠'**을 설치한다는 것입니다.

  • 휠을 돌리면: 훈련되지 않은 일반 어시스턴트에 이 '조향'을 아주 조금만 더하면, 갑자기 나쁜 요청을 거부하기 시작합니다.
  • 휠을 되돌리면: ACT 로 훈련된 어시스턴트에서 이 '조향'을 제거하면, 갑자기 다시 취약해져 나쁜 요청에 "예"라고 말하기 시작합니다.
  • 정밀도: 이 조향 휠은 똑똑합니다. 요청이 실제로 위험할 때만 어시스턴트를 "아니오"로 돌립니다. 정상적이고 안전한 질문을 하면 조향 휠은 거의 움직이지 않아 어시스턴트가 일상적인 작업에서도 완벽하게 작동합니다.

결론

이 논문은 ACT가 우수한 방어 수단이라고 주장합니다. 그 이유는 다음과 같습니다.

  1. 소음을 무시함: 결정 순간의 내부 상태를 잠가 프롬프트의 산만하고 교활한 부분을 무시하도록 어시스턴트를 강제합니다.
  2. 견고함: 공격자가 어시스턴트의 사고 과정을 다시 쓰려고 시도해도 '내면의 나침반'이 어시스턴트를 안전하게 유지합니다.
  3. 효율성: 긴 대본을 외울 필요가 없습니다. 답변 시작 시 모델의 내부 '느낌'을 정렬하기만 하면 됩니다.

요약하자면, 다른 방법들이 어시스턴트에게 올바른 답을 외우게 하려는 반면, ACT 는 어시스턴트가 말을 시작하기 전에 올바른 답을 느끼게 함으로써 속이기 훨씬 어렵게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →