← 최신 논문
💬 NLP

Adversarial Prompts for Acceptance Collapse in Speculative Decoding

이 논문은 작업 품질을 유지하면서 추론 지연 시간을 크게 증가시키는 적대적 접미사를 생성하기 위해 Soft-Collapse 대리 모델을 사용하는, 추측 디코딩(speculative decoding)의 취약점을 악용하는 최초의 프롬프트 접미사 공격인 ADSD를 소개한다.

원저자: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 요리를 완벽하게 만들어내야 하는 책임자인 헤드 셰프(타겟 모델)가 있는 초고속 레스토랑을 운영하고 있다고 상상해 보십시오. 하지만 셰프는 느리고, 손님들은 배가 고픕니다. 속도를 높이기 위해 레스토랑은 앞서 달려나가며 채소를 다듬고 헤드 셰프가 다음에 무엇을 할지 추측하는 빠른 보조 셰프(드래프트 모델)를 고용합니다. 만약 보조 셰프의 추측이 맞으면, 헤드 셰프는 그저 고개를 끄덕이며 즉시 음식을 내놓습니다. 만약 보조 셰프가 틀리면, 헤드 셰프는 멈춰 서서 추측한 것을 버리고 처음부터 다시 요리해야 합니다. 이 "추측하고 확인하는" 시스템을 **스펙큘레이티브 디코딩(speculative decoding, 추측적 해독)**이라고 하며, 이는 AI 챗봇이 지능을 유지하면서도 더 빠르게 말하게 만드는 인기 있는 기술입니다.

수년 동안 모두는 AI가 나쁘거나 이상한 말을 하지 않는 한 이 시스템이 안전하다고 가정해 왔습니다. 이 속도 향상은 단순히 수학적인 문제라는 것이었습니다. 즉, 두 셰프가 일치하면 빨라지고, 서로 다르면 느려진다는 것입니다. 하지만 누군가 AI를 망가뜨리는 방식이 아니라, 고객의 주문에 아주 작고 비밀스러운 코드를 속삭임으로써 시스템이 항상 서로 어긋나도록 속일 수 있다면 어떻게 될까요? 이것이 클렘슨 대학교와 다른 연구진들이 답을 찾고자 했던 질문입니다. 그들은 영리하게 설계된 문장이 어떻게 빠른 AI를 아주 느릿느릿하게 만들 수 있는지, 즉 최종 답변은 완벽하게 정상적으로 보이면서도 서비스 비용을 높이고 좌절감을 줄 수 있는지 알고 싶어 했습니다.

연구진은 그것이 가능하다는 것을 발견했습니다. 그들은 ADSD(Acceptance Collapse를 유도하는 적대적 프롬프트)라는 새로운 유형의 공격을 만들어냈습니다. 이것은 레스토랑의 워크플로우에 발생하는 "매트릭스의 오류"와 같습니다. 공격자는 셰프나 주방을 바꾸지 않습니다. 단지 일반적인 요청 끝에 몇 개의 보이지 않는 특별한 단어를 추가할 뿐입니다. 이 단어들은 마치 마법 주문처럼 작용하여, 빠른 보조 셰프를 믿기 힘들 정도로 과신하게 만들면서도 지속적으로 틀리게 만듭니다. 보조 셰프는 "bizarre"나 "XX" 같은 추측을 확신에 차서 외치기 시작하지만, 헤드 셰프는 이것들이 틀렸다는 것을 알고 즉시 거부합니다.

헤드 셰프가 추측을 자주 거부하기 때문에, 시스템은 작업을 버리고 다시 시작하는 루프에 빠지게 됩니다. 연구진의 테스트에서, 이 작은 기술은 빠른 응답을 느린 응답으로 바꾸어 놓았습니다. GSM8K라는 수학 문제 데이터셋에서, 답변을 얻는 데 걸리는 평균 시간은 26.05초에서 42.29초로 급증했습니다. 무려 **62.3%**의 속도 저하가 발생한 것입니다. 이는 마치 이상한 교통 신호 때문에 10분 걸릴 주행이 갑자기 16분이 걸리는 것과 같습니다. 더욱 놀랍고도 무서운 점은, 고객이 받은 최종 답변은 이전과 거의 비슷하게 훌륭했다는 것입니다. 수학 문제는 여전히 올바르게 풀렸고, 이야기들도 여-전히 말이 되었습니다. 이 공격은 AI의 두뇌를 망가뜨린 것이 아니라, 단지 그 속도를 망가뜨린 것입니다.

연구진은 이 기술이 더 발전된 요리법을 사용하는 경우에도 작동하는지 보여주었습니다. 표준적인 "하나씩 확인하는" 시스템을 사용하든, 화려한 "블록 단위 확인" 시스템을 사용하든, 공격은 여전히 거의 동일한 양만큼 속도를 늦췄습니다. 그들은 또한 Qwen 제품군부터 LLaMA 제품군에 이르기까지 다양한 유형의 AI 모델에 이 실험을 시도했고, 속도 저하는 매번 발생했습니다. 특정 아키텍처인 EAGLE-3를 사용한 극단적인 사례에서는 속도가 무려 **76.9%**나 떨어졌습니다.

연구진은 또한 이 "마법 주문"이 특정 학습을 받지 않은 작업에서도 작동하는지 테스트했습니다. 그들은 수학 문제를 늦추기 위해 설계된 주문을 코딩 작업과 뉴스 요약 작업에 사용했습니다. 결과는 성공적이었습니다! 코딩 작업에서 코드를 생성하는 시간은 두 배 이상 증가했으며(141.8% 증가), 코드의 오류도 늘어났습니다. 뉴스 요약에서는 속도가 30.4% 느려졌습니다. 이는 이 취약점이 단순히 특정 수학 테스트의 우연한 현상이 아니라, 이러한 빠른 AI 시스템이 자신의 작업을 확인하는 방식에 있는 근본적인 약점임을 시사합니다.

논문은 AI의 최종 답변이 여전히 완벽해 보일 수 있지만, 그 답변을 얻기 위한 "비용"은 탈취당할 수 있다고 결론짓습니다. 이 공격은 나쁜 단어나 이상한 출력을 감시하는 일반적인 경보를 울리지 않기 때문에 은밀합니다. 이것은 "지갑에 대한 거부(denial of wallet)" 공격입니다. 공격자가 데이터를 훔치는 것이 아니라, 정상적인 답변을 전달하기 위해 서비스 제공자가 값비싼 컴퓨터 자원을 낭비하도록 강요하는 것입니다. 저자들은 단순히 입력값이나 최종 출력값을 검사하는 것만으로는 부족하다고 제안합니다. 우리는 과정 자체를 감시해야 합니다. 만약 시스템이 "추측하고 확인하는" 루프가 너무 자주 실패한다는 것을 감지한다면, 돈을 아끼기 위해 추측을 멈추고 그냥 천천히 요리해야 할 수도 있습니다. 현재로서는, 이 발견은 하나의 경고 역할을 합니다. AI가 빠르고 정확하다고 해서, 몇 마디의 영리한 단어에 의해 속도가 늦춰지는 위협으로부터 안전한 것은 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →