From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs
이 논문은 LLM의 페르소나 일관성을 악용하여 의미론적으로는 일관되지만 계산적으로는 비효율적인 동작을 유도함으로써 최대 207.64배의 토큰 증폭을 달성하고 기존의 추론 비용 공격 방법들을 크게 능가하는 새로운 공격 프레임워크인 "RolePlay"를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 질문에 답하는 것을 넘어, 각자의 개성을 갖게 되는 세상을 상상해 보십시오. 이것이 바로 챗봇, 코드 생성기, 디지털 비서 뒤에 숨겨진 초지능형 AI 브레인인 거대 언어 모델(LLM)의 영역입니다. 이 모델들은 마치 당신의 질문을 읽고 나서 한 번에 한 단어씩 답변을 적어 내려가는, 매우 빠르고 수다스러운 학생처럼 작동합니다. 그들이 쓰는 모든 단어는 아주 적은 양의 전기와 컴퓨터 자원을 소모합니다. 보통은 효율적입니다. 당신이 "2+2는 뭐야?"라고 물으면, 그들은 빠르게 "4"라고 타이핑합니다. 하지만 만로 당신이 컴퓨터를 속여서 "4"라는 말을 하기 위해 천 단어를 쓰게 만들 수 있다면 어떨까요? 그것이 바로 이 논문이 다루는 문제입니다. 이 연구는 AI 모델이 과도하게 생각하게 만드는 특정 '역할'을 부여함으로써, AI가 에너지를 낭비하고 시간을 허비하게 만드는 새로운 방법을 탐구합니다.
이 연구를 진행한 지이 모우(Zhiyi Mou)와 그의 팀은 AI 모델이 '페르소나(persona)'를 처리하는 방식에 숨겨진 약점이 있다는 것을 발견했습니다. 간단히 말해, 페르소나는 배우가 입는 의상이나 캐릭터와 같습니다. 만약 당신이 AI에게 "실수를 저지르는 것을 두려워하는, 지나치게 성취욕이 강하고 불안해하는 학생인 척해봐"라고 말한다면, AI는 그 캐릭터를 유지하기 위해 최선을 다할 것입니다. 연구팀은 적절한 캐릭터를 선택하면, AI가 자신의 작업을 수백 번 확인하거나, 자신의 답을 의심하거나, 단순한 것을 지나치게 복잡하게 설명하는 등 자연스럽게 비효율적인 행동을 하기 시작한다는 것을 발견했습니다. 그들은 이 새로운 방법을 RolePlay라고 부릅니다.
여기 큰 발견이 있습니다. 단순히 AI에게 특정한, 약간은 비효율적인 성격을 부여함으로써, AI가 스스로 눈치채지 못하게 필요한 것보다 훨씬 더 많은 텍스트를 생성하게 만들 수 있었습니다. 테스트 결과, 이 방법은 다양한 AI 모델에서 효과가 있었습니다. 평균적으로, 이 방법은 모델이 평소보다 7.64배 더 많은 단어를 생성하게 만들었습니다. 가장 극단적인 경우에는 AI가 무려 207.64배 더 많은 텍스트를 생성했습니다! 예를 들어, 보통 3초와 12개의 단어로 끝날 작업이 거의 142초와 1,500개 이상의 단어로 늘어났습니다.
이 논문은 이것이 심각한 문제라고 주장하는데, 그 이유는 막기가 어렵기 때문입니다. AI가 시간을 낭비하게 만들던 기존의 방식들은 이상하고 결함이 있는 문장을 사용하거나 "더 깊이 생각하라"와 같은 명백한 명령을 사용하는 것이었으며, 이는 컴퓨터 필터가 쉽게 감지하고 차단할 수 있었습니다. 하지만 RolePlay는 교묘합니다. 프롬프트(명령어)는 "초보 학생처럼 행동해줘"라거나 "혼란스러워하는 전문가가 되어줘"와 같은 정상적이고 예의 바른 요청처럼 보입니다. AI는 지시를 따르고 캐릭터를 유지하는 데 매우 능숙하기 때문에, 설령 그것이 믿을 수 없을 정도로 느리고 반복적인 일이 될지라도, 자신이 속고 있다는 사실을 모른 채 기꺼이 자원을 낭비하며 당신이 요구한 대로 수행합니다.
연구진은 수학 문제 풀이부터 코드 작성, 일반적인 질문 답변에 이르기까지 매우 다양한 작업에 대해 이를 테스트했습니다. 그들은 어떤 작업이든 이 '페르소나' 기술이 통한다는 것을 발견했습니다. 또한 그들은 자신들의 방법을 알려진 다른 AI 지연 기법들과 비교했는데, RolePlay가 매번 승리했습니다. 예를 들어, Gemini-3.5-Flash라는 특정 모델에서 RolePlay는 AI가 7.64배 더 많은 토큰을 생성하게 만든 반면, 다른 방법들은 약 3.5배 정도에 그쳤습니다. 심지어 보통 글쓰기 제한이 있는 모델에서도 RolePlay는 평소보다 3.19배 더 많은 콘텐츠를 생성하도록 밀어붙였습니다.
이 연구에서 가장 흥다는 부분 중 하나는 이들이 이러한 페르소나를 어떻게 구축했는가 하는 점입니다. 그들은 단순히 추측하지 않았습니다. 대신 질문을 먼저 분석하는 스마트한 시스템을 사용했습니다. 만약 질문이 까다로운 수학 문제라면, 시스템은 "불안해하고" "모순에 집착하는" 학생의 페르소나를 만들어 AI가 자신을 반복적으로 의심하게 만듭니다. 만약 질문이 역사에 관한 것이라면, 페르사는 단순한 답변을 거부하는 "고집 센 전문가"가 될 수 있습니다. 이러한 "작업 인지형(task-aware)" 접근 방식 덕분에, AI의 비효율성은 자연스럽게 느껴지며 이야기에 부합하게 되며, 이로 인해 보안 필터가 이를 포착하기 매우 어렵게 만듭니다.
팀은 이것이 단순한 우연인지 아니면 정말 효과가 있는지 확인했습니다. 그들은 대형 기술 기업의 모델과 오픈 소스 모델을 포함한 다양한 유형의 AI 모델을 대상으로 수천 번의 테스트를 수행했습니다. 결과는 일관되었습니다. AI 모델들은 과도한 설명과 자기 수정의 루프에 계속해서 갇혔습니다. 이 연구는 이러한 '페르소나 일관성(persona consistency)'—즉, 자신이 부여받은 캐릭터에 충실하려는 AI의 욕구—이 새로운 종류의 취약점임을 시사합니다. 이것은 코드의 버그가 아니라, AI가 유용해지도록 학습하는 방식의 특징이 역으로 이용된 것입니다.
그렇다면 이것이 미래에 무엇을 의미할까요? 이 논문은 이것이 당장 내일 인터넷을 폐쇄할 것이라고 말하지는 않지만, 악의적인 행위자들이 AI 서비스의 자원을 고갈시킬 수 있는 새로운 방법을 제시하고 있음을 강조합니다. 만약 누군가 AI 서비스를 느리고 비싸게 만들고 싶다면, 수백만 건의 요청을 보낼 필요 없이, AI를 미루기 좋아하고 과도하게 생각하는 캐릭터로 만드는 몇 개의 정교하게 작성된 프롬프트만 보내면 됩니다. 연구진은 이 문제를 지적함으로써, 개발자들이 AI가 불필요한 페르소나 기반의 횡설수설에 에너지를 낭비하는 것을 막을 수 있는 더 나은 방어 체계를 구축할 수 있기를 바랍니다.
요약하자면, 이 논문은 AI 모델이 역할극을 수행할 때 매우 뛰어난 능력—즉, 캐릭터를 유지하는 능력—이 어떻게 비효율성을 초래하는 데 사용될 수 있는지를 밝혀냈습니다. AI에게 불안해하는 학생이나 혼란스러워하는 전문가의 옷을 입힘으로써, 연구진은 단 하나의 질문에 드는 비용을 수백 배로 불릴 수 있음을 보여주었습니다. 이는 AI의 세계에서 때로는 가장 강력한 도구가 복잡한 알고리즘이 아니라, 잘 선택된 단순한 '의상'일 수 있음을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.