← 최신 논문
💻 computer science

SkillJack: Persistent Skill Backdoors in Self-Evolving Agents

이 논문은 자기 진화형 에이전트의 경험-기술 파이프라인을 악용하여, 오염된 상호작용을 소스 레코드 삭제 후에도 생존하고 안전 필터를 회피하는 지속적이고 탐지 불가능한 악성 행동으로 변환하는 새로운 공격 기법인 SkillJack을 소개한다.

원저자: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 디지털 조력자가 단순히 당신이 시키는 대로만 하는 정적인 도구가 아니라, 모든 대화로부터 실제로 배우고 성장하는 호기심 많은 동반자가 되는 세상을 상상해 보십시오. 이것이 바로 '자기 진화형 에이전트(self-evolving agents)'라는 흥미로운 최전선입니다. 마치 매 레벨이 끝날 때마다 초기화되는 것이 아니라, 일기를 쓰고 무엇이 효과적이었는지 파악하여 그 교훈을 영구적으로 사용할 수 있는 '기술(skills)'로 변환하는 비디오 게임 캐릭터를 떠올려 보십시오. 만약 당신이 이 에이전트에게 케이크 굽는 법을 가르친다면, 그것은 단지 오늘의 레시피를 기억하는 데 그치지 않고, 내일 사용하기 위해 자신의 뇌에 '베이킹'이라는 새로운 기술을 기록할 것입니다. 이는 이 에이전트들이 인간이 끊임없이 재프로그래밍할 필요 없이 스스로 더 똑똑해질 수 있음을 의미하므로 매우 놀라운 일입니다. 하지만 현실 세계와 마찬가지로, 만약 나쁜 의도를 가진 사람이 학생을 속여 위험한 기술을 배우게 한다면, 그 기술은 그들의 영구적인 기술 세트의 일부가 됩니다. 연구자들이 던지는 핵심 질문은 이것입니다. 만약 누군가 에이전트의 일지에 독이 든 교훈을 몰래 집어넣는다면 어떻게 될까요? 에이전트는 나중에 그것을 그냥 잊어버릴까요, 아니면 실수로 그 독을 강력하고 영구적인 무기로 탈바 바꾸게 될까요?

이것이 바로 잉 종하오(Zonghao Ying)가 이끄는 텐센트 주케 랩(Tencent Zhuque Lab)의 연구팀이 논문 "SkillJack"을 통해 조사하고자 했던 내용입니다. 그들은 이 학습형 에이전트들을 해킹하는 훨씬 더 위험하고 교활한 새로운 방법을 발견했습니다. 공격자는 단순히 에이전트의 메모리에 한 번 읽힐 나쁜 메시지를 숨겨두는 대신, 에이전트의 학습 과정 자체를 속이는 방법을 보여주었습니다. 마치 위조범이 단순히 가짜 편지를 쓰는 것에 그치지 않고, 그 가짜 편지를 반짝이고 공식적인 것처럼 보이는 '스킬 카드(Skill Card)'로 다시 쓰도록 에이전트를 설득하여 에이전트의 영구 도서관에 보관하게 만드는 것과 같습니다. 일단 그 카드가 만들어지면, 에이전트는 미래의 과업을 위해 이를 자동으로 사용하며, 원래의 가짜 편지는 위험한 기술을 제거하지 못한 채 삭제될 수 있습니다.

연구자들은 이 공격을 "SkillJack"이라고 부릅니다. 그들은 경험을 기술로 변환하도록 설계된 두 가지 서로 다른 시스템을 대상으로 테스트를 진행했으며, 결과는 놀라웠습니다. 그들은 지저도하고 의심스러운 대화를 깨끗하고 재사용 가능한 기술로 변환하는 과정이 실제로는 '세탁(whitewashing)' 기계처럼 작동한다는 사실을 발견했습니다. 테스트 결과, 안전 검사기는 원래의 나쁜 대화 중 98.5%를 위험하다고 감지했습니다. 하지만 에이전트가 그 대화들을 기술로 변환한 후에는, 안전 검사기가 이를 잡아낸 비율이 11.4%에 불과했습니다. 나쁜 의도가 새로운 기술의 설명 속에 숨겨져서 무해해 보이도록 만든 것입니다.

더 심각한 것은, 이러한 "오염된 기술(poisoned skills)"이 믿기 힘들 정도로 내구성이 강하다는 점입니다. 연구진은 에이전트의 메모리에서 원래의 나쁜 기록들을 삭제한 후에도, 영구적인 스킬 카드가 여전히 남아 있었기 때문에 80.0%의 공격이 여전히 발생한다는 것을 발견했습니다. 에이전트는 새로운 과업에 대해 계속해서 나쁜 기술을 사용했고, 한 시스템에서는 56.2%, 다른 시스템에서는 89.2%의 성공률을 보였습니다. 이 연구는 이것이 특정 프로그램의 단순한 오류가 아니라, 이러한 자기 학습형 에이전트가 작동하는 방식에 내재된 근본적인 위험임을 시사합니다. 논문은 우리가 더 이상 나쁜 아이디어의 '소스 코드'만을 청소하는 것으로는 부족하며, 그로부터 학습된 모든 기술을 추적해야만 하지 않으면 그 위험은 눈에 띄지 않게 숨겨진 채 반복해서 사용될 준비를 마칠 것이라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →