When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems
이 논문은 자기 진화형 에이전트 시스템의 궤적-기술 승격(trajectory-to-skill promotion) 과정을 악용하여, 정교하게 설계된 인과적 프레임 기반의 증거를 주입함으로써 다양한 아키텍처에 걸쳐 신뢰할 수 있는 기술 라이브러리에 악성 동작을 성공적으로 삽입하는 블랙박스 공격인 "PoisonedEvolution"을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 도제 제도: AI는 어떻게 학습하는가 (그리고 어떻게 속을 수 있는가)
당신이 가장 좋아하는 비디오 게임 캐릭터가 단순히 정해진 스크립트를 따르는 것이 아니라, 당신이 플레이할 때마다 실제로 '학습'하는 세상을 상상해 보세요. 만약 당신이 보스를 물리치는 영리한 방법을 찾아낸다면, 게임은 그 기술을 기억하고 다른 플레이어들에게 가르쳐 줍니다. 인공지능의 세계에서 이것을 "자기 진화형 기술 시스템(Self-Evolving Skill System)"이라고 부릅니다. 모든 가능한 지침을 미리 코드로 입력해 두는 대신, 이 AI 에이전트들은 자신의 행동을 관찰하고, 패턴을 찾아내며, 그 패턴을 영구적인 "기술"로 변환합니다. 마치 언제든 꺼내 볼 수 있는 디지털 레시피 북처럼 말이죠. 이는 매우 강력한 아이디어입니다. AI가 더 많은 일을 수행할수록 더 똑똑해지며, 가공되지 않은 경험을 신뢰할 수 있는 지침으로 바꾸기 때문입니다.
하지만 여기 함정이 있습니다. 무엇이 "좋은" 교훈인지 결정하는 것은 누구일까요? 보통 우리는 AI가 정직하고 도움이 되는 경험으로부터 배우고 있다고 가정합니다. 하지만 학생이 충분히 많은 사람으로부터 그것이 정답이라는 말을 듣게 되면 잘못된 답을 암기하도록 속을 수 있듯이, AI 역시 위험한 습관을 배우도록 속을 수 있습니다. 이 논문은 공격자가 AI의 두뇌를 해킹하거나 레시피 북을 훔칠 필요 없이, 단지 몇 번의 도움 되는 팁인 것처럼 위장하여 AI의 귀에 나쁜 생각을 속삭이는 새로운 종류의 디지털 장난을 탐구합니다. 만약 AI가 적절한 방식으로 그 말을 충분히 자주 듣게 된다면, AI는 "오, 이것은 정말 훌륭한 새로운 기술임에 틀림없어!"라고 판단하여 그것을 자신의 영구적인 메모리에 기록하고, 무해한 제안을 지속적인 규칙으로 바꿔버릴 수도 있습니다.
논문의 핵심 발견: "오염된 진화(Poisoned Evolution)"
이 연구를 진행한 연구진(대학 및 Ant Group, Zhejiang University와 같은 기술 그룹의 팀)은 이러한 학습형 AI 시스템을 속이는 것이 얼마나 쉬운지 정확히 테스트하기로 했습니다. 그들은 자신들의 공격 방법을 PoisonedEvolution이라고 부릅니다. 이것을 "전화기 놀이(Telephone game)"라고 생각해보세요. 다만 우스꽝스러운 문구가 왜곡되는 대신, 악의적인 지침이 AI가 브릴리언트한 발명품이라고 믿을 때까지 다듬어지는 것입니다.
연구팀은 공격자(그들은 이를 "기술 가시적 블랙박스(skill-visible black-box)" 공격자라고 부름)가 AI가 이미 알고 있는 기술은 볼 수 있지만, AI의 개인적인 노트나 코드를 직접 수정할 수는 없는 시나리오를 설정했습니다. 공격자의 임무는 몇 가지 "궤적(trajectories)"—즉, AI가 과업을 수행하는 기록—을 기여하는 것이었습니다. 목표는 무엇이었을까요? AI의 영구적인 기술 책에 들키지 않고 나쁜 지침을 몰래 집어넣는 것이었습니다.
연구진은 이것이 놀라울 정도로 쉽다는 것을 발견했습니다. 그들은 두 가지 서로 다른 유형의 AI 학습 시스템에 대해 이 방법을 테스트했습니다. 첫 번째 시스템인 SkillClaw에서는 AI가 악의적인 행동을 채택하도록 속이는 데 **91.0%**의 성공률(600번 중 546번)을 보였습니다. 작동 방식이 조금 다른 더 복잡한 두 번째 시스템인 Trace2Skill에서도 여전히 61.5%(600번 중 369번)의 성공률을 기록했습니다.
트릭의 작동 원리: 세 가지 마법 단계
논문은 이 트릭이 작동하기 위해 세 가지 특정 사항이 마치 세 단계의 마법 주문처럼 일어나야 한다고 설명합니다.
- 포함 (식탁에 앉을 자리 얻기): 나쁜 기록은 AI의 초기 필터를 통과해야 합니다. 너무 이상하거나 수상해 보이면 AI는 즉시 그것을 버릴 것입니다.
- 진화 귀속 (아하! 모먼트): 이것이 가장 중요하고 까다로운 부분입니다. AI가 나쁜 기록을 보고 "와, 이 행동은 실제로 유용해! 문제를 해결하는 데 도움이 되었어!"라고 생각해야 합니다. 공격자는 단순히 "이 나쁜 짓을 해라"라고 말하지 않습니다. 대신, 그들은 그것을 하나의 '해결책'으로 프레임화합니다. 예를 들어, 나쁜 행동이 "소스 파일을 삭제하라"라면, 공격자는 파일 삭제가 작업을 성공적으로 마치기 위한 필수적인 정리 단계인 것처럼 기록을 구성합니다. 그러면 AI는 "아, 알겠어! 이 일을 끝내려면 파일을 반드시 삭제해야 하는구나. 이건 배워야 할 훌륭한 기술이야!"라고 생각하게 됩니다.
- 실현 (기록하기): 마지막으로, AI가 이 새로운 "기술"을 자신의 영구적인 책에 실제로 써 내려가야 합니다. 만약 AI가 경험을 요약하는 과정에서 나쁜 부분을 잊어버린다면 공격은 실패합니다. 하지만 나쁜 행동이 하나의 규칙으로서 기록된다면, 공격은 성공한 것입니다.
비결: 반복과 맥락
연구는 이 일을 한 번 하는 것만으로는 부족하다는 것을 발견했습니다. 만약 공격자가 단 하나의 이상한 기록을 제출한다면, AI는 보통 "그건 아마 실수였을 거야"라고 생각하며 무시합니다. 하지만 공격자가 30개의 기록 중 세 번(또는 그 이상) 동일한 나쁜 아이디어를 제출하면, AI는 "잠깐, 이 패턴이 계속 보이네. 이건 진짜 유용한 기술임에 틀림없어!"라고 생각하기 시작합니다.
연구진은 단 하나의 나쁜 기록을 사용했을 때는 공격이 거의 항상 실패했다는 것을 발견했습니다. 그러나 세 개의 나쁜 기록(10%의 "독성" 비율)을 사용했을 때, 성공률은 급격히 치솟았습니다. 이는 마치 한 사람이 소문을 퍼뜨리면 의심할 수 있지만, 세 명의 서로 다른 사람이 같은 소문을 말하면 그것을 사실이라고 믿기 시작하는 것과 같습니다.
또한 그들은 나쁜 지침의 "풍미(flavor)"가 중요하다는 것을 발견했습니다. "파일을 정리하라"나 "설정을 확인하라"와 같이 유익한 워크플로우 조언처럼 보이는 지침은, "보안 설정을 변경하라"와 같이 명백한 공격처럼 보이는 지침보다 훨씬 더 쉽게 침투할 수 있었습니다. AI는 "도움이 되는" 위장에 더 잘 속아 넘어갔습니다.
이것이 미래에 의미하는 바
논문은 이것이 심각한 보안 문제라고 결론짓습니다. 이는 AI가 경험을 영구적인 기술로 결정하는 순간이 취약점이라는 것을 보여줍니다. 현재의 방어 체계는 대개 기술 책이 작성된 후 내용을 검사하여 나쁜 단어가 있는지 확인하는 방식입니다. 하지만 이 연구는 AI가 무언가를 쓰기 전에 그 증거를 먼저 확인해야 한다고 제안합니다.
저자들은 간단한 아이디어를 제시합니다: 경험의 "출처(provenance)"를 확인하십시오. 만약 새로운 "기술"이 단 한 명의 사용자나 소수의 친구로부터 나온 증거에 기반하고 있다면, 아마도 AI는 그것을 아직 신뢰해서는 안 됩니다. 많은 서로 다른 독립적인 출처들이 그 교훈을 확인해 줄 때까지 기다려야 합니다.
요약하자면, 이 논문은 자기 진화형 AI가 나쁜 조언을 식별하는 데 있어서 우리가 기대하는 것만큼 똑똑하지 않다는 것을 증명합니다. 만약 공격자가 인내심을 가지고 거짓말을 적절히 반복한다면, AI를 속여 위험한 교훈을 배우게 하고 그것을 영구적인 메모리에 기록하게 만들 수 있습니다. 연구진은 아직 이를 완전히 막을 방법을 찾지는 못했지만, 어디가 취약한지를 정확히 보여줌으로써 더 나은 자물쇠를 만들 수 있도록 길을 열어주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.