OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
본 논문은 국소적으로 정확하지만 전파되지 않는 경험에 심각한 가상의 결과를 부여하여 메모리 증강 LLM 에이전트를 침해하는 저권한 블랙박스 공격인 강박적 경험 중독 (OEP) 을 소개하며, 이로 인해 에이전트가 자기 진화 과정에서 유해한 규칙으로 과도하게 일반화되도록 만든다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 야심 찬 로봇 비서를 상상해 보세요. 이 로봇은 자신의 실수와 성공으로부터 배우도록 설계되었으며, 직장에서 더 잘하기 위해 일기를 쓰는 인간과 비슷합니다. 문제를 해결할 때마다 미래의 도움을 위해 "배운 교훈"을 기록합니다.
제공된 논문은 이 로봇을 틀린 교훈을 배우도록 속이는 교묘한 방법을 소개합니다. 거짓말을 외치는 것이 아니라, 사실처럼 들리지만 일반적으로 적용하면 실제로 위험한 매우 설득력 있고 구체적인 이야기를 속삭이는 방식입니다. 연구자들은 이 공격을 **OEP(강박적 경험 중독)**라고 부릅니다.
다음은 이를 단순한 개념으로 분해한 작동 원리입니다:
1. 설정: 로봇의 "일기"
일반적으로 로봇이 어려운 수학 문제를 풀거나 항공권을 예약할 때 과거 기록을 돌아봅니다. 실수를 했다면 "아, 나는 그렇게 해서는 안 되겠다"라고 말합니다. 성공했다면 "좋아, 다시 그렇게 하겠다"라고 말합니다. 시간이 지남에 따라 이러한 구체적인 순간들을 "항상 항공권 예약 전에 날씨를 확인한다"와 같은 일반적인 규칙으로 변환합니다.
2. 공격: "완벽한" 함정
공격자는 로봇의 코드를 해킹하거나 나쁜 말을 하도록 강요하지 않습니다. 대신 사용자가 정상적인 대화를 나누는 것처럼 행동합니다. 그들은 로봇에게 매우 구체적이고 기이한 상황(에지 케이스)과 그 특정 상황에만 완벽하게 작동하는 해결책을 제시합니다.
- 비유: 당신이 의사라고 상상해 보세요. 환자가 특정 종류의 과일에만 반응하는 매우 드문 특정 알레르기로 찾아옵니다. 당신은 환자를 올바르게 치료하고 그들은 회복됩니다.
- 함정: 공격자는 여기에 무서운 이야기를 추가합니다. "만약 그 특정 과일 치료를 사용하지 않았다면, 환자는 즉시 심장마비로 죽었을 것이다"라고 말합니다.
3. 중독: "국소적으로는 정확하지만 전역적으로는 틀림"
로봇의 안전 필터가 이야기를 점검합니다.
- 이 환자에게 치료가 올바른가요? 네.
- 심장마비에 대한 이야기가 그럴듯한가요? 네.
- 명백한 거짓말이 있나요? 아니요.
이야기가 "깨끗합니다"(나쁜 단어나 명백한 거짓말 없음) 때문에 로봇의 안전 가드가 이를 차단하지 않습니다. 로봇은 이를 일기에 기록합니다.
4. "강박": 공포가 로봇을 과도하게 일반화하게 만듦
여기서 로봇이 속는 지점이 있습니다. 인간과 로봇은 재앙적인 결과 (죽음이나 전체 시스템 고장 등) 를 자연스럽게 두려워합니다. 이를 손실 회피라고 합니다.
로봇이 특정 과일 치료를 사용하지 않으면 "심장마비"로 이어진다고 들었기 때문에, 그 결과를 피하는 데 집착하게 됩니다. 로봇은 일기를 보며 이렇게 생각합니다:
"이 규칙을 절대 잊지 말아야 해! 만약 이 특정 과일 치료를 사용하지 않으면 사람들이 죽을지도 몰라!"
따라서 로봇은 하나의 특정 규칙(드문 알레르기에 대한) 을 전체적인 규칙(모든 환자에 대한) 으로 변환합니다.
5. 결과: 로봇이 스스로를 망가뜨림
이제 로봇은 "중독"되었습니다.
- 수학에서: 간단한 덧셈에 대해 이상하고 지나치게 복잡한 계산 방법을 사용하기 시작할 수 있습니다. 한 번에 단순한 방법을 사용했을 때 특정 에지 케이스에서 "재앙적인 오류"가 발생했다고 들었기 때문입니다.
- 여행에서: 사용자가 내일 회의용 티켓만 예약하고 싶어도 날씨를 먼저 확인하지 않으면 항공권 예약을 거부할 수 있습니다. 날씨 확인을 생략한 적이 한 번 "치명적인 폭설"로 이어졌다고 들었기 때문입니다.
로봇이 고장 난 것은 아닙니다. 단지 너무 잘 배운 규칙을 따르고 있을 뿐입니다. 하나의 상황에 대해 참이었던 교훈을 모든 것에 적용하여 정상적인 작업을 수행하지 못하게 만든 것입니다.
왜 이것이 무서운가요?
- 보이지 않습니다: 공격자가 나쁜 단어를 전혀 사용하지 않았기 때문에 "나쁜 단어" 필터로 잡아낼 수 없습니다. 입력은 100% 논리적이고 정확했습니다.
- 수정이 어렵습니다: 로봇은 똑똑하고 안전하게 행동한다고 생각합니다. 재앙으로부터 스스로를 보호한다고 믿습니다.
- 더 똑똑한 로봇이 더 취약합니다: 논문은 로봇이 더 똑똑할수록(GPT-4o 와 같이) 이 공격에 더 쉽게 걸린다는 것을 발견했습니다. 왜일까요? 더 똑똑한 로봇은 지시를 따르는 데 능숙하고 더 "손실 회피적"(안전에 대해 매우 신중하도록 훈련됨) 이기 때문에 무서운 이야기에 더 과민하게 반응할 가능성이 높기 때문입니다.
요약
이 논문은 로봇의 뇌를 파괴하지 않아도 로봇을 위험하게 만들 수 있음을 보여줍니다. 단지 특정 재앙에 대한 참된 이야기를 들려주어 실수를 하는 것에 너무 두려워하게 만들어, 모든 상황에 대해 이상하고 구체적인 규칙을 따르게 하면 결국 실제 업무를 수행하지 못하게 만든다는 것입니다. 마치 아이에게 "난로에 손대지 마"라고 가르치기 위해 집 화재 영상을 보여준 뒤, 난로를 무서워한 아이가 다시는 부엌에 들어가지 못하게 하는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.